机器人前瞻(公众号:robot_pro)
作者 | 许丽思
编辑 | 漠影

机器人前瞻7月28日报道,近日,旋玑智能推出言传智会具身大脑VoxInsight。这不是一台完整的机器人,而是一套面向机器人本体和智能硬件的软硬一体交互模组。

VoxInsight融合原生全双工语音交互大模型、全模态终身记忆和具身智能体框架,打通机器人从实时感知、自然对话、长期理解到本体执行的链路,让机器人不仅能够开口说话,还能持续听取信息、记住用户,并将人的意图转化为任务执行。

一、三项能力,让机器人听得懂、记得住、做得到

VoxInsight首先要解决的是机器人如何“听得懂、讲得出”。真实对话中,人会插话、补充信息,也会临时改变需求。传统交互往往需要等待用户说完后再作出回应,机器人在自己说话时,也很难继续接收新的信息。

VoxInsight以原生全双工语音交互大模型FLM-Audio-2为核心。该模型由RoboBrain-Audio升级而来,支持机器人边听、边说、边理解。在机器人说话的同时,它仍能持续听取用户的新信息,识别意图变化,并及时调整回应。

例如,用户原本让机器人取桌上的物品,随后改口说“不是桌上的,是厨房那个”。机器人需要保留此前对话中的对象信息,修改地点,并重新安排后面的动作。对人而言只是一句临时补充,对机器人而言,则需要重新理解上下文。

第二项能力是“记得住”。VoxInsight搭载全模态终身记忆系统EgoMem,可以沉淀用户偏好、历史对话、个性化画像和关系信息,让机器人在下一次见面时仍能找到此前交互的线索。用户说“还是上次那个”时,机器人不必要求其重新解释全部背景。

第三项能力是“做得到”。通过具身智能体框架RoboClaw,VoxInsight可以连接机器人本体能力和外部场景系统,将用户的真实意图进一步转化为任务执行、本体驱动和多任务协同,使自然语言交互与机器人的实际行动衔接起来。

能边听边说、长期记忆,旋玑智能推出言传智会具身大脑VoxInsight

二、软硬一体,为机器人装上一颗“智会头”

如果交互能力只停留在模型和接口层面,机器人厂商仍需自行处理算力、传感器、麦克风、摄像头、扬声器以及本体适配等问题。VoxInsight因此采用软硬一体的模组化产品形态,将交互所需的软件能力和硬件组件整合在一起。

软件侧,VoxInsight集成FLM-Audio-2、EgoMem和RoboClaw,形成实时自然交互、长期个性化服务以及任务执行能力。硬件侧,产品将低功耗算力模组、多模态传感器矩阵、扬声器和摄像头等组件收进机器人头部造型中,并提供与机器人本体连接的接口。

旋玑智能将这套产品称为“智会头”。这一概念不限定某一种机器人外形或品牌,而是指可以装配到不同机器人上的交互具身大脑。它向上连接声音、身份和上下文,向下连接导航、抓取等技能,将人的自然表达转化为机器人可以继续执行的任务。

对于机器人本体和智能硬件厂商而言,这种产品形态意味着无需从零搭建复杂的交互系统,即可获得一套可部署、可适配、可迭代的具身交互大脑。即使更换不同的机器人本体,这颗“头”仍可保留理解用户、长期记忆和调度行动的能力。

能边听边说、长期记忆,旋玑智能推出言传智会具身大脑VoxInsight

三、面向商业服务、智能座舱和智慧家庭

VoxInsight目前主要面向服务机器人、智能座舱和智能家居等具有较强人机交互需求的方向。

在商业服务场景,机器人可以用于酒店前台接待、商场导览、导购咨询和无人售货交互,连续理解不同用户提出的需求。在智能座舱场景,机器人可以理解驾驶者和乘客的多轮表达,使车内交互不再只是单次指令响应。在智慧家庭场景,机器人可以连接家庭设备,记住不同家庭成员的使用习惯,提供个性化服务与陪伴。

旋玑智能成立于2025年7月,创始人王业全(Evan)任智源人工智能研究院PI、北京大学研究员,曾牵头及参与FLM、Tele-FLM等系列模型研发。公司核心成员主要来自智源人工智能研究院。

2025年,智源与乐聚机器人共建联合实验室,研制初代交互具身大脑RoboBrain-Audio。旋玑智能基于相关技术成果成立,专注于交互具身大脑。

从FLM-Audio-2的全双工语音交互,到EgoMem的长期记忆,再到RoboClaw连接机器人本体执行任务,VoxInsight希望将听见、记住和行动接入同一条链路,让机器人从“能说话”进一步走向“会交流”。