机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影
机器人前瞻9月7日报道,近日,银河通用联合清华大学、北京大学、北京理工大学、哈尔滨工业大学、上海期智研究院等机构发布了手势交互框架RoboGesture。

该框架基于流式实时语音,为人形机器人生成贴合语义、动作自然且具备安全约束的语音伴随手势,让机器人在实时社交中完成倾听、应答与肢体表达。
基准测试结果显示,RoboGesture在碰撞控制能力上表现突出,BEAT评测结果为0.88,在SemanticBEAT语义场景下进一步降至0.13。
此外,该团队还构建了RoboGesture数据集,涵盖300多个手势类别,同时搭建半自动化数据生产管线,产出约1000小时经过碰撞验证的音频-动作配对样本。
一、三层机制,协同优化手势交互
过去,语音伴随手势生成技术大多数用于虚拟形象、三维数字人。现有落地人形机器人的方法是:先基于人体骨骼模型生成手势,再通过逆运动学与比例微分控制器,将动作在线重定向到机器人本体。
但这套方案在实际部署时,很容易发生严重的自碰撞问题,比如灵巧手撞击机身胸腔、电机出现不自然的抖动等。
而RoboGesture直接基于机器人自身,完成训练模型。简单来说,模型最终学习的不是“人体怎么动、再怎么映射给机器人”,而是直接学习“这台机器人应该怎么动”,从模型层面减少了对在线动作重定向的依赖。
该框架基于宇树G1人形机器人原生运动学空间完成模型训练,并部署在真机上开展实测。该机型上半身躯干与手臂共17个自由度,同时搭载24个自由度的强脑科技灵巧手。
RoboGesture解决最核心的问题,是模态遮蔽。
在实时连续交互的场景中,模型容易“偷懒”。仅依靠前一时刻的关节位姿就能维持动作输出,模型便会持续沿用历史动作惯性,从而忽略实时传入的语音内容,最终导致手势和对话语义完全不相关。
针对这个问题,RoboGesture设计三层机制来抑制模型惰性。

1、分层语义-声学对齐器
传统文本方案易丢失语调、重音等韵律细节。RoboGesture采用Mimi音频编解码器编码流式音频,并以多任务学习训练分层Transformer,其中浅层提取音频节奏特征,深层依托300类手势分类任务解析全局语义。
2、反惯性CFG掩码
该模型用条件流匹配扩散Transformer做联合训练时,会有15%的概率清空历史动作数据。这层机制让模型仅依靠当前语音生成手势,避免其单纯沿用之前的动作惯性。
3、安全过滤器
实际部署时,生成的动作会经过在线MPC完成安全校验。该滤波器基于凸二次规划算法,加入速度约束、轨迹误差最小化与防碰撞限制。单帧仅增加5.6毫秒时延,满足机器人30Hz控制需求,同时还能离线过滤训练数据集。
整套“聆听-响应-手势生成” 闭环耗时约2秒,时间主要消耗在语音识别、语义理解环节;手势生成与安全滤波模块运算效率较高,不会拖慢整机实时交互。
二、300余类手势,1000小时训练数据
为了弥补训练数据的不足,该团队构建了高质量语义手势数据集RoboGesture。该数据集含300多类经过真机验证的语义手势,手势类目参考了SeG、EgoGesture数据集。

所有手势采用光学动捕设备进行采集,人工标注动作,经过动作重定向与优化后在实体机器人上复现,以此验证动作可行性与控制精度。
在此基础上,该团队还搭建了半自动化合成数据管线,通过“场景文本生成→手势标记→多模态合成→时序融合→安全优化”五个环节,共产出1000小时训练数据。
三、多个指标领先,COL指标最低降至0.13
该团队将RoboGesture与LivelySpeaker、DiffSHEG、Semantic Gesticulator等主流模型开展对比测试。

行业通用评测基准BEAT,从动作真实度、语音节拍匹配、动作误差、手势多样性以及机器人碰撞风险五大维度进行评估。从评测结果来看,RoboGesture综合表现领先。
其中该模型的FGD仅0.8452,远低于DiffSHEG的2.2316与Semantic Gesticulator的3.0147。
人工评估从节奏匹配度、语义契合度、机械手动作稳定性三个维度展开,RoboGesture在语义匹配、真机动作稳定性两方面优势最为明显。
在碰撞安全指标(COL)上,该模型在BEAT评测下数值为0.88,SemanticBEAT语义场景下低至0.13,大幅优于其他基线模型。
结语:从“会做事”到“善表达”,机器人补上交互一环
过去,人形机器人的智能更多体现在“听懂指令”和“完成任务”,但真正自然的人机交互,还需要机器人能够像人一样通过动作表达情绪、强调重点和回应交流。
RoboGesture从机器人自身运动学出发,将音频理解、手势生成与安全控制打通,为机器人建立了一套从“听”到“动”的实时交互闭环。人形机器人正在从单纯“会做事”,进一步走向会交流、会表达、会回应。