机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影

机器人前瞻9月2日报道,近日大晓机器人联合香港中文大学多媒体实验室、南洋理工大学等机构,开源了面向第一视角视频的3D双手形状重建模型ACE-Ego-Hand,并已产出约5000小时训练数据。

手被挡住也能还原!这家上海机器人公司开源3D手形重建模型

ACE-Ego-Hand可从海量第一视角视频中提取结构化的双手三维操作轨迹,将人类真实的抓取、装配和双手协同经验转化为机器人可学习的大规模数据。

同时,ACE-Ego-Hand首次将视频生成模型作为DreamHand编码器,实现端到端训练,只需对整段视频进行一次分析,就能直接输出双手的姿态、形状和3D位置。

该模型在五个第一视角手部基准上进行评测,48项主要指标比较中,ACE-Ego-Hand有45项领先

此外,在离屏手部评测中,ACE-Ego-Hand在ARCTIC和HOT3D上,相较ViDiHand的综合误差分别降低45.9%和61.1%。

一、效率提升33倍,手部出画面也能补全3D轨迹

第一视角视频可为行业提供可规模化使用的操作数据,但由于手部经常被物体遮挡,且频繁离开画面等问题,导致现有的单帧与窗口式时序回归模型,一旦手部短暂离开画面就会失效。

而传统的VDMs(视频扩散模型),作为像素空间渲染器,需要执行庞大且随机的多步采样。先经过多步去噪采样,再逐步生成中间视频或像素结果,最后从生成结果中估计手部姿态。

此流程导致计算成本高,同时也会累积误差。

因此,ACE-Ego-Hand首先解决的是手部3D恢复过程中的效率问题

该模型将视频扩散模型改造成几何编码器,不用多轮反复采样,省去大量重复计算,减少误差。输入的视频经过VAE得到干净潜变量,仅需单次前向推理,即可提取视频扩散Transformer中间层的时空特征。

手被挡住也能还原!这家上海机器人公司开源3D手形重建模型

随后,这些特征被直接送入双向时空解码器,由模型端到端地输出双手姿态、形状、可见性和3D空间位置。

在单张A100 GPU上,ACE-Ego-Hand达到约63.1 fps,约为ViDiHand高精度配置下的33倍效率,提高大规模处理产线第一视角操作视频的效率。

手被挡住也能还原!这家上海机器人公司开源3D手形重建模型

其次,ACE-Ego-Hand解决的是,还原手部被遮挡或离开视野后的运动轨迹

在真实产线操作过程中,手部被工件遮挡是常见状态,对于机器人学习来说,完整的连续轨迹通常比高质量单帧结果更有价值,因为机器人需要学习的是动作过程,而不是单个姿态。

但传统因果模型主要根据过去帧预测当前结果,手部离开画面后只能靠历史数据往后猜。因此每往后推算都会叠加误差,导致轨迹容易跑偏,产生漂移。

ACE-Ego-Hand则并未使用因果掩码,而是对完整视频片段进行分析,通过手消失前与重新出现后的画面,推理出不可见区间手部的三维位置,输出从头到尾不间断、连续完整的双手3D运动轨迹。

并且为了避免遮挡期间出现手部尺度变化,该模型还引入片段级形状先验。同一只手在一个视频片段内只预测一次形状参数,而不是每帧单独估计,有效改善手部尺寸闪烁、轮廓畸变,同时避免手部遮挡复出后出现左右手识别混淆。

二、摆脱相机标定限制,兼容各类头戴采集设备

以往手部3D重建模型时,在采集视频前要专门做相机标定,测出相机内部参数。并且换设备、换镜头就要重新标定,跨设备复用性较差。

而ACE-Ego-Hand在测试阶段无需显式输入相机内部参数,通过头戴式第一视角视频,即可恢复手部在相机坐标系下的度量3D位置。

并且,该模型还支持原生鱼眼超广角输入,面对鱼眼图像显著的径向畸变,模型无需提前标定相机、做图像去畸变,直接从畸变画面预测像素到三维空间的观测射线,完成手部度量3D位置恢复。

手被挡住也能还原!这家上海机器人公司开源3D手形重建模型

模型不仅判断“手在画面中的哪里”,还进一步估计“手距离相机多远”,实现从二维定位到度量3D运动恢复的扩展。

此外,该模型还提供K-free配置。在这个配置中,模型可以直接用视频自身画面特征推算出完整的空间观测射线场,不用提前录入相机焦距、畸变系数等标定参数,也不用对鱼眼广角画面做额外去畸变预处理。

这意味着手部模型不必完全绑定在某一台固定相机或某一套标定参数上,可以更灵活地适应人员移动、头部转动和采集视角变化。

三、五大基准评测,48项指标45项领先

ACE-Ego-Hand在五个第一视角手部基准上进行了评测,覆盖五大场景:双手重度遮挡、复杂多变的主观拍摄视角、跨品类物体4D人机交互泛化测试、手物联动的双手姿态估计,以及长时序多物体连续操作任务。

48项主要指标比较中,该模型有45项指标领先。

在ARCTIC、HOT3D和HOI4D上超过ViDiHand;在H2O和OakInk2上,也在多数姿态、定位和轨迹稳定性指标上超过此前最佳方法。

其中,在评估复杂第一视角和广角相机条件下,手部、物体3D跟踪能力的基准HOT3D上,ACE-Ego-Hand的MPJPE-p为12.888mm,相比ViDiHand的21.514mm降低约40%。

手被挡住也能还原!这家上海机器人公司开源3D手形重建模型

在复杂任务完成过程中,面向双手协同操作和长时域动作的基准OakInk2上,ACE-Ego-Hand的MPJPE-p为8.988mm,优于此前最佳的WiLoR(26.520 mm),误差降低约66%。

手被挡住也能还原!这家上海机器人公司开源3D手形重建模型

结语:让第一视角视频真正变成机器人能学习的数据

ACE-Ego-Hand解决的并不仅是手部3D重建精度问题,更重要的是降低了从真实人类视频中获取机器人操作数据的门槛。

过去,第一视角视频虽然数量庞大,但由于遮挡、出画面、相机差异等问题,很难直接转化为机器人可学习的结构化数据。ACE-Ego-Hand则将其转化为连续、稳定且具有度量信息的双手3D运动轨迹。

凭借对复杂遮挡场景、长时序任务和多设备采集的适配能力,海量第一视角视频或将成为机器人学习人类操作经验的重要数据来源。

ACE-Ego-Hand真正值得关注的地方,不只是让机器人“看懂”画面,而是把人类真实操作,真正变成机器人能够学习的高质量数据。