机器人前瞻9月8日报道,近日,原力数字科技推出了自主研发的DeepMove无标记点动作捕捉系统

具身机器人要学会人类的操作技能,高度依赖人类示范示教数据,而传统动捕方案是数据采集的一大瓶颈:采起来太麻烦,效率也不够高

传统动作捕捉往往需要示范人员穿戴动捕服、粘贴反光标记点,还要提前进行设备调试和场地准备。偶尔采一次数据问题不大,但如果要持续采集不同人员、不同动作和不同任务的数据,前期准备就会变得比较繁琐,时间成本、人力成本会大幅抬升,制约具身机器人数据规模化生产。

DeepMove从前期准备环节入手,把原本复杂的动作捕捉流程做得更简单。采用无标记点视觉捕捉后,采集人员不用穿动捕服,也不用粘贴反光标记点,只需完成一次约5秒的T-pose校准,就可以直接开始动作采集了。

这意味着换人、换任务时,不再需要反复进行穿戴和准备,能够更快进入数据采集状态。同时,采集人员也不再受到动捕服和标记点的束缚,可以更加自然真实地完成抓取、搬运、操作等动作,输出更贴近真实世界的人体行为样本。

更重要的是,DeepMove并不只是把“人怎么动”记录下来。通过多机位同步拍摄,系统能够还原包括手指动作在内的全身三维动作,同时支持多人动作捕捉和刚体道具视觉追踪,完整留存人体姿态、手部精细操作、人和道具物体之间交互关系。

也就是说,人在完成一个任务时,身体怎么动、手怎么操作,以及人与物体怎么交互,都可以被记录下来,为机器人后续的示教、训练和算法验证提供更完整的数据。

此外,DeepMove还支持在线和离线两种采集方式,让真人示范既可以直接用于机器人遥操作,也可以被批量采集和处理,快速积累训练数据集,兼顾真机调试与数据沉淀。

一、传统动捕 vs DeepMove

传统光学动作捕捉系统通过追踪粘贴在被捕捉对象身体上的反光标记点来重建动作。而DeepMove去除了这些标记点,转而通过多台相机同步采集的视频数据,并利用原力的自研引擎完成动作解算。

通过独创的双神经网络聚合推理、跨相机身份匹配与生物力学约束求解技术,DeepMove可在3D空间中实时还原全身骨骼动作、手指姿态以及支持刚体道具的运动状态。

机器人训练数据,连动捕服都可以省了!原力数字科技推出DeepMove

二、自研多视角深度学习算法,兼顾高质量与实时性

无标记点只是DeepMove的表面特征。真正决定一套无标记动作捕捉系统是否能够用于专业制作的,是它能否从普通视频中持续生成准确、稳定、自然且具有时间连续性的三维动作数据

为此,DeepMove构建了一条完整的基于深度学习网络的自研技术链路:

机器人训练数据,连动捕服都可以省了!原力数字科技推出DeepMove

系统首先通过深度视觉模型对多个同步机位中的人体进行检测与姿态感知,从画面中提取稳定的二维人体特征。

随后结合多相机标定信息,通过自主优化的多视角空间重建算法,将不同视角下的二维信息融合到统一的三维空间中,恢复被捕捉对象的高精度3D Marker数据

视觉识别不可避免会面对遮挡、快速运动、关键点抖动以及局部识别误差。DeepMove并不会直接把视觉模型得到的结果作为最终动画数据。系统进一步引入生物力学约束与时序运动优化,综合被捕捉对象的骨骼结构、关节运动关系以及动作在时间上的连续性,对三维运动数据持续进行约束和修正,从而让动作不仅准确,而且自然。

在保证动作数据质量的同时,整套技术链路针对实时计算进行了优化。从获取视频信号到输出骨骼数据并显示,端到端的处理耗时约16ms让高质量动作解算与低延迟实时输出能够同时发生。

三、轻装上阵,5 秒进入动作捕捉

传统光学动作捕捉已经成为业内成熟的专业技术标准,但通常需要专用动捕服、反光标记点、经过控制的设备配置,以及较为复杂的被捕捉对象前期准备。

DeepMove则提供了一种更加轻量、灵活的捕捉方式。被捕捉对象可以穿着合适的普通服装进入捕捉区域,完成约5秒的T-pose后即可开始动作捕捉。

更精简的前期准备,为被捕捉对象能够以更加自然的状态投入动作,也让现场布置、被捕捉对象更换、多人拍摄以及场地转换变得更加高效、灵活。

四、实时与离线,一套系统覆盖两种工作模式

DeepMove在同一套界面和数据格式下,同时支持实时捕捉与离线处理,适应现场拍摄与后期批量处理等不同制作需求。

在实时模式下,从获取相机视频信号,到完成数据解算输出显示,端到端处理耗时仅需16ms,能够持续输出高质量骨骼数据并实时驱动数字角色。导演与动画师能够在拍摄过程中直接查看角色动作捕捉效果,及时判断动作是否符合要求、是否需要调整或重新拍摄,让制作判断提前发生在动作捕捉现场。

在离线模式下,支持对已经录制完成的多机位同步视频进行批量处理,并提供断点续算能力。处理完成后,原始视频与还原后的骨骼数据可逐帧对照查看,方便制作团队检查、复核动作结果。

五、从身体到指尖,一次捕捉完整动作

DeepMove通过同一套基于相机的视觉系统,同时捕捉身体动作和手指姿态,减少了单独记录或后期重新制作手部动作的需求。

系统可以同步输出身体骨骼和手指姿态,从脚步、肢体动作,到握持、指向以及环境交互操作等动作,都能够在同一套视觉系统中完成捕捉。

六、人物与道具,同场同步捕捉

DeepMove可以通过视觉追踪刚体道具在三维空间中的位置和朝向,适用于使用工具、环境交互以及其他符合捕捉条件的交互道具。

道具对应的Mesh和骨骼数据可以与被捕捉对象同时呈现在同一个三维场景中,让制作团队能够实时查看被捕捉对象与道具之间的空间关系和互动效果

道具完成校准并添加至系统后,可以在后续拍摄中重复使用,无需每次重新进行完整的设置流程。

七、多人同场,依然保持实时捕捉

DeepMove支持多人同时进行动作捕捉,可以自动将同场多名被捕捉对象分离为独立Actor,并通过跨相机身份匹配保持人物身份。

在内部测试环境中,使用8台相机和NVIDIA GeForce RTX 5090的配置,DeepMove达到了以下表现:

机器人训练数据,连动捕服都可以省了!原力数字科技推出DeepMove
通过增加相机数量以及采用更高性能的硬件,系统还可以支持更多被捕捉对象同时进行捕捉实际表现会受到硬件配置、相机数量及布局、场景复杂度、遮挡情况以及具体制作环境等因素影响。

八、少至 3 台相机,即可实现高质量捕捉

DeepMove仅需3台相机即可进行无标记动作捕捉,并获得稳定、高质量的动作数据。根据场地、被捕捉对象数量及拍摄需求增加相机,可以获得更丰富的观察视角,进一步提升复杂动作和遮挡情况下的捕捉稳定性。

更灵活的相机配置,让DeepMove能够满足从轻量拍摄到专业制作的不同需求。

九、高精度实时 Retargeting,动作直接驱动角色

DeepMove内置高精度Retargeting能力,可自动完成骨架识别与角色定义,无需逐个骨骼手动映射,同时支持可视化编辑,可在视窗中直接进行调整。

捕捉到的动作可以实时映射至不同身体比例和骨骼结构的数字角色。在动作采集的同时,制作团队即可直接查看目标角色的动作效果,让动作捕捉、角色适配与交互评估在同一流程中实时完成。

十、普通相机,任意场地也能实现专业级动作捕捉

DeepMove无需依赖专业动捕相机以及专用的动作捕捉场地,使用GoPro等普通相机在任意的场地即可进行动作捕捉操作。

更轻量的设备配置,让系统能够灵活部署于专业工作室、普通摄影空间以及室外等不同场地,将高质量动作捕捉带到真正需要动作采集的地方。

十一、实时连接引擎,顺畅接入主流制作管线

DeepMove可以将骨骼数据实时传输至Unreal Engine等实时引擎,直接驱动数字角色,满足虚拟制作、实时预演、动画Blocking以及在引擎内实时查看和评估交互效果等制作需求。

在数据交付环节,DeepMove支持一键导出多种行业标准格式,包括FBX、BVH和C3D等,可用于Maya、MotionBuilder、Unreal Engine等主流制作工具及管线。

十二、从捕捉到交付,一套软件完成

DeepMove将相机标定、动作捕捉、解算、审核、动作修正以及最终数据导出集中在同一套软件中完成,减少不同制作阶段在多个工具之间反复切换带来的流程成本。

系统内置多种工具,包括问题帧检测、插值、平滑、脚部锁定、相机排除、动作重新三角测算以及多人场景中的轨迹修复等功能。

其集成式捕捉与解算引擎无需依赖外部处理服务,可以部署于专业工作室、虚拟制作环境、常规摄影空间以及符合条件的临时制作场地。

十三、专业级动作捕捉,更轻量,更便捷

DeepMove面向那些重视无标记点动作捕捉、更快的前期准备、实时反馈以及制作流程整合的影视、游戏与虚拟制作等项目,提供了一种更加轻量、灵活的专业动作捕捉选择。

通过将支持多人全身与手指捕捉、刚体道具捕捉、实时预览、动作审核与优化,以及最终数据导出等功能整合到同一个系统中,DeepMove让被捕捉对象能够更加专注于动作,让制作团队更早看到结果、更快的做出判断。

不止记录动作:DeepMove 重构具身智能训练数据生产链路

DeepMove将捕捉、解算、审核、修正与导出等环节整合在同一套软件中,把动作捕捉从单纯的“记录动作”,进一步升级成为一套覆盖“数据采集—处理—交付的工具链”

随着具身智能从单点验证走向规模化应用,机器人对高质量训练数据的需求也在持续增加,数据采集的成本与效率也因此更加关键。

DeepMove 的核心价值,相比单纯增加数据采集量,如何以更低成本获取真实、自然且多样化的人类交互数据,并将其转化为机器人能够学习和执行的样本,正在成为具身智能数据采集需要解决的关键问题。