机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思

机器人前瞻8月11日报道,近日,清华大学深圳国际研究生院、腾讯Robotics X、香港科技大学与深圳技术大学研究团队提出了一种可交互世界模型GeniWorld。

GeniWorld的特点在于,能够利用URDF(统一机器人描述格式)的渲染技术,将机器人的动作指令转化为一段与真实相机视角对齐的机器人运动画面。

这样一来,世界模型就能从转化的运动画面中得知机器人接下来具体要如何运动,即使面对未知的场景,也能准确预判并控制机器人的动作。

结合了GeniWorld合成的数据后,π0 VLA模型在空间重排、新物体实例、光照变化等挑战性场景下的总体成功率大幅提升,从40.8%提升至69.0%。

清华腾讯RoboticsX港科大联手发布,世界模型能看懂机器人未来动作了▲《GeniWorld:基于视觉化动作的机器人操纵通用交互式世界模型》

一、一个“预测未来的观测结果”的模型

通用机器人策略的最新进展展现出了多任务能力,但在复杂且未见的未知环境中,其鲁棒性依然有限。背景、物体实例、空间布局以及任务配置的变化,都可能导致性能大幅下降。

若通过扩展机器人学习与评估来覆盖这些变化,通常需要构建新的物理环境,这不仅成本高昂,还严重限制了场景的多样性。

动作条件世界模型提供了一种替代方案。它允许机器人在“想象空间”中进行交互,从而促进可扩展的策略学习与评估。但它仍然受限于有限的动作可控性,且在分布外(OOD)场景中的泛化能力较差。

基于此,该研究团队提出GeniWorld。这是一个基于具身视觉动作条件化的可泛化交互式世界模型,能够与策略及人类操作员实现闭环交互。即使只有有限的演示数据,该模型也能在多样化场景中展现出强大的泛化能力,并生成新的行为。

对于目标机器人系统,特定的构型运动学模型首先将数值动作序列转换为密集的机器人运动序列。

基于预训练的视频生成模型,研究团队通过URDF(统一机器人描述格式)的渲染技术,将机器人的动作转化为“视觉化动作表示”,随后,这些运动被编码为隐空间表示,并与带有噪声的视频Latent进行拼接。拼接后的复合表示输入给因果扩散Transformer,通过流匹配预测未来视频。

清华腾讯RoboticsX港科大联手发布,世界模型能看懂机器人未来动作了

▲ GeniWorld运行方法

在推理阶段,初始场景图像作为第一帧输入。动作输入经由基于URDF的渲染器生成运动条件,模型利用KV缓存维护历史上下文,从而预测未来的观测结果。

二、两种设置上均实现最高生成质量

为评估GeniWorld的生成保真度与泛化能力、策略评估可靠性和用于策略提升的数据合成能力,该研究基于RoboTwin2.0,构建了Clean-to-Clean设置和Clean-to-Random设置,两个用于评估动作条件世界建模的设置。

Clean-to-Clean设置:该设置遵循标准WorldArena协议。干净的数据被拆分,每个任务使用45条轨迹用于训练,5条用于评估。在50个任务中,共产生2,250个训练Episode和250个留出测试Episode。

Clean-to-Random设置:该设置用于零样本域外评估。模型在相同的2,250个Clean Episode上进行训练,且在未经适配的情况下,直接在Random子集的250个Episode上进行评估。这些Episode在场景外观、物体实例、物体摆放和任务相关的空间布局上进行大幅度调整。

在两种设置下,研究团队使用PSNR、SSIM、LPIPS、FID、FVD和EWM Score来评估视觉预测质量,将GeniWorld在相同的训练拆分下与 Ctrl-World、IRASim和EnerVerse-AC进行对比。

清华腾讯RoboticsX港科大联手发布,世界模型能看懂机器人未来动作了

▲ Clean-to-Clean设置和Clean-to-Random设置

如上图所示,GeniWorld在Clean-to-Clean和Clean-to-Random设置下均实现了最高的生成质量。

GeniWorld在Clean-to-Clean上的EWMScore是61.80,高于Ctrl-World的58.74,IRASim的48.83和EnerVerse-AC的52.92

GeniWorld在Clean-to-Random上的EWMScore为63.54,高于Ctrl-World的51.47、IRASim的46.41和EnerVerse-AC的31.28

对于消融分析,基于相同的视频底座,团队评估了数值动作、投影末端执行器姿态、投影骨架动作以及密集视觉动作四种动作的条件化设计,并且将基于拼接的动作嵌入与ControlNet风格的条件化进行对比。

清华腾讯RoboticsX港科大联手发布,世界模型能看懂机器人未来动作了

▲ 四种动作条件化设计

实验结果显示,与基线表示相比,视觉动作实现了更快的收敛速度和持续领先的性能,即使在早期训练阶段也能生成高保真输出。这表明视觉动作通过利用预训练视频模型的生成先验,提供了更有效的输入模态。

三、成功率从40.8%提升至69.0%

在真机验证上,研究团队使用双臂Xtrainer机器人系统构建实验平台,将机器人的URDF模型集成至Isaac Sim中进行运动控制,并复刻物理相机搭建,以渲染出视觉一致的观测数据。

清华腾讯RoboticsX港科大联手发布,世界模型能看懂机器人未来动作了

▲ 双臂Xtrainer机器人系统构建实验平台

团队让π0VLA模型在移碗、折毛巾、放置马克杯和开抽屉,四个具有代表性、包含多样化物体和复杂物理动态的操纵任务上进行训练,每个任务仅使用25条演示轨迹进行训练,通过Xtrainer遥操作系统采集演示数据。

在训练数据采集期间,团队会保持桌面环境干净整洁,但会在不同Episode之间对被操纵物体的位姿进行随机化处理,例如会对空间重新排列、将目标物体替换成未见过的实例、在桌面上放置随机物体或改变环境的照明。

训练结果显示,Spatial-Gen将空间重新排列下的成功率从37.5%提升至62.5%Diverse-Gen在干扰项、新实例和光照变化下带来了更高的增益。

清华腾讯RoboticsX港科大联手发布,世界模型能看懂机器人未来动作了

▲ 训练结果

结合两种数据源在所有设置下表现最佳:空间重新排列下达到70.0%,有干扰项时达到72.5%,新实例上达到70.0%,光照变化下达到 52.5%,同时将总体成功率从40.8%提升至69.0%

结果表明,GeniWorld通过合成高度多样的数据,无需付出手动搭建场景和数据采集的高昂成本,即可有效缓解机器人策略学习中的数据匮乏问题,提升策略在挑战性分布外场景下的整体性能。

结语:缓解数据采集痛点,让机器人在“想象空间”预演未来

从仿真到真实、从有限演示到泛化部署,数据稀缺始终是制约具身智能规模化落地的核心瓶颈之一。GeniWorld的探索表明,可泛化世界模型为这一难题提供了一条可行路径,让机器人在“想象空间”中预演未来,以合成数据弥补现实数据采集的高昂成本。

真机验证中69.0%的总体成功率提升,印证了这一方向的潜力。不过泛化世界模型距离产业化落地仍存在不小差距,实验室成果仅是起点,能否经受真实场景考验,才是决定技术价值的关键。