机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思

机器人前瞻8月14日报道,近日,华盛顿大学联合艾伦人工智能研究所发布论文《FLEX-π:具有计算可调性的多流世界-动作模型》,推出了一款将RGB视觉特征、3D点图几何特征以及DINO物体语义特征共同嵌入到统一共享隐空间中的世界-动作模型FLEX-π

简单来说,只需要给机器人看几次示范,搭载了该模型的机器人就能够在堆满杂物的桌面上进行餐具分拣、整理厨房,甚至拉开一个柔软的笔袋拉链,即便在更换陌生环境,更换物体颜色的情况下,也依旧能够进行实时处理。

这背后体现的是该模型的核心优势,FLEX-π不仅能够看懂普通的彩色图像,还能在内部理解物体的三维位置、形状,以及“这是什么物体”的语义信息,所以,即便在陌生、杂乱的环境中更换物体颜色,机器人的处理和反应速度也基本不受影响。

在真机验证上,FLEX-π在5项任务上的表现都优于所有基线模型,且优势随着任务难度的增加而扩大在RoboTwin50项任务中,该模型的“仅动作模式”取得了94.6%的成功率。华盛顿大学发布新模型,FLEX-π用3D几何+物体语义重塑机器人操控

▲ 《FLEX-π:具有计算可调性的多流世界-动作模型》

一、为WAM模型补上3D几何与物体语义

通用机器人策略通过联合预测未来观测与动作(即世界-动作模型,WAM),近期已成为视觉-语言-动作模型(VLA)的替代方案。

WAM的高示范效率与强泛化能力主要源于两个因素。首先,模型在训练时通过联合预测动作与未来观测,学习到了鲁棒的特征表示;第二,模型继承了在海量视频数据上预训练的视频生成主干网络的强时空先验。

尽管预测未来的视觉观测是WAM训练的核心,但目前的通用WAM几乎完全依赖视频生成模型的编码器去预测未来的RGB图像隐变量。这种方式虽然有效,但通过像素重建训练出的隐变量主要捕捉的是外观细节,并没有很好地对齐机器人操控所需的3D结构和物体语义。

直接对几何信息和物体语义进行监督,能够补充这些关键特征,为WAM提供更强的联合预测训练信号。但传统的实现手段往往需要付出高昂的代价,增加传感器模态、重新训练新的先验网络,或者牺牲模型的推理速度。

那么,如何在不付出上述代价的前提下,进一步放大WAM在联合预测和强视觉先验上的优势?

该论文提出的FLEX-π,不仅能够预测未来的RGB观测,还预测未来的3D点图与物体级语义,从而实现了极高的示范效率和泛化性能。

在此基础上,FLEX-π无需新增传感器、无需训练新的视觉先验,也不需要增加推理延迟,完全避免了上述的三项成本代价。

具体而言,FLEX-π使用了一个来自预训练视频生成模型的单一、冻结状态的VAE,将RGB图像与3D点图编码到同一个隐空间中,尽管该 VAE仅在RGB像素上训练过,却能够直接对点图进行重构,同时结合DINOv3来构建以物体为中心的DINO特征。

华盛顿大学发布新模型,FLEX-π用3D几何+物体语义重塑机器人操控

▲ FLEX-π

FLEX-π将每种视觉模态嵌入到一个统一且共享的隐空间Token流中,每种视觉输入模态各自形成一条Token流,随后将每条流路由传递至一个“混合 Transformer”主干网络中。

由于机器人动作是与每个未来的视觉流联合生成的,该策略不仅继承了互联网级预训练的丰富先验,还为动作生成学习到了更强的内部特征表示。

最后,FLEX-π在训练期间对视觉输入流进行随机Dropout,并应用跨模态约束,即无论某种未来的流是否作为输入被观测到,模型都会去生成它。

这使得单个训练好的模型权重在推理时能够灵活地运行在任意视觉输入和输出子集上。这种设计允许工程人员在部署时自行选择“速度-性能”曲线上的最佳平衡点,且无需在训练阶段将其固定。

与此同时,该模型通过视觉流Dropout与跨模态约束可实现灵活训练,单个FLEX-π模型权重在推理时无需重新训练,即可支持可用输入流与输出流的任意组合,从极速的“仅动作模式”到“全模态联合生成模式”,甚至在仅有1条视觉输入的情况下也能正常运行。

二、在“仅动作模式”取得94.6%的成功率

在真机实验阶段,该论文所设计的实验主要用于评估该模型的高精度与长时程任务表现、分布外条件或小样本数据利用效率能力、推理速度与性能权衡、多视觉流与联合生成作用。

研究团队在RoboTwin、LIBERO、LIBERO-Plus和真实双臂YAM机器人平台上对该模型进行评估。在RoboTwin上,团队将FLEX-π与 π0.5、Fast-WAM以及LingBot-VA三款机器人策略基线进行对比;在真实世界实验中,除了对比π0.5和Fast-WAM,还加入了一款3D VLA基线模型ManiFlow

1、高精度与长时程任务表现

在真实世界实验中,将单个预训练好的FLEX-π模型权重部署到了真实双手YAM机器人上。该实验覆盖了包含5项不同难度的任务,分别是盘子上架、餐具分拣、厨房整理以及最难的两项任务,自修末端夹爪和软质笔袋拉链。

华盛顿大学发布新模型,FLEX-π用3D几何+物体语义重塑机器人操控

▲ 软质笔袋拉链

实验结果显示,无论是在“仅动作模式”还是“全模态联合生成模式”下,FLEX-π在5项任务上的表现都优于所有基线模型,且优势随着任务难度的增加而扩大。华盛顿大学发布新模型,FLEX-π用3D几何+物体语义重塑机器人操控

▲ 真实世界实验结果

在“全模态联合生成模式”下,FLEX-π在“厨房整理”任务上的完成率比最强基线高出5.0%;在难度更高的任务上增幅更为显著,在“自修末端夹爪”任务上高出42.7%,在“软质笔袋拉链”任务上高出27.2%

在所有任务的平均表现上,FLEX-π的成功率比π0.5的成功率提升了3.5倍,相比ManiFlow的成功率提升了2.3倍

2、分布外泛化与示范数据利用效率

在测试模型的泛化能力与示范数据利用效率上,该团队引入了分布外物体极度混乱的视觉背景与干扰物,并测试了仅使用一半真实世界示范数据重新训练后的模型表现。

华盛顿大学发布新模型,FLEX-π用3D几何+物体语义重塑机器人操控

▲ 分布外泛化与示范数据利用效率实验结果

结果显示,FLEX-π对视觉分布偏移具有很强的鲁棒性。该模型在“全模态联合生成模式”下,性能仅下降了4.7%,在“仅动作模式”下仅下降了 4.1%

相比之下,原本表现最强的基线模型ManiFlow尽管能够获取深度信息,性能却下降了26.7%;π0.5则在未见过的强难度的“软质笔袋”任务上直接下降了25.6%

3、推理速度与性能权衡

为了对模型的推理速度和性能进行权衡,对比FLEX-π与最先进的VLA及WAM模型的表现,研究团队首先在RoboTwin50项任务的标准仿真基准上进行了对比评估。

华盛顿大学发布新模型,FLEX-π用3D几何+物体语义重塑机器人操控

▲ RoboTwin实验结果

实验结果显示,FLEX-π的“仅动作模式”取得了94.6%的成功率,超越了最强VLA基线模型Qwen-RobotManip的93.9%;在“全模态联合预测模式”下,FLEX-π同样击败了所有WAM基线模型,包括Motu 以及其中最强的LingBot-VA 2.0

结语:模型仍有提升空间

该论文提出了FLEX-π,一款拥有60亿参数,具有计算可调性的WAM模型,实验结果表明在真实双臂机器人硬件部署中,该模型的表现优于所有基线模型;在“仅动作生成模式”下,其推理速度比所有对比基线模型都更快。

尽管FLEX-π取得了出色的性能,但该模型仍存在局限。在收敛时间上,虽然经过了系统优化,但由于引入了多流额外模态以及跨模态约束,FLEX-π的训练收敛周期相对更长。在真实世界任务微调中,模型至少需要10个Epoch才能充分收敛。

其次,该模型在“全模态联合生成模式”下,其推理延迟依然高于参数量相当的传统VLA模型;同时,该模型的语义推理能力与预训练规模仍有提升空间,若为FLEX-π注入更强的语义推理能力,并引入更大规模的机器人预训练数据,将能进一步拓宽模型的上限。