机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思
机器人前瞻8月13日报道,近日,加州大学圣地亚哥团队发布论文《FACT:面向世界-动作模型的多故障感知因果训练》,推出了一款因果世界-动作模型FACT。
简单来说,FACT就是先生成动作,后根据这个动作去预测做完之后会发生什么,任务会推进多少。
现有的WAM模型大多只用成功案例来训练,模型看不到“错误动作会带来什么后果”。而FACT的特点在于,它将失败的轨迹用来训练,不学习其中错误的具体操作,而是学习这些错误操作所造成的后果,这也避免了模型在错误动作下产生“任务能成功”的幻觉。
而实验结果也显示,FACT的性能优于现有的多种基线方法,在可见任务中,FACT的成功率可达82%,随着故障数据加入训练,模型性能也得到了提升。

▲《FACT:面向世界-动作模型的多故障感知因果训练》
一、先生成动作,后预测结果
构建通用机器人策略是机器人学习领域的核心目标。视觉-语言-动作模型(VLA)给定图像观测与语言指令,模型可学习并输出机器人动作。
与之互补的世界-动作模型(WAMs),则通过引入未来视觉预测强化了这一范式。它们利用视频模型或未来预测目标,在学习控制的同时,学习场景在机器人交互下将如何演化。
现有的WAM通常将预测的未来作为选择动作的中间信号,要么像是“视频优先”系统那样,先构想未来视频,再利用逆向动力学模型解码出动作;要么是将预测的未来帧或隐变量作为动作预测的条件。但两种方法可能会导致在测试阶段,即便机器人做出了错误动作,模型依然会盲目预判任务成功。
那么要如何才能将未完成目标的失败轨迹用作后果监督,加以利用,同时又不把失败的动作当成模仿目标?
该研究团队提出了FACT,这是一种“先生成动作,后预测结果”的因果世界-动作模型。FACT会给出备选动作,再将这些动作带入模型,预测未来视频与任务进度值。
在架构设计,论文将整个Token顺序拆解为五段,其中P是观测前缀,A是预测动作片段,G是清晰的教师强制动作片段,V是价值片段,I是未来视频片段。

▲FACT架构图
价值评估与未来视频预测均基于“干净的动作G”进行条件约束。而“带噪的动作槽A”无法直接接触到干净动作,因此模型能利用对未来结果的预测来提升动作生成的精准度,同时又不会造成目标信息的泄漏。
成功示范数据同时会对动作预测和世界预测进行监督;对于失败轨迹的采样,模型会屏蔽动作模仿损失,但依然会对观察到的失败未来以及较低的任务进度值进行监督。这样可以让模型学会理解“失败后果”,而非盲目模仿“错误行为”。
由于在失败结果上接受过训练,价值评估模块对动作变得高度敏感。在实际部署时,它可以对采样的N个候选动作进行打分和排序,从而提升系统的可靠性。
二、成功率82%,推理速度提升3倍
在真机验证上,团队通过基准测试对比、受控变体对照以及诊断性分析对FACT进行评估。该实验主要围绕FACT整体性能表现、动作条件的作用和故障数据的价值三个方面展开。
在仿真环境中,研究团队让模型在50个RoboTwin任务上进行训练,并加入了约1.3K条推演故障数据。
如下图显示,视频联合训练将FACT的平均成功率从81.8%提升到了85.6%,而故障联合训练进一步将其提升至87.5%。这使得FACT在该基准测试上的表现非常接近Motus,FACT成功率为87.5%,Motus为87.8%,同时在部署推理时的运行速度约为其3倍。

▲RoboTwin模拟结果
该研究团队评估了叠方块、抓方块、双臂交接、叠碗以及倒水这5个可见操作任务,以及叠方块、抓方块、叠碗这3个改变了物体颜色、形状和相应指令的保留不可见变体。

▲可见操作任务和不可见任务
方块操纵任务使用了200条专家示范数据,其余可见任务各自使用50条。并且该研究为每个方块任务采集了约30条故障推演轨迹用于联合训练。
在可见任务中,FACT的表现优于Motus,FACT的成功率为82%,而Motus的成功率仅为64%,故障感知训练将该成功率进一步从82%提升到了89%,结合可选的打分机制后更是达到了92%。

▲可见任务与不可见任务结果
值得注意的是,在没有引入失败后果数据的前提下,单凭打分机制并不能提升性能,这证实了价值头只有在经过后果训练后才真正具备实用价值。
在不可见变体上,故障感知训练将成功率从67%提升至77%,结合可选的打分机制后达到82%。这一结果非常接近π0.5模型的85%,尽管π0.5得益于大规模机器人预训练,而FACT并未使用此类预训练数据。
结语:在失败中学习,仍有不足
该论文提出的FACT通过将“先生成动作,后预测后果”的因果顺序引入世界-动作模型,将失败轨迹转化为有效的后果监督信号,避免了模型在执行错误动作时,也依旧盲目预测“自己能够成功”的幻想。
但同时,FACT仍有局限。首先,在价值头设计上仍需改进,未来工作可以在保持相同动作条件化价值接口的前提下,替换当前的价值头,或引入可学习式的进度估计器来增强。
其次,在价值引导筛选上会带来额外计算开销,最佳候选选择策略是以计算量换取可靠性。在延迟要求严苛的场景下,FACT可以仅运行动作模式而跳过价值引导的选择,但若要进行价值引导的候选筛选,则需要对每个候选批次额外执行一次评分前向传播。