机器人前瞻(公众号:robot_pro)
作者 | 钟宸
编辑 | 漠影
机器人前瞻9月10日报道,昨日,智元发布了原生世界—动作模型(World Action Model,WAM)GE-Act 2.0。
智元称,GE-Act 2.0的所有模型参数,包括视觉表征、未来生成、动作预测等核心组件均从随机初始化开始,在具身操作数据上从头训练。
训练完成后,模型不针对评测任务做任何微调和示范,直接在陌生场景、陌生物体上,接受语言指令跟随、多技能操作和陌生环境泛化等真机零样本(Zero-shot)检验,覆盖100项原子任务、20类技能、两种机器人本体。
结果显示,随着数据规模扩大100倍,模型不仅原有技能更稳定,还逐步解锁了此前完全无法完成的新任务,包括折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作。
智元称,原生世界—动作模型的Scaling路径首次被系统性验证。
一、可在复杂场景完成任务,展现长程任务能力
在相同的零样本OOD协议下,智元评估了GE-Act 2.0在目标对象、颜色、大小、形状、位置和顺序方面的指令理解能力。实验表明,该算法能够在杂乱的场景中准确选择目标对象,且能够遵循习得动作偏好(Learned Action Biases)不同的指令,并且能够通过指令组合使能力泛化到新的任务场景中。
首先,GE-Act 2.0可以在复杂场景中执行指令。在智元展示的视频中,模型可在杂乱的物品中识别指令所需的正确物品,并执行夹起的操作。

且该模型能够遵循更复杂的“抓取和放置”指令,结合物体和颜色的区别,正确识别需要移动的物体以及放置的位置。在智元展示的视频中,搭载该模型的G1-OP可将绿色苹果放到绿色的盘子中,并将橙子放到橙色的盘子中。
其次,GE-Act 2.0展现了避免习得动作偏好的能力。在视频中,即使鞋子在鞋盒旁边,G1-OP会遵循把杯子放进鞋盒的指令。智元指出,该策略遵循指令对象-目的关系,而非场景暗示的关系。
同时,模型还能够打断原来的指令,执行最新的指令,在智元展示的视频中,G1-OP可在取消拿起绿色杯子的指令后继续执行拿起蓝色杯子的指令,且进行了连续两次取消,但从视频来看,杯子差一点就要被拿起,且G1-OP显得有些“手忙脚乱”。

GE-Act 2.0还能够在非标准场景中,通过执行连续的单步指令,实现零样本泛化能力,从而完成全新的长程任务。它能利用语言指导,将熟悉的操作技能转化为新的任务序列,而无需针对特定任务的微调。
在展示的视频中,G1-OP的目标是食物放入托盘中,它可以将苹果、芒果、零食袋以及瓶子分不同步骤放进盘中。
二、重新设计架构,展现跨本体迁移能力
这一模型是怎么做到的?智元对此的解释是,GE-Act 2.0面向具身操作重新设计整套架构,给出了从头预训练的完整方法论。

首先,智元设计了更高效的视觉编码器CoAE,将一帧256×384画面压缩为24个视觉token,仅为DINOv3的十六分之一,同时保留语义、运动与局部结构。
压缩后反推动作的精度与DINOv3、V-JEPA 2.1等高信息量表征接近,在4,000条机器人操作数据的受控测试中,指令—画面匹配准确率达97.95%,为五种对照表征中最佳。
其次,智元采用一步式视觉规划,一次生成完整未来,并让动作误差直接反馈给世界模型。配合高效视觉表征,模型在RTX 5090显卡上生成一个连续动作chunk仅需104毫秒。
最后,GE-Act 2.0采用了知识对齐选择性优化方法(KASO),即一次生成多个可能的未来,只选择与真实动作最一致的结果参与训练。在陌生场景的分布外(OOD)评测中,机器人选对指令目标的比例较基线提高7.5个百分点,最终完成抓取的成功率提高10个百分点。
在数据架构上,GE-Act 2.0提出让每类数据承担合适的学习任务:
- 使用3.9万小时“指令—视频”数据预训练世界模型,学习环境如何变化,其中包含3,000小时无本体数据(不带动作标注的第一视角与人类操作视频);
- 以3.2万小时机器人轨迹预训练逆动力学模型(IDM),学习“画面这样变化时机器人做了什么”,其中包含2,000小时失败操作与真实场景部署回流(rollout)数据,不要求成功标签;
- 最后通过3万小时“指令—视频—动作”完整数据进行联合训练,把两种能力连接起来。

在评测中,GE-Act 2.0把真机零样本表现作为标准:不微调、不示范、不换模型,测试中的场景、背景、光照和物体实例均未进入训练。
在相同训练配方下,最后一阶段分别使用300/1,200/5,000/30,000小时四档数据,智元指出,模型在三方面展现出Scaling:
首先是取得非零成功率的任务,在G1-OP机器人上从39项增至76项,在G2-90D机器人上从24项增至72项。智元指出,折叠毛巾、嵌套纸杯、拔插笔盖、插花等较精细动作在小规模数据训练的模型上无法被理解,而当数据达到3万小时规模时出现显著的能力顿悟。
从智元在技术博客展现的视频来看,G1-OP可在零样本的情况下,完成将倾倒的水瓶扶正的操作。

以及将一个杯子,套至另一个杯子内的操作。

以及擦去桌面油污的操作。

而对于仅贡献训练数据不足2%的G2-90D,该模型依然在零样本的情况下完成指令,诸如摘取笔帽,从视频来看,机械臂能精准识别到笔帽并完成摘取操作,同时右臂依然握住笔杆。

以及把芒果放进容器内的操作,但从视频来看,似乎机械臂并未准确定位到容器中央。

而从任务成功率的数据来看,G1-OP机器人总体成功率从17.1%提升至44.1%,G2-90D机器人从13.4%提升至31.1%,且5,000到30,000小时仍未见明显饱和。

另外,虽然G1-OP机器人贡献超50%训练数据,G2-90D机器人占比不足2%,但后者总体成功率仍随共享数据扩大提升17.7个百分点,出现了跨本体的能力迁移。


最后,微调后的GE-Act 2.0在RoboTwin陌生环境测试中取得60.52%成功率,在GenieSim指令遵循测试中获得0.770分,均超过π0.5、GR00T N1.7等参与比较的模型。
结语:从头训练,验证具身Scaling Law
从GE-Act 2.0的发布来看,智元正在试图回答具身智能领域一个核心但尚未被充分验证的问题:世界—动作模型是否也能像大语言模型一样,走出一条清晰的Scaling Law路径?
答案是初步肯定的。当训练数据从300小时扩展到3万小时,模型不仅在原有任务上表现更稳定,更在折叠毛巾、嵌套纸杯、插花等精细操作上出现了“顿悟”。
不过,G1-OP零样本44.1%的成功率也提醒我们,这条路径虽然被验证存在,但距离真正的应用仍有不小的距离。
跨本体迁移的出现固然令人振奋,说明模型学到的并非某一台机器人的肌肉记忆,而是某种更通用的操作语义,但G2-90D在部分任务中暴露的定位偏差以及数据上的差距,也说明能力在不同本体间的迁移可能并不均匀。
接下来值得关注的,是当数据规模继续扩大一个数量级后,是否还会涌现出现在尚未预见的新能力,以及能否实现更广泛的应用。
技术博客:https://ge-act-v2.github.io/#conclusion