机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思

机器人前瞻9月8日报道,今天,松延动力正式发布通用具身智能技术品牌Scalabot

Scalabot致力于构建机器人理解世界、推演未来与自主行动的核心能力,让智能从模型走向真实世界。让机器人能在没见过的环境里完成没被教过的任务。

而此次同步对外发布的HERON-World Model则是Scalabot技术架构体系HERON下的首个世界模型。

HERON-World Model 是面向具身交互的动作条件世界模型。也就是说,模型把抽象的动作序列,转换为可以观看、分析和比较的视频。

只需给到模型当前场景、历史观察、可用的机器人状态、任务指令和候选动作,模型就能生成对应的未来视频。保持起点不变、替换动作条件,就可以观察不同预测分支中的运动与场景变化。

在WorldArena 1.0 Track 1 的开源测试方案中,HERON-World Model 的综合得分为75.80分。

松延动力称,未来,Scalabot将以家庭服务为重要场景,同时向商业服务等其他领域延伸。

一、四项协同设计打通规模化预训练

HERON-World Model的核心突破在于解决了数据从何而来、动作如何被理解、已有知识如何被利用以及模型容量如何增长四个问题,并据此形成四项相互配合的设计。

1、训练数据的扩展

如下图所示,模型将真实机器人遥操作、重建仿真与人类第一视角操作视频组织为三层互补的预训练数据金字塔

让机器人先预演、后行动,松延动力发布世界模型

▲预训练数据金字塔

顶层的真实机器人数据提供同步观测、本体状态与控制记录,建立动作和真实执行结果的直接对应。中层的仿真数据通过改变初态、对象与动作组合,补充难以反复实采的交互情形;底层的人类视频覆盖日常对象、工具使用、双手协作与多智能体交互,为扩展视觉经验提供可规模化的数据来源。

三者纳入同一个预训练过程,通过共享动作接口与未来视频预测目标,把不同来源的经验汇聚到同一个模型。

但如果人类视频缺少标准控制日志,动作恢复也会受到遮挡和估计误差影响。团队的处理方式是把可靠性落实到具体时刻和具体动作分量,例如,一只手被遮挡,不必同时丢弃另一只手与相机的可靠运动信息,简而言之,可以完全确定的信息提供完整的内容,部分可靠的信息只保留可信的部分。

2、动作接口的扩展

机器人关节目标、人类手腕运动和仿真控制记录原本采用不同的时间、坐标与数据格式。

团队设计了完整的数据管线,在数据侧完成时间同步、坐标转换与运动整理等操作,把所有异构动作统一到相同的动作空间,再通过Action Encoder转换为模型使用的Action Token。动作方向、幅度与执行时序由此成为未来视频预测的明确条件。

数据侧完成物理含义的对齐,统一动作编码连接不同来源,未来视频预测则为它们提供共同的学习目标。

3、知识隔离和梯度截断

在架构上,团队结合 Mixture-of-Transformers(MoT)与 Mixture-of-Experts(MoE),分别组织语言知识与视频生成的参数分工,以及不同生成阶段的参数分配。

如下图所示,MoT 将预训练视觉语言模型(VLM)的语言路径与动作条件扩散 Transformer(DiT)连接起来,VLM 语言分支及其 MoT 参数保持冻结,通过逐层单向注意力向 DiT 提供任务信息。

让机器人先预演、后行动,松延动力发布世界模型

▲动作条件世界模型整体架构

具体而言,VLM 分支接收任务语言,并保持预训练参数冻结;初始画面与历史视觉由视觉编码器转换为词元,连同本体状态、Action Token 和带噪未来视频词元进入 DiT 生成分支。

DiT 通过单向联合注意力逐层读取VLM的KV Cache,根据特征层的交互在生成分支内建模视觉、状态与动作的关系。在训练过程中,VLM 的参数梯度在冻结的预训练语言编码路径处截断。

这使得模型既可以复用 VLM 大模型的深层语言理解能力,将组合式指令解析为粒度条件信号,同时利用VLM模型内化的世界知识。这样就保证VLM不会“一边学,一边忘”。

4、生成容量的扩展

随着数据覆盖扩大,模型既要处理相机和身体移动引起的整体画面变化,也要处理手指、夹爪与物体之间的局部交互。同时各阶段对于场景结构与视觉细节的建模需求也有所不同。

因此,团队提出在生成 DiT 中采用高、低噪声双专家模型架构:高噪声专家侧重场景布局与大尺度运动,低噪声专家侧重对象边界、局部几何与精细交互。多专家MoE路由依据当前噪声阶段选择专家,每个去噪步只激活一个生成专家。

二、从闭环模拟到策略优化

在应用上,世界模型可以成为策略模型开展模拟交互的基础。策略产生动作,世界模型返回预测观察,策略再根据新的观察决定下一步。接入奖励评价与强化学习后,这种循环还可用于探索策略优化。

该模型的价值不仅是展示一段未来视频,还能为复杂任务提供可反复调用的预测接口,让执行分析、候选比较与后续学习能够围绕同一个模型展开。

1、动作条件视频滚动与长程闭环模拟

从真实初始画面出发,策略模型根据当前观察与任务指令生成一段动作,HERON-WM 预测动作执行后的画面,再将片段末帧与近期视觉历史反馈给策略,形成“生成动作—预测画面—更新观察”的长程闭环模拟。

每轮动作都依赖上一轮预测结果,而非预先固定的动作序列,从而在无需逐次实体执行的条件下,支持对策略执行过程的分析与评估。

如下图所示,在执行“将红色积木移至中央,再将绿色积木叠放其上”的任务中,策略与世界模型交替推进伸手、抓取、搬运和堆叠等步骤,预测画面持续作为下一轮决策的观察,将多个动作阶段串联为完整的任务模拟。

过程中产生的动作与预测画面还可整理为合成轨迹数据,用于后续的策略分析与数据构建。

让机器人先预演、后行动,松延动力发布世界模型

▲策略与世界模型交替运行,预测画面成为下一轮动作生成的观察。

2、基于预测后果的候选动作评估

在相同初始观察与任务指令下,策略或规划器会提出多组候选动作,由HERON-WM分别预测对应的未来视频。

任务评分器根据预测结果与任务目标的符合程度进行评分,选出得分最高的动作;需要评价动作跟随程度时,也可将候选动作一并纳入评分。

世界模型负责预测后果,评分器负责评价后果,使策略能够在实际执行前比较不同动作的预期结果。

例如,在针对“将绿色积木叠放到蓝色积木上”的指令时,策略提出不同的候选动作,世界模型生成各自对应的预测轨迹,再由任务评分器比较其与目标的符合程度。

如下图所示,图中选择评分最高的候选A2进入执行,形成“提出候选—预测后果—评估筛选—执行动作”的决策流程。

让机器人先预演、后行动,松延动力发布世界模型

▲相同初态下展开多个候选未来,经任务评分后选择动作。

3、滚动时域规划

而闭环模拟也可以与真实执行结合。系统只执行当前选中动作的一小段,随后读取新的真实观测,再预测和比较下一批候选动作。

模型内闭环使用预测结果继续推进,滚动时域规划则不断用真实反馈重新锚定状态。两者分别服务于离线推演与在线决策;短时预测如何改善真实任务表现,需要结合推理时延和执行反馈共同评估。

4、反事实轨迹生成与策略优化

从同一真实起点改变动作方向、幅度或执行时序,可以构造多组动作—后果样本,为不同操作方式、失败过程与恢复尝试提供候选训练数据。

进一步接入奖励模型和强化学习算法,世界模型可以承担策略训练中的模拟环境:策略尝试动作,模型返回预测观察,奖励反馈驱动策略参数更新,再通过真实交互检验和校正。

这使世界模型从预测与评估接口进一步进入策略优化循环。

三、最高得分100分,最低得分仅39.6分

在真机验证上,团队采用WorldArena 1.0 Track 1的开源测试方案和测试集作为评估标准,该榜单涵盖视觉质量、运动质量、内容一致性、物理遵循、三维准确性与可控性六大维度,能够较全面评估世界模型的综合表现。

结果显示,HERON-World Model在该测试上综合得分为75.80分,领先UNIS(73.64)、SisyphusWorld(73.06)等基线模型。

在运动质量上,该模型的表现最优,取得满分成绩;在内容一致性上,该模型得分为90.11分,为次优;但在视觉质量上,该模型仅得39.60分,在榜单中并非处于领先。

让机器人先预演、后行动,松延动力发布世界模型

▲WorldArena 1.0 Track 1视觉质量、运动质量、内容一致性榜单

在物理遵循、三维准确性与可控性三个维度上,该模型的表现均领先于UNIS、BWM-Fast等基线模型。

让机器人先预演、后行动,松延动力发布世界模型

▲WorldArena 1.0 Track 1物理遵循、三维准确性与可控性榜单

此外,团队还在EgoDex、AgiBot 与 RoboTwin 上划分测试集,分别涵盖人类第一视角操作、真实机器人与仿真场景,评测 HERON-WM 在重建质量、视觉质量、内容一致性、时序表现、几何精度和交互控制6大方面上的13项量化指标结果。

结果显示,该模型在EgoDex、AgiBot与RoboTwin三个测试集上,同样展现了领先性能。

让机器人先预演、后行动,松延动力发布世界模型让机器人先预演、后行动,松延动力发布世界模型

让机器人先预演、后行动,松延动力发布世界模型

如动图所示,在打开冰箱、提起水壶、纸杯盖合和抛接球等AgiBot与EgoDex案例中,HERON-WM 能够较好地跟随给定动作,并连贯呈现门体受拉转动、水壶随手部移动、杯盖与纸杯接触等变化,使体现出较好的动作可控性与物理一致性。

让机器人先预演、后行动,松延动力发布世界模型

结语:为具身智能铺一条“先预演、后行动”的路径

大语言模型把不同来源的文字组织成统一的词元,以预测下一个词元为预训练范式。具身智能面临的,是把这条路径延伸到物理世界。

HERON-World Model的价值在于为机器人提供了一种可反复调用的预测接口,让执行分析、候选比较与后续学习能够围绕同一个模型展开。

但该模型在真机验证中的视觉质量上的得分并非处于领先位置,且仿真环境与真实世界仍有距离,是否真的能够在真实物理世界中取得好的效果,仍需要观察。