机器人前瞻(公众号:robot_pro)
编译 | 钟宸
编辑 | 漠影

机器人前瞻8月11日报道,今天,Dyna Robotics发布世界动作模型Dyna-2,该公司称,这一模型预训练数据集包含超100万小时的第一人称人类视频数据,囊括4380万个片段,97160条任务指令,9917种物体。

Dyna-2还首次证明,人类行为到机器人行为的scaling law真实存在,也就是说,预训练过程中使用越多的人类数据,该模型在处理那些机器人从未见过的数据时的预测效果就越好。

Dyna Robotics成立于2024年,由Lindon Gao、杨世远(York Yang)和Jason Ma三位华人联合创立。公司总部位于美国,并在中国上海设有硬件研发中心。该公司此前还发布了Dyna-1,是全球首款可落地于商业场景的灵巧操作基础模型。

Lindon Gao任联合创始人兼CEO,和York Yang同为连续创业者,上一家创办的公司Caper AI被Instacart 以约 3.5 亿美元(约合人民币23.6亿元)收购;

Jason Ma是宾夕法尼亚大学GRASPP实验室博士,主攻机器人基础模型和强化学习,曾在Google DeepMind、英伟达、Meta AI工作。

在去年9月,该公司完成了1.2亿美元(约合人民币8.1亿元)的融资,英伟达、三星、LG、亚马逊都参与了此轮融资。

一、具备灵巧手操作能力,可在干扰下完成任务

该公司展现了采用Dyna-2的机械臂在干扰下可完成的各项任务,包括干扰灯光、视觉受限、人为干扰等情况,展现了鲁棒性和预测能力:

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲在迪斯科灯光下切菜(来源:Dyna Robotics)

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲在闪烁灯光下切菜(来源:Dyna Robotics)

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲在遮住摄像头情况下切菜(来源:Dyna Robotics)

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲在人为干扰情况下切菜(来源:Dyna Robotics)

而在该公司官方账号展现的视频中,该模型还具备可教学性、灵巧手操作能力以及对指令的遵循:

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲可教学性(来源:Dyna Robotics)

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲灵巧手操作能力(来源:Dyna Robotics)

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲可遵循指令(来源:Dyna Robotics)

而在X(原推特)平台上,部分网友对该成果评价较高:

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

也有网友讨论技术细节,认为这一成果的发布预示着世界(动作)模型的成功:

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna也将Dyna-2的早期版本与Dyna-1进行了对比测试。

Dyna-1是该公司之前发布的模型,使用了VLA架构,在动作预测方面也采用了类似的Transformer混合架构,其初始化参数来自Qwen3-VL-3B。

该公司在相同的条件下对这两个模型进行了训练和比较,以下是7项基准测试任务的总体结果:WAM的成功率是VLA的1.55倍,其评分则相当于VLA的1.12倍

在同时考虑预训练阶段的检查点步骤(checkpoint step)和后训练的测试结果的直接对比中,Dyna-2的胜率为65%,Dyna-1的胜率为29%,另有6%的案例为平局。VLA的大部分胜利都发生在预训练的早期阶段,也就是在WAM模型尚未建立起预训练优势之前。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

此外,由于后训练数据集的规模较小,Dyna-1在处理这类任务时容易受到干扰而无法正常运行。而Dyna-2则无需人工干预,即便在极端的工作条件下也能正常运行。

该公司宣称,像Dyna-2这样的通用模型的一大优势在于可以直接应用于客户现场的实际情况中,无需进行额外的微调。

虽然在内部测试中,Dyna的两代模型成功率均为100%,但在实际使用环境中,Dyna-1的合格率为46%,Dyna-2的合格率为87%。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

二、验证scaling law,首发模型单步蒸馏流程

而Dyna-2作为世界动作模型,是一个单一生成模型,能够同时或分别对未来的视频和动作进行去噪处理

该模型以视频扩散架构为基础。在架构上,Dyna-2结合了Transformer的混合架构:无论是视频还是动作,每种输入数据都被单独分词处理,然后通过相应的DiT层进行处理。这些DiT层可以通过注意力机制相互协作。而本体感知信息则被直接作为输入传递给动作预测模块。

在处理视频时,会使用因果掩码机制(causal masking);而在处理动作时,则使用双向注意力机制(bidirectional self-attention,不使用因果掩码),同时还会考虑所观察到的视频中的相关元素。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna采用流匹配算法(flow matching)来训练模型。具体而言,令c表示条件上下文(过去的画面、本体感知信息以及语言指令), z表示未来的视频内容,a则表示未来的动作信息。按照标准的流匹配流程,该模型会逐步将来自各模态的受损真实样本通过噪声转化。

同时,该公司训练网络uθ来预测速度,从而对受损样本进行去噪,以下为公式:

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna为训练模型,收集了超过一百万小时的人类操作视频。该公司介绍,这些视频大多是人们进行日常操作时的第一人称视角视频,如烹饪、整理物品、折叠衣物、组装物品等,由其数据合作伙伴以及该公司团队共同收集而来。

该公司建立了完善的数据清洗、手部动作提取、验证和过滤流程,以确保来自不同来源的数据的准确性和一致性。对于那些符合手部动作质量标准的视频,其标注信息中包含3D手部动作数据。

该公司利用这些数据推导出动作模型训练所依赖的伪动作监督(pseudo-action supervision)。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

对于scaling law的验证,Dyna分别基于两种连续误差指标和两种离散的、基于阈值的准确度指标来分析结果,并让Dyna-2模型在从一千小时到一百万小时不等的不同人类数据量上进行训练,然后利用此外的人类数据集(held-out human dataset)来评估模型的性能。

结果显示,无论哪个指标,模型的预测性能都呈单边上升趋势

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna还利用了两个机器人数据库的39项任务对Dyna-2进行了测试,涵盖了诸如布料处理、打结、打包、清洁、食品服务以及组装等各种日常操作场景。该公司称,接受测试的模型的训练数据均不来自数据库。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna展示了测试评估的结果(使用零样本离线机器人,在两个固定的双臂操作平台上完成),所有评估指标都随着预训练数据量的增加而呈现出单调的变化趋势。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna还宣称,这是首次在存在实体形态差异的跨平台场景下验证出scaling law。其研究还发现,当预训练数据量从1万小时增加到10万小时时,模型性能会出现一个转折点。该公司认为,只要预训练数据量足够大,跨平台场景的知识迁移(cross-embodiment knowledge transfer)能自然实现。

在Dyna的研究中,其还开发了一套单步蒸馏流程,能够将完整的Dyna-2模型蒸馏为一个单步学生(one-step student)模型,从而以更高的吞吐量生成视频。该公司称,这是首个面向视频生成的单步蒸馏流程,能生成高质量的指令控制操作视频,且可用于规划和评估。

不过,Dyna也承认,其生成的视频质量仍无法与全精度模型相媲美。

该公司的方法是将单步视频生成视为一个控制问题,也就是学生(student)与不断移动的目标之间的“追逐游戏”。

Dyna不把“教师”(teacher)固定为模型目标,而是让学生与一条连续的目标路径进行互动,这条路径从初始化时可达的位置开始,一直延伸到数据本身。

该路径会根据学生对目标的响应情况实时调整,因此,目标只会以学生能够跟上的速度向后移动,从而始终处于可到达的范围内,确保了得分的可靠性。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

通过这一方法,模型的推理成本降低了90倍,同时仍能保持出色的视频生成质量。

在使用单个H100芯片处理时,对于一段时长为三秒、包含三个视角的视频,该模型的处理时间从10,203毫秒下降到了110毫秒

也就是说,只需单次网络评估(single network evaluation),就相当于用传统方法需要上百次评估才能得到的结果。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna-2的单步蒸馏流程,使模型能够直接生成高保真度的、受指令条件影响的“以自我为中心的未来场景”。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

Dyna Robotics成立于2024年9月,目标是制造高性能、通用型机器人。该公司估值目前已突破6亿美元(约合42.7亿元人民币)。

英伟达押注的华人团队发布世界动作模型Dyna-2,验证跨本体scaling law

▲左为York Yang,中为Lindon Gao,右为Jason Ma(来源:Dyna Robotics)

公开资料显示,三位创始人均为华人背景:

Lindon Gao自幼随父母从中国移民美国,本科毕业于纽约大学斯特恩商学院。

而York Yang出生于中国杭州,本科毕业于浙江大学电子工程专业,在中国完成本科教育后赴美求学,硕士毕业于UCLA计算机专业。

Jason Ma博士毕业于宾大GRASP实验室,曾先后在英伟达AI、Meta AI和谷歌DeepMind任职。

团队其他核心成员则来自哈佛、MIT、Berkeley等著名高校以及谷歌、Nvidia、Aurora、Cruise等头部科技公司。

查看完整技术报告,了解更多技术细节:http://dyna.co/dyna-2

结语:踏过百万小时门槛,具身想象力再提升

Dyna-2的发布,或许标志着机器人学习正从“专用模型”走向“通用世界模型”的关键拐点。

行业曾经普遍认为,想实现具身智能的能力涌现,至少需要百万小时级的真实物理交互数据,而Dyna通过目前最为热门的第一人称视频数据踏过这一门槛。

而对于如何让规模庞大的世界模型落地机器人本体这一难题,Dyna也给出了自己的方法。

当百万小时的人类视频数据足以让模型在存在实体形态差异的跨平台场景下验证出scaling law,当单步蒸馏将推理延迟从10秒压缩到110毫秒,Dyna Robotics证明的不仅是技术可行性,更是一种商业想象力——一个无需现场微调、即插即用的通用世界动作模型,可能正在重新定义机器人落地的成本曲线。