机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思
机器人前瞻8月21日报道,在2026世界机器人大会上,一台机器人拿起黄瓜,削皮、切片,动作流畅连贯,1分钟零失误削完一根黄瓜。几步之外,另一台机器人正在将一块块异形积木精准拼插,每10秒完成一次拼装。而在传送带区域,机器臂以3秒一次的节拍完成抓取和放置。

▲削黄瓜
削黄瓜、切黄瓜、搭建积木长城、传送带分拣,四个真实场景,同一个模型。原力灵机带来的具身基础模型DM0.5,正在用同一套“大脑”跨越厨房案板、展台和产线传送带三种截然不同的场景。
今年7月,原力灵机发布DM0.5,该模型定位为面向开放世界的通用具身基础模型。相比上一代 DM0,DM0.5 拥有更大的数据规模、更先进的架构、更强的开放世界泛化能力。
一、不只是看图说话,而是对动作和环境进行预测
WRC现场,原力灵机的展台前,机器人正在削黄瓜、垒长城、分快递,具身智能行业发展到现在,机器人已经不再局限于“跳舞”,而是在真正干活。
原力灵机有一个判断:跳舞潮正在退去,模型走向C位的时代到了。过去两年,人形机器人在舞台上翻跟头、跳舞的画面已屡见不鲜,但这些只是表演,离进入真实场景干活还有距离。如今,评判标准已经从“能不能动”转向“能不能干”。
原力灵机认为,具身规模化场景会先于具身的GPT时刻出现。什么意思?业界一直在期待一个“万能模型”的出现,就像ChatGPT出现那样,但具身智能的特殊性在于,模型再强,也要在物理世界里接受检验。
与其等待一个遥不可及的完美时刻,不如让模型先进入真实场景,在具体场景中迭代能力、积累数据。“用起来”本身就比“等一个最好的模型”更重要。

▲原力灵机创始人、CEO唐文斌
正是基于这一判断,DM0.5在训练数据规模、数据质量、架构创新以及开放世界泛化能力四个方面实现全面升级,意味着DM0.5从传统的“执行固定指令、单次动作重复”,进化为“理解意图、多维连续泛化、长时可靠运行”。
相比上一代DM0,DM0.5的核心优势主要体现在Zero-Shot能力、Fine-Tuning 能力、长记忆能力、动作鲁棒性、多机型适配性五个方面:
第一,Zero-Shot能力。 这是DM0.5最核心的提升方向。简单说,就是让模型在陌生的开放环境中,直接听懂用户的自然语言指令并完成任务。
第二,Fine-Tuning高效可靠。 基础模型越强,下游的专用模型就越强。DM0.5在特定任务上进行微调时,训练效果更好,成本也更低。
第三,长记忆能力。 DM0.5的架构支持历史信息学习,最长可记住60秒内的任务进程。这意味着在执行削黄瓜、垒积木这类长流程任务时,模型清楚自己做到哪一步了,知道前后逻辑关系,不会做着做着就”断片”。
第四,动作更加鲁棒。 光线变化、相机视角调整,甚至人为主动干扰……在这些情况下,DM0.5依然能保持稳定的动作表现。
第五,多机型支持。 DM0.5已在多种不同型号的机器人上进行训练,模型可以通过后训练快速迁移到从未见过的机型上。换了硬件,大脑依然通用。
在技术架构上,DM0.5延续VLA架构,以4B VLM作为多模态主干,并配置680M Action Expert生成连续机器人动作。

▲DM0.5架构图
同时,相比DM0,DM0.5的重点不只是扩大模型和数据规模,而是在历史上下文、具身推理、动作监督和数据质量上做系统增强。
传统VLA模型通常在每个控制步只输入当前图像和当前状态,适合短时、局部操作任务。
而DM0.5通过引入历史帧,让模型在决策时能够获得短期情境记忆。
模型会同时接收当前帧和过去若干关键帧,提供长达1分钟的任务进程状态变化,物体是否已经被拿起、区域是否被清理、机器人是否经过了某个地标……
训练时,数据管线会从当前时刻向前采样多个历史slot,每个历史slot通过时间采样和空间抽样,合并为固定数量的视觉token,采用随机历史长度和历史增强,使模型同时适应长历史、短历史和无有效历史的输入状态。
DM0.5在机器人数据中引入11种不同的自回归任务,使训练不仅依赖连续动作监督,也持续强化指令遵循、动作预测和时序环境感知。
在训练过程中,DM0.5的具身推理任务主要分为三类:
1、任务规划。模型需要识别当前任务执行到了哪个阶段,前后步骤是什么关系,整体进度如何。
2、事件与环境预测。模型不仅要看当前画面,还要预测下一秒会发生什么。
3、动作生成。在前两种推理的基础上,模型还要生成未来一段时间的动作序列。
该任务设计是为了让模型不只学习当前画面对应的动作,还要学习在当前指令和任务进程下为什么应该执行这段动作,以及未来世界状态会发生的变化。
机器人采集的数据中,同一任务的多次采集存在不同执行节奏,如果把模型预测动作与原始轨迹的固定时间位置强绑定,模型学习的内容会产生偏差。
DM0.5通过动态动作匹配,将监督从“固定时间点对齐”改为“轨迹进展对齐”。
模型输出固定长度的未来动作片段,数据侧保留更细粒度的真实动作轨迹。训练时为每个预测动作在真实轨迹中选择动作锚点,并且为了避免时间反转,要求越靠后的预测动作,只能匹配到越靠后的真实轨迹位置。
每个候选匹配的损失由预测动作与真实动作锚点之间的误差计算,整体匹配通过动态规划进行计算,使所有预测动作的匹配总损失最小。
这一机制能够降低遥操作数据中的时间相位噪声,使模型更关注抓取、对准、接触、释放等任务关键动作变化,从而提高动作生成的平滑性、鲁棒性和跨采集员节奏泛化能力。
二、从Zero-Shot到Fine-Tuning:DM0.5的真机实验说了什么
为评估模型在未见任务配置下的零样本泛化能力,原力灵机从动作类型与条件约束两个维度系统考察模型性能。
其中,动作维度涵盖8类基础操作原语:pick、put、move、pull、cover、wipe、stack、press;条件维度则包括颜色、形状、尺寸、状态、执行序列、相对位置及绝对位置共7类语义约束。
在实验设置上,原力灵机设置每个测试任务均由至少一个动作原语构成,并根据设计可选配若干条件约束,以模拟真实操作中指令的多样性与组合复杂度。
在上述任务集上,原力灵机选取了四组模型X平台的组合开展对比评测,在 Franka平台部署Pi0.5-Droid与DM0.5-Droid两个模型;在Dexmal-Mirror平台部署DM0与DM0.5两个模型。

▲实验结果
实验结果表明,DM0.5在绝大多数评测维度上均显著优于对比模型,已形成较为系统的Zero-Shot动作执行与语言条件理解能力。提升主要体现在动作覆盖范围扩大、基础操作稳定性增强,以及对多类语义约束的指令遵循能力提升。

▲实验结果
在评估Fine tuning能力时,使用 RoboChallenge Table30 v2 评测DM0.5的真实机器人桌面操作能力。该评测覆盖多类真实桌面操作场景,包括长期记忆、视觉感知与目标定位、精细抓放等维度。
实验结果表明,DM0.5在Table30 v2 上取得了 SOTA,整体 Success Rate为43%,综合Score为54.42。 在盖章定位、按按钮等需要记忆目标状态和动作顺序的任务中,DM0.5 的记忆能力显著提升了执行稳定性。
此外,原力灵机在单臂操作环境 Libero 与双臂操作环境 RoboTwin2.0中评估了DM0.5 的微调能力;还使用R2R和RxR两个基准评测DM0.5在导航上的性能。
▲ LIBERO综合评测和RoboTwin2.0评测
同时,在导航场景仿真测试中,DM0.5在R2R和RxR的Val-Unseen数据集上,成功率分别达到59.7%和 65.5%,相比所有基线方法均取得了显著优势。

▲R2R Val-Unseen数据集评测
三、削黄瓜、垒长城、分快递,同一个模型的多任务适应能力
WRC现场,DM0.5将用四个真实场景回答同一个问题:一个模型到底能覆盖多少种截然不同的任务?
削黄瓜+切黄瓜,黄瓜是典型的柔性物体,表皮光滑、质地柔软、形状不规则,机器人要完成削皮和切片,需要实时感知接触力、调整刀具角度和速度。

▲削黄瓜
DM0.5展示的是毫米级手感控制能力,这背后是模型对力反馈的实时理解和对动作的连续调节,而非预设轨迹的机械重复。1分钟无失误削完一根黄瓜。

▲切黄瓜
多机器人协同搭长城模型,每10秒完成一次拼装。积木长城涉及多块异形积木的识别、对准和插接,精度要求达到亚毫米级。
更重要的是,多机器人协同意味着DM0.5不仅要控制单个机械臂,还要在多个本体之间协调动作序列。

▲搭长城
混合SKU快节拍物流分拣,3秒完成一次精准抓取和放置,准确率超85%。传送带上的货物品类混杂、位置随机,DM0.5需要在高速运动中完成识别、决策和执行。
▲物流分拣
结语:具身智能的下一站,是让模型在真实世界里“干活”
过去两年,VLA模型让机器人迈向了视觉、语言与动作的统一建模。机器人不再只是根据固定程序执行动作,而是开始理解自然语言指令、识别开放世界中的物体。
但一个通用机器人基础模型,不能只在固定场景完成既定的任务。它需要真正理解任务的指令,在不同物体状态、不同环境、不同机器人本体和各类干扰下保持稳定可靠执行。
这正是DM0.5的出发点:走出实验室,走向开放世界。
从削黄瓜的毫米级手感,到垒长城的亚毫米级精度,再到传送带上的工业级节拍,通用具身基础模型一步步走向厨房、展台和产线。具身智能离“进入真实世界”的距离,正在被一步步缩短。