机器人前瞻(公众号:robot_pro)
作者 | 江宇
编辑 | 漠影
机器人前瞻9月10日报道,刚刚,宇树公开了新一代通用人形机器人基础模型UnifoLM-WLA-1.0。
这是一款参数量为60亿的具身智能模型。宇树称,其使用约2500小时高质量真机数据训练,一套模型即可驱动机器人完成64项桌面操作和全身操作任务,并能够同时适配平行夹爪以及两类灵巧手。
从官方展示来看,这64项任务包括10项全身操作任务和54项桌面操作任务。

▲倒垃圾(前半部分)

▲倒垃圾(后半部分)
前者涵盖倒垃圾、把衣服放进洗衣机、整理鞋子、收拾浴室和厨房、铺床、取蔬菜、整理沙发等场景;

桌面任务则包括叠毛巾、叠衣服、收纳餐盘、电池充电等。
值得注意的是,宇树为UnifoLM-WLA-1.0加入了一套“具身推理+未来变化预测+动作学习”体系:机器人既要理解当前看到的空间和物体,也要预测一次交互可能让场景中的什么地方发生变化,随后再生成具体动作。
宇树将其概括为:Understand the World, Connect with Action——理解世界,并将理解连接到行动。
目前,宇树官网中的Code、Models和Datasets均显示为Coming soon,相关代码、模型权重及数据集尚未正式开放下载。
项目主页:
https://unigen-x.github.io/unifolm-wla.github.io/
一、一套模型干64种活,还要同时控制手和身体
UnifoLM-WLA-1.0被称之为“通用人形基础模型”,核心在于把双臂协作和全身操作放进了同一套模型。
以往不少机器人操作模型主要关注机械臂和末端执行器,比如抓取、放置、整理物品。但当任务从桌面走向真实家庭环境,机器人经常需要同时移动身体、调整姿态,再配合双臂和末端执行器完成操作。
在宇树给出的案例中,搭载该模型的机器人可以同时调动双臂、末端执行器和下半身,完成多项需要全身协同的操作任务。
比如机器人整理鞋子、厨房、浴室时,涉及在更大空间范围内移动和连续操作;

▲浴室
铺床等任务中,双臂动作也需要和身体姿态进行配合。

▲铺床(前半部分)

▲铺床(后半部分)
宇树称,UnifoLM-WLA-1.0目前可以由同一套模型完成10项全身操作和54项桌面操作任务。同时,这套模型没有绑定单一末端执行器,可以支持平行夹爪和两种灵巧手。
宇树为此建立了一套统一动作空间,将机器人动作拆成末端执行器位姿、末端执行器关节和下半身关节三部分,再分别通过RVQ,也就是残差向量量化模型,将连续动作转化为离散Token。

▲离散动作学习
简单来说,机器人原本连续变化的手臂、手指和身体运动,被转换成了模型可以统一学习和预测的“动作词元”。这些不同身体部分的Token还会按照共享时间步对齐,一起送入模型,从而学习手、末端执行器和下半身之间的协同关系。
二、先预测“哪里会变”,再让机器人动手
UnifoLM-WLA-1.0另一个比较特别的地方,在于宇树把交互后的场景变化也放进了模型训练。
在真正动手之前,机器人通常能够大致判断自己的动作会带来什么结果。
比如叠毛巾时,手移动以后毛巾会发生形变;拿起餐盘后,餐盘原来的位置会变空;推动或者拿取一个物体时,真正发生变化的区域通常只占整个画面的一部分。

▲包装手机
宇树把这类信息称为Dynamic Region,也就是动态区域。
具体来看,其首先利用光流从前后视频帧中提取发生变化的区域,再通过VQ-VAE把这些连续变化压缩成固定长度的离散Token。此后,模型只需要看到当前图像+任务描述或动作条件,就可以预测未来哪些区域可能发生变化。
这样一来,模型学习的内容不再局限于“现在画面里有什么”,还包括“如果执行这个动作,接下来哪里可能发生变化”。这构成了宇树所谓的interaction-centric world modeling,即以交互为中心的世界建模。
在这一基础上,宇树又把视觉、语言、动态区域Token和动作Token放进统一的多模态模型中,形成UnifoLM-ER-Flow。
最终的UnifoLM-WLA-1.0则进一步在这套多模态骨干上增加MMDiT Action Expert动作专家模块,用于生成连续机器人动作。
三、500万份具身推理数据,7项开源评测拿下第一
在训练机器人真正“动手”之前,宇树还单独强化了模型的空间理解和具身推理能力。
其具身推理模型UnifoLM-ER-1-4B基于Qwen3-VL-4B训练,使用了超过500万份具身推理样本。这些数据覆盖图像点预测、物体检测、多图推理、2D轨迹预测、3D物体检测以及多图空间问答等任务,同时与通用图文数据共同训练,以尽量保留基础视觉语言能力。

▲模型架构
此次,宇树便公布了16项多模态感知和理解Benchmark结果。
UnifoLM-ER-1-4B在RefSpatial-Bench、Where2Place、PixMo-Point、BLINK、EmbSpatial、RoboSpatial和VSR共7项测试中取得参评开源模型最高成绩。

例如,其在Where2Place上取得82.0分,PixMo-Point为73.8分,EmbSpatial为88.9分,RoboSpatial为73.1分。
这组测评的参评模型中,也不乏GPT-6 Astra、GPT-5.6 Sol等顶尖闭源模型。在双方均参与的测试中,UnifoLM-ER-1-4B在多项空间理解任务上的成绩超过GPT-6 Astra。
其中,Where2Place达到82.0分,比GPT-6 Astra高13分;BLINK达到93.4分,高3分;CV-Bench达到88.6分,高1.3分;EmbSpatial达到88.9分,高5.6分。
结语:宇树继续补齐人形机器人“大脑”
从这次UnifoLM-WLA-1.0来看,宇树在人形机器人模型上的布局正在进一步完整:围绕人形机器人“大脑”的探索,已经逐步串起感知理解、交互预测到动作生成这条链路。
目前,宇树已经公开UnifoLM-WLA-1.0项目主页,并预告后续将开放模型、代码和数据集。
如果这三部分后续全部落地,开发者将能够更直接地验证其在64项任务之外的泛化能力,也能看到宇树这套路线在不同机器人和真实任务上的表现。