机器人前瞻(公众号:robot_pro)
作者 | 刘俐杉
编辑 | 许丽思
现在具身智能行业最热的话题是什么?落地应用。
工厂里,机器人学着搬运物料;酒店里,机器人来回做配送。这些工作听起来不复杂,无非是把东西从A点搬到B点。但一个容易被忽略的前提是,机器人得先搞明白:目的地在哪里,路该怎么走。
如果把这个任务放到更复杂的场景里呢?今天在工厂搬货,明天被调到酒店送餐;上一秒跟着人走,下一秒要自己找到某个物体。环境变了、任务变了,甚至连机器人的“身体”都换了,它还能不能继续正常工作?
说到底,这不是算法设计的问题,是数据的问题。
真实世界里采集机器人数据有多难?你需要把一个机器人放到一个具体的环境里,让它执行一个具体的任务。跑完一轮,数据才算到手。换台机器人?重新采。换个场景?重新采。换个任务?还是重新采。成本高、速度慢,根本跟不上模型迭代的节奏。
亮源新创近日开源了通用导航大脑LightNav-0。这个模型最特别的地方在于:部署到新机器人、新环境、新任务时,不需要用目标机器人的导航数据做训练,也不用额外微调,直接就能用。
研究团队走通了一条Real-Sim-Real的技术路径:先把2000多个真实室内外场景搬到仿真环境里,转化成可以反复使用的数字资产。然后在仿真中跑了4000多小时的导航训练数据,经过SFT(监督微调)和RL(强化学习)两轮训练后,最后回到真实机器人上做验证。

亮源新创2024年底成立,创始人兼CEO姜旭,2019年到2023年供职于OpenAI,完整经历了大模型从技术探索到产品落地的全过程。这次LightNav-0的训练思路,也能看到大模型后训练的影子。团队把Physical AI的发展拆成三个阶段:规模化预训练、规模化对齐、规模化部署。这次开源的LightNav-0也是对应的是第二阶段“规模化对齐”的重要实践成果。
一、把真实世界变成“可以反复使用的训练场”
先算一笔账。
如果完全靠真实世界采集数据,一个机器人、一个环境、一个任务,采集一组。效率极低,成本极高,数据量永远跟不上模型的需求。具身后训练最头疼的就是这个问题。
亮源新创的做法是:把真实世界的场景做成数字资产,反复使用。
他们搭了一个数据引擎,从互联网上采集了2000多个真实室内外场景(不同格式、不同来源),全部接入统一的仿真接口。进了仿真环境,每个场景就能变出无数种玩法——目标点不同、路线不同、视角不同、任务形式不同。
相机高度、安装角度也随机变化。这样模型在训练时看到的不是“固定视角下的单一场景”,而是各种机器人可能看到的画面——人形机器人的视角高度,四足机器人的晃动视角,轮式机器人的低矮视角,全都包含在训练数据里。
现实中调一次相机位置要费多大力气?在仿真里,这只是一个参数。
每个场景被采集一次,就可以源源不断地生成新的导航组合。真实世界的一次性数据,变成了仿真中可以反复调用的资产。
更重要的是,LightNav-0的数据引擎跑完一次仿真,输出的不只是一段视频。
它会生成一条对齐的数据记录:模型在这一帧看到了什么画面、对应的自然语言指令是什么、需要关注画面中的哪个位置、下一步该怎么移动——视觉、语言、动作、空间位置,四个维度同步对齐,形成一条完整的“具身经验”。
亮源新创特别强调,这种多模态对齐,才是把场景规模转化成模型能力的核心。如果只是渲染出一堆仿真视频,价值有限;但把这些视频和语言指令、动作序列、空间坐标精确对应起来,模型才能真正学到东西。
目前这套数据引擎已经跑出了4000多小时的视觉-语言-动作对齐经验。而更大的价值在于,这些经验不是一次性用完就扔的——真实世界部署中暴露的新问题,会反馈回来,成为下一轮训练需要补充的场景类型、任务类型和交互方式。采集→训练→部署→反馈→再采集,形成一个正向循环。

二、三步后训练:先看懂空间,再学会走路,最后从错误中长记性
数据有了,怎么训练?
亮源新创把LightNav-0的后训练拆成三个阶段:Embodied Reasoning(ER)中期训练、SFT监督微调、RL强化学习。通俗点说就是:先看懂空间,再学着走,最后在犯错中自己纠偏。
第一步:ER中期训练——先看懂“这是哪儿”
为什么需要这个阶段?
因为导航模型的很多基础能力,其实不一定要靠机器人走路的数据来学。
比如:把自然语言里的“沙发”和画面里的沙发对应起来;判断哪里能走、哪里过不去;理解“桌子左边”“柜子后面”这类空间关系;追踪视野里目标的移动。这些能力,靠图像和视频就能大规模学习,成本比让机器人满地跑低得多。
所以第一阶段,模型先拿大量的图像和视频数据做中期训练,把视觉和语言的空间理解能力建起来。第二阶段再引入机器人轨迹数据,把这些空间能力“接上”动作输出。
第二步:SFT监督微调——看大量成功案例,学“标准答案”
物理世界采集的轨迹数据有限,覆盖不了太多场景、路线、视角组合。但有了Real-Sim-Real这套数据引擎,一个真实场景被采集一次,就可以在仿真里变出无数条可执行的导航轨迹。

数据引擎拿到一个场景后,会自动识别哪些位置是可到达的,生成可执行的路径,从第一人称视角呈现,同时根据完成的任务生成相应的自然语言指令。每个episode从引擎出来时,都附带一份完整的同步记录:语言指令+视觉历史+图像空间点+运动轨迹。

第二阶段,模型就在这4000多小时的“对齐数据”上做监督微调——看大量“标准答案”,学习在给定指令和观察下,应该做出什么样的空间判断和动作。

第三步:RL强化学习——自己摔过跤,才知道怎么爬起来
SFT阶段有个天然的局限:它只给模型看成功的导航路线。
但真实世界里,机器人不可能每一步都走对。一次拐弯拐早了、一次刹车踩晚了、一次跟丢了目标,模型就被推到了“训练数据里极少出现”的状态。如果只在成功案例上学习,遇到这些偏离状态,模型就懵了。
第三阶段,RL出场。
这一阶段全程在仿真里跑。模型自己提出完整的导航计划,模拟器对结果打分——走对了奖励,走偏了扣分。训练信号不再来自“成功案例的模仿”,而是来自策略自身产生的轨迹和对应的结果。模型从自己的错误中学习,学会在偏离时把自己拉回来。
三个阶段串起来就是:先建立空间认知 → 再学习标准行为 → 最后在试错中自我优化。这也解释了为什么LightNav-0能在从没见过的机器人、环境和任务上表现出泛化能力——它不是记住了某几条固定路线,而是建立了一套可迁移的导航判断逻辑。
三、仿真评测10项第一,真机部署四款平台全部通过
模型有没有学到真东西?看评测。
研究团队在10个VLN基准测试上做了验证,涵盖指令遵循、物体导航、开放词汇搜索、目标跟踪等任务类型,使用了VLN-CE、Matterport3D、HM3D、HM3D-OVON、EVT-Bench等数据集。
在只用一个RGB摄像头、只看当前视野的情况下,LightNav-0在全部10项评测里排名第一。即使把多相机、全景感知等更宽视野的系统也拉进来比,LightNav-0在多项指标上仍然领先。

但评测分数只能告诉你“任务完成了没有”,解释不了“如果失败了,问题出在哪”。
所以亮源新创自己搭了一个INSIGHT-Bench评测基准,把导航能力拆成五个原子维度:基础指令、方向指令、关系指令、极值指令、序数指令。场景类型也覆盖了五种:公寓、住宅、商业空间、机构场所、户外环境。

在210个模型从未见过的场景、1097条评测指令上,LightNav-0在每个指令类别和场景类别上都拿到了最高成功率。
仿真跑得好,上真机如何呢?
团队在不改变模型权重的前提下,直接把LightNav-0部署到了四种完全不同形态的机器人上:人形、四足、飞行、轮式。
让它们在没去过的室内外环境里执行三类任务,长指令跟随、开放词汇物体导航、目标追踪。

四款平台、三类任务、全新环境,全部通过。
换机器人不只是换个平台那么简单。本体一变,摄像头高度变了,视野角度变了,运动方式也变了。四足是走的,轮式是滚的,飞行器是悬空的。环境一变,目标位置不同了,障碍物不同了,可通行的路径也不同了。
LightNav-0能在零样本(zero-shot)的前提下扛住这些变化,说明上面那套Real-Sim-Real的数据生产方式和三阶段后训练方法,确实在真实世界里得到了验证。
当然,公开的VLN基准给大家提供了一个统一的比较尺子,但榜单成绩和真实用户的机器人使用体验之间还有距离。
亮源新创透露,下一步计划开放一套更贴近真实使用场景的VLN评测体系,覆盖更多机器人本体、更多真实室内外环境、更自然的复杂语言指令、长程任务和异常恢复能力。
结语:具身智能的下半场,拼的是“数据怎么规模化生产”
从LightNav-0的实践来看,这条Real-Sim-Real的闭环已经非常清晰:
真实数据决定模型面对什么样的世界,仿真负责把场景、任务、行为组合规模化地扩展开,模型训练完再回到真实机器人接受检验。
这套方法在10项仿真评测中取得全面领先,在四款不同形态的真机上完成了零样本部署。在一定程度上已经说明:规模化后训练数据和模型的零样本泛化能力之间,已经跑通了一条可以继续深挖的技术路径。
接下来的问题是:当模型架构逐渐趋同,谁能持续获得更多、更丰富、同时又和真实世界保持精确对应关系的训练数据,谁就可能拿到下一阶段的入场券。
具身智能行业这几年形成一个共识:真实数据采集慢、成本高、覆盖场景有限;仿真数据虽可规模化生成,与真实世界之间又存在天然壁垒。两种路径各有利弊,行业始终缺少一个能兼顾“质”与“量”的平衡方案。
LightNav-0的价值,不在于又多了一个开源的SOTA级VLN模型,而在于它用一套完整的技术流程,把“真实世界和仿真环境到底能不能有效协同”这个问题,给出了一个经过验证的确定答案。
模型跑通了Real-Sim-Real这条闭环——真实场景定义数据质量的下限,仿真规模化放大数据的上限。 LightNav-0不只是一个开源模型,它示范了一条让数据规模化生产,并真正服务于真实应用的技术路径。