机器人前瞻(公众号:robot_pro)
作者 | 周加琦
编辑 | 漠影

机器人前瞻9月10日报道,近日,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型Puffin-World

上海机器人独角兽开源世界模型,能“看懂”三维物理世界了

Puffin‑World在一个统一多模态模型中,将物理、几何、外观视作三类原生三维世界状态。为实现三维世界的精准构建和稳定交互,该模型打通重力场感知、自由视点空间仿真、三维世界生成与重建,以及闭环探索,可根据机器人的动作,预判场景的后续状态变化。

为支撑模型训练,该团队还构建了Puffin-16M数据集,包含1500万组视觉-语言-相机三元组、100万条旋转轨迹样本。

在性能评测上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir、LaMAR四项公开基准评测中均取得SOTA。其中在Stanford2D3D上,横滚角、俯仰角、垂直视场角中位误差低至0.29°、0.53°、1.62°,相机物理姿态预测精度领先其他方案。

项目链接:https://kangliao929.github.io/projects/puffin-world/

代码链接:https://github.com/KangLiao929/Puffin

Arxiv链接:https://arxiv.org/abs/2609.04196

Hugging Face链接:https://huggingface.co/blog/KangLiao/puffin-world

一、从三层世界状态出发,Puffin-World统一物理、几何与外观

目前,多数生成式世界模型只会预测未来的RGB图像或视频内容。但真实的物理世界并不只有视觉画面,而是由物理、几何、外观三层状态共同构成。

想要实现图像稳定生成、空间一致仿真、可交互的真实三维场景,就必须同时融合这三层信息。

因此,Puffin-World从三维世界状态本身出发,结合三种状态共同构成“世界如何存在”到“世界如何被交互”的完整表达。

其中,物理状态负责判断视角在真实世界的绝对位置与朝向,包含重力场、纬度图;几何状态通过深度信息还原场景的三维结构、空间远近与表面关系;外观状态则对应最终呈现的RGB视觉画面。

另外,Puffin-World还提出了全向相机(Omni-Camera)表征,将绝对与相对两类相机表征合二为一。这样一来,Omni-Camera既保留了绝对表征识别重力、对齐真实世界的物理锚定能力,又具备相对表征流畅推演连续镜头运动、多视角变换的优势。

这套统一表征可以同时支撑物理场景理解、任意视角可控生成、连续三维场景建模。

最终,三种世界状态回答了“世界如何存在”,全向相机表征则打通了“世界如何被观察与交互”,共同构成Puffin-World从感知到生成、从单一视角到完整场景的闭环能力。

二、覆盖四大能力,可感知、生成并探索三维世界

Puffin-World依托单一多模态模型,能够同时实现物理世界感知、自由视角空间仿真、三维世界生成与重建、闭环自校准探索的能力。

不同于传统方案为不同任务单独搭建子网络,该模型通过三层统一设计,让一个模型就能兼容全部视觉与三维场景任务,通用性更强。

Puffin-World的核心能力主要包含四个部分。

上海机器人独角兽开源世界模型,能“看懂”三维物理世界了

单图理解物理信息。只用输入单张图像,Puffin-World就能够推算出相机的绝对物理状态,包含重力朝向、横滚俯仰角度、视场大小等真实世界物理参数。

自由视点空间仿真。该模型支持任意可控相机视角生成,可根据自定义镜头位置、角度与运动方式,智能推演镜头移动后的全新视角,实现真实、稳定、符合物理规则的自由视角场景仿真。

三维世界生成与重建。Puffin-World能够根据文字、单视角或多视角图像,完成场景外观生成和三维几何重建,精准还原场景的深度、空间结构、物体位置等,构建更加完整的三维场景。

闭环自校准探索。该模型可复刻指定相机轨迹生成完整场景,并能预判镜头运动、推演未来画面,自动修正视角与重力偏差,实现自适应的持续探索,更接近真实机器人交互。

三、1600万组数据加持,补齐真实世界绝对相机位姿

目前多模态领域,能同时精准匹配画面内容、场景语义、真实物理规则的高质量数据集非常稀少。为此,该团队构建了Puffin-16M数据集,包含1500万组视觉-语言-相机三元组,以及100万条复杂、高难度相机运动的轨迹样本,分别命名为Puffin-Cam-15M与Puffin-Traj-1M。

上海机器人独角兽开源世界模型,能“看懂”三维物理世界了

其中Puffin-Cam-15M将原始全景场景素材从20万张扩充至90万张,覆盖室内外、合成场景、真实环境,以及多国自动驾驶街景。Puffin-Traj-1M则覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况。

另外,现有公开数据集,只能记录镜头之间相对的位置变化,无法对应真实世界的重力、绝对朝向,导致模型学不到真实物理规律。因此,该团队还利用Puffin-World为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图片。

四、四项Benchmark拿下SOTA,复杂场景下仍保持高精度

根据评测结果显示,在Stanford2D3D、MegaDepth、TartanAir、LaMAR四个公开数据集上开展评测。Puffin-World在室内实景、户外街景、仿真合成、大规模真实图像各类场景下,横滚角、俯仰角、视场角三项相机参数的预测误差均取得最优结果。

上海机器人独角兽开源世界模型,能“看懂”三维物理世界了

在Stanford2D3D中,该模型的横滚角、俯仰角、垂直视场角中位误差分别为0.29°、0.53°、1.62°,展现极强的绝对相机物理理解能力,能够精准识别重力与世界坐标系。MegaDepth评测下,横滚角、俯仰角、视场角中位误差达到0.28°、1.01°、2.41°。面对真实复杂的城市户外环境,Puffin-World依旧保持很高的预测精度。

在TartanAir中,Puffin-World三项参数中位误差为0.31°、0.67°、2.34°,在合成场景下也可以稳定完成相机物理参数的推算。另外在LaMAR评测下,横滚角、俯仰角、视场角中位误差为0.26°、0.71°、2.73°。面对海量风格的真实图像,该模型依旧保持领先的预测水平。

结语:世界模型从“预测画面”走向“理解世界”

过去的生成式世界模型更多聚焦于预测下一帧图像或视频,而Puffin-World进一步将物理、几何、外观以及相机运动统一到同一模型中。

这也意味着,世界模型正在从对视觉内容的预测,进一步走向对真实世界状态的建模与推演。对于机器人而言,这种能力让机器能够在行动之前理解所处环境、预测动作可能带来的变化,进一步支撑其在真实三维世界中的自主感知、决策与交互。