登录

大晓机器人联合南洋理工大学S-Lab发布统一多模态世界模型框架Puffin


速读:为统一绝对方向和跨视角运动,Puffin-World提出Omni-Camera相机表示,将重力锚定的绝对相机信息与基于射线的相对几何结合起来。 作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。 地平线不会随意漂移,场景的上下关系不会在运动中失真,生成视角与目标相机轨迹也能保持一致。 世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。 当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演WorldActionModel(WAM)角色。
大晓机器人联合南洋理工大学S-Lab发布统一多模态世界模型框架Puffin-World

大晓机器人联合南洋理工大学S-Lab发布统一多模态世界模型框架Puffin-World

2026年09月10日 19:55

【TechWeb】9月10日消息,大晓机器人联合南洋理工大学S-Lab等机构发布并开源统一多模态世界模型框架Puffin-World。作为面向空间智能与具身智能的成果,Puffin-World首次在一个统一多模态框架中,将物理、几何和外观定义为三种原生的三维世界状态,并贯通重力场感知、自由视点空间仿真、三维世界生成与重建以及闭环探索,预测机器人行动后世界将处于什么状态。

Puffin-World同步开源代码、模型和Puffin-16M数据集,包括1500万组视觉—语言—相机三元组和100万条具有挑战性的旋转轨迹,并开放覆盖28个公开数据集、约4450万张图像的绝对相机位姿标注,为机器人仿真、合成数据生产与具身智能训练提供可复现、可扩展的技术底座。

针对机器人训练来说,需要的并不是一段视觉上逼真的视频,而是能够支撑感知、定位、规划和行动的环境信息:当前相机处于什么姿态,重力方向是否稳定,场景结构如何延续,机器人移动后将看到什么。图像只是世界状态的一部分,物理方向、空间几何和视觉外观共同构成机器人真正需要的训练环境。

统一构建三种原生状态——物理、几何与外观

Puffin-World从三维世界状态本身出发,将其建模为三种相互关联的原生状态:

物理状态:描述相机和观测视角在真实世界中的绝对朝向,包括重力场与纬度图。

几何状态:通过深度信息表达场景的三维结构、空间远近和表面关系。

外观状态:对应相机最终观察到的RGB图像。

三种状态共同构成从“世界如何存在”到“世界如何被交互”的完整表达。模型生成新视角时,不仅要回答画面应该是什么样,还要保证该画面在物理方向和三维结构上成立。

为统一绝对方向和跨视角运动,Puffin-World提出Omni-Camera相机表示,将重力锚定的绝对相机信息与基于射线的相对几何结合起来。模型先从参考图像中精确理解相机的横滚角、俯仰角和视场角,再通过物理传播机制,将参考视角中的重力信息传递至后续视角。

即使相机经历连续旋转和长轨迹移动,整个生成过程也拥有一个稳定的物理参照系。地平线不会随意漂移,场景的上下关系不会在运动中失真,生成视角与目标相机轨迹也能保持一致。

Puffin-World还在同一次生成过程中联合输出RGB外观和深度几何,使生成结果能够直接用于三维重建,而不必在视频生成之后再依赖独立的深度估计模块补充空间结构。由此,世界生成与世界重建不再是前后割裂的两个步骤,而成为同一个状态预测过程。

一个模型完成四件事,从理解世界走向闭环探索

Puffin-World可以在一个模型中统一四类过去往往需要不同系统分别完成的任务。

第一,单图理解相机物理信息。输入一张图片,模型能够结合地平线、垂直结构和场景构图进行空间推理,预测相机相对于真实物理世界的横滚角、俯仰角和垂直视场角,同时生成场景语义描述。模型不仅识别“图中有什么”,还理解“当前视角以怎样的姿态看到了它”。

第二,自由视点空间仿真。除文字描述外,用户还可以明确指定相机方向和视场角。模型据此生成符合目标机位的画面,使文生图从内容控制进一步走向精确的空间控制。

第三,三维世界生成与重建。模型可以从文字、单张图像或少量参考图像出发,按照指定相机轨迹生成多个新视角,并同步预测每个视角的外观和深度。不同视角随后可以汇聚为具有一致空间结构的三维世界。

第四,闭环自校准探索。当相机姿态偏离重力方向时,模型可以先感知当前物理状态,再推理需要执行的修正动作,并生成动作执行后的目标观察,由此形成“状态感知—动作预测—结果生成—再次校准”的闭环,高效扮演World Action Model (WAM)角色。技术报告还展示了模仿式世界探索能力,即从同一初始视角出发,按照给定相机轨迹扩展并探索新的三维世界。

这四类能力并非四个模型的简单拼接,而是由同一套视觉、语言、相机和世界状态表征共同支撑。任务的变化不再依赖切换系统,而由输入内容、相机条件和视图角色决定。这种统一性,使Puffin-World更接近机器人从感知、推理到行动的完整工作链路。

1600万核心数据与4450万开放标注,扩大世界模型训练底座

世界模型能否理解复杂空间,很大程度上取决于训练数据是否同时具备视觉内容、场景语义、绝对相机信息和多样化运动。为此,团队构建了Puffin-16M数据集,包含两个组成部分。

Puffin-Cam-15M提供1500万组视觉—语言—相机三元组,覆盖室内、室外、真实和合成等多种场景,并包含不同分辨率、宽高比、相机姿态和视场角。它不仅告诉模型图像中有什么,还告诉模型这张图像是在怎样的相机观测条件下形成的。

Puffin-Traj-1M则提供100万条具有挑战性的旋转轨迹,覆盖连续俯仰、横滚、偏航、复合运动以及360度环视等复杂情况,重点补足传统三维数据集在大幅旋转和长轨迹探索方面的不足。

与主要描述视角之间相对变化的数据不同,Puffin-16M进一步引入相机相对于重力和真实世界的绝对方向。模型不仅学习“相机从上一帧移动了多少”,还要理解“相机当前在世界中处于什么方向”。

除自建数据集外,团队还利用Puffin-World精准的物理世界感知能力为28个公开数据集补充绝对相机位姿标注,覆盖约4450万张图片,包括ImageNet、CC12M、Objects365、ScanNet、DL3DV和GPIC等。标注内容包括横滚角、俯仰角和视场角,可用于研究不同视觉数据中的机位偏差,也可为相机条件生成、物理世界理解和空间智能训练提供大规模监督。

更重要的是,Puffin-World同步开放代码、模型和数据集。开源的不只是一个算法实现,而是一套从数据、标注、训练到评测的完整技术链路,使研究机构和产业开发者可以围绕机器人仿真、合成数据、虚拟现实、三维内容生产与具身智能开展后续开发。

四项SOTA,从相机理解到三维生成

Puffin-World的统一能力在四项Benchmark中取得SOTA成绩。

在相机到真实世界理解任务上,Puffin-World在Stanford2D3D、MegaDepth、TartanAir和LaMAR四个公开基准上取得最佳或并列最佳的中位误差,并在大多数AUC指标上领先。

其中,在Stanford2D3D上,Puffin-World对横滚角、俯仰角和垂直视场角的中位误差分别为0.29度、0.53度和1.62度,显示出较强的绝对相机理解能力。

在相机可控生成基准Puffin-Cam-Bench上,模型生成结果的上方向、纬度和重力方向中位误差分别为0.84度、1.26度和0.79度,FID为75.93,均优于参与比较的通用图像生成模型和已有相机可控生成方法。这意味着Puffin-World不仅能够生成质量较高的图像,还能让生成画面准确服从指定的相机状态。

在Puffin-Traj-Bench上,Puffin-World取得18.00的PSNR、0.613的SSIM和0.288的LPIPS;生成轨迹的横滚角、俯仰角和视场角中位误差分别为0.80度、1.10度和2.96度。其中,PSNR、LPIPS以及三项相机控制误差均取得最优结果。

在RealEstate10K三维世界生成测试中,Puffin-World取得17.22的PSNR、0.595的SSIM和0.318的LPIPS,三项视觉一致性指标均优于对比方法。

这些结果表明,Puffin-World并非只在单一任务上提高图像质量,而是在相机物理理解、灵活空间控制、几何一致性生成和三维重建之间建立了相互支撑的统一能力。

从“生成一段看起来合理的视频”,到“预测一个具有物理、几何和外观一致性的世界状态”,Puffin-World推动世界模型从视觉内容生成进一步走向可感知、可校准、可探索和可重建的三维环境。这也是世界模型真正进入机器人训练与具身智能应用所需要完成的一次范式转变。

主题:模型|相机|Puffin-World