登录

李飞飞发布:全球首个多模态世界模型


速读:李飞飞发布:全球首个多模态世界模型2026年09月02日08:59量子位MD鱼羊发自凹非寺。
2026年09月02日 08:59

量子位

鱼羊 发自 凹非寺

量子位 | 公众号 QbitAI

「全球首个」 多模态世界模型 ,来了!

来自李飞飞World Labs。

World Labs对这个名为 Atlas 的新一代世界模型,用词可谓毫不克制,「全球首个」之外,slogan也明确强调出,这一次,可不只是生成一段可互动视频了哟:

建模世界,移动相机,模拟空间和时间。

就是说,Atlas能够以像素级的相机控制生成图像和视频帧,并完成3D重建。并且 空间 和 时间 都能理解。

李飞飞本人将其视作World Labs的「里程碑式」成果,直接一手置顶:

Atlas为 从视觉特效到 机器人 的众多应用场景打开了大门。

飞飞高徒、英伟达机器人主管Jim Fan也来捧场,指出:这是机器人领域Real-to-Sim的一大步。

具体来说,Atlas是一个 多模态自回归扩散Transformer ,它的能力包括:

相机控制生成 :仅需一张图片,Atlas即可生成具有像素级相机控制的图片和视频,最高可输出1分钟、1440p的视频。

空间重建 :Atlas可以基于一张到数十张输入图像,重建真实世界场景。既可以生成新视角下的图像帧,也能输出显式3D表示,其效果超过当前专门针对3D重建训练的最先进模型。

时空模拟 :Atlas可以根据输入视频同时建模空间和时间,可以转换已有视频中的观察视角,制作具有戏剧性的视觉效果,同时支持机器人Real-to-Sim工作流。

图像生成 :Atlas可以根据文本生成图片和360°全景图,能够遵循复杂Prompt、准确渲染文字,并生成大量不同的视觉风格。

对于 机器人模拟 ,仅需喂Atlas几张照片,它就能生成逼真的RGB和深度数据。这样一来,机器人就能在更多不同的模拟空间中进行训练和测试。

从头训练的多模态世界模型

技术细节上,Atlas是一个 全能模型 (omni model) 。

它的目标,是在一个统一的模型架构中,同时处理多任务、多种输入和输出数据。

与此同时, 空间控制是整个模型的核心 。

为了实现这些目标,李飞飞团队设计了一种全新的基础架构,来作为未来世界模型的基础—— 多模态自回归扩散 Transformer 。

文本、图像、视频、3D数据……各种输入都会被锚定在三维空间中,从而形成一个 空间上下文 。

然后,Atlas会根据这个上下文生成多模态输出。

这样一来,比如把 两张毫无关系的参考图片 放进同一个上下文中,再分别指定它们在3D空间中的位置,Atlas就能把它们缝合成一个空间自然、连续的世界。

更具体地拆解一下, 多模态 ,指的是Atlas可以原生处理多种不同的数据类型,包括 文本、图像、相机位姿、3D深度图 等。

视频则被表示为 图像序列 。

每一张图像和每一幅深度图,都对应一个明确的相机位姿。

自回归 ,指Atlas操作的是一系列元素组成的序列,序列中的每一个元素都可以属于前面提到的某一种数据模态。

Atlas每次生成一个新的输出,都会以前面已经存在的序列内容作为条件。

这种灵活的设计天然适用于各种不同任务。

每一种任务,本质上都只是一种不同类型的序列——前面是输入,后面是输出。

扩散模型 ,指Atlas是一个Rectified Flow (校正流) 模型,通过逐步去噪来生成输出。

扩散模型尤其擅长对图片和视频这种高维连续数据进行建模。同时,在推理时,只需要改变去噪步骤的数量,就可以实现速度和质量的平衡。

而 Transformer 不必多说,在世界模型领域,Transformer也被证明是非常稳健的基础架构。

也就是说,Atlas实际上融合了大语言模型和视频模型中的大量思想。

Atlas既可以利用大量原本服务于LLM推理和加速的技术,包括KV Cache、缓存感知路由、解耦式服务等等。

另一方面,它又和现代图像、视频生成模型一样,是一个潜空间扩散模型,可以利用扩散蒸馏、无分类器引导、移位噪声调度等算法,并引入更先进的VAE架构。

研究团队在相机控制生成和3D重建两个关键任务上对这个新一代世界模型进行了定量评估。

在相机控制生成上,结果显示,Atlas优于SOTA视频模型。

并且相机轨迹越复杂,Atlas的优势越大。

主题:世界|机器人|李飞飞|多模态世界模型