登录

李飞飞的World Labs,把赛博朋克的「超梦」做出来了


速读:在这个名为「多模态自回归扩散Transformer」的架构里,Atlas把文字、图像、深度以及相机位姿(CameraPose)全都揉进了同一个「空间上下文」。 图|电影《黑客帝国》经典的「子弹时间」镜头。 而Atlas最大的质变,在于它把摄影机位姿(CameraPose)做成了模型的原生几何输入参数。
2026年09月02日 18:3

1999 年《黑客帝国》里基努·里维斯仰身躲子弹的那一幕,让「子弹时间」成了影史上最震撼的视觉奇观之一。

图|电影《黑客帝国》经典的「子弹时间」镜头 图|电影《黑客帝国》经典的「子弹时间」镜头 当年拍摄这个镜头时,剧组在绿幕摄影棚里沿弧线布置了 120 台静态相机,并在阵列两端配置电影摄影机。

相机按照事先设计的时间差依次曝光,让人物动作以极慢速度继续,同时让视角沿着相机阵列移动。后期再通过插帧、数字背景与合成,把这些离散视角接成我们后来熟悉的「子弹时间」。

图|《黑客帝国》「子弹时间」镜头幕后 图|《黑客帝国》「子弹时间」镜头幕后 去年 10 月底的 VOGUE 时尚盛典,现场为了重现这种效果,同样围起了一整圈密不透风的弧形金属支架,上面齐刷刷架着整整 60 台 iPhone 17 Pro,配合 Blackmagic 扩展坞与 Genlock 锁相同步发生器,才拍出了刷屏全网的明星子弹时间大片。

图|VOGUE 盛典上的刘亦菲「子弹时间」 图|VOGUE 盛典上的刘亦菲「子弹时间」 对传统多机位「子弹时间」阵列来说,想获得足够连续的真实视角,最直接的办法始终是把相机铺得足够密。

图|现场由 60 台 iPhone 17 Pro 组成的高密度拍摄阵列(来源:影视飓风) 图|现场由 60 台 iPhone 17 Pro 组成的高密度拍摄阵列(来源:影视飓风) 而李飞飞 World Labs 刚刚发布的 3D 世界模型 Atlas,直接打破了这个规矩。

少掉的 57 台相机,到底被谁「算」没了?

在官方给出的演示里,同样是动态主体的「子弹时间」,现场既没有 60 台手机组成的庞大阵列,也没有复杂的锁相发生器——操作人员只随手在几个不同角度架了 3 到 5 台普通的手机和运动相机,就完成了素材采集。

图|Atlas 生成的子弹时间画面(来源:World Labs) 图|Atlas 生成的子弹时间画面(来源:World Labs) 要想在时间静止的同时移动机位,传统的做法就像小时候玩过的「连点成线」游戏:为了勾勒出一条平滑的圆弧轨迹,过去必须密密麻麻标出 60 个点,连起来才不会显得突兀生硬。

Atlas 彻底改写了这个游戏规则。它不再需要 60 个点,3 到 5 个点就够了。

图|Atlas 使用 3 到 5 个机位即可生成 3D 视角画面(来源:World Labs) 图|Atlas 使用 3 到 5 个机位即可生成 3D 视角画面(来源:World Labs) 在这个名为「多模态自回归扩散 Transformer」的架构里,Atlas 把文字、图像、深度以及相机位姿(Camera Pose)全都揉进了同一个「空间上下文」。

当操作人员把几台手机从不同角度拍到的视频丢给模型时,每一帧画面都带着明确的三维空间坐标。

凭借这几个真实的稀疏视角(Sparse Views),模型在统一的 空间上下文 里维持不同视角之间的几何一致性,并推断、生成输入没有覆盖的区域。

图|World Labs 图|World Labs 这个空间上下文的胃口很大:静态场景通常只要 2 到 3 张照片就能完成基础重建,而如果需要更精细的细节,它也能一口气吃下上百张图片。给的真实视角越多,模型对空间的理解就越扎实。正如 World Labs 的技术博客:

它看见的越多,需要「想象」的就越少。

The more it sees, the less it imagines.

在镜头拍到的地方,Atlas 会尽量保持内容与几何的一致;而物体背面、遮挡区等没有被摄影机记录的位置,则根据训练中学到的世界先验生成一个「合理的答案」。

进可重构特写,退可俯瞰全场

看到这里,你可能多少也有点好奇:如今的视频模型也能生成环绕运镜,Atlas 和输入一句「生成一段摄影机围绕主体旋转的视频」有什么区别?

在去年 APPSO 针对 VOGUE 子弹时间的复刻实验中,我们就曾用一张库里投篮的高清照片输入给视频生成模型,通过 Prompt 提示词成功模拟出了一段相当流畅的环绕运镜。

图|爱范儿/APPSO 此前使用可灵 AI 模拟的子弹时间环绕效果 图|爱范儿/APPSO 此前使用可灵 AI 模拟的子弹时间环绕效果 这种基于单图和提示词的生成方式非常惊艳,也很适合快速创作。不过从精确控制的角度来看,它与 Atlas 走的其实是两条截然不同的技术路线:

主流视频生成模型是在二维像素层面,根据文本语义去推演「一段看起来像是在旋转拍摄的视频」,镜头的运动轨迹、转速和景深关系更多依赖模型自主发挥;

而 Atlas 最大的质变,在于它把摄影机位姿(Camera Pose)做成了模型的原生几何输入参数。

图|Atlas 原生支持 Camera Pose 精确控制虚拟摄影机在空间中的环绕轨迹(来源:World Labs) 图|Atlas 原生支持 Camera Pose 精确控制虚拟摄影机在空间中的环绕轨迹(来源:World Labs) 这意味着你不用再靠提示词碰运气,费劲地让 AI「把镜头往左上方拉一点」;你可以像在 3D 软件里排布机位一样,直接给虚拟摄影机设定精确的运动轨迹。

更关键的是,这些轨迹坐标与现实空间是严格对应的——现场相机在哪个位置,虚拟镜头移到什么距离,Atlas 都能更明确地对齐。

图|拍摄完成后通过世界模型事后生成的高空俯视全新机位(来源:World Labs) 图|拍摄完成后通过世界模型事后生成的高空俯视全新机位(来源:World Labs) 普通 AI 视频是在 2D 画布上「 画 出运镜的感觉」;而 Atlas 是先在神经网络内部构建起一个具有空间与时间连续性的三维世界,再派一台受你完全操控的虚拟摄影机进入这个世界去 重新取景 。

当摄影机机位真正变成一个可自由调节的参数,整个摄影的规则就被改写了。如果把视线放宽到整个影像技术的发展史,你会发现一部摄影史,本质上就是「现场拍摄决策不断向后期推迟」的历史:

百年前的胶片时代,摄影师需要在拍摄现场完成大量关键决定,对焦、机位、快门时机尤其难以后期挽回,曝光和色彩虽然也有暗房调整空间,但容错远没有今天这么高;

进入数码时代后,RAW 格式让我们可以在拍摄后随意调整白平衡和曝光;计算摄影与多摄系统的普及,让我们可以在拍完照片后再重新模拟光圈虚化与景深;

而 Atlas 把这种「后期自由度」推向了最核心的 机位 :拍摄结束后,摄影师不仅能自由切换角度,甚至可以在电脑里凭空调出一个现场根本不存在的「上帝视角」——去俯瞰整个场景,或者拉近重构一个细节特写。

主题:「子弹时间」