登录

视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系


速读:视频世界模型困在像素网格里:腾讯开源SCoPE,用射线空间重写位置关系2026年08月24日06:01机器之心Pro视频模型与世界模型,究竟应该在什么坐标系里工作? SCoPE直接根据相机运动,为每个视频token计算对应的观察射线,并将射线坐标注入视频DiT。 SCoPE(Sightline-CoordinatePositionalEncoding),一套面向视频DiT的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。 单条射线不确定深度,两条射线的关系却能帮助建立三维对应:当内容一致、射线相交,两个token就可能指向同一个三维点。 视频1:SCoPE从单张输入图生成的交互式相机控制结果。
2026年08月24日 06:

视频模型与世界模型,究竟应该在什么坐标系里工作?

现有视频 DiT 通常以 (u, v, t) 张量网格组织位置。它能标出 token 位于哪一帧、哪一行、哪一列,却没有编码一次观察来自世界中的哪里、朝向哪里。镜头移动或出现重复纹理时,网格地址与场景位置之间的对应很快变得含混。

香港大学、香港科技大学与腾讯 ARC Lab 联合提出  SCoPE(Sightline-Coordinate Positional Encoding) ,一套面向视频 DiT 的射线空间位置编码:让视频模型处理位置关系的基底从张量网格转向射线空间。

视频 1:SCoPE 从单张输入图生成的交互式相机控制结果。画面左下为 WASD 指令,右下为对应相机轨迹。

先看一段由 SCoPE 生成的结果。输入只有一张静态图片和连续的 WASD 指令,模型能够按指令前进、后退和横移,组合动作同样成立。整个过程没有游戏引擎、人工建模或三维重建。SCoPE 直接根据相机运动,为每个视频 token 计算对应的观察射线,并将射线坐标注入视频 DiT。整体新增参数不到原视频模型的 0.1%,相机控制、跨视角一致性与 revisit 一致性均得到改善。

作者:Minghao Yin、Jiahao Lu、Wenbo Hu、Wang Zhao、Ying Shan、Kai Han 

机构:香港大学、香港科技大学、腾讯 ARC Lab

论文:https://arxiv.org/abs/2606.27345

项目主页:https://visual-ai.github.io/scope/

代码:https://github.com/TencentARC/SCoPE

模型:https://huggingface.co/TencentARC/SCoPE

视频世界模型究竟需要怎样的坐标系

Video DiT 通常用(u, v, t) 表示位置。它记录 token 位于哪一帧、哪一行、哪一列,却没有相机与场景的几何。相机一动,同一个物体就会换到新的网格位置。

最理想的坐标当然是表面三维点坐标:每个 token 画的是世界中的哪个点,就用哪个点作为地址。但在生成开始之前,场景表面和深度都还不存在,这个坐标无从获得。

射线提供了一条出路。轨迹一旦给定,每个 token 对应的观察射线就可以提前计算。单条射线不确定深度,两条射线的关系却能帮助建立三维对应: 当内容一致、射线相交,两个 token 就可 能指向同一 个三维点 。

这正好与 attention 的工作方式相接。Attention 本来就在比较 token,SCoPE 让它在比较内容的同时,也比较射线几何。原本无法提前获得的三维点坐标,由「内容匹配 + 射线相交」在生成过程中隐式建立。

SCoPE 将相机射线坐标注入 Video DiT,让模型在比较 token 时同时看到内容与视线之间的关系。它讨论的核心由此变得清楚:视频世界模型的位置坐标可以从像素网格走向描述观察世界的射线空间。

图 1:SCoPE 为每个视频 token 引入相机射线。面对外观相同的候选区域,内容特征负责寻找可能的匹配,射线相交关系进一步判断哪个候选与上一帧指向同一个三维点。射线进入 query/key 后,内容匹配与几何判断可以在同一次 attention 中完成。

坐标进入 attention

才能参与每一次关系判断

具体做法并不复杂。相机轨迹给定后,SCoPE 为每个视频 token 计算一条 Plücker 射线。射线经过 投影、归一化和 Normalize-Gate-Inject 尺度门控 ,随后写入 attention 的 query 和 key。

这样,attention 在比较两个 token 时,会同时计算它们的内容是否相似、两条射线是否相交。以前面的窗户为例,内容特征会找出两扇外观相似的窗;射线几何则进一步判断,哪一扇窗的射线与上一帧的射线共同指向同一个三维点。两部分合在一起,模型才能建立可靠的跨视角匹配。图 1 右侧展示的内容项、射线项和交叉项,就是这一计算展开后的结果。

整个过程直接发生在原有的 self-attention 中,不需要再增加一套 attention。新增参数不到原模型的 0.1%。真正改变的是 token 之间的匹配依据: 模型除了比较「看起来像不像」,还会判断「在几 何 上能不 能对应」 。相机控制、跨视角一致性和 revisit 都建立在这套匹配方式上。

图 2:相机参数被分解为 token 级 Plücker 射线,经投影、RMSNorm 与尺度门控进入 query/key,观察几何随之直接参与 attention score。

同一种坐标关系可以服务于交互式指令和预设轨迹。下面六段结果均从单张图生成:上排接收 W、A、S、D 指令,下排沿预设轨迹推进。

视频 2:上排展示交互式 WASD 相机控制,下排展示沿给定相机轨迹生成的结果。 视频 2:上排展示交互式 WASD 相机控制,下排展示沿给定相机轨迹生成的结果。 坐标关系能否跨越画风与模型规模

射线由相机决定,不依赖于输入是摄影、绘画还是概念设计的风格。在五组手绘概念图中,同时产生与目标轨迹一致的视差和构图变化。画风改变会移动视觉特征分布,相机中心、观察方向和射线关系仍采用同一种几何描述。模型可以在新内容分布上继续调用已经学到的坐标关系。

图 3:风格化输入泛化(Generalization to stylized inputs)。每行是一张手绘概念图及其生成序列,右侧为对应目标相机轨迹。

消融实验验证了 SCoPE 的核心设计。我们分析了增益来自哪里,去掉内容 — 射线交叉项后旋转误差升到 0.135,去掉纯射线项后则升至 0.159。这证明缺少任何一项都会影响其性能。

另一组实验考察 SCoPE 能否随模型规模扩展。从 5B 增长到 14B 后,SCoPE 在平移误差上的领先幅度从 12% 扩大到 25%,FVD 从 23% 扩大到 47%。模型越大,SCoPE 的优势反而越明显,说明射线坐标并非针对小模型的局部修补; 骨干能力增强后,模型能够更充分地利用其中的几何关系 。

图 4:相机控制、生成质量、关键消融与模型规模趋势。左图比较 5B 模型的 RotErr 与 FVD;右上显示交叉项和纯射线项对 RotErr 的贡献;右下展示从 5B 到 14B 的相对领先幅度。

Revisit:来路与归途共享同一组射线

Revisit 直接体现了射线坐标的性质。相机离开起点再沿闭环返回时,末段与开头虽然相隔很多帧,却会重新经过同一组射线。在 (u, v, t) 网格坐标中,归途拥有全新的地址;而在射线空间中, 同一个观察位置仍然对应同一个射线地址,看过的地方没有因此换掉自己的位置和身份 。

因此,SCoPE 不需要额外设计一个模块去「记住」起点。来路与归途共享射线坐标,attention 可以直接重新建立两者之间的联系。 Revisit 一致性也由此成为射线坐标带来的性质 。

闭环测试验证了这一点。SCoPE 的 LPIPS Recovery 从最强对比方法的 0.102 提升到 0.587。相机回到原来的观察位置时,画面也更接近出发时看到的场景。

视频 3:上方为同里茶楼,下方为沧浪亭。相机沿闭环轨迹离开后回到初始射线附近,场景随观察坐标一同恢复。

让射线空间成为世界模型的基础坐标系

(u, v, t) 记录 token 被放在张量的位置。世界模型还需要判断,不同视角中的 token 是否来自同一个世界点。SCoPE 用生成前即可获得的相机射线作为坐标,并通过「内容一致 + 射线相交」在 attention 中建立三维点匹配。

相机控制和 Revisit 展示了这套坐标带来的结果:相机移动时,模型能够维持同一个场景;相机回到原位时,同一组射线重新获得同一个位置身份。

SCoPE 的意义因此不只是一组更好的相机控制结果。它说明, 世界模型可以把 token 组织在观察世界的射线空间中,而不再只依赖排列视频数据的像素网格 。对于下一步可导航、可交互的生成世界,射线空间提供了一种真正属于世界模型的坐标系。

主题:模型|位置|世界模型