登录

ECCV 2026|一段视频,重建一个可仿真的动态世界


速读:动态GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为OVOW恢复的实例级4DMesh场景。 单张图片也可作为一帧视频处理。
2026年08月18日 06:3

机器人走出实验室后,训练数据不再只是 “多不多” 的问题:环境能否覆盖真实世界的尺度、遮挡、接触和运动,直接决定策略能否落地。Real2Sim 因此重新受到关注 —— 如果普通视频也能变成可交互的仿真场景,采集成本会比人工建模或专用设备低得多。

难点在于,视频里看见的世界并不等于物理引擎可用的世界。现有 4D 重建常以隐式场、Gaussian primitives 或点云为结果,适合新视角渲染,却很难直接拆出独立对象,也缺少封闭 Mesh、真实尺度和稳定的时序运动。

OVOW(One Video, One World)给出的答案很直接:从一段普通单目视频出发,把场景拆成实例,补全几何,恢复尺度与运动,再按照重力、接触和支撑关系重新组装,最终得到可以进入物理引擎的 4D Mesh 世界。该工作由清华大学、中国科学技术大学、SparcAI 等团队完成,已被 ECCV 2026 接收。

OVOW:从单目视频出发,恢复实例级 4D Mesh 世界,并将其送入物理仿真 OVOW:从单目视频出发,恢复实例级 4D Mesh 世界,并将其送入物理仿真 论文标题: One Video, One World: Turning Monocular Video into Physical 4D Scenes

项目主页:https://onevideooneworld.github.io/

论文:https://arxiv.org/abs/2606.31388

代码: https://github.com/SparcAI-Inc/OVOW

从 “能渲染” 到 “能仿真”

OVOW 的突破不只是 “重建得像”,而是输出可编辑、可碰撞的实例级 Mesh:刚体记录真实尺度与逐帧 6-DoF 位姿,非刚体保留拓扑一致的时序形变。对象因此能被单独移动、删除或替换。

系统还会估计地面和重力,修正悬浮、穿透与错误支撑;单张图片也可作为一帧视频处理。

Image-to-3D Reconstruction:每组左侧为输入图像,右侧为 OVOW 恢复的实例级 3D Mesh 场景。系统能够在单图条件下恢复独立对象、完整几何与空间布局。图片来源:OVOW 论文 Figure 5 / 项目主页。

一条从视频到物理世界的流水线

整条流水线不另训专用大模型,而是串联视觉基础模型,依次完成场景理解、几何与运动恢复、物理组装。

OVOW 方法总览(阶段 1–3):从视频中的对象发现与运动分类出发,分别恢复静态/刚体 Mesh、可变形 Mesh 序列、真实尺度与逐帧运动

系统先识别实例与运动类型并生成跨帧掩码,再补全遮挡区域,恢复静态、刚体及可变形对象的 Mesh;随后估计真实尺度与逐帧运动,最后校正地面、重力、悬浮、穿透和支撑关系。

关键设计|不依赖预定义骨架或类别模板,直接用顶点形变统一描述静态、刚体与非刚性运动。

一套表示,覆盖静态、刚体与非刚性运动

OVOW 以实例 Mesh 为底座,将整体轨迹与局部形变分开,因而能同时处理车辆、飞机等刚体,以及飞鹰、北极熊等非刚体。

案例一|桌面刚体

动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示

案例二|室内多对象

动态 GIF:左侧为黑色越野车、哑铃与花盆组成的输入视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示

案例三|飞鹰形变

动态 GIF:左侧为野外飞鹰视频,右侧为 OVOW 恢复的拓扑一致非刚性 4D Mesh。画面来自 OVOW 项目主页官方演示 动态 GIF:左侧为野外飞鹰视频,右侧为 OVOW 恢复的拓扑一致非刚性 4D Mesh。画面来自 OVOW 项目主页官方演示 案例四|机场多刚体

动态 GIF:左侧为机场多对象视频,右侧为 OVOW 恢复的实例级刚体 Mesh 场景。飞机、摆渡车与航站楼被分别重建。画面来自 OVOW 项目主页官方演示

案例五|北极熊形变

动态 GIF:左侧为包含北极熊及多个物体的视频,右侧为 OVOW 恢复的实例级 4D Mesh 场景。画面来自 OVOW 项目主页官方演示

从重建结果到物理仿真的最后一公里

可仿真的关键,是改变初始条件后,场景仍能产生新结果。

仿真与编辑

OVOW 可重新摆放对象或施加外力,由物理引擎计算新的碰撞、倾倒和位移。

案例一|原始布局

动态 GIF:OVOW 项目主页“Simulation and Editing”中的 Toy-Car Tabletop I。重建得到的黑色越野车、哑铃、花盆与桌面资产在新的初始状态下发生碰撞、倾倒与位移

案例二|改变布局

动态 GIF:Toy-Car Tabletop II。花盆位于车辆前方,哑铃与书本采用新的初始位置;在重力与接触作用下,各实例产生与案例一不同的碰撞和位移

案例三|重新组合

动态 GIF:Toy-Car Tabletop III。哑铃、花盆、书本与黑色越野车被重新组合,由同一组重建资产生成第三套倾倒、滑动与碰撞过程

三段动画复用同一组资产,仅改变初始布局便产生不同轨迹;这不是视频重放,而是物理引擎重新计算的结果。

重建质量与流水线可靠性

团队构建了各含 120 个场景的静态与动态基准,每个场景含 3–5 个对象,并提供 Mesh、轨迹、相机、深度和分割真值。

动态基准上,Scene-IoU-OBB 为 0.440、Object-IoU 为 0.210,速度为 3.35 秒 / 帧。运动类型识别、位姿恢复、有效场景与重力仿真稳定率分别为 95.4%、92.4%、86.8% 和 82.7%,速度较逐帧方法提升一至两个数量级。

当普通视频成为 Physical AI 的数据入口

对 Physical AI 而言,RGB 像素只是入口。策略训练真正需要的是对象边界、几何、尺度、轨迹,以及接触和支撑等能够被执行的状态。OVOW 把视频变成实例级 4D Mesh,再由仿真器改变布局、目标和外力,从同一段观测扩展出多组反事实交互轨迹。

这也使 OVOW 可以成为 D4RT 类数据管线的上游。D4RT 用统一的时空查询接口学习深度、相机和 3D 点轨迹,训练时从带真值轨迹的数据中采样时空查询;OVOW 则能提供对象级 Mesh、相机、深度和运动,并在仿真中生成更长、可控、带真值的 tracking 序列。两者并非同一种方法,但在数据生产上可以衔接:OVOW 负责把真实或生成视频变成可仿真的世界,再输出 D4RT 式重建与跟踪任务所需的训练样本。

数据链|普通视频到实例级 4D Mesh,再到物理仿真、可控长时轨迹,以及 4D 重建、跟踪模型与机器人策略。

因此,OVOW 的价值不只是复现一段视频,而是把一次观测变成可以反复干预的数据源:重新摆放对象,制造碰撞、遮挡和长尾状态,再把这些原本很难采集的过程交给世界模型与机器人策略学习。

ONE VIDEO, ONE WORLD|一段视频,记录的不应只是世界的外观;它也可以成为一个能够被理解、编辑和仿真的物理世界。

作者介绍

作者团队来自清华大学、中国科学技术大学、SparcAI、香港理工大学、电子科技大学、南洋理工大学,关注三维视觉、动态场景理解与具身智能。Junhao Chen 与 Boran Zhang 为共同一作,Yufei Wang 为通讯作者。

主题:世界|真实尺度|真实尺度与逐帧运动