登录

把动作「画」给视频世界模型,跨本体双向推演,李飞飞参与


速读:并且这种学习依赖特定机器人产生的训练数据,换一台机器人,这些数据的结构还会全部改变。 模型微调用了约15小时的机器人交互数据,同一个模型可以支持正向预测、逆向生成、多种机器人本体、策略评估和模型规划。 预测机器人动作产生的环境变化; 一种是直接从真实视频中分割机械臂,另一种是根据机器人状态、URDF模型和相机参数渲染其运动。 前者保留真实视觉信息,后者方便在推理时自由输入新的动作轨迹。
2026年07月23日 15:17

编辑|山辉

如果要让机械臂把咖啡机旁的杯子移到桌上,需要经历哪几个步骤?

在模型驱动规划中,它需要先生成多条候选动作,再交给世界模型预演,根据预演结果决定如何执行动作。

其中,视频世界模型通常会接收当前画面,以及关节角、末端位姿、夹爪状态等数值动作,生成执行动作后的未来视频。

可问题在于,对视觉模型来说,要建立某组数字和画面动作之间的对应关系,需要额外的学习。

并且这种学习依赖特定机器人产生的训练数据,换一台机器人,这些数据的结构还会全部改变。

既然视觉模型更熟悉画面,为什么不干脆把动作也「画」给它看?

近日,斯坦福大学、马里兰大学帕克分校和哈佛大学的研究团队发布论文《Masked Visual Actions for Unified World Modeling》。第一作者为 Hadi Alzayer,李飞飞、吴佳俊、张吕敏等研究者参与。

研究团队提出 Masked Visual Actions,将机器人的候选动作渲染成像素级运动轨迹,再让视频模型补全环境的响应,改变输入的实体后,同一个模型还能在两个方向上工作:

给出机器人怎么动,预测环境会如何变化;

给出目标物体怎么动,生成机器人可能采取的行为。

模型微调用了约 15 小时的机器人交互数据,同一个模型可以支持正向预测、逆向生成、多种机器人本体、策略评估和模型规划。在 RoboCasa 任务中,视频模型辅助规划带来了 7 至 26 个百分点的成功率提升;模型预测的策略表现与真实仿真结果达到 0.982 的相关系数;逆向动作提取管线在 CoffeeServeMug 任务上取得 90% 的成功率。

论文标题: Masked Visual Actions for Unified World Modeling

项目主页:https://masked-visual-actions.github.io/

论文链接: https://arxiv.org/abs/2607.19343v1

翻译成视频就容易看懂了

视频世界模型直接预测未来图像或视频,常见工作方式可以概括为:当前图像+数值动作序列 → 未来视频。

数值动作能够精确控制机器人,却与视频模型熟悉的像素信息存在表示差异。

从一串动作数据到最终画面,中间还隔着多层转换:动作数据 → 机器人姿态 → 相机投影 → 画面运动 → 环境响应。

Masked Visual Actions 提前完成了这层转换。

训练数据通过两种方式构造。一种是 直接 从真 实视频中分割机械臂 ,另一种是 根据机器人状态、URDF 模型和相机参数渲染其运动 。前者保留真实视觉信息,后者方便在推理时自由输入新的动作轨迹。

视频模型接收初始画面和这段机器人轨迹,再补全物体与环境的变化。

相比末端执行器点或机器人骨架,完整掩码还包含机器人的形状、占用空间、遮挡关系和潜在接触边界,模型能够直接「看」到动作过程。

这种表示也带来了更好的 跨机器人本体泛化能力 。

在 DROID 训练分布内,完整掩码、末端执行器位置和机器人骨架都能较好地控制视频生成,差距并不明显。

在训练分布内三种视觉条件表现接近 在训练分布内三种视觉条件表现接近 但当测试对象换成训练中未见过的自定义夹爪,或直接换成 BEHAVIOR 中的双臂机器人后,差距迅速拉开。

换成双臂机器人后,完整像素掩码对机器人形态的保持明显更稳定。 换成双臂机器人后,完整像素掩码对机器人形态的保持明显更稳定。 末端点和骨架只提供稀疏的运动信息,模型容易将新机器人改写成训练时见过的形态,甚至凭空生成另一台机器人;直接接收原始动作状态的 Ctrl-World,在双臂机器人上也容易生成静止或损坏的画面。

Masked Visual Actions 则直接给出新本体的完整轮廓与运动,因此能够较稳定地保留机器人形态,并继续预测它与环境的交互。 

换句话说,不同机器人的关节数量、动作维度和控制方式可以完全不同,但进入视频模型后,都被转换成了同一种信息,这让跨机器人本体泛化成为可能。

两种填空方式,零样本切换逆向建模

在此之前,已经有一些尝试证明了「把 URDF 机器人渲染成掩码并用作视频模型条件」这一思路的可行性,

例如,BridgeV2W 将机器人动作渲染成像素对齐的本体掩码,再注入预训练视频模型。这种表示能缩小动作坐标空间与视频像素空间之间的差距,并支持不同机器人本体。

与之相比,Masked Visual Actions 把问题进一步抽象为:一段交互视频中,可以提供任意一部分实体的运动参考,再让模型补全其余实体。

用填空题类比,BridgeV2W 的题目基本固定为: 已知机器人动作,填写环境部分。

Masked Visual Actions 则把它概括成: 已知交互中的部分实体,填写剩余部分。

于是,模型获得了一种逆向使用方式: 希望物体这样运动,机器人应该怎么动?

实际上,论文中的模型主要使用机器人掩码进行正向训练,推理时却能直接接收目标物体轨迹,零样本转向逆向建模。作者认为, 这 种能 力来自视觉条件与视频模型内部表征之间的对齐。

在更完整的机器人系统中,这两种推理也许可以连续配合。

机器人接到 “把杯子放到桌上” 的任务后,逆向推理先提出可能的动作方案,正向模型再预演这些方案的结果,系统选择可靠轨迹并执行。完成一小段动作后,摄像头重新观察场景,再进入下一轮规划。

更少的数据,更彻底的接口统一

研究团队基于 Wan-Fun-Control 2.2 14B 进行 LoRA 微调,数据来自 DROID 真实机器人视频和 RoboCasa 仿真环境,包含成功与失败轨迹。

其中失败样本十分关键。世界模型需要学会错误动作会产生什么结果,否则它可能对每一条候选轨迹都生成一个看似成功的未来。

论文中还提到,模型微调使用了约 15 小时的机器人交互数据。

附录显示,训练数据约包括 1000 条 DROID 演示和 4000 条 RoboCasa 样本。模型使用 8 张 H200 训练约 10000 步,耗时 4 天。

这套系统依赖 14B 基础模型和较强硬件,整体并不轻量。

它的数据效率主要体现在不需要从头训练机器人世界模型,而是 通过少量机器人样本激活视频模型已有的运动、接触与物体交互知识,并覆盖了多种能力:

预测机器人动作产生的环境变化;

根据目标物体运动生成机器人行为;

适应训练中未出现的机器人本体;

以及从生成视频中提取可执行行为等。

实验结果

实验中先由 Diffusion Policy 为同一场景采样多条候选动作后,视频模型生成对应未来,Gemini 3.1 Pro 再从任务进度、物理真实性和接触情况等方面评价每段视频,最后选择最优动作执行。

模型规划

在关闭微波炉、打开抽屉、打开洗碗机、关闭冰箱等任务中,加入视频模型规划后,成功率获得了  7 至 26 个百分点 的提升。候选数量增加时,整体表现也随之提高。

主题:模型|数值动作|同一个模型