登录

李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的


速读:李飞飞、YilunDu罕见联手:别给机器人建大脑了,直接偷视频模型的李飞飞、YilunDu罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIRPaper115。 在仅用15小时数据微调情况下,就能让机器人操作,从单臂泛化到未见过的双臂上。
李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIR Paper 115

李飞飞、Yilun Du罕见联手:别给机器人建大脑了,直接偷视频模型的|GAIR Paper 115

2026年08月06日 18:4

用像素动作的新接口,打通视频大模型与机器人之间的壁垒

    作者丨 邓哲敏

    编辑丨 齐铖湧

今年视频生成和具身智能领域,阵容最为豪华的一篇“融合体论文”出现了。

前几天,一篇名叫 Masked Visual Actions for Unified World Modeling 的论文,挂在 arxiv 上,这篇工作还未在学术圈传开,但绝对马上就要爆了。

因为它的署名栏和论文内容都实在太炸裂了,大家自己看吧。

不仅包括李飞飞,ImageNet 缔造者,如今全力押注空间智能;吴佳俊,斯坦福助理教授,物理推理方向代表人物,刚获得热乎的 IJCAI 2026 计算机与思维奖,还没领奖;张吕民,ControlNet 作者,如果你用过 AI 绘画里照着姿势生成人物的功能,你已经在用他的技术。

还有斯坦福计算成像实验室负责人 Gordon Wetzstein、机器人基础模型核心推动者黄文龙等十多位顶尖学者。

更让AI科技评论(雷峰网公众号)意外的是哈佛助理教授 Yilun Du,也在其中。

因为大家可能知道,他和李飞飞,恰好是具身智能领域两条路线的代表人物。一个主张让 AI 直接在看得懂的画面里思考,一个主张把一切先压缩成抽象数字再思考,学术交集极少,上次合作还是五年前杜在 MIT 读博,之后一直观点分野,这次同署,本身就是看点。

要知道,学术圈里,某些名字凑在一起就是信号。两条路子平时互不相让,这次却出现在同一篇论文里。

只能说这篇工作,可能找到了两条路线都认账的交叉点,或者叫做共识?

机 器人 , 也许 根本 不需要 自己 专属的大模型 。

这个“共识”有些可怕,现在多少大厂拼命卷机器人大脑基模,多少创业公司靠一个基模撑起了几十亿估值,但这篇论文,在挑战这一认知。

按论文的结论,也许机器人不仅不需要自己的专属大模型,甚至不需要重训已有的视频生成模型,只需要 找对接 口, 就 完全可以直接利用日趋成熟的视频生成模型 。

同时,这篇论文对产业界的影响也是巨大的,它的思路一旦走通,那么今后各个工厂或者快递分拣站“换条机械臂就宕机”的跨本体难题,将得到彻底解决。

好了,说太多了,开始解读一下。

01

过去视频模型懂物理不懂动作, 是因为缺"翻译接口"

总结来看,这篇论文可以概括出一句话:过去视频模型懂物理但不懂动作,是因为缺一个"翻译接口",如今通过 MVA 把动作变成像素遮罩轨迹即可完成翻译,同时,MVA 模型能同时做正向(世界模拟)和逆向(动作生成)。在仅用 15 小时数据微调情况下,就能让机器人操作,从单臂泛化到未见过的双臂上。

解读论文前,先通过一个小例子来解释一下行业痛点。

如果一个人广泛浏览物理纪录片、慢动作回放和日常视频,一定会练出一种物理直觉:球滚到桌边,多半会掉;水杯被撞,水会洒。这种直觉不是背出来的,是看多了自然长出来的。

今天的视频生成模型,差不多就是这样一个人。

无论 Sora 还是国内宇宙厂、老铁厂、生数或其他开源模型,吞下海量视频后,也练出了类似的物理直觉。给它一段拿起水壶倾斜的开头,它能续出一个大致靠谱的后续:水壶里的水会被倒进杯子里。没人教过它牛顿定律,它全靠看出来的。

但它有个致命问题:从没亲手做过任何事。你把机械臂放在它面前,让它把杯子挪到左边,它会愣住,因为完全不懂往左挪这句话该怎么变成给电机的信号。

这篇论文前言基于这些分析,直接指出一件重要的事:

当下视频模型懂物理,但不会下达指令。

马上论文给出答案说:问题出在了“翻译”上。

很多人看到这里估计懂了,这里讲的翻译,其实指的是视频模型看懂以后,该以什么方式传递指令。

其实机器人的世界讲的是一套很干巴的语言,关节转了多少度,末端移动了多少厘米,夹爪合拢到什么程度。这套语言跟视频模型脑子里那套“像素怎么流动、颜色怎么变化”的语言完全对不上。

这就好比你请了一位见多识广的美食评委,但你没法直接和他聊菜谱,只能用摩尔斯电码敲给他。他心里门儿清这道菜该怎么做,可你敲的那串点和划他完全看不懂。

过去几年,研究者们试过不少办法弥合这道沟。

论文直接拿一些经典工作出来举例,提到被誉为机器人策略开山之作的 UniPi ,虽然能做到用文本引导视频生成规划,但文字指令太模糊,动作精度始终受限于语言描述;

此外,又举例 cmu 和 Meta 合作的经典工作 Track2Act ,能在画面上标轨迹点,用点轨迹预测做操作,但稀疏的点描述不清一个连续动作;

还有另一个思路,也就是 Ctrl-world ,它是把机器人的关节角度直接喂给模型,最直接,却也最脆弱,因为换一款机械臂,同样的“关节 1 转 30 度”意味着完全不同的姿态,模型立刻懵掉。

这些方案的共同思路是 逼着视频模型去学一门它本不熟悉的外语。

而这篇论文换了个问法: 为什么不干脆用视频模型自己的母语跟它说话?

02

一个巧思,打通视频模型 和机器人操作的结界

整套方法出乎意料地朴素,拆开看其实就三步。 整套方法出乎意料地朴素,拆开看其实就三步。 ▎ 第一步:把动作变成一段涂了颜色的录像

这篇论文提到,他们用了一个叫 SAM 的工具,全称 Segment Anything Model,是 Meta 做的抠图模型,是目前视觉圈最好用的通用抠轮廓工具之一。

SAM 把视频里的机器人和操作物体从画面中分割出来,得到它们在每一帧中的区域(mask)。

由于机器人和物体都在不断运动,这些区域随着时间连续变化,自然就形成了两条运动轨迹:一条记录机器人是如何移动的,另一条记录物体是如何变化的。

这就是这篇论文(MVA)对动作的全部定义。没有角度,没有坐标,没有数字,只有色块在画面里怎么游走,就这么简单。

▎ 第二步:遮住一条轨迹,让模型自己把它补出来

这一步是整篇论文真正的巧思。

把物体运动的轨迹遮住,只留机械臂运动轨迹,再把这段缺了一半的录像交给 AI,问它接下来会发生什么?

AI 盯着机械臂的运动轨迹一推演:手臂这样伸过去、这样一推,那个被藏起来的物体接下来会往哪儿移动、会不会被碰倒。

反之,把机械臂遮住,AI 看到一个杯子从桌子左边滑到右边,却看不到是谁推的。它必须反过来推理机械臂应该怎么伸、怎么动。

这时你可能发现了,前者 AI 扮演的是世界模拟器:给定机器怎么动,推演世界会如何变化。后者AI 扮演的是动作生成器:给定世界该如何变化,反推出机器应该怎么行动。

这个巧思最妙的是,完成这两项任务的始终是 同一个模型、同一套参数 ,没有任何切换开关。它是在模拟世界还是在生成动作,只取决于你遮住哪条颜色。

这让我们想到有点像做完形填空,同一篇文章,这次挖空动词,下次挖空名词,考察的是同一个脑子的不同能力。

▎ 第三步:不需要从头训模型,只用15小时就能教会机器人

MVA 没有从零训练任何东西,它站在了一个现成模型的肩膀上:阿里的开源视频生成模型 Wan2.2 。Wan2.2 有 140亿 参数,基于扩散 Transformer 架构,是目前开源阵营里生成质量最能打的选手之一(但非常可惜,据AI科技评论最新消息,Wan 团队已经解散)。

这套组合里,Wan2.2 相当于那个看过一万部纪录片的“人”,物理直觉已经练得相当到位了。MVA仅仅用 LoRA(Low-Rank Adaptation,一种很省力的微调手段),就让 Wan2.2 能看懂刚才机器人语言体系中涂抹色块。

之所以不去动大脑本身,仅用现成模型搭建,是因为大动干戈地全面重训,不仅花钱费力,还很容易把原本积累的物理直觉冲洗掉。就像一个物理学家被拉回去重刷三年小学数学题,搞不好反而把微积分忘了。

对比一下就出来了,别人都花几个亿从零开始训基座模型,外加堆几千几万小时机器人操作数据,才勉强让机器人学会动作。

而 MVA 的思路,是 0 元购现成的开源模型 + 15 小时数据,就直接让机器人实现 zero-shot 泛化效果,有点离大谱了。

主题:机器人|直接偷视频模型|YilunDu罕见联手