登录

顶会具身辩论赛实况:徐丹飞激辩,PI连输三轮,谷歌大佬倒戈


速读:世界模型和策略模型,应该合体还是分开? 陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。 他补充道:分开还有一个很大实际好处——调试和迭代更清晰。
2026年07月27日 10:3

数据从哪来?控制靠像素还是动作?

    作者丨 张   璐

    编辑丨 齐铖湧

在具身智能与机器人领域迅速演进的今天,一个问题正在浮出水面:

要想让机器人真正走进千家万户,我们到底该靠特定硬件采集的“具身数据”,还是该拥抱浩瀚如海的“互联网与人类行为数据”?

2026年RSS大会最后一天的workshop圆桌讨论,现场火药味十足。五位专家围绕世界模型的实际落地展开激烈交锋。

来自Georgia Tech和Nvidia的 徐丹飞 ,以组合世界模型的研究闻名;Google与NYU的 Sherry Yang ,专注物理代理的世界模型评估与改进;Physical Intelligence的 Laura Smith ,强调具身智能的实践落地;NVIDIA的 Max Li ,长期深耕大模型架构;OpenDriveLab的 Li Chen ,则在机器人数据与控制领域有丰富经验。

主持人抛出三个核心辩题,让五位专家分成两派正面碰撞。雷峰网 (公众号:雷峰网) AI科技评论小队在现场记录下这场思想碰撞,以下是完整实录:

01

第一轮辩论:

世界模型和策略模型,应该合体还是分开?

大家都知道现在搞AI都在追求大一统,但在机器人领域,这条路真的走得通吗?主持人一上来就抛出问题—— 世界模型和策略模型,应该合体还是分开?现场的几位大佬瞬间根据各自的学术立场分成了两大阵营。

▎ 本轮对阵的双方是:

“大一统”合体派:  PI科学家Laura Smith、英伟达Max Li(主张把所有功能塞进一个超级模型里,既动脑又动手)

“各司其职”分开派:  谷歌Sherry Yang、源策未来陈立(Lee)、徐丹飞(主张分开搞,看重工程运行效率和调试清晰度)

支持“合体”的一方 认为,现在AI的大趋势就是Everything in One。Laura认为,MoE模型都能把成百上千个专家塞进一个网络,为什么世界模型和策略不能合并?最终我们肯定想要一个超级模型,既能理解世界,又能直接行动。

她的观点得到了同阵营  Max Li  的赞同。从长远来看,Max 也相信未来的终局一定是全能的大模型,但他非常务实地补充道:现在AI“能想象到什么”和机器人“实际能做到什么”之间,其实存在着一条巨大的鸿沟。

视频模型学得再好,动作数据太少也发挥不出来,所以目前的当务之急,是怎么通过表征学习把世界模型的想象力翻译成机器人的执行力。

听到这里,坐在“分开派”阵营的  陈立(Lee)  坐不住了,他直接从底层工程的“运行效率”出发,给合体派泼了一盆冷水。

陈立强调,机器人是要在现实中实时干活的,策略模型的响应速度和运算效率是命根子,必须保证它跑得飞快。

要是为了盲目追求合体,把世界模型这个庞然大物强行塞进同一个网络里,导致策略模型被拖慢、机器人动作卡顿,那在实际落地中根本没办法用。为了效率,必须分开调试 和特殊化处理。

陈立的说法得到了 Sherry Yang 的强烈声援。Sherry 指出:“目前绝大多数模型其实还处于欠拟合阶段。世界模型要吃下海量具身交互数据已经非常吃力,如果再强行塞进策略学习的任务,两个目标会互相打架, 训练效果反而下降。”

她进一步解释了两个模块的本质差异:世界模型需要大量失败数据来真正理解物理规律,比如机器人撞到东西、滑倒、抓不稳等场景,这些对提升模型鲁棒性非常重要。但策略模型的主要目标是学习成功行为。如果强行合体,失败数据可能会污染策略,让机器人学到更多错误的动作模式。

徐丹飞也站在分开派这一边。他补充道:分开还有一个很大实际好处—— 调试和迭代更清晰 。

当机器人任务失败时,我们能快速定位:到底是世界模型没想对(预测未来不准),还是策略没执行好(动作选错了)。如果全塞到一个黑箱模型里,出了问题就很难指责具体哪个部分。

主题:世界模型|分开|机器人|徐丹飞|应该合体