登录

世界模型进入下半场:自变量WALL-SS突破三大瓶颈,让虚拟世界成为机器人的「训练场」


速读:世界模型是架构。 可以说,WALL-SS是少数画面预测会跟随动作指令的模型。
2026年08月27日 19:2

机器人世界模型的下一场竞争,可能不是画质,是架构。

作者|Li Yuan

编辑|郑玄

一只机械臂的夹爪明明没有夹住杯子,杯子却像被磁铁吸住一样,跟着夹爪升了起来。这个看似荒诞的问题,正在困扰机器人世界模型,业内甚至将其称为「磁铁式抓取」。

视频生成模型只要让画面看起来合理,就算完成任务;但世界模型不能只追求「像真的」。机器人训练数据大多来自成功演示,模型容易形成捷径:与其理解动作的细微差别,不如按照画面,直接生成最可能的结果。

可在真实世界里,夹爪位置偏移几毫米,就可能让结果从抓起变成碰倒杯子甚至抓空。世界模型真正需要理解的,是动作与结果之间的因果关系。

8 月 27 日,自变量机器人发布下一尺度自回归世界模型 WALL-SS,试图让世界模型从「能用」走向「好用」。WALL-SS 不是一次性生成整个画面,而是通过由粗到细的方式描绘未来,让不同动作真正对应不同结果;同时结合长时记忆机制,实现最长 60 秒连续推演。

测试显示,WALL-SS 连续推演 60 秒后,画面和运动轨迹仍更接近真实视频,动作跟随得分达到 0.29,而 Cosmos3-Nano 为 0.044,其他测试模型干脆为 0。可以说,WALL-SS 是少数画面预测会跟随动作指令的模型。

自变量同时宣布开源 WALL-SS。对于尚未形成统一技术路线的机器人世界模型而言,开源的意义不仅是开放一个模型,更是让行业共同验证:世界模型是否在按照动作做预测,虚拟推演能否真正服务于真实机器人。

「技术范式尚未收敛时,持续探索本身就是竞争力。」具身智能需要的不只是快速落地的硬件,也需要持续挑战既有路线、开拓核心技术边界的公司。

01

世界模型,成为具身智能的主赛道

2026 年,世界模型正在成为机器人领域最受关注的技术方向之一。

英伟达持续迭代 Cosmos,并开始将视频世界模型用于机器人控制和规划;Meta 的 V-JEPA 2 尝试让机器人通过预测物理世界的变化,在陌生环境中完成抓取。越来越多研究也开始探索用世界模型替代部分真机测试,让机器人在「动手」之前,先在虚拟世界中预测不同策略的结果。

理解这股热潮并不复杂。大语言模型通过预测下一个词学习语言规律, 世界模型预测的则是下一刻的世界 :机器人向左移动,杯子会不会被碰倒;夹爪再收紧一点,物体能不能被抓起;一个动作持续执行十秒,场景最终会变成什么样。

这对具身智能尤其重要。过去几年,行业主要解决的是机器人「怎么做」的问题,VLA 可以根据视觉和语言指令直接输出动作。但随着机器人能力提升,一个新的问题变得越来越突出:如何判断一套策略到底好不好?

如果每次模型迭代都依赖真机测试,成本高、周期长,很容易成为训练和迭代的瓶颈。传统仿真虽然可以承担部分测试,但需要人为建模物体材质、摩擦、形变和接触关系,很难覆盖真实世界的复杂性。世界模型则试图从真实视频和机器人交互数据中学习世界如何变化,让机器人可以在虚拟环境中反复预测和验证策略。

它甚至可以进一步参与机器人的决策。VLA 看到杯子后直接决定「伸手去抓」, 世界模型则可以先预测不同动作的后果,再帮助机器人选择更合适的策略——从「直接行动」走向「先想象,再行动」。

主题:世界模型|动作|WALL-SS|画面|结果