登录

乐享以太大模型,让中国具身智能坐上定义席


速读:被推到台前的,还有一组更根本的追问:当计划被打破、条件被临时改写、任务被中途打断,机器人还能不能重新收敛到目标? 整条任务链是:接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。 更细致的一个瞬间是:在没有人开口要求的情况下,它想到吃烧烤的顾客会需要纸巾,主动把纸巾送了过去。
2026年09月23日 09:46

从“预测”到“求解”:乐享以太大模型重塑 Physical AI 解题范式。

    作者丨 幸丽娟

    编辑丨 董子博

具身智能行业一直在等一个 ChatGPT 时刻。 但这个时刻,未必长得像 ChatGPT 。

决定这个时刻的,不是机器人会聊天,也不是机器人学会了几个动作,而是在不确定环境里,机器人能不能自主思考、判断和执行,在无序的事件中,持续完成任务。

过去两年,行业积累的几乎全是“能力上限”的展示:选好场景、选好时机、反复调试,再拍出一条完美的Demo。

上限可以“被编辑”出来展示。真实效果如何,却少有人敢公开测。

但机器人真正进入现实世界,考验的不只是最好时能做到什么,更是环境不断变化时,它还能不能把事情做下去。

9 月 16 日傍晚。上海闵行一家烧烤店门口,乐享科技让两台机器人摆起了烧烤摊。接下来近一个小时,它们要接单、烤串、上菜。

这场直播的规则, 测的正是 机器人在 这种真实环境里的应变能力 。

没有剪辑,没有遥控,没有预设脚本。

更绝的是,观众可以实时干预:随机出题,自由改造场地布局,随手改道具摆放位置,临时打断正在进行的任务并追加需求。现场 3 桌、6 名顾客的主线任务,就是“干扰”,看机器人能不能像人一样自己“圆场子”。

而就在不久前,这家公司刚刚站在了一场舆论风暴的中心。

故事线是这样的:

7 月,乐享上线以太大模型官网并公开完整技术路线;8月26日,一段机器人协作收拾房间的10分钟一镜到底 Demo,在具身圈传开。

9 月 3 日,OpenAI 上线 GPT-6 Astra 官网;三天后,首席科学家 Jakub Pachocki 发表万字长文《异星心智》。

9 月 10 日,乐享创始人郭人杰发文,三问 OpenAI:技术理念为何高度重合?概念表述为何如出一辙?官网设计为何似曾相识?他称对方“像素级搬运”“直接蒸馏”,并称法律团队已启动程序。

舆论随之分成两派。一派说这是硬实力,另一派说这是“蹭热度”、“demo造假”。

面对这些质疑声,乐享决定让 搭载 以太大 模型的机器人自己上场回应 。 于是,这场户外烧烤直播来了。

被推到台前的,还有一组更根本的追问:当计划被打破、条件被临时改写、任务被中途打断,机器人还能不能重新收敛到目标? 如果能,又凭什么能?

乐享敢把场子开放出来,就是因为 以太大模型 的架构从一开始就不是为“把预设流程跑完”设计的 。 这一点,在近一个小时的直播里看得最清楚。

01

开放环境直播:

一次可被干扰的硬核测试

炉子支起来,名为“二爷”和“五弟”的两台机器人各就各位。一台点单送餐,一台负责守炉。

整条任务链是:接单、分析顾客需求、勘探场地、分拣食材和工具、烤制、动态翻面控温、成品整理、送餐归位。

为了证明现场没有遥操,创始人郭人杰把摄像机带进后厨,翻转镜头拍现场人员,又掀开背景幕布,展示那个唯一能藏人的小房间——里面各种食材厨具堆得到处都是,完全没有人遥操的空间。

他在开场直言直播的仓促:“我们周日才跟烧烤店老板聊好,花几万块钱租下这块场地。”

然后,机器人的五项核心能力在这场直播中,被反复测试: 然后,机器人的五项核心能力在这场直播中,被反复测试: 主动感知。 服务机器人在完成点单、将需求传递给烧烤机器人后,会注意顾客的等餐时间,当感知到顾客等候较久,会主动上前询问出餐进度。

更细致的一个瞬间是:在没有人开口要求的情况下,它想到吃烧烤的顾客会需要纸巾,主动把纸巾送了过去。

多模态理解。 有顾客在点单时临时提出“少放辣”。这个需求首先以语言形式进入服务机器人,它需要理解这句话的语义,同时结合视觉信息确认顾客指的是哪一份订单,然后将新要求转身传递给负责烧烤的同伴。

烧烤机器人收到调味指令后,精准识别食物位置,均匀完成撒料操作。这背后是对物体尺寸、材质、位置及相互约束关系的多模态空间理解。

流式记忆。 一个小时的直播被打散来做:3 组顾客轮流点单、多轮上菜、临时打断穿插其中。服务机器人全程没丢掉手里的任务链,能把进度推进到收尾。

更直观的一幕是:服务机器人正在给顾客点单,突然被要求“拿瓶水”。它停下点单,先去递水,再接着把单点完。整个过程没有犹豫,也没有等下一条指令。

这件事看起来简单,但对机器人来说不是。打断一次,上下文就可能被覆盖,任务状态归零,它得重新知道“我刚才在做什么”“做到哪了”“为什么做到那一步”。对于其他依赖单步观测做决策的机器人而言,这几乎是不可能完成的任务。

动力学建模。 烧烤机器人自主为食材刷涂酱汁,这个过程非常考验空间感知和力度控制,因为模型需要理解物体的物理属性,结合动力学模型输出符合物理规律的动作。

另一个更能说明问题的瞬间是翻面:机器人第一次给食材翻面时没有翻好,食材掉落炉架。第二次调整了抓取和翻转姿势,成功了。

这背后,是动力学建模在实时求解:系统不是从记忆里检索一个“标准翻面动作”,而是在当前的重心偏移、摩擦系数和夹持条件下,重新解出了一组能让动作成立的力矩参数。

持续自 进化 。 烧烤机器人翻面第一次失败、第二次调整姿势成功的瞬间,同样是模型持续自我迭代能力的直接写照。这种并不完美的过程,恰恰能让人直观地看到模型是如何通过失败反馈,自主进化,最终顺利完成任务。

这五项能力,看似在测五个不同的维度,实际上指向模型从数字世界走向物理世界的真正门槛: 机器人能不能在约束不断变化的情况下,依旧能把事情做对。

过去,这个判断靠人写规则、靠数据拟合、靠预设流程。而这场直播验证了,模型在不同的约束条件下,靠自主智能就可以把“对的动作”解出来。

这两台机器人默契完成协作任务的画面,很容易让人想到八月底那段在具身圈刷屏的视频。 10分钟,一镜到底。狭小的空间里,两台不同品牌和型号的机器人,全程自主协作收拾房间。

视频里发生了这些事,值得反复琢磨—— 视频里发生了这些事,值得反复琢磨—— 一台机器人用刮水器擦玻璃,有一处怎么都擦不干净。它重复几次后停下来,判断脏东西可能在玻璃外面,于是把刮水器伸出窗外;

接着,它收拾桌面,双手被占满时,另一台主动拿起桌上的围巾挂到它脖子上,发现围巾太长,还用双手把围巾捧起来,被帮助的机器人看懂了,弯下了腰......双方通过自主协同,完成了这次物品“迁徙”;

随后,较矮的机器人要把围巾放进柜子上方隔层,可它只有 1.3 米,够不到。它找到旁边的箱子推到地上,想弯腰搬起来垫脚,却发现自己弯不下腰,于是它选择用脚踢过去;

箱子踢歪了,机器人又开始琢磨怎么把箱子回正,这时候,身高 1.7 米的另一台机器人走了过来:它似乎看出了同伴的困境,放下了手上的活,主动帮忙把围巾放到目标位置。

中途闹钟响了,两台机器人转去处理桌面和冰箱收纳任务,做完再回来接着做没做完的事,进度没被清零。

一个在室内,一个在户外;一个做家务,一个要烤串上菜。展示的却是同一件事:以太大模型可以让机器人自主思考,自主决策,并在试错中完成自我进化,以及实现跨本体协作。

这背后,还有一个更深层的追问: 它凭什么做到?

要回答这一点,得先看市面上现有的具身智能主流方案为什么做不到。

02

VLA 和 WAM ,绕不开“预测”这道坎

当前具身智能有两条主流路线:VLA 和 WAM。

2026年4月,英伟达研究科学家Jim Fan在红杉AI Ascent大会上宣告:VLA 已死,WAM 当立。这番论断将两条路线的争论推到了台前。

但无论是哪条路线,两者的底层逻辑却是同一件事:预测。

▎ VLA 预测动作分布

从 RT-1、RT-2 到 OpenVLA,再到 Π0 系列,VLA 的思路是:把图像和语言指令编码进一个多模态主干,直接解码出动作序列。

数学上,它学的是一个条件动作分布 p(a|o,l)。给定当前观测 o 和语言指令 l,输出动作 a。

这条路的好处很直接:快。链路短,延迟低,能接高频控制;语言模型的语义能力可以直接复用,机器人“听得懂”开放词汇的指令。

但随着模型走向更加开放的真实环境,一些结构性缺陷也开始暴露。

第一个缺陷,是 语言被架空 。 ICML 2026上的一篇论文(LangForce)给这个缺陷起了一个学术名字:信息坍缩。在目标驱动的数据采集范式下,语言指令往往仅凭视觉观察就能高度预测——看到柜子就对应“开柜子”,看到瓶子就对应“拿瓶子”。指令与动作之间的条件互信息趋近于零,模型实际上忽略了语言,退化成了一个纯粹的视觉策略。

在 RoboCasa 基准上,一个完全忽略语言指令的纯视觉模型,成功率与接收完整语言指令的模型几乎相同。 在 RoboCasa 基准上,一个完全忽略语言指令的纯视觉模型,成功率与接收完整语言指令的模型几乎相同。 这意味着,VLA 学到的不是“理解指令然后行动”,而是在特定视觉场景下匹配特定动作。它把“听懂”和“看见”悄悄合并成了同一件事。而合并的代价是:分布外的新场景、新任务,泛化会显著下滑。

第二个缺陷,是 它跳过了对环境的动力学建模 。 它不预测动作执行后世界会怎么变,只学“这个场景对应什么动作”。所以它没法回答“我把手伸出去会不会撞到窗框”这类问题,因为它压根没在算这件事。

▎ WAM 预测未来世界状态与动作

WAM 就是为了补 VLA 的第二个缺陷来的。它采用“先预演、后动作”的推演式架构:先预测动作执行后世界状态会如何变化,再反推最优控制指令。

数学上,它学的是一个 未来状态与动作的 联合分布 p_θ(s_{t+1:t+H}, a_{t:t+H-1} | o_{≤t}, a_{

这条路补上了 VLA 缺失的物理预测。它学的是“物体被推、被抓、被丢弃时会怎样移动”,这种物理知识比语义知识更通用。

但 它依旧没有解决信息坍缩问题。 WAM 的视频预测同样绑在具体本体的相机视角上,语言指令在其中的权重依然很低。它补了物理,没补语义。

而且代价很大。基于视频扩散 Transformer 的 WAM,推理时要逐帧预演未来状态。NVIDIA 的 DreamZero 训练一次要 8 张 H100 跑 25 天。而且长程预测的误差会逐步累积,最终误导决策。

VLA 快,但语言被架空、不做动力学;WAM 补了物理,但代价高、语义弱。两者都在用“预测”驱动决策——一个预测动作,一个预测世界状态。

而真实世界的变体是无穷的 。光照角度、物体摆放、地面摩擦、人的随机干预,这些变量的组合空间不可能被穷举。预测范式的天花板就压在这里:分布外,没有高概率样本可取。

也就是说,预测范式依赖的是训练数据里见过的情形。 分布外没有数据,模型就没有可参照的概率分布,决策也就失去了依据,预测出“下一个对的动作”更是无从谈起。

那还有别的解法吗?

乐享没有执着于在“预测”这道题上找最佳答案,而是直接换一个题:

不预测“下一个最可能的动作”,求解 的是 “ 约束条件下,什么状态会更接近目 标 ”。

03

以太大模型:从“预测”到“求解”

作为机器人的大脑,以太大模型的核心机制是 Energy-Driven(能量驱动),底层由神经元分配来支撑。

两者各回答一个问题:用什么来判断一个状态是不是“对的状态”,以及这个判断在哪里被计算出来。

▎ 能量驱动:用什么来判断“对的状态”

“能量”这个词容易让人联想到物理能量,但它在以太大模型里是一个数学对象:任务完成度、物理约束、记忆状态和动作可行性,被整合进一个统一的能量函数。

每个项都是一个数字,描述当前状态在某个维度上“有多好”或“有多差”。加起来,得到一个总分。 总分越低,状态越好。

机器人的决策过程, 就是在这个能量地形上找低点。哪个行动能让总分降得更多,就执行哪个 。

对比来看, VLA 和 WAM 的底层都是概率对象,都受同一个数学性质的约束: 分布是归一化的,所有可能结果的概率加起来必须等于 1。

这就带来一个限制: 两个分布无法直接加在一起,得到一个新的合法分布 。 “把杯子拿起来”是一个分布,“不要碰到旁边的碗”是另一个分布。把这两个分布相加,在数学上无法构成一个新的合法分布,更不可能自动获得“拿起杯子同时不碰碗”的语义。

从机制上看,这就是 VLA 和 WAM 在“多任务”上吃力的根本原因。每多一个约束,要么往训练集里加数据,要么加一个适配模块。约束进的是训练集,不是目标函数。

而 能量是标量,标量天然支持复合:任务目标是一个能量项,物理约束是另一个能量项 。加起来,就得到一个新的目标函数。不需要重新训练,不需要为每个任务单独微调。

这是能量驱动和预测范式最根本的分野: 预测范式把约束塞进数据,能量范式把约束写进目标。

决策方式也跟着变了。拟合分布的模型本质上在做条件检索:给定当前观测,从训练分布里找出概率最高的动作——这也是它在分布外会塌掉的原因,分布外没有高概率样本可取。

而能量最小化是一个优化过程: 它在当下的具体环境里当场找一个低能量解,而且求解自带剪枝,能量高的候选会被迅速淘汰,不必把成千上万条路径都推演完 。

回到出租屋里擦玻璃那个瞬间。VLA 如果没见过“玻璃外侧有污渍”,不会主动把手伸出窗外,因为“伸出窗外”从未与“擦玻璃”配对过。

但在能量框架下,“擦玻璃”的目标是把玻璃表面的状态从“脏”推向“干净”,物理约束包括“污渍可能在任一侧”,内侧达不到目标,系统自然搜索到外侧。

搬箱子那个瞬间更清楚。机器人要把围巾放进上方的柜子,够不到,它就找到箱子,想搬起来垫脚,但发现自己弯不下腰。试了几次之后,它一脚把箱子踢到了柜子边。

这“一脚”不是被检索出来的。如果训练数据里没有“用脚踢箱子到柜子边”这个动作,VLA 和 WAM 都不会主动做这件事。

但在能量框架下,“目标物不可达”是一个能量项,“箱子可以承重”是一个物理约束,“弯不下腰”是一个本体约束,“脚可以推动箱子”是另一个物理约束。系统在当下环境里,用这些约束解出了一条可行路径。

它判断下一步行动的方式,不是从记忆里翻答案,是当场“解题”:在约束不断变化的当下,重新解出什么才是对的状态。

▎ 神经元分配:“对的状态”在哪里被算出来

能量驱动定义了“用什么来判断一个状态是不是‘对的状态’”,但还有一个工程问题没解决:这个判断需要在每一步决策中实时计算。如果每一次评估都要激活整个 4B 模型,算力根本撑不住实时闭环。

以太大模型的解法是神经元分配。它按需调度计算资源,不让整个模型始终处于活跃状态。

主题:机器人|乐享|环境|任务|以太大模型