登录

告别通用具身模型崇拜:具身智能走向异构策略编排


速读:各个策略在擅长的任务上都有独特的优势,但真实世界往往同时要求高度的语义理解、闭环控制、几何精度、长时序推理,远远超出了单一控制策略的能力边界。 纵观具身智能技术历史长河上闪耀的星辰,VLA擅长视觉语义理解与开放词汇指令,RL在特定分布内具有稳定闭环行为,TAMP擅长逻辑与几何规划,WAM则通过预测未来辅助决策…我们不难发现,它们的能力并非是彼此替代,而是在某些方向高度互补。
2026年08月03日 09:3

当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。

论文标题: RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning

Project Page:https://robo-harness.com

arxiv link: https://arxiv.org/abs/2607.18060

具身智能正在经历模型能力竞赛:VLA 在 Scaling 的道路上一路狂奔,WAM 弥合未来预测和动作生成,RL 依靠 Reward Design 强化执行稳定性,TAMP 凭借严密的逻辑进行长序推理…

各个策略在擅长的任务上都有独特的优势,但真实世界往往 同时 要求 高度的语义理解、闭环控制、几何精度、长时序推理,远远超出了单一控制策略的能力边界。仰望 “通用具身模型”,只能长叹:“道阻且长”。

RoboHarness: 没有最强的模型,只有最合适的策略。

为什么需要异构策略编排?

与其苦苦等待未来一个通用模型包办一切,不如问问:协同调用现有的控制策略,我们能做什么?

纵观具身智能技术历史长河上闪耀的星辰,VLA 擅长视觉语义理解与开放词汇指令,RL 在特定分布内具有稳定闭环行为,TAMP 擅长逻辑与几何规划,WAM 则通过预测未来辅助决策… 我们不难发现,它们的能力并非是彼此替代,而是在某些方向高度互补。

既然单一策略难以覆盖复杂任务的全部需求,为什么不让异构策略协同工作,在不同阶段各展所长?

从模型竞争,走向异构策略编排

RoboHarness 主要解决两个异构策略协同的关键难题: (1) 如何选择最适合的策略?(2) 异构策略间如何交接?它将 VLA、RL、TAMP 等控制策略封装为可调用技能,由 coding agent 进行高层任务拆解及子任务路由,并在相邻异构策略状态分布不兼容(Out of Distribution)时生成桥接轨迹。系统无需底层策略共享结构、动作空间或训练数据,也无需联合训练,可无痛接入新的底层控制策略,包括 WAM、VLN 或 MPC 等。

主题:策略|具身智能|能力边界|走向异构策略编排