告别通用具身模型崇拜:具身智能走向异构策略编排
当 VLA、WAM、RL、TAMP、MPC 等机器人控制策略在各自擅长的任务中大放异彩,如何刻画其能力边界,并在正确的时机为不同子任务匹配最合适的策略,正逐渐成为机器人完成复杂长时序任务的关键。

论文标题: RoboHarness: Memory-Driven Orchestration of Heterogeneous Robot Policies for Long-Horizon Planning
Project Page:https://robo-harness.com
arxiv link: https://arxiv.org/abs/2607.18060
具身智能正在经历模型能力竞赛:VLA 在 Scaling 的道路上一路狂奔,WAM 弥合未来预测和动作生成,RL 依靠 Reward Design 强化执行稳定性,TAMP 凭借严密的逻辑进行长序推理…
各个策略在擅长的任务上都有独特的优势,但真实世界往往 同时 要求 高度的语义理解、闭环控制、几何精度、长时序推理,远远超出了单一控制策略的能力边界。仰望 “通用具身模型”,只能长叹:“道阻且长”。
RoboHarness: 没有最强的模型,只有最合适的策略。
为什么需要异构策略编排?
与其苦苦等待未来一个通用模型包办一切,不如问问:协同调用现有的控制策略,我们能做什么?
纵观具身智能技术历史长河上闪耀的星辰,VLA 擅长视觉语义理解与开放词汇指令,RL 在特定分布内具有稳定闭环行为,TAMP 擅长逻辑与几何规划,WAM 则通过预测未来辅助决策… 我们不难发现,它们的能力并非是彼此替代,而是在某些方向高度互补。
既然单一策略难以覆盖复杂任务的全部需求,为什么不让异构策略协同工作,在不同阶段各展所长?
从模型竞争,走向异构策略编排
RoboHarness 主要解决两个异构策略协同的关键难题: (1) 如何选择最适合的策略?(2) 异构策略间如何交接?它将 VLA、RL、TAMP 等控制策略封装为可调用技能,由 coding agent 进行高层任务拆解及子任务路由,并在相邻异构策略状态分布不兼容(Out of Distribution)时生成桥接轨迹。系统无需底层策略共享结构、动作空间或训练数据,也无需联合训练,可无痛接入新的底层控制策略,包括 WAM、VLN 或 MPC 等。