登录

迈向长程智能体,人大高瓴发布149页全景综述


速读:在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。 本综述从Foundation、Evolution、Harness、Optimization、Application和Frontier六个视角下,如图5所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。
2026年07月25日 15:3

过去几年,大模型已经从单轮聊天机器人,快速演变为软件工程、深度检索、计算机操作、多模态交互与科学发现中的决策核心。新的问题随之出现: 一个智能体即使单步表现足够聪明,能否在数百、数千次相互依赖的行动中始终记得目标、修正错误、管理上下文,并可靠安全地把任 务 做完?

这正是 长程智能体(Long-Horizon Agents) 研究要回答的问题。在智能体能力快速演进的今天,长程能力正日益成为其进入真实生产环境的核心瓶颈。依据 METR 的测量:在约 50% 成功率下,前沿智能体完成软件工程类任务的 “人类专家等效时长” 已从早期模型的秒级提升到十余小时。如图 1 所示, 该时间跨度大约每 7 个月翻一倍;从 2023 年后,翻倍周期进一步缩短至约 4 个月 , 这说明智能体的长程能力仍处在高速扩展阶段。

图 1 前沿智能体可完成任务的时间跨度持续增长 图 1 前沿智能体可完成任务的时间跨度持续增长 在本文中,我们想强调的是:智能体 “跑得久”,并不等于 “具备长程能力”。真正的关键,不在于占用更多时间与算力,而在于 能否在更长、更复杂、更真实的推理依赖链上持续、有效地行动。 长期以来,Autonomous Agent、Self-Evolving Agent 等概念常与长程智能体混用。为理理清这一局面,这篇 149 页综述系统梳理超过 900 项研究、系统与工程实践,首次以「 外部脚手架工程 × 内部模型优化 」的协同演化视角,给出长程智能体的统一定义、完整分类与未来路线图。

论文标题: Towards Long-Horizon Agents: A Survey

项目主页:https://long-horizon-agents.github.io/

论文链接: https://openreview.net/forum?id=HyhfhlbWGh

项目仓库:https://github.com/RUC-NLPIR/Awesome-Long-Horizon-Agents

目前该综述刚发布就在小红书、GitHub、X 等社交平台上收获极高的关注度与反响!

为什么长程任务难:

单步错误的积累会导致整条轨迹失控

长程任务的难点并不只是某一步是否答对,而是大量紧密耦合的步骤必须组成一条连贯轨迹。单步看似微小的偏差,在长链条中会被反复继承和放大。论文将典型失败归纳为三类:

目标漂移与误差累积 :执行数千步后,Agent 逐渐偏离最初目标;局部错误不断叠加最终把整条轨迹带向错误方向。

上下文腐化与窗口压力 :上下文并非越长越好。随着历史推理轨迹和工具输出的不断堆积,模型可能会出现性能骤降,也可能因感知到窗口将满而过早结束任务。

稀疏、延迟奖励与不可逆行动 :很多任务只在最后给出奖励信号,这使得中间决策难以获得准确归因;而任务执行过程越长,出现误删数据、错误授权或错误操作等不可逆操作的风险越高。

这意味着,单纯扩大参数量或上下文窗口并不能解决全部问题。一个模型即使拥有更强推理能力,如果缺少计划维护、状态持久化、工具治理、验证和恢复机制,仍可能在长轨迹中迅速失控。

核心论点:

智能体外部和内部协同进化

基于上述挑战,本综述提出的核心论点: “长程智能体能力” 是系统级能力,它源于外部 “脚手架工程(Harness Engineering)” 与内部 “模型优化(Model Optimization)” 的协同演进。

理解长程智能体的关键是把视线从模型单体移向由模型与 Harness 共同构成的完整系统。模型提供推理和行动的策略;而 Harness 则负责进一步支持模型决策的执行,包括组织上下文、维护状态、调度工具、编排流程,并对关键步骤进行验证与恢复。二者共同决定智能体能否沿着一条漫长而相互依赖的轨迹稳定前进。因此,长程能力应被视为整个 Model-Harness 系统的属性,而不是基础模型的一项孤立指标。

论文进一步提出一条双向演化路径:如图 2 所示,Harness Engineering 先把计划、记忆、工具和验证等能力外置,用工程手段迅速拓展模型的能力边界;系统在真实交互中积累的轨迹与反馈,再通过 Model Optimization,用数据 / 环境构造、微调、强化学习、蒸馏和自进化等策略逐步沉淀到模型内部。模型变强后,又能驾驭更复杂的 Harness。外部能力扩展与内部能力吸收由此形成持续循环。

图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化 图 2 长程智能体研究全景:外部脚手架工程与内部模型优化共同进化 三层长程阶梯:从长窗口推理,

到跨会话记忆,再到跨任务泛化

本论文不以 “运行时长” 作为长程任务的唯一标准,而是考察任务是否包含大量相互依赖的逻辑决策,以及这些依赖需要跨越多大的执行边界。如图 3 琐事,本文提出 H1 - H3 三层任务与 C1 - C3 三层能力的阶梯框架:

任务层级:

H1|窗口内任务: 单 上下文窗口内完成,但不是一次回答就结束;须在持续交互中,把相互依赖的决定组成连贯轨迹。

H2|跨窗口 / 跨会话任务: 远超单窗口或单会话(常持续数小时至数天);须压缩上下文,并在中断或交接后恢复进度。

H3|跨任务流: 任务持续到来,总目标跨越多个子任务与环境;要求持久运行,而非封闭的一次性回合。

能力层级:

C1|交互式推理(对 H1): 规划 — 行动 — 观察 — 修正,维持连贯路径。

C2|状态与记忆(对 H2): 在 C1 之上,读写记忆、建检查点、可靠恢复。

C3|经验积累(对 H3): 在 C1/C2 之上,沉淀可复用技能,从经验中泛化并持续改进。

可以看出,三个能力层级并不是彼此割裂的:C2 以 C1 为前提,C3 又建立在 C1 与 C2 之上。一个能够长期成长的 H3 智能体,仍必须在每个具体任务中维持稳定推理和可靠记忆。

图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高 图 3 三类长程任务及其对应能力,任务跨度越大,能力要求越高 从 Prompt 到 Harness:

智能体控制面的三次跃迁

如图 4 ,本综述将大模型系统的演进概括为三个阶段。变化的关键不是 “提示词越来越长”,而是可被工程化控制的范围不断向外扩展。

图 4 长程智能体跨越三个阶段的演进概览 图 4 长程智能体跨越三个阶段的演进概览 阶 段一:Prompt Engineering(2020 - 2023)。 通过指令、思维链、任务分解和自我修正等提示策略,引导模型在单次调用中产生更可靠的推理。控制主要集中在输入文本。

阶段二:Context Engineering(2023 - 2025)。 系统开始主动组织检索结果、工具返回、对话历史与压缩摘要。重点从 “如何写一个好提示” 转向 “每一步究竟让模型看到什么上下文”。

阶段三:Runtime Harness(2025 至今)。 控制面扩展到智能体运行脚手架:Harness 不仅组织上下文,还管理工具、记忆、工作流、权限、验证、恢复和多智能体协作。Agent 由一次模型调用,演化为可持续运行的智能体系统。

这一演进也解释了为什么当下的 Agent 竞争越来越像系统工程竞争:同一个基础模型,在不同 Harness 中可能呈现截然不同的任务上限、成本和可靠性。

六维图谱:

把碎片化智能体研究放进统一坐标系

本综述从 Foundation、Evolution、Harness、Optimization、Application 和 Frontier 六个视角下,如图 5 所示,论文将分散在记忆、工具学习、多智能体、强化学习、上下文工程、安全治理等方向的工作放入同一张图谱。其价值不仅是 “列出更多论文”,更在于回答每项改进究竟发生在哪里:是基础策略更强,还是 Harness 更完善;是提升单窗口推理,还是解决跨会话状态;是任务成功率更高,还是成本和安全边界得到改善。

图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿 图 5 长程智能体研究的统一分类框架:从演化、Harness、模型优化和应用,延伸至开放前沿 外部 Harness:

让长程能力可控制、可验证、可恢复

如图 6 所示,本综述把 Harness 拆为六个相互连接的核心组件,覆盖从目标设定到最终交付的完整生命周期:

循环与工作流 : 包括线性执行、Plan—Execute 和分支搜索。它们负责显式分解任务、追踪子目标,并在失败时重规划或回退。

上下 文与记忆 : 对工作上下文执行丢弃、压缩和选择,将长期有效的信息写入持久记忆,避免上下文无限膨胀。

工具、MCP 与技能: 连接外部能力,支持工具接口与协议、主动工具发现以及可复用技能库。工具越多,选择、描述和安全治理也越重要。

编排: 完成任务分解、角色分配、协作拓扑和通信协议管理,使多个模型或智能体能够协同,而不是互相制造噪声。

Hooks 与中间件: 在输入、工具调用和协议边界执行规则、权限、监控与安全策略,并可根据风险动态调整。

验证: 从步骤级到任务结束级检查正确性、安全性和目标一致性,并用外部信号驱动修正,而非依赖模型自我认可。

值得注意的是,Harness 并不只是 “给模型套一层壳”。它承担的是长期执行中的状态机、控制器和安全边界:当模型出现短视、遗忘或误判时,Harness 必须能让系统停下来、检查、切换路径或恢复。

图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、 图 6 Agent Harness 全景:六个核心组件贯穿从目标设定、规划执行到反思恢复、 验证交付的完整生命周期。

内部优化:

把外化长程能力逐步写回模型内部

如果说 Harness 解决的是 “运行时怎样把事情做完”,内部模型优化解决的则是 “如何让策略本身越来越适合长程任务”。综述沿完整训练链路梳理了七类方向:

架构底座 : 显式长上下文、压缩状态、混合架构与高吞吐机制,使长轨迹可表示、可训练、可负担地解码。

任务、 环境与轨迹合成: 构建规模化、可验证、足够真实的交互环境,并生成包含成功与失败经验的长轨迹数据。

预训练与中期训练 : 注入推理先验、长上下文状态、多模态感知和合理数据配比。

微调: 通过指令选择、课程学习与蒸馏,让模型先掌握基础交互,再逐步面对更长、更难的任务。

智能体强化学习: 处理长轨迹中的信用分配、策略优化、采样策略与多轮交互,使稀疏终局奖励能够指导中间步骤。

On-Policy Distillation: 从模型自己生成、且不断变化的分布中学习,缩短教师策略与部署策略之间的偏差。

自进化: 从离线经验整理走向在线自我改进,进一步探索智能体与环境共同演化。

这条链路强调:训练数据不能只包含最终答案,还需要真实的环境反馈、过程状态、工具结果与错误恢复轨迹;优化目标也不能只看单步准确率,而要关注整条轨迹是否高效、可恢复且满足最终约束。

图 7 长程智能体能力的训练管线:以架构底座为基础,通过数据与环境合成、预训练、微调、强化学习、在线策略蒸馏和自进化,将运行时能力逐步内化进模型

长程智能体的形态:

以接口为线索的五类应用

如图 8 所示,论文按 Agent 与环境交互的接口,将实践形态归纳为五类。看似不同的应用,背后都承受目标漂移、状态持久化、反馈利用和验证恢复等共同压力:

软件工程: 理解大型代码仓库,维护跨文件计划,根据测试与评审反馈反复修复。

信息检索: 执行深度或广度搜索,整合多源证据,在长链检索保持结论可追溯。

计算机操作: 在浏览器、桌面和移动端持续感知界面状态,完成真实操作。

多模态智能体: 在图像、视频、音频等高成本信息中主动选择观察对象,并完成跨模态理解与生成。

通用智能体: 面向个人助理、具身系统和生产力任务,在多工具、多环境和长期目标之间切换。

相应地,评测也必须从一次性问答升级为 “面向时间跨度的评测”:任务是否真正包含长依赖?中间步骤能否检查?失败后是否恢复?系统在不同预算和 Harness 下的能力是否可归因?这些问题将直接决定榜单结果能否反映真实部署价值。

图 8 长程智能体的五类代表性应用形态 图 8 长程智能体的五类代表性应用形态 未来展望:

长程智能体的四个前沿方向

论文最终将开放问题归纳为四个轴、九个具体方向。随着任务跨度继续增长,研究重点将从 “能不能跑起来” 转向 “能否长期有效、经济并且可信地运行”。

Evolution : 泛化与持续学习。 让 Harness 自身能够演化、迁移和复用,并支持持续学习与终身学习。关键问题是:外置流程如何自动优化,又如何把经验稳定地内化为长期能力。

Effectiveness : 进入真实环境。 构建既可验证又足够真实的训练环境,提高昂贵真实交互的样本效率,并推动数字 Agent 向具身智能体迁移。论文认为,下一阶段的限速因素可能不再只是模型规模,而是环境构建。

Efficiency : 学会花预算。 未来 Agent 需要感知任务难度、剩余 token、时间和金钱预算,动态决定何时深思、何时压缩上下文、何时切换模型。多模态场景还要决定保留哪些帧、音频或视觉证据。

Trustworthiness:可恢复且可治理的自治。 长轨迹会放大错误与权限风险,因此需要更早识别失败路径,以外部验证锚定反思,并通过最小权限、审批门、沙箱、来源追踪和独立审计保护安全不变量。

其中,一个重要判断是:生产环境中的安全与权限边界,主要落在 Harness,而非模型权重中。模型侧对齐必要但不充分;真正决定哪些工具可调用、哪些行动需审批、哪些经验可复用的,是运行时控制层。

总结:迈向长程智能体

过去的大模型 Scaling 围着参数、数据和算力而优化;进入智能体后,时间跨度成为另一条轴线: 衡量的不是系统能跑多久,而是能否在更长、更复杂、更真实的依赖链上持续有效行动。 这篇综述的核心判断很明确: 长程智能体不是 “更聪明” 的单点升级,而是 Harness 工程与模型优化共同演化 的结果。 从基础、演化、Harness、优化、应用到前沿,我们把分散研究收进同一张地图,也把开放问题落在演化、有效性、效率与可信性四条轴上。在梳理既有工作之外,我们还提炼若干将定义下一阶段长程智能体研究的新兴方向。希望本文能为后续研究奠定坚实基础,并为研究者与实践者提供有用参考。随着智能体系统不断成熟,长程智能体仍将是一个核心而开放的问题,并很可能在构建稳健、通用、持久的人工智能中发挥决定性作用。

作者信息: 本文由 中国人民大学、北京大学、清华大学、 中 山大学、香港科技大学和新加坡国立大学 的研究者联合完成。论文的核心贡献者为 董冠霆 、 宋晓帅 、 扈煜阳 、 金佳杰 与 张宬浩 ,通讯作者为中国人民大学高瓴人工智能学院 窦志成教授 。

主题:任务|轨迹|长程智能体|模型