登录

开源Agent框架刷爆ARC-AGI-3,「自我改进」的RLM harness引争议


速读:这些脚手架非但没有帮模型发挥,反而逼着模型去绕过自己的框架。 一是RLM,给模型一个持久的IPython内核当REPL用,上下文是变量、子智能体是函数调用,模型可以直接用代码操作自己的历史、工具和子智能体。
2026年08月07日 19:15

一款新开源的智能体框架(harness),声称在 ARC-AGI-3 上联合 Opus 5 拿到了 95.5% 的成绩,超过人类专家基线。官方帖子迅速获得大量关注,GitHub 星标已接近 5 千。

要知道,ARC-AGI-3 不是那种「刷过题库就能拿高分」的考试,它是一堆完全陌生的抽象游戏,每个游戏的规则、目标、甚至操作逻辑都不相同。你进去之后,没人告诉你该做什么,你得自己摸索、试错、归纳,然后在有限的行动预算内完成目标。

这个框架名叫  Prime Agent ,由 Prime Intellect 发布。官方对它的定义是: 一个面向编程、研究和长时间自主任务的「自我改进 RLM harness」 。

项目链接: https://github.com/PrimeIntellect-ai/prime-agent

RLM 是 MIT 博士生 Alex Zhang 等人去年 10 月发布的一项工作,其全称是 Recursive Language Models,即递归语言模型。按照论文里的介绍,它是一种将输入上下文视为可操作「变量」的通用推理策略:主模型在类似 Jupyter 的编程环境(REPL)中工作,通过编写代码对庞大的上下文变量进行切分与过滤,并将子任务递归外包给临时的小模型调用,最终综合各结果形成答案 —— 例如在 Python REPL 中调用 GPT-5 及 mini 版迭代处理用户提示。

当时,它的效果就已经非常惊艳:在 OOLONG 等最难长上下文评测中,GPT-5-mini 采用 RLM 的正确率超直接使用 GPT-5 两倍以上且单次成本更低。因此,研究者断言,这将是一个强大的新范式,且相比纯 CoT 或 ReAct 代理,显式训练以递归推理为核心的 RLM 很可能成为推理时扩展能力的下一个里程碑。

如今, Prime Agent 把 RLM 论文的核心理念进一步工程化落地了,并在此基础上做了重要扩展 。我们一起来看一下他们做了哪些创新。

Prime Agent 为什么那么强?

官方博客里写的很清楚:它彻底重构了「harness 该怎么设计」这一底层假设。

Prime Intellect 团队认为,现有的 harness 设计都是围绕早期模型的能力建的 —— 固定的工具调用格式、强制的上下文压缩、设计时写死就再也不变的子智能体和提示词。这些脚手架非但没有帮模型发挥,反而逼着模型去绕过自己的框架。模型越聪明,旧的 harness 就越像一副不合身的镣铐。

Prime Agent 的解法是把这套脚手架彻底打开。它做了两个关键设计:

一是 RLM ,给模型一个持久的 IPython 内核当 REPL 用,上下文是变量、子智能体是函数调用,模型可以直接用代码操作自己的历史、工具和子智能体。即使会话被压缩,完整历史仍保留在外部状态中,需要时可被程序化取回;

二是 Continual Harness ,把提示词、技能、记忆和子智能体全部变成运行时可 CRUD 的状态,agent 能在执行过程中实时创建、修改、调用它们,甚至跨会话通信。

换句话说,Prime Agent 不是给模型配了一套更聪明的工具箱,而是把工具箱的钥匙交给了模型自己。

在 ARC-AGI-3 这种每道题规则都陌生的战场上,它能一边做题一边改写自己的解题策略,而不是被出发前的预设绑住手脚,所以它能在 ARC-AGI-3 上以更少的 token 消耗跑出更高分数。

Prime Agent 怎么让 Agent 持续工作?

但「把钥匙交给模型」只是一层。Prime Agent 还试图解决一个更现实的问题:

Agent 怎么才能连续工作几个小时、几天,甚至在人退出终端后继续运行?

为此,它在底层放了一个后台 daemon,统一管理所有正在运行的会话。每个子智能体都有独立的上下文、文件目录、IPython 状态和会话记录。一次任务结束后,子智能体不会立刻被销毁;主智能体可以记住它的 ID,过一段时间再把它叫回来继续工作。

这和常见的「一次性外包」不太一样。

普通多智能体系统里,主 Agent 把任务扔给子 Agent,拿到一份摘要,双方关系就结束了。Prime Agent 中的子智能体更像一个长期项目成员:它保留自己的工作现场,主 Agent 可以追问、纠偏,或者让多个 Agent 直接交换信息。

Prime Agent 架构图。 Prime Agent 架构图。 为了让任务真正跑得足够久,Prime Agent 还把长期自主运行拆成了三个机制:

Goal 负责保存一个持续目标,在任务完成前不断提醒 Agent 继续推进;

Heartbeat 按固定时间把消息重新注入会话,例如检查子智能体进度、轮询实验结果;

Autonomous Mode 负责在一轮输出结束后自动续跑,避免 Agent 做到一半就停下来。

用户则可以给它设置最大轮数、token 预算和执行时间,并设置一道完成前必须通过的测试。比如让它修改一个项目时,测试没通过,系统就会把失败结果重新交给 Agent,让它继续修;如果工作区没有变化,也不会毫无意义地重复执行同一个失败测试。

所以 Prime Agent 所谓的「长时间自主」,并不是简单地给模型一句「继续努力」,而是把目标保存、定时唤醒、自动续跑、失败反馈和资源上限做成了一套运行机制。

Prime Agent 是如何「自我改进」的?

最值得解释的,是它的 /refine。

Prime Agent 会读取自己刚刚经历的完整轨迹:尝试过什么、在哪里失败、什么方法有效,然后把可复用的经验写回 harness。

这些修改可能是一条新的提示词备注、一段记忆、一个技能,也可能是一份新的子智能体配置。比如它发现某类测试经常因为网络波动失败,就可以把「先重试再判断代码错误」沉淀成一个技能;如果某个子智能体的分工方式效果不好,它也可以修改这个子智能体的说明。

不过,它不能改写最底层的系统提示词。每次 refinement 都会记录触发原因和修改结果,并保留历史版本,出现问题时可以回滚。

这也是 Continual Harness 和普通「长记忆」的区别:它不只是把过去发生的事存下来,而是试图把经历转化成下一轮可以直接调用的能力。

在官方展示的 Factorio ( 一款 2D 工厂模拟游戏 )实验中,Prime Agent 就把一次次成功和失败转化成记忆与技能,不断改进工厂布局,几个 小时内把生产分数推到了 10 万以上。

主题:模型|上下文|框架|子智能体|ARC-AGI-3