首个统一元递归自我改进架构,让AI「变强的方式」本身变强
过去两年,AI 领域最激动人心的叙事之一,是让模型自己改进自己:自己生成训练数据、自己改写提示词、自己修复自己的代码。这条路线叫 递归自我改进(Recursive Self-Improvement,RSI) 。
但一个少有人追问的问题是:这些系统里,「改进系统的那套程序」本身,进化了吗?答案是没有。从 STaR、Self-Refine,到 STOP、Darwin Gödel Machine、ADAS、AFlow,几乎所有 RSI 系统都遵循同一个结构,即一套固定的改进程序,反复作用于模型。 因此,即使模型在变强,但「让模型变强的方式」却完全固定,因此被局限于一阶的自我改进 。
近日,CosmosMind 联合来自斯坦福、伯克利、MIT、清华、北大等十多个海内外顶级高校的研究者发布技术报告 MetaRSI-v1,提出全球首个统一 Model-RSI、Data-RSI、Harness-RSI 的元递归自我改进新架构, 首次把递归自我改进作用于 RSI 自身——自我改进,进入了「平方时代」 。
论文标题:MetaRSI/RSI^2 A Meta-Recursive Self-Improving System for Recursive Self-Improving Systems Themselves
项目主页:https://github.com/CosmosMind-ai/RSI-Harness
论文:https://www.cosmosmind.ai/research/metarsi-v1.pdf
HuggingFace:https://huggingface.co/CosmosMind/RSI-Harness
在没有任何外部教师模型参与的情况下 , MetaRSI-v1 使得一个仅 30 亿激活参数的小模型, 在四项基准上平均自我提升 10.9 分 ;并且让 GPT-5.6、Claude Opus 5 等六款前沿旗舰模型, 平均提升 7.3 分 。比数字更重要的是,MetaRSI-v1 是一套试图 统一整个 RSI 领域的架构语言 :一个内核、两条编排轴、三个算子、整个元 RSI 层,以及五大定律。
图 3:MetaRSI-v1 概览 一、统一的 Loop Kernel 范式
图 4:Loop Kernel 范式 Loop Kernel 是 MetaRSI-v1 首次提出的自我改进统一形式 : 它第一次把「进步如何发生」抽象成一条与对象无关的闭环:消费反馈得到的学习信号,在 Data、Harness、Model 上提出改动,交由验证器裁决,并将结果回流为下一轮信号。Data、Harness、Model 从此开始能够被统一成同一 Kernel 的不同实例化算子,可组合、可统一调度,自我改进由此 第一次拥有了统一、可复用的底层骨架 。
二、三种算子:Data-RSI、Harness-RSI、Model-RSI
沿用同一个 Loop Kernel,自我改进在三个可写面上展开,分别由 Data-RSI、Harness-RSI、Model-RSI 三个算子承担并协同完成。
Data-RSI : 从自身运行轨迹提取学习信号,经校验用于合成数据并交由下游消费,标定并放大模型正向能力与负向能力边界。
Harness-RSI : 利用学习反馈信号,在 Harness 拆分出的 System Prompt、Skill、MCP、Tools、Memory 五个可插拔槽位上生成改进,做加法与减法。
Model-RSI : 更新模型自身的参数与结构,将反复验证有效的行为内化到模型。
三、横向编排与纵向优化策略
横轴(horizontal orchestration)编排算子的应用顺序 : RSI² Agent 在每个决策点根据信号反馈选定下一个算子,再把该算子有机衔接、编排并送入 RSI Loop Kernel 执行。
纵轴(vertical optimization)优化算子的内部策略 : RSI² Agent 向目标算子专属的 RSI² Sub-Agent 下发指令,后者根据学习信号与环境反馈等改写算子本身的 RSI 规则,优化 RSI 系统本身。
四、四种 Agent 协同下的三层 RSI 嵌套
整套架构由四个 Agent 协调运作,并且均能被人类专家局部替换,形成 human-in-the-loop 系统。
1、Transition Agent: 负责衔接横向编排中上游算子的产物与下一个算子对产物的消费。
2、RSI² Agent : 在每个决策点选择进行横轴(指定下一个算子)或纵轴(向 Sub-Agent 下发策略改写指令)优化。
3、RSI² Sub-Agent: 在纵向优化中,接受来自 RSI² Agent 的执行指令,对算子内部的 RSI 策略进行调整。
4、MetaRSI² Agent: 学习如何进行合适的纵横优化,优化 RSI² Agent 的策略学习。
四个 Agent 对应形成三个 RSI 优化 Level:算子改进目标系统,双轴编排改进算子用法,元层改进双轴编排策略本身。
五、实验:小模型与前沿模型均实现自我进化
实验沿两条路线展开 : 小模型路线 使用可训练的开源模型,Data、Harness、Model 三个算子全部启用; 前沿模型路线 面向 Claude Opus 5、GPT-5.6 Sol、Kimi K3 等顶级模型,这类模型参数巨大或为闭源模型,仅启用 Data 与 Harness 算子。
路线一:小模型的自我改进。 目标模型为 Qwen3.5-35B-A3B(35B 总参、3B 激活),在 Terminal-Bench 2.1、SWE-bench Pro、GPQA-Diamond 高难度子集、AIME 四项基准上评测。
图 5:MetaRSI 让 Qwen3.5-35B-A3B 实现自进化 MetaRSI-v1 平均提升 10.9 分,SWE-bench Pro 解决率接近翻倍 ,Meta 层为 RSI 带来更高的天花板, 连续自进化的累计增益提升显著 。
图 6:「改进改进者」,MetaRSI 让小模型累计自进化增益扩大 路线二:前沿模型的自我改进。 多款前沿模型在 Terminal-Bench 2.1 上平均提升 7.3 分,说明 MetaRSI 范式对前沿模型同样成立, 旗舰模型同样留有可观的自我改进空间 。
图 7:六款前沿模型的自我改进 六、五条定律:进步的单位是循环
MetaRSI 梳理出 两条互补的改进路线 :Harness-RSI 保持权重不变,让自我改进覆盖任何可通过接口调用的模型;Model-RSI 通过训练把能力内化进模型。
且 MetaRSI 首次重新定义了 Data-RSI :作为模型的能力边界探测与放大器,通过对执行轨迹与外界反馈 learning-signal 的联合分析,得到经过验证的经验并 scale 为可复用的数据,并标定这些经验能够支撑到哪里,框定模型能力的正、负边界。
Data-RSI 的产物同时供给 Harness-RSI 与 Model-RSI 消费,两条路线的改动结果又能够流回 Data-RSI,重新标定能力边界、驱动下一轮,能力由此逐轮披露、累积。在这一过程中,Harness 不仅能做加法,还能做减法:Data-RSI 放大暴露的问题经 Model-RSI 内化之后,原本吸纳在 Harness 中的知识会变成冗余,Harness-RSI 系统在回放校验下将其删除,能力留下,成本退场。
在此之上,MetaRSI 提炼出五条定律。
定律一:验证决定自我改进的前沿。 一个领域能不能形成自改进闭环,取决于该领域任务能否被检验,是否有合适的 verifier。
定律二:自我认知会过期,重新发现能力边界是速率瓶颈。 RSI 改变 Agent 能力,其原本旧的系统描述随即失效。
定律三:能力与载体无关,但成本与载体有关。 例如,同一项能力放在 Harness 里,每次推理都要重付成本;内化进 Model 只需付一次,成熟循环能够持续把能力迁移到更便宜的载体。
定律四:可信度由不可写面度量。 在闭环内部,真正能力变强和放宽成功标准会得到完全相同的分数,而且这种偏差从内部无法察觉,也无法靠统计纠正。
定律五:循环不凭空创造能力,一切增益本质上都是外部信息熵的输入或能力的激发。 自改进只能重新组织、放大并固化模型已经具备的潜力。因此,每次提升都要分清两部分:哪些是把已有能力放大出来的,哪些是真正从外部新引入的。
七、从架构到生态:让每个科学领域都有自己的循环
MetaRSI-v1 并不要求一个领域一步到位执行整个 Loop。因为科学研究与工程实践本身就是一条条流水线:提出假设、设计实验、执行、解读,每个环节都有清晰的输入和产出。与其一步到位,不如先在任意一个环节跑通一个小循环;这个环节的产物自然就能成为下游的起点。 当足够多的小循环转起来,它们会彼此衔接,最终编织成覆盖整个领域科研流程的大循环。
这也让新领域的接入门槛变得很低。一个领域只需要准备三样东西:能跑出结果的任务族、一套判断对错的验证器,以及一份哪怕还很粗糙的初始脚手架;其他部分全部能够由通用机制接管。
为了让这套范式真正流动起来, 团队同步开源了 RSI-Harness ——一个能自我学习、自我迭代的 Harness,并可以在使用中 为不同科学领域与工程实践沉淀出可移植的 Harness Genome 。团队同时搭建了 Genome 开放社区 , 希望每个科学领域都能沉淀出自己那套可靠的脚手架,让每一个新闭环都能站在前人的肩膀上启动。
主题:模型|统一|MetaRSI-v1|Model-RSI