登录

RSI靠“做梦”就能进化?谷歌提出不改模型也能持续变强的新系统


速读:近日,Google、GoogleDeepMind、马里兰大学和弗吉尼亚大学的研究人员提出了一个名为Dream-RSI的系统。 现在很多AI智能体系统谈记忆,本质上还是在“记笔记”。 在Lasso任务上,Dream-RSI找到的求解器超过了sklearn、glmnet等标准实现。 一种是被总结成几条经验,重新塞回模型的上下文; 于是,一个完整的自我改进循环形成了。
2026年09月18日 16:46

想要让 AI 变强,一定要重新训练模型吗?谷歌想尝试一种新思路:与其不断改模型,不如先让 AI 学会改进自己解决问题的方法。近日,Google、Google DeepMind、马里兰大学和弗吉尼亚大学的研究人员提出了一个名为 Dream-RSI 的系统。RSI 是最近 AI 圈很火的概念,它的全称是 Recursive Self-Improvement(递归式自我改进):一个 AI 系统先改进自己,再用改进后的系统继续推动下一轮改进。

不过,Dream-RSI 所做的改动其实很克制,它没有重新训练 Gemini,也没有修改模型权重;而是修改了模型上方的一层“探索策略”: 面对一个复杂问题,应该先尝试哪个方向,哪些方案值得继续,什么时候应该及时停手,以及有限的算力应该怎么分配。

AI 会解题了,但还不一定会“做研究”

过去几年,AI 在代码、数学和算法设计上的能力提升得很快。以 AlphaEvolve 一类系统为例,AI 已经可以不断提出候选方案、运行实验、根据结果修改方案,再进入下一轮尝试。一次复杂任务,可能经历几百甚至几千轮这样的循环。Dream-RSI 将这一过程称为“发现循环”(discovery loop)。

问题是,当搜索空间越来越大以后,“模型有多聪明”只决定了一部分结果,另一部分取决于它怎么搜索。假设 AI 同时发现了十几个可能的方向。有些值得继续深挖,有些已经接近死路;有些应该集中资源跑下去,有些失败一次就可以放弃。模型即使有能力找到好答案,如果探索策略很差,也可能把大量算力浪费在无意义的分支上。

最简单的办法是让 AI 根据过去的结果不断调整搜索策略。但问题在于,我们如何确保新的策略真的更好?判断一个答案好不好,通常执行一次就知道;但判断一套策略好不好,却往往需要把整套流程重新跑一遍。系统可能需要重新调用几百次智能体、生成大量代码并运行完整实验。

当需要比较几十甚至几百种策略时,真正昂贵的就不再只是解决问题,而是寻找一种更好的解决问题方式。 而 Dream-RSI 的解决方案是:既然这些实验以前已经跑过,为什么还要重新跑一次?

把过去走过的路,变成 AI 可以反复进入的“梦境”

一次 AI 研究任务结束之后,留下来的除了最终答案,还有过程:尝试过哪些代码,从哪个方案继续修改,每一次执行得到了什么结果,哪些路线失败,哪些路线取得了更好的分数,这些信息共同组成了一棵庞大的“发现树”。

过去,这些记录通常只有两种命运。一种是被总结成几条经验,重新塞回模型的上下文;另一种是变成训练数据,用于之后的微调。而 Dream-RSI 提出了第三种用法:不急着总结,而是把整段探索历史直接变成一个可以反复回放的模拟器。

我们可以把这个过程想象成走迷宫。第一次进入迷宫时,AI 不知道出口在哪,只能不断尝试。但在这个过程中,它也顺记录了试错过程,形成了一张地图。下一次再尝试新的走法时,它不需要真的重新走一遍迷宫,而是可以先对着这张地图,在脑中尝试不同路线。这就是 Dream-RSI 所说的“做梦”。

假设新的探索策略决定先尝试 A,再进入 C,最后放弃 B。只要 A、B、C 都已经在之前的真实实验里出现过,系统就不需要重新调用智能体,也不需要再次运行代码。每一个节点的结果已经存在,它只需要沿着过去的发现树重新“走”一遍。

研究人员把这种历史环境称为 replay simulator,也就是“回放模拟器”。 一套原本需要大量模型调用才能验证的探索策略,现在只需要读取已有记录,就能快速知道它过去会走向哪里。 于是,一个完整的自我改进循环形成了。

AI 先在真实环境中进行一轮探索,留下新的发现树;随后进入这些历史记录中反复“做梦”,测试不同策略;从中筛出表现更好的方法,再回到真实任务继续探索。新的实验又产生新的历史,下一轮“梦境”也会随之扩大。真实探索制造梦境的组成数据,梦境的记录又反过来改变下一次真实探索。这就是 Dream-RSI 独有的递归模式。

让模型少走弯路

这种方法最直接的效果是节省算力。研究团队把 Dream-RSI 放在算法工程、数学优化和 GPU 内核优化三个领域进行测试,包括 Lasso 正则化路径求解、Sum-Difference、自相关不等式、圆堆叠以及 KernelBench 等任务。实验中,负责真正生成代码和解决问题的 Gemini 模型并没有不断更新,变化的是位于模型之上的探索策略。

在 Lasso 任务上,Dream-RSI 找到的求解器超过了 sklearn、glmnet 等标准实现。在部分比较中,它比此前的 SimpleTES 少用了最多约 162 倍 Agent 调用;与使用固定探索策略的自身基线相比,Agent 调用量也减少了约 1.7 倍。

数学优化任务里,它在更少的搜索轮次下达到或超过强基线,在部分实验中算力消耗下降超过 50 倍;到了 GPU 内核优化任务,它要么用更少的 generations 达到相近性能,要么在相同预算下找到更快的实现。可见,Dream-RSI 提供了一种不同的能力增长方式。

过去谈模型进步,通常意味着参数更多、训练数据更多、强化学习规模更大。但 Dream-RSI 展示的是另一条路径:底层模型完全可以不变,仅仅通过重新组织它已有的能力,就能解决更多问题。

这就好比同一个研究员,他的智商、知识储备都没有突然发生变化,但随着研究经验增加,他开始知道哪些方向值得追,哪些实验大概率是在浪费时间,什么时候应该换路线。变化的不是“脑子”,而是方法。

AI 的“经验”,可能不应该被总结得太干净

Dream-RSI 还有一个颇为反直觉的实验。研究人员尝试过一种更符合直觉的方法:既然过去的探索有价值,就让模型把历史经验总结成自然语言,比如“这个方向效果不好”“下次应该优先尝试另一种方法”,再把这些经验放进下一轮智能体的提示词。结果反而更差。

相比把完整历史变成 replay simulator,直接告诉 AI“过去学到了什么”,会让它更容易过早排除某些方向,搜索范围反而变窄。这其实引出了另一个有趣的问题:AI 到底应该怎样拥有经验?

现在很多 AI 智能体系统谈记忆,本质上还是在“记笔记”。任务结束以后提炼几条规则,下次需要时再检索出来,重新放进上下文。这种方法的问题在于,任何总结都是一种压缩。“这条路线失败了”是简单的一句记录,但会丢失大量信息:它在什么条件下失败,失败到什么程度,旁边还有哪些分支,当时还有哪些可能性没有继续尝试……

相比之下,Dream-RSI 保存的是完整的过程。于是过去的失败不再只是失败,它变成了一个可以被重新进入的空间。AI 可以站在同一个历史节点上,重新问一次:如果当时换一个选择,会发生什么?

从这个角度看,未来高级智能体最重要的资产,可能不仅是训练数据、上下文窗口或者知识库,还包括大量曾经真实运行过的行动轨迹。 过去做过的工作不再只是消耗掉的算力,而有可能继续成为下一轮研究的基础设施。

当然,Dream-RSI 距离大众想象中的“AI 自我进化”还有很远。它没有修改 Gemini 的权重,也没有重新训练模型。真正被更新的,是负责决定如何搜索的策略层。它能够反复“做梦”的前提,也是过去真实跑过这些实验。对于历史上从未到达过的区域,Dream-RSI 并不能凭空知道结果。

所以它不能永远留在梦里。每经过一轮策略优化,AI 仍然需要回到真实环境,进入过去没有探索过的新区域,再把这些新的结果加入历史。只有这样,系统的记录才会不断扩大。但 Dream-RSI 提供了一种新的思路,未来更强的 AI,未必每一轮都需要一个更聪明的模型。它可能只是越来越擅长一件看起来很普通的事情:记住自己走过的路,然后少走弯路。

参考资料:

https://www.dream-rsi.com/

https://venturebeat.com/orchestration/googles-dream-rsi-cuts-discovery-agent-calls-up-to-162x-by-replaying-searches-it-already-ran

运营/排版:何晨龙

注:封面/首图由 AI 辅助生成

主题:模型|Dream-RSI|一个|问题|系统