Skip to content

认识 Dream-RSI:谷歌让 AI 靠「做梦」自我进化,模型权重一个字没改

先说一个我自己的尴尬经历。

上周我让一个编码 Agent 帮我优化一段数据处理脚本,它吭哧吭哧跑了三个小时,生成了上百个候选版本。我满怀期待去看结果——它在一个早就该放弃的方向上,死磕了两个半小时。

那一刻我意识到一件挺反直觉的事:现在这些 AI Agent 的瓶颈,可能已经不是模型够不够聪明了

模型就那样了。真正决定成败的,是它往哪走、何时掉头、什么时候认栽。

2026 年 9 月 14 日挂上 arXiv 的一篇论文,冲的就是这件事。论文一作 Tong Zheng 是马里兰大学二年级博士生,今年夏天才以学生研究员身份进谷歌,身后站着 17 人的作者团,署名机构包括 Google、Google DeepMind、马里兰大学帕克分校和弗吉尼亚大学

论文名叫《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》——通过演化世界实现递归自我改进

X 上有人直接喊:谷歌可能刚刚破解了递归自我改进。

我先把结论摆这儿:这话夸张了,但它确实是今年我看到最有意思的一篇。 因为它是个特别聪明的工程取巧。

什么是 Dream-RSI

Dream-RSI 是一套让 AI 智能体**自我改进"搜索策略"**的框架,由 Google、Google DeepMind 联合两所高校提出,论文编号 arXiv:2609.14858(2026 年 9 月 14 日提交,12 页)。

要理解它,得先认识它的前辈 AlphaEvolve

AlphaEvolve 的思路是"大力出奇迹":让模型不断生成候选代码 → 自动评估打分 → 围绕高分方案继续变异 → 再评估。几百上千轮下来,硬生生从搜索空间里刨出人类没找到过的算法。今年它靠这套打法改进了矩阵乘法上限、推进了拉姆齐数边界。

但 AlphaEvolve 有个死穴——探索策略是工程师手写死的

哪个分支该多给算力、哪个方向该尽早砍掉、同时开几条并行线、什么时候收手,全是提前写好的规则。搜索空间一小还凑合,空间一大,固定策略就会把算力成吨地灌进死胡同,而且不长记性,下次照样踩同一个坑。

那让策略自己进化不就行了?

理论上行,代价上要命。评估一段候选代码,跑一次就知道好坏;评估一套探索策略,得让它带着智能体从头跑完整整几百上千轮,看最后挖出什么,才能给这套策略打分。 每改一版策略就重跑一遍完整发现流程,等几天出一个分数——没人耗得起这个"试错税"。

Dream-RSI 的解法极其朴素,朴素到我看完有点想拍大腿:

跑过的过程存下来。评估新策略时不再重跑,直接拿旧过程回放。

一次真实搜索结束后,系统会把整个搜索历史——每个尝试过的分支、每次的工作区状态、候选程序、执行结果、报错信息、最终得分——组织成一棵发现树(discovery tree),然后把它变成一个回放模拟器(replay simulator)

树上每个走过的节点都有真实结果。所以新策略要测试,根本不需要再调 Gemini 生成代码、也不用重跑评估程序,只需要按不同顺序把已有节点重读一遍

  • 如果当时先探索另一条分支,结果会怎样?
  • 如果同时开更多并行任务,能不能更早撞见高分答案?
  • 如果第五轮就砍掉那个长期没进展的方向,能省多少次调用?

这些问题的答案,已经躺在历史里了

论文把这个过程叫做 "做梦"(Dreaming)。系统不再于真实世界重演每一种策略,而是在过去经验构成的世界里,把成千上万种可能的行动路线彩排一遍。

一作 Tong Zheng 在 Hugging Face 上留的那句话,是整篇论文的内核:

要实现递归自我改进,智能体必须学会做梦。而历史,就是它们做梦的世界。

这个名字明显是致敬 DeepMind 自家的 Dreamer 系列世界模型——不过 Dreamer 是让智能体在学出来的环境模型里想象未来轨迹,Dream-RSI 则把同样的思路用在了搜索策略这一层,而不是底层的感知与控制。

它有什么特别之处

第一,闭环是真的闭环。

Dream-RSI 不是一次性优化,它跑一个"行动 → 记录 → 做梦 → 改进 → 再行动"的循环:

真实探索(当前策略调度 Gemini 跑任务,全过程沉淀成发现树)

构建回放模拟器(本轮 + 历史所有发现树,并入模拟器池)

离线做梦(另一个固定模型改探索策略代码,生成多个候选,在模拟器里按质量/调用数/并行效率三项打分)

最优策略部署到下一轮真实探索 → 产生新历史 → 回到第一步

过去的执行记录从"一次性日志"变成了"可反复进入的训练场",这是整个设计里最值钱的一步。

第二,底层模型一个参数都没动。

实验里跑活的模型是通过 Gemini CLI 调用的 Gemini 3.1 Pro 和 Gemini 3.7 Flash,评估器和执行接口也全程冻结。每一轮真正被重写的,只是探索策略这层轻量编排代码——可以理解成架在 Agent 之上的一套"导航系统"。

这点非常重要,后面讲边界时还要说。

第三,它学到的不是死规则,是"看情况调整力度"。

在 ConvDiv 内核任务里出现过一个细节:前几轮结果持续变好,Dream-RSI 就把每轮评估次数从 110 次一路降到 50 次,主动省算力;等性能进入平台期,它又把搜索范围重新拉开,随后拿到了新的性能提升。

有进展时收敛利用,停滞了就放宽探索。这不是一条写死的 if-else,是它自己在回放里试出来的节奏感。

第四,一个反直觉的发现:人给 AI 指方向,反而更差。

研究团队试过一种更省事的用法——把历史搜索轨迹总结成自然语言,比如"哪些方向曾经成功""哪些方案别再试了",塞进下一轮的 prompt 里。

结果持续低于不加方向性建议的版本。

他们的解释是:长周期探索依赖多个并行方向,而自然语言总结容易把历史中偶然成功的路线固化成强先验,让模型过早收缩搜索空间。

说人话就是——它从过去"学得太具体",最后只会沿着已经验证过的路继续走。

记忆通常为下一次决策提供内容,而回放模拟器为决策机制本身提供训练和评估环境。这是 Dream-RSI 和普通记忆系统最本质的区别。

实测效果:数据得挑着看

论文在三个差异明显的领域做了验证。有些数字很炸,但有些得打个折。

算法工程:Lasso 正则化路径

任务是让 AI 在保证数值正确的前提下,发现跑得更快的 Lasso 路径求解器。Lasso 在特征选择、基因组分析、金融建模里用得极广。

配置固定探索策略Dream-RSI变化
Gemini 3.1 Pro(调用次数)550 次317 次少约 42%
Gemini 3.1 Pro(求解器耗时)3587.1 ms2931.0 ms更快
Gemini 3.7 Flash(调用次数)3200 次1879 次少约 41%
Gemini 3.7 Flash(求解器耗时)2516.7 ms2350.6 ms更快

花更少的调用,拿到更好的结果——这个对比是同模型、同资源、同初始策略下的,最有说服力。

那个到处流传的 "162 倍",来自和 SimpleTES(GPT-OSS-120B,跑了 51200 次生成)的对比:317 对 51200,差距约 162 倍。

但我得泼盆冷水:这俩底层模型和系统设计都不一样,不是严格控制变量的横向比较,看着爽就好。对固定探索基线的 1.7 倍提升,才是更诚实的数字。

最终它找到的求解器,在六个未参与搜索的测试数据集上超过了 scikit-learn 和 glmnet 的标准实现。不过论文也老实说了,这只在给定数据集、硬件和正确性约束下成立,不等于能全面取代这些久经考验的通用库

数学优化:有赢有输

在和差不等式、自相关不等式、圆填充三项任务上:

任务Dream-RSI 成绩对比
和差不等式1.145427表中最佳
圆填充2.635983追平 AlphaEvolveV2 最强纪录
自相关不等式1.456375落后 SimpleTES(1.453675)

注意最后一行——SimpleTES 用了 51200 代才拿到那个数,Dream-RSI 用了不到 1000 代。性价比赢了,绝对值输了。

部分场景下算力成本降低 50 倍以上

GPU 内核工程:KernelBench

在 VGG16、LayerNorm、ConvDiv、ConvMax 四项上:

任务结果
VGG162.43 倍生成次数,达到相近性能
LayerNorm1.79 倍生成次数,达到相近性能
ConvDiv相同预算下,内核性能达固定策略的 2.09
ConvMax相同预算下,内核性能达固定策略的 1.44

现在能用上吗?说实话:还不太行

这部分我本来该叫"快速上手",但 Dream-RSI 是篇预印本论文,项目仓库显示完整代码还在准备发布,外部研究者目前没法完整复现实验。

所以咱聊点现在就能用上的——它的思路

1. 把探索策略显式化,别埋在 prompt 里。

如果你在写自己的编码 Agent 或搜索流程,先把"开几条并行线""什么时候砍分支""什么时候停"这些决策从提示词里抽出来,变成一份独立、可修改的配置或代码。Dream-RSI 的前提就是策略可编程——策略不可编程,就没法演化。

2. 别扔掉你的搜索日志。

大多数人把 Agent 的失败记录当垃圾。Dream-RSI 最值钱的一步,恰恰是把这些垃圾变成了训练场。每一次生成、每一次评估、每一个得分,都记下来,存成结构化数据。 这条今天下午就能改,零成本。

3. 少给方向性建议,多给评估环境。

那个"自然语言总结反而拖后腿"的结论,对我触动挺大。它暗示了一件事:在长周期探索里,告诉 AI "答案大概长这样"可能是在帮倒忙。 与其塞结论,不如给它一个能低成本试错的环境,让它自己演化出方法论。

4. 想跟进就盯这几个地方:

  • 论文原文:arxiv.org/abs/2609.14858
  • 相关系统:AlphaEvolve、AlphaEvolveV2、OpenEvolve、ShinkaEvolve(论文都做了对比)
  • 底层模型:Gemini 3.1 Pro / Gemini 3.7 Flash,均通过 Gemini CLI 调用

它到底算不算"真正的 RSI"?

我自己的判断:算半个。

RSI(Recursive Self-Improvement,递归自我改进)在激进定义里,是"AI 改进自身核心能力 → 更强之后再更高效地改进自己 → 能力加速增长"的飞轮。

Dream-RSI 确实闭环了:改策略 → 产生新经验 → 经验再改进下一代策略。但它有三重硬边界:

  • 没碰模型权重。 Gemini 3.1 Pro 和 3.7 Flash 全程冻结,没有训练出更强的新模型。
  • 只在元探索层有效。 它学会了更好地选分支、分并行、定停止时机,但没证明这种提升能无限延续,也没证明策略能迁移到任意开放任务。
  • "世界"只覆盖走过的路。 回放模拟器无法预测历史之外的新分支——从没试过的路线,光靠回放判断不了价值。它能更高效地利用经验,但替代不了真实探索

所以"AI 已经可以无限自我进化"这个说法,是夸大了。

更准确的说法是:谷歌展示了一种便宜得多的元层自我改进机制——不重新训练大模型,也能让智能体根据执行历史持续修改自己的搜索编排。

Dream-RSI 与其说是在创造一个会自我训练的模型,不如说是在创造一套会自我管理的研究系统。它不会让 Gemini 醒来后突然变聪明,却可能让同一个 Gemini 少走很多弯路。

而在动辄成千上万次生成与验证的自动科研场景里,少走弯路本身就是一种能力增长

顺带一提:DeepMind 也在同一天做了一件事

Dream-RSI 论文公布前后,还有个信号值得注意。

DeepMind CEO Demis Hassabis 宣布成立 DeepMind Institute。和负责训模型、做产品、搞技术的 Google DeepMind 不同,这个新机构关注 AGI 可能带来的社会影响,引入经济学、公共政策、哲学、教育、社会科学等视角。由联合创始人 Shane Legg 任执行编辑,Google 高级副总裁 James Manyika 与 Hassabis 共同参与。

Legg 在新机构成立时警告:AI 能力的进步速度不应超过安全控制的发展速度。 越来越强的 Agent 已经能写软件、执行长任务、参与开发下一代 AI 系统——这让递归自我改进从一个理论概念,逐渐变成了现实的治理问题。

他同时表示,现在宣布 AGI 已到为时过早,仍维持此前判断:到 2028 年出现"最低限度 AGI"的概率约 50%

一边在论文里推进 RSI,一边成立机构研究它的影响。这个组合拳,我觉得比单纯发一篇论文更值得琢磨。

进阶

行业里有个正在成型的共识:谈模型进步,过去第一反应是加预训练算力、扩数据、做强化学习——这些全都直接作用于模型参数,贵、慢、吃算力集群。

现在越来越多研究把改进目标转向了模型之外:提示词、上下文、记忆、技能库、评估标准、工具调用方式、多智能体协作机制,以及包裹模型的那一层 Harness

这意味着,未来衡量一个 AI 系统是否在自我改进,不能只看模型权重变没变。即使基础模型被冻结,一个能自动改工作流、调搜索策略、积累经验并重新分配算力的智能体,也可能在同样的 Token 预算下干更复杂的活。

Dream-RSI 就是把这层窗户纸捅破的那根手指。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档