认识 Dream-RSI:谷歌让 AI 靠「做梦」自我进化,模型权重一个字没改
先说一个我自己的尴尬经历。
上周我让一个编码 Agent 帮我优化一段数据处理脚本,它吭哧吭哧跑了三个小时,生成了上百个候选版本。我满怀期待去看结果——它在一个早就该放弃的方向上,死磕了两个半小时。
那一刻我意识到一件挺反直觉的事:现在这些 AI Agent 的瓶颈,可能已经不是模型够不够聪明了。
模型就那样了。真正决定成败的,是它往哪走、何时掉头、什么时候认栽。
2026 年 9 月 14 日挂上 arXiv 的一篇论文,冲的就是这件事。论文一作 Tong Zheng 是马里兰大学二年级博士生,今年夏天才以学生研究员身份进谷歌,身后站着 17 人的作者团,署名机构包括 Google、Google DeepMind、马里兰大学帕克分校和弗吉尼亚大学。
论文名叫《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》——通过演化世界实现递归自我改进。
X 上有人直接喊:谷歌可能刚刚破解了递归自我改进。
我先把结论摆这儿:这话夸张了,但它确实是今年我看到最有意思的一篇。 因为它是个特别聪明的工程取巧。
什么是 Dream-RSI
Dream-RSI 是一套让 AI 智能体**自我改进"搜索策略"**的框架,由 Google、Google DeepMind 联合两所高校提出,论文编号 arXiv:2609.14858(2026 年 9 月 14 日提交,12 页)。
要理解它,得先认识它的前辈 AlphaEvolve。
AlphaEvolve 的思路是"大力出奇迹":让模型不断生成候选代码 → 自动评估打分 → 围绕高分方案继续变异 → 再评估。几百上千轮下来,硬生生从搜索空间里刨出人类没找到过的算法。今年它靠这套打法改进了矩阵乘法上限、推进了拉姆齐数边界。
但 AlphaEvolve 有个死穴——探索策略是工程师手写死的。
哪个分支该多给算力、哪个方向该尽早砍掉、同时开几条并行线、什么时候收手,全是提前写好的规则。搜索空间一小还凑合,空间一大,固定策略就会把算力成吨地灌进死胡同,而且不长记性,下次照样踩同一个坑。
那让策略自己进化不就行了?
理论上行,代价上要命。评估一段候选代码,跑一次就知道好坏;评估一套探索策略,得让它带着智能体从头跑完整整几百上千轮,看最后挖出什么,才能给这套策略打分。 每改一版策略就重跑一遍完整发现流程,等几天出一个分数——没人耗得起这个"试错税"。
Dream-RSI 的解法极其朴素,朴素到我看完有点想拍大腿:
跑过的过程存下来。评估新策略时不再重跑,直接拿旧过程回放。
一次真实搜索结束后,系统会把整个搜索历史——每个尝试过的分支、每次的工作区状态、候选程序、执行结果、报错信息、最终得分——组织成一棵发现树(discovery tree),然后把它变成一个回放模拟器(replay simulator)。
树上每个走过的节点都有真实结果。所以新策略要测试,根本不需要再调 Gemini 生成代码、也不用重跑评估程序,只需要按不同顺序把已有节点重读一遍:
- 如果当时先探索另一条分支,结果会怎样?
- 如果同时开更多并行任务,能不能更早撞见高分答案?
- 如果第五轮就砍掉那个长期没进展的方向,能省多少次调用?
这些问题的答案,已经躺在历史里了。
论文把这个过程叫做 "做梦"(Dreaming)。系统不再于真实世界重演每一种策略,而是在过去经验构成的世界里,把成千上万种可能的行动路线彩排一遍。
一作 Tong Zheng 在 Hugging Face 上留的那句话,是整篇论文的内核:
要实现递归自我改进,智能体必须学会做梦。而历史,就是它们做梦的世界。
这个名字明显是致敬 DeepMind 自家的 Dreamer 系列世界模型——不过 Dreamer 是让智能体在学出来的环境模型里想象未来轨迹,Dream-RSI 则把同样的思路用在了搜索策略这一层,而不是底层的感知与控制。
它有什么特别之处
第一,闭环是真的闭环。
Dream-RSI 不是一次性优化,它跑一个"行动 → 记录 → 做梦 → 改进 → 再行动"的循环:
真实探索(当前策略调度 Gemini 跑任务,全过程沉淀成发现树)
↓
构建回放模拟器(本轮 + 历史所有发现树,并入模拟器池)
↓
离线做梦(另一个固定模型改探索策略代码,生成多个候选,在模拟器里按质量/调用数/并行效率三项打分)
↓
最优策略部署到下一轮真实探索 → 产生新历史 → 回到第一步过去的执行记录从"一次性日志"变成了"可反复进入的训练场",这是整个设计里最值钱的一步。
第二,底层模型一个参数都没动。
实验里跑活的模型是通过 Gemini CLI 调用的 Gemini 3.1 Pro 和 Gemini 3.7 Flash,评估器和执行接口也全程冻结。每一轮真正被重写的,只是探索策略这层轻量编排代码——可以理解成架在 Agent 之上的一套"导航系统"。
这点非常重要,后面讲边界时还要说。
第三,它学到的不是死规则,是"看情况调整力度"。
在 ConvDiv 内核任务里出现过一个细节:前几轮结果持续变好,Dream-RSI 就把每轮评估次数从 110 次一路降到 50 次,主动省算力;等性能进入平台期,它又把搜索范围重新拉开,随后拿到了新的性能提升。
有进展时收敛利用,停滞了就放宽探索。这不是一条写死的 if-else,是它自己在回放里试出来的节奏感。
第四,一个反直觉的发现:人给 AI 指方向,反而更差。
研究团队试过一种更省事的用法——把历史搜索轨迹总结成自然语言,比如"哪些方向曾经成功""哪些方案别再试了",塞进下一轮的 prompt 里。
结果持续低于不加方向性建议的版本。
他们的解释是:长周期探索依赖多个并行方向,而自然语言总结容易把历史中偶然成功的路线固化成强先验,让模型过早收缩搜索空间。
说人话就是——它从过去"学得太具体",最后只会沿着已经验证过的路继续走。
记忆通常为下一次决策提供内容,而回放模拟器为决策机制本身提供训练和评估环境。这是 Dream-RSI 和普通记忆系统最本质的区别。
实测效果:数据得挑着看
论文在三个差异明显的领域做了验证。有些数字很炸,但有些得打个折。
算法工程:Lasso 正则化路径
任务是让 AI 在保证数值正确的前提下,发现跑得更快的 Lasso 路径求解器。Lasso 在特征选择、基因组分析、金融建模里用得极广。
| 配置 | 固定探索策略 | Dream-RSI | 变化 |
|---|---|---|---|
| Gemini 3.1 Pro(调用次数) | 550 次 | 317 次 | 少约 42% |
| Gemini 3.1 Pro(求解器耗时) | 3587.1 ms | 2931.0 ms | 更快 |
| Gemini 3.7 Flash(调用次数) | 3200 次 | 1879 次 | 少约 41% |
| Gemini 3.7 Flash(求解器耗时) | 2516.7 ms | 2350.6 ms | 更快 |
花更少的调用,拿到更好的结果——这个对比是同模型、同资源、同初始策略下的,最有说服力。
那个到处流传的 "162 倍",来自和 SimpleTES(GPT-OSS-120B,跑了 51200 次生成)的对比:317 对 51200,差距约 162 倍。
但我得泼盆冷水:这俩底层模型和系统设计都不一样,不是严格控制变量的横向比较,看着爽就好。对固定探索基线的 1.7 倍提升,才是更诚实的数字。
最终它找到的求解器,在六个未参与搜索的测试数据集上超过了 scikit-learn 和 glmnet 的标准实现。不过论文也老实说了,这只在给定数据集、硬件和正确性约束下成立,不等于能全面取代这些久经考验的通用库。
数学优化:有赢有输
在和差不等式、自相关不等式、圆填充三项任务上:
| 任务 | Dream-RSI 成绩 | 对比 |
|---|---|---|
| 和差不等式 | 1.145427 | 表中最佳 |
| 圆填充 | 2.635983 | 追平 AlphaEvolveV2 最强纪录 |
| 自相关不等式 | 1.456375 | 落后 SimpleTES(1.453675) |
注意最后一行——SimpleTES 用了 51200 代才拿到那个数,Dream-RSI 用了不到 1000 代。性价比赢了,绝对值输了。
部分场景下算力成本降低 50 倍以上。
GPU 内核工程:KernelBench
在 VGG16、LayerNorm、ConvDiv、ConvMax 四项上:
| 任务 | 结果 |
|---|---|
| VGG16 | 少 2.43 倍生成次数,达到相近性能 |
| LayerNorm | 少 1.79 倍生成次数,达到相近性能 |
| ConvDiv | 相同预算下,内核性能达固定策略的 2.09 倍 |
| ConvMax | 相同预算下,内核性能达固定策略的 1.44 倍 |
现在能用上吗?说实话:还不太行
这部分我本来该叫"快速上手",但 Dream-RSI 是篇预印本论文,项目仓库显示完整代码还在准备发布,外部研究者目前没法完整复现实验。
所以咱聊点现在就能用上的——它的思路。
1. 把探索策略显式化,别埋在 prompt 里。
如果你在写自己的编码 Agent 或搜索流程,先把"开几条并行线""什么时候砍分支""什么时候停"这些决策从提示词里抽出来,变成一份独立、可修改的配置或代码。Dream-RSI 的前提就是策略可编程——策略不可编程,就没法演化。
2. 别扔掉你的搜索日志。
大多数人把 Agent 的失败记录当垃圾。Dream-RSI 最值钱的一步,恰恰是把这些垃圾变成了训练场。每一次生成、每一次评估、每一个得分,都记下来,存成结构化数据。 这条今天下午就能改,零成本。
3. 少给方向性建议,多给评估环境。
那个"自然语言总结反而拖后腿"的结论,对我触动挺大。它暗示了一件事:在长周期探索里,告诉 AI "答案大概长这样"可能是在帮倒忙。 与其塞结论,不如给它一个能低成本试错的环境,让它自己演化出方法论。
4. 想跟进就盯这几个地方:
- 论文原文:arxiv.org/abs/2609.14858
- 相关系统:AlphaEvolve、AlphaEvolveV2、OpenEvolve、ShinkaEvolve(论文都做了对比)
- 底层模型:Gemini 3.1 Pro / Gemini 3.7 Flash,均通过 Gemini CLI 调用
它到底算不算"真正的 RSI"?
我自己的判断:算半个。
RSI(Recursive Self-Improvement,递归自我改进)在激进定义里,是"AI 改进自身核心能力 → 更强之后再更高效地改进自己 → 能力加速增长"的飞轮。
Dream-RSI 确实闭环了:改策略 → 产生新经验 → 经验再改进下一代策略。但它有三重硬边界:
- 没碰模型权重。 Gemini 3.1 Pro 和 3.7 Flash 全程冻结,没有训练出更强的新模型。
- 只在元探索层有效。 它学会了更好地选分支、分并行、定停止时机,但没证明这种提升能无限延续,也没证明策略能迁移到任意开放任务。
- "世界"只覆盖走过的路。 回放模拟器无法预测历史之外的新分支——从没试过的路线,光靠回放判断不了价值。它能更高效地利用经验,但替代不了真实探索。
所以"AI 已经可以无限自我进化"这个说法,是夸大了。
更准确的说法是:谷歌展示了一种便宜得多的元层自我改进机制——不重新训练大模型,也能让智能体根据执行历史持续修改自己的搜索编排。
Dream-RSI 与其说是在创造一个会自我训练的模型,不如说是在创造一套会自我管理的研究系统。它不会让 Gemini 醒来后突然变聪明,却可能让同一个 Gemini 少走很多弯路。
而在动辄成千上万次生成与验证的自动科研场景里,少走弯路本身就是一种能力增长。
顺带一提:DeepMind 也在同一天做了一件事
Dream-RSI 论文公布前后,还有个信号值得注意。
DeepMind CEO Demis Hassabis 宣布成立 DeepMind Institute。和负责训模型、做产品、搞技术的 Google DeepMind 不同,这个新机构关注 AGI 可能带来的社会影响,引入经济学、公共政策、哲学、教育、社会科学等视角。由联合创始人 Shane Legg 任执行编辑,Google 高级副总裁 James Manyika 与 Hassabis 共同参与。
Legg 在新机构成立时警告:AI 能力的进步速度不应超过安全控制的发展速度。 越来越强的 Agent 已经能写软件、执行长任务、参与开发下一代 AI 系统——这让递归自我改进从一个理论概念,逐渐变成了现实的治理问题。
他同时表示,现在宣布 AGI 已到为时过早,仍维持此前判断:到 2028 年出现"最低限度 AGI"的概率约 50%。
一边在论文里推进 RSI,一边成立机构研究它的影响。这个组合拳,我觉得比单纯发一篇论文更值得琢磨。
进阶
行业里有个正在成型的共识:谈模型进步,过去第一反应是加预训练算力、扩数据、做强化学习——这些全都直接作用于模型参数,贵、慢、吃算力集群。
现在越来越多研究把改进目标转向了模型之外:提示词、上下文、记忆、技能库、评估标准、工具调用方式、多智能体协作机制,以及包裹模型的那一层 Harness。
这意味着,未来衡量一个 AI 系统是否在自我改进,不能只看模型权重变没变。即使基础模型被冻结,一个能自动改工作流、调搜索策略、积累经验并重新分配算力的智能体,也可能在同样的 Token 预算下干更复杂的活。
Dream-RSI 就是把这层窗户纸捅破的那根手指。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档