---
url: /deepmind/what_is_dream_rsi.md
description: >-
  2026年9月谷歌联合 Google DeepMind、马里兰大学、弗吉尼亚大学发布 Dream-RSI
  递归自我改进框架（arXiv:2609.14858），把历史搜索记录变成"回放模拟器"，让 AI 在梦境中演化探索策略。Lasso 任务调用次数暴降 162
  倍，GPU 内核优化少 2.43 倍生成次数，全程不修改 Gemini 权重。本文用大白话讲清它是什么、强在哪、边界在哪。
---

# 认识 Dream-RSI：谷歌让 AI 靠「做梦」自我进化，模型权重一个字没改

先说一个我自己的尴尬经历。

上周我让一个编码 Agent 帮我优化一段数据处理脚本，它吭哧吭哧跑了三个小时，生成了上百个候选版本。我满怀期待去看结果——**它在一个早就该放弃的方向上，死磕了两个半小时。**

那一刻我意识到一件挺反直觉的事：现在这些 AI Agent 的瓶颈，可能已经**不是模型够不够聪明了**。

模型就那样了。真正决定成败的，是它往哪走、何时掉头、什么时候认栽。

2026 年 9 月 14 日挂上 arXiv 的一篇论文，冲的就是这件事。论文一作 Tong Zheng 是马里兰大学二年级博士生，今年夏天才以学生研究员身份进谷歌，身后站着 17 人的作者团，署名机构包括 **Google、Google DeepMind、马里兰大学帕克分校和弗吉尼亚大学**。

论文名叫《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》——**通过演化世界实现递归自我改进**。

X 上有人直接喊：谷歌可能刚刚破解了递归自我改进。

我先把结论摆这儿：**这话夸张了，但它确实是今年我看到最有意思的一篇。** 因为它是个特别聪明的工程取巧。

## 什么是 Dream-RSI

**Dream-RSI** 是一套让 AI 智能体\*\*自我改进"搜索策略"\*\*的框架，由 Google、Google DeepMind 联合两所高校提出，论文编号 [arXiv:2609.14858](https://arxiv.org/abs/2609.14858)（2026 年 9 月 14 日提交，12 页）。

要理解它，得先认识它的前辈 **AlphaEvolve**。

AlphaEvolve 的思路是"大力出奇迹"：让模型不断生成候选代码 → 自动评估打分 → 围绕高分方案继续变异 → 再评估。几百上千轮下来，硬生生从搜索空间里刨出人类没找到过的算法。今年它靠这套打法改进了矩阵乘法上限、推进了拉姆齐数边界。

但 AlphaEvolve 有个死穴——**探索策略是工程师手写死的**。

哪个分支该多给算力、哪个方向该尽早砍掉、同时开几条并行线、什么时候收手，全是提前写好的规则。搜索空间一小还凑合，空间一大，固定策略就会把算力成吨地灌进死胡同，而且**不长记性**，下次照样踩同一个坑。

那让策略自己进化不就行了？

理论上行，代价上要命。**评估一段候选代码，跑一次就知道好坏；评估一套探索策略，得让它带着智能体从头跑完整整几百上千轮，看最后挖出什么，才能给这套策略打分。** 每改一版策略就重跑一遍完整发现流程，等几天出一个分数——没人耗得起这个"试错税"。

Dream-RSI 的解法极其朴素，朴素到我看完有点想拍大腿：

> **跑过的过程存下来。评估新策略时不再重跑，直接拿旧过程回放。**

一次真实搜索结束后，系统会把整个搜索历史——每个尝试过的分支、每次的工作区状态、候选程序、执行结果、报错信息、最终得分——组织成一棵**发现树（discovery tree）**，然后把它变成一个**回放模拟器（replay simulator）**。

树上每个走过的节点都有真实结果。所以新策略要测试，根本不需要再调 Gemini 生成代码、也不用重跑评估程序，**只需要按不同顺序把已有节点重读一遍**：

* 如果当时先探索另一条分支，结果会怎样？
* 如果同时开更多并行任务，能不能更早撞见高分答案？
* 如果第五轮就砍掉那个长期没进展的方向，能省多少次调用？

这些问题的答案，**已经躺在历史里了**。

论文把这个过程叫做 **"做梦"（Dreaming）**。系统不再于真实世界重演每一种策略，而是在过去经验构成的世界里，把成千上万种可能的行动路线彩排一遍。

一作 Tong Zheng 在 Hugging Face 上留的那句话，是整篇论文的内核：

> 要实现递归自我改进，智能体必须学会做梦。而历史，就是它们做梦的世界。

这个名字明显是致敬 DeepMind 自家的 **Dreamer** 系列世界模型——不过 Dreamer 是让智能体在学出来的环境模型里想象未来轨迹，Dream-RSI 则把同样的思路用在了**搜索策略**这一层，而不是底层的感知与控制。

## 它有什么特别之处

**第一，闭环是真的闭环。**

Dream-RSI 不是一次性优化，它跑一个"行动 → 记录 → 做梦 → 改进 → 再行动"的循环：

```
真实探索（当前策略调度 Gemini 跑任务，全过程沉淀成发现树）
   ↓
构建回放模拟器（本轮 + 历史所有发现树，并入模拟器池）
   ↓
离线做梦（另一个固定模型改探索策略代码，生成多个候选，在模拟器里按质量/调用数/并行效率三项打分）
   ↓
最优策略部署到下一轮真实探索 → 产生新历史 → 回到第一步
```

过去的执行记录从"一次性日志"变成了"可反复进入的训练场"，这是整个设计里最值钱的一步。

**第二，底层模型一个参数都没动。**

实验里跑活的模型是通过 **Gemini CLI 调用的 Gemini 3.1 Pro 和 Gemini 3.7 Flash**，评估器和执行接口也全程冻结。每一轮真正被重写的，只是**探索策略这层轻量编排代码**——可以理解成架在 Agent 之上的一套"导航系统"。

这点非常重要，后面讲边界时还要说。

**第三，它学到的不是死规则，是"看情况调整力度"。**

在 ConvDiv 内核任务里出现过一个细节：前几轮结果持续变好，Dream-RSI 就把每轮评估次数从 110 次一路降到 50 次，主动省算力；等性能进入平台期，它又把搜索范围重新拉开，随后拿到了新的性能提升。

有进展时收敛利用，停滞了就放宽探索。这不是一条写死的 if-else，是它自己在回放里试出来的节奏感。

**第四，一个反直觉的发现：人给 AI 指方向，反而更差。**

研究团队试过一种更省事的用法——把历史搜索轨迹总结成自然语言，比如"哪些方向曾经成功""哪些方案别再试了"，塞进下一轮的 prompt 里。

结果**持续低于**不加方向性建议的版本。

他们的解释是：长周期探索依赖多个并行方向，而自然语言总结容易把历史中偶然成功的路线固化成强先验，让模型过早收缩搜索空间。

说人话就是——**它从过去"学得太具体"，最后只会沿着已经验证过的路继续走。**

> 记忆通常为下一次决策提供**内容**，而回放模拟器为**决策机制本身**提供训练和评估环境。这是 Dream-RSI 和普通记忆系统最本质的区别。

## 实测效果：数据得挑着看

论文在三个差异明显的领域做了验证。**有些数字很炸，但有些得打个折。**

### 算法工程：Lasso 正则化路径

任务是让 AI 在保证数值正确的前提下，发现跑得更快的 Lasso 路径求解器。Lasso 在特征选择、基因组分析、金融建模里用得极广。

| 配置 | 固定探索策略 | Dream-RSI | 变化 |
| --- | --- | --- | --- |
| Gemini 3.1 Pro（调用次数） | 550 次 | **317 次** | 少约 42% |
| Gemini 3.1 Pro（求解器耗时） | 3587.1 ms | **2931.0 ms** | 更快 |
| Gemini 3.7 Flash（调用次数） | 3200 次 | **1879 次** | 少约 41% |
| Gemini 3.7 Flash（求解器耗时） | 2516.7 ms | **2350.6 ms** | 更快 |

**花更少的调用，拿到更好的结果**——这个对比是同模型、同资源、同初始策略下的，最有说服力。

那个到处流传的 **"162 倍"**，来自和 SimpleTES（GPT-OSS-120B，跑了 51200 次生成）的对比：317 对 51200，差距约 162 倍。

**但我得泼盆冷水**：这俩底层模型和系统设计都不一样，不是严格控制变量的横向比较，看着爽就好。对固定探索基线的 **1.7 倍**提升，才是更诚实的数字。

最终它找到的求解器，在六个未参与搜索的测试数据集上超过了 scikit-learn 和 glmnet 的标准实现。不过论文也老实说了，这只在给定数据集、硬件和正确性约束下成立，**不等于能全面取代这些久经考验的通用库**。

### 数学优化：有赢有输

在和差不等式、自相关不等式、圆填充三项任务上：

| 任务 | Dream-RSI 成绩 | 对比 |
| --- | --- | --- |
| 和差不等式 | 1.145427 | 表中最佳 |
| 圆填充 | 2.635983 | 追平 AlphaEvolveV2 最强纪录 |
| 自相关不等式 | 1.456375 | **落后** SimpleTES（1.453675） |

注意最后一行——SimpleTES 用了 51200 代才拿到那个数，Dream-RSI 用了不到 1000 代。性价比赢了，绝对值输了。

部分场景下算力成本降低 **50 倍以上**。

### GPU 内核工程：KernelBench

在 VGG16、LayerNorm、ConvDiv、ConvMax 四项上：

| 任务 | 结果 |
| --- | --- |
| VGG16 | 少 **2.43** 倍生成次数，达到相近性能 |
| LayerNorm | 少 **1.79** 倍生成次数，达到相近性能 |
| ConvDiv | 相同预算下，内核性能达固定策略的 **2.09** 倍 |
| ConvMax | 相同预算下，内核性能达固定策略的 **1.44** 倍 |

## 现在能用上吗？说实话：还不太行

这部分我本来该叫"快速上手"，但 Dream-RSI 是篇预印本论文，项目仓库显示**完整代码还在准备发布**，外部研究者目前没法完整复现实验。

所以咱聊点现在就能用上的——**它的思路**。

**1. 把探索策略显式化，别埋在 prompt 里。**

如果你在写自己的编码 Agent 或搜索流程，先把"开几条并行线""什么时候砍分支""什么时候停"这些决策从提示词里抽出来，变成一份独立、可修改的配置或代码。Dream-RSI 的前提就是策略可编程——策略不可编程，就没法演化。

**2. 别扔掉你的搜索日志。**

大多数人把 Agent 的失败记录当垃圾。Dream-RSI 最值钱的一步，恰恰是把这些垃圾变成了训练场。**每一次生成、每一次评估、每一个得分，都记下来，存成结构化数据。** 这条今天下午就能改，零成本。

**3. 少给方向性建议，多给评估环境。**

那个"自然语言总结反而拖后腿"的结论，对我触动挺大。它暗示了一件事：**在长周期探索里，告诉 AI "答案大概长这样"可能是在帮倒忙。** 与其塞结论，不如给它一个能低成本试错的环境，让它自己演化出方法论。

**4. 想跟进就盯这几个地方：**

* 论文原文：[arxiv.org/abs/2609.14858](https://arxiv.org/abs/2609.14858)
* 相关系统：AlphaEvolve、AlphaEvolveV2、OpenEvolve、ShinkaEvolve（论文都做了对比）
* 底层模型：Gemini 3.1 Pro / Gemini 3.7 Flash，均通过 Gemini CLI 调用

## 它到底算不算"真正的 RSI"？

我自己的判断：**算半个。**

RSI（Recursive Self-Improvement，递归自我改进）在激进定义里，是"AI 改进自身核心能力 → 更强之后再更高效地改进自己 → 能力加速增长"的飞轮。

Dream-RSI 确实闭环了：改策略 → 产生新经验 → 经验再改进下一代策略。但它有三重硬边界：

* **没碰模型权重。** Gemini 3.1 Pro 和 3.7 Flash 全程冻结，没有训练出更强的新模型。
* **只在元探索层有效。** 它学会了更好地选分支、分并行、定停止时机，但没证明这种提升能无限延续，也没证明策略能迁移到任意开放任务。
* **"世界"只覆盖走过的路。** 回放模拟器无法预测历史之外的新分支——从没试过的路线，光靠回放判断不了价值。它能更高效地利用经验，**但替代不了真实探索**。

所以"AI 已经可以无限自我进化"这个说法，是夸大了。

更准确的说法是：谷歌展示了一种**便宜得多的元层自我改进机制**——不重新训练大模型，也能让智能体根据执行历史持续修改自己的搜索编排。

> Dream-RSI 与其说是在创造一个会自我训练的模型，不如说是在创造一套**会自我管理的研究系统**。它不会让 Gemini 醒来后突然变聪明，却可能让同一个 Gemini 少走很多弯路。

而在动辄成千上万次生成与验证的自动科研场景里，**少走弯路本身就是一种能力增长**。

## 顺带一提：DeepMind 也在同一天做了一件事

Dream-RSI 论文公布前后，还有个信号值得注意。

DeepMind CEO Demis Hassabis 宣布成立 **DeepMind Institute**。和负责训模型、做产品、搞技术的 Google DeepMind 不同，这个新机构关注 **AGI 可能带来的社会影响**，引入经济学、公共政策、哲学、教育、社会科学等视角。由联合创始人 **Shane Legg** 任执行编辑，Google 高级副总裁 **James Manyika** 与 Hassabis 共同参与。

Legg 在新机构成立时警告：**AI 能力的进步速度不应超过安全控制的发展速度。** 越来越强的 Agent 已经能写软件、执行长任务、参与开发下一代 AI 系统——这让递归自我改进从一个理论概念，逐渐变成了现实的治理问题。

他同时表示，现在宣布 AGI 已到为时过早，仍维持此前判断：到 2028 年出现"最低限度 AGI"的概率约 **50%**。

一边在论文里推进 RSI，一边成立机构研究它的影响。这个组合拳，我觉得比单纯发一篇论文更值得琢磨。

## 进阶

行业里有个正在成型的共识：谈模型进步，过去第一反应是加预训练算力、扩数据、做强化学习——这些全都直接作用于模型参数，贵、慢、吃算力集群。

现在越来越多研究把改进目标转向了模型**之外**：提示词、上下文、记忆、技能库、评估标准、工具调用方式、多智能体协作机制，以及包裹模型的那一层 **Harness**。

这意味着，未来衡量一个 AI 系统是否在自我改进，**不能只看模型权重变没变**。即使基础模型被冻结，一个能自动改工作流、调搜索策略、积累经验并重新分配算力的智能体，也可能在同样的 Token 预算下干更复杂的活。

Dream-RSI 就是把这层窗户纸捅破的那根手指。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
