---
url: /gemini_4_pro/what_is_gemini_4_pro.md
description: >-
  2026年9月17-18日，Arena 上出现一款名为 gemini-3.8-flash 的匿名模型，被大量开发者实测判定为 Gemini 4 Pro
  早期检查点。网传跑分 DeepSWE v1.1 约 88%、Terminal-bench 2.1 95.3%、OSWorld-2.0
  86.8%、GDPval-AA v2 2064 Elo，传闻 1000 万上下文、25.6 万输出、$2.25/$11.25 每百万 token
  定价。本文梳理时间线、跑分、实测案例与 RSI 背景，并划清「传闻」与「官方确认」的边界。
---

# Gemini 4 Pro 偷跑：谷歌把下一代旗舰塞进了「3.8 Flash」的马甲里

先说一个荒诞的细节。

2026 年 9 月 2 日，谷歌正式发布了 **Gemini 3.8 Flash**，模型 ID 叫 `gemini-3.8-flash`。

半个月后的 9 月 17 日，大伙儿在 Arena 上又看到了一个叫 **gemini-3.8-flash** 的模型。

同一个名字，同一个平台，但行为完全不像同一个东西——它为了画一张 PS5 的矢量图，吭哧吭哧**想了十分钟**。

一个 Flash 级别的模型思考十分钟？Flash 这个名字的含义就是「快」。这就好比你家楼下的便利店突然开始慢炖佛跳墙，你很难不去怀疑后厨换了人。

于是 AI 圈这几天达成了一种高度一致的默契：**这大概就是谷歌下一代旗舰 Gemini 4 Pro 的早期检查点，披着 3.8 Flash 的外衣在公测。**

> 先把丑话说在前面：**截至 2026 年 9 月 18 日，谷歌官方没有发布过任何关于 Gemini 4 Pro 的公告。** 下文所有跑分、规格、价格均来自 Arena 实测、X 上的开发者分享和媒体转述，属于**传闻与推测**，不是文档。我会尽量标清楚哪句是实测、哪句是猜的。别拿这篇文章去跟人打赌。

## 事情是怎么一步步变成这样的

把时间线摊开，你会发现这事一点都不突然——谷歌的 Pro 线已经沉寂太久了。

| 时间 | 事件 |
| --- | --- |
| 2026 年 2 月 19 日 | **Gemini 3.1 Pro** 发布，这是 Pro 系列**最后一次大版本更新** |
| 2026 年 5 月（I/O） | 皮查伊预告 **Gemini 3.5 Pro 将于 6 月上线** |
| 2026 年 6 月 → 8 月 | 3.5 Pro 一再跳票，最终未见发布 |
| 2026 年 9 月初 | WSJ 独家爆料：**3.5 Pro 被砍了**，原因是进化幅度有限，表现甚至打不过自家的 Flash |
| 2026 年 9 月 2 日 | **Gemini 3.8 Flash**（及 3.8 Flash Cyber）正式发布 |
| 2026 年 9 月 14 日 | 谷歌公开 **Dream-RSI** 研究：让 Agent 从经验中改进自己的搜索策略 |
| 2026 年 9 月 17-18 日 | Arena 出现同名 **gemini-3.8-flash**，实测能力明显超出，被指为 Gemini 4 Pro 检查点 |

从 2 月到 9 月，**七个月**，Pro 线没有任何大动静。而同一时间，OpenAI 掏出了 GPT-6 Astra，Anthropic 掏出了 Claude Fable 5.1，牌桌早就换了一批筹码。

谷歌上一次真正让 AI 圈集体倒吸一口气，得往前数好几个月了。

## 所以 Gemini 4 Pro 到底是什么

严格说，我们现在只知道「**有个东西**」，不知道「**它叫什么**」。把已知和传闻分开看：

**相对靠谱的部分（有多名开发者独立实测交叉印证）：**

* Arena（LMSYS Chatbot Arena / arena.ai）上出现了一款**匿名**模型，挂名 `gemini-3.8-flash`
* 多位开发者实测后认为，它的能力**显著强于** 9 月 2 日发布的正式版 Gemini 3.8 Flash
* 典型特征是**超长的测试时推理**：复杂任务会思考 8-10 分钟再输出，而不是几秒钟给答案
* SVG / 3D 生成、前端交互页面、可玩小游戏的完成度出现明显代差

**纯传闻部分（单一来源或匿名爆料，看看就好）：**

* 内部代号叫 **Argon**
* 后端被扒出 **1000 万 token 输入上限**、**25.6 万 token 输出上限**
* 具备**永久跨会话记忆**，且**不需要外接 API 就能联网**
* 定价 **每百万输入 token 2.25 美元 / 每百万输出 token 11.25 美元**
* 谷歌已关闭 RSI（递归自我改进）闭环，导致预训练提前完成

一个有意思的旁证：有人在 3D 飞行模拟的测试里，把 Arena 上的 `gemini-3.8-flash` 和官方的 Gemini 3.8 Flash 正面对比，画面效果差距大到不像是同一个量级的东西。**同名，不同模**——这基本是坐实「马甲」的关键证据。

> 我的判断：这个模型大概率是真的存在，而且确实是谷歌的下一代前沿模型。但它最终**会不会叫 Gemini 4 Pro、什么时候发布、参数是不是这些**，全部未知。匿名上 Arena 是行业里很常见的做法——先拿真实用户的水军式盲测刷分和 debug，再挑个好日子官宣。

## 泄露出来的跑分有多夸张

下面这组数字来自网上疯传的基准测试图，被 36 氪（新智元）、钜亨网等多家媒体转载。**请记住：这不是谷歌官方发布的数据。**

| 基准 | 测试内容 | Gemini 4 Pro（传闻） | 对比 |
| --- | --- | --- | --- |
| DeepSWE v1.1 | AI 智能体编码任务 | **约 88%** | 比 GPT-6 Astra 高近 2 个百分点 |
| GDPval-AA v2 | 真实知识工作任务（Elo） | **2064** | 唯一突破 2000 分的模型 |
| Terminal-bench 2.1 | 终端编码 | **95.3%** | 排名第一 |
| OSWorld-2.0 | 电脑操作 / 计算机使用 | **86.8%** | 超过 Astra 与 Fable 5.1 |

如果这张表是真的，含义就一句话：**在智能体编码、终端操作、电脑控制这三条当前最卷的赛道上，它同时领跑。**

更狠的是价格。传闻中的 $2.25 / $11.25 每百万 token，如果属实，它是「御三家」（谷歌、OpenAI、Anthropic）前沿模型里**最便宜的那个**。

> 便宜这件事，比跑分第一更值得琢磨。前沿模型真正的瓶颈从来不是「能不能做」，而是「做一次多少钱」。一个能跑长任务、又便宜的模型，才敢被塞进日均亿级调用的产品里。谷歌有搜索、Workspace、Android 一整套吞量的入口，它对成本的敏感度比谁都高。

## 实测里真正让我在意的几个案例

跑分会骗人，作品不会。这几天流传最广的几个实测：

**1. 鹈鹕骑自行车（经典 SVG 地狱题）**

这是圈内公认的「坐标理解照妖镜」——大多数模型画出来的鹈鹕和自行车，要么比例崩坏，要么部件错位。而它的输出里居然还带**配色主题、日夜切换、车灯开关、解剖标注、踏频控制**。这就不是「画得像」了，是理解了「这是个可以调的东西」。

**2. 一张 PS5 的矢量图，想了十分钟**

有开发者让它输出 PS5 的 SVG，模型花了约十分钟思考、编译、修正，最后吐出几千行代码，把曲面、阴影、光驱细节都还原了。十分钟的推理时间本身就是信号：**谷歌在大规模堆测试时算力（test-time compute）**。

**3. 空客 H145 直升机 3D 模型**

十分钟生成一个完整 3D 模型。类似的还有像素风 3D 宝塔、可交互的 3D 卡丁车竞速游戏、Minecraft 风格的体素建造器——注意是**可玩**的，带完整交互逻辑。

**4. 一个「滚动即笔触」的创意展示页**

14 分钟，做出一个素描/石墨质感的网页，向下滑动时线条逐渐加深。UI 品味这件事一向是模型的软肋，这里明显上了个台阶。

开发者 Pankaj Kumar 的总结很朴素，也最实在：**速度快，SVG 和 3D 生成明显进步，复杂要求一次提示就能吃准。**

## 为什么所有人都在往 RSI 上想

这波讨论里最出圈的不是跑分，是一个缩写：**RSI（Recursive Self-Improvement，递归自我改进）**。

链条是这样的：

* Google DeepMind 首席战略官 Jasjeet Sekhon 前不久在伯克利的活动上公开表示，**RSI 已成为 AI 巨额投资逻辑里的关键一环**
* 9 月 14 日，谷歌公开了 **Dream-RSI** 研究，核心是让 Agent 在探索过程中不断改进自己的搜索策略、从上一轮经验里升级下一轮探索（本站在 [认识 Dream-RSI：AI 靠做梦自我进化](/deepmind/what_is_dream_rsi) 里写过）
* 于是网上开始流传更激进的说法：**Gemini 4 之所以提前完成预训练，是因为 DeepMind 在训练里把 RSI 闭环跑通了**

这个说法目前**没有任何官方证据**。但「AI 参与改进 AI」的迹象确实越来越多了——Anthropic 前几天也披露，Claude 现在已经主导该公司 26% 的模型研发工作。

> 如果 RSI 的循环真能持续转起来，那模型能力的曲线可能就不只是指数增长了。当然，也可能只是又一次集体上头。这两件事在 AI 圈发生的概率差不多高。

## 现在能怎么「摸」到它

想第一时间用上，路径其实很明确：

**1. 去 Arena 盲测**

直接去 [LMSYS Chatbot Arena](https://lmarena.ai/) 或 arena.ai 盲测聊天，碰运气排到那个匿名模型。判断方法很简单：**让它画一只鹈鹕骑自行车的 SVG**，如果它思考了好几分钟还带日夜切换按钮，那你大概率中奖了。

**2. 盯住官方渠道**

真正的发布只会从这三个地方出来：

* [Google 官方博客 blog.google](https://blog.google/)（模型发布的第一现场）
* [Google AI Studio](https://aistudio.google.com/) 的模型下拉列表（新模型通常先在这里灰度）
* [Gemini API 文档的模型页](https://ai.google.dev/gemini-api/docs/models)（模型 ID 正式落地）

**3. 代码层面提前留好切换口子**

别把模型 ID 硬编码进业务代码里。用官方的 `google-genai` SDK 时，把它抽成配置：

```python
from google import genai

client = genai.Client(api_key="YOUR_API_KEY")

# 把模型 ID 抽成配置，等 gemini-4-pro 正式上线时改一行即可
MODEL_ID = "gemini-3.8-flash"  # TODO: 切换为 gemini-4-pro

resp = client.models.generate_content(
    model=MODEL_ID,
    contents="用 SVG 画一只侧视角的家猫，要求比例准确",
)
print(resp.text)
```

装 SDK 就一行：

```bash
pip install google-genai
```

**4. 提前想清楚成本**

如果传闻里的 1000 万上下文是真的，那「把整个代码库塞进去」这件事会从噱头变成日常。但也要准备好另一面：**超长上下文 + 超长思考 = token 烧得飞快**。真上线那天，先在小流量上跑一周账单，再决定要不要切主力。

## 进阶

跑分只是入场券，真正决定体验的是它落到你手里的那一天：延迟多少、上下文会不会降智、工具调用稳不稳、价格扛不扛得住批量。

这些东西，只有自己跑一遍才知道。等它正式发布，我会第一时间在 gemini.meetcoding.cn 更新实测。

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
