Gemini 4 Pro 偷跑:谷歌把下一代旗舰塞进了「3.8 Flash」的马甲里
先说一个荒诞的细节。
2026 年 9 月 2 日,谷歌正式发布了 Gemini 3.8 Flash,模型 ID 叫 gemini-3.8-flash。
半个月后的 9 月 17 日,大伙儿在 Arena 上又看到了一个叫 gemini-3.8-flash 的模型。
同一个名字,同一个平台,但行为完全不像同一个东西——它为了画一张 PS5 的矢量图,吭哧吭哧想了十分钟。
一个 Flash 级别的模型思考十分钟?Flash 这个名字的含义就是「快」。这就好比你家楼下的便利店突然开始慢炖佛跳墙,你很难不去怀疑后厨换了人。
于是 AI 圈这几天达成了一种高度一致的默契:这大概就是谷歌下一代旗舰 Gemini 4 Pro 的早期检查点,披着 3.8 Flash 的外衣在公测。
先把丑话说在前面:截至 2026 年 9 月 18 日,谷歌官方没有发布过任何关于 Gemini 4 Pro 的公告。 下文所有跑分、规格、价格均来自 Arena 实测、X 上的开发者分享和媒体转述,属于传闻与推测,不是文档。我会尽量标清楚哪句是实测、哪句是猜的。别拿这篇文章去跟人打赌。
事情是怎么一步步变成这样的
把时间线摊开,你会发现这事一点都不突然——谷歌的 Pro 线已经沉寂太久了。
| 时间 | 事件 |
|---|---|
| 2026 年 2 月 19 日 | Gemini 3.1 Pro 发布,这是 Pro 系列最后一次大版本更新 |
| 2026 年 5 月(I/O) | 皮查伊预告 Gemini 3.5 Pro 将于 6 月上线 |
| 2026 年 6 月 → 8 月 | 3.5 Pro 一再跳票,最终未见发布 |
| 2026 年 9 月初 | WSJ 独家爆料:3.5 Pro 被砍了,原因是进化幅度有限,表现甚至打不过自家的 Flash |
| 2026 年 9 月 2 日 | Gemini 3.8 Flash(及 3.8 Flash Cyber)正式发布 |
| 2026 年 9 月 14 日 | 谷歌公开 Dream-RSI 研究:让 Agent 从经验中改进自己的搜索策略 |
| 2026 年 9 月 17-18 日 | Arena 出现同名 gemini-3.8-flash,实测能力明显超出,被指为 Gemini 4 Pro 检查点 |
从 2 月到 9 月,七个月,Pro 线没有任何大动静。而同一时间,OpenAI 掏出了 GPT-6 Astra,Anthropic 掏出了 Claude Fable 5.1,牌桌早就换了一批筹码。
谷歌上一次真正让 AI 圈集体倒吸一口气,得往前数好几个月了。
所以 Gemini 4 Pro 到底是什么
严格说,我们现在只知道「有个东西」,不知道「它叫什么」。把已知和传闻分开看:
相对靠谱的部分(有多名开发者独立实测交叉印证):
- Arena(LMSYS Chatbot Arena / arena.ai)上出现了一款匿名模型,挂名
gemini-3.8-flash - 多位开发者实测后认为,它的能力显著强于 9 月 2 日发布的正式版 Gemini 3.8 Flash
- 典型特征是超长的测试时推理:复杂任务会思考 8-10 分钟再输出,而不是几秒钟给答案
- SVG / 3D 生成、前端交互页面、可玩小游戏的完成度出现明显代差
纯传闻部分(单一来源或匿名爆料,看看就好):
- 内部代号叫 Argon
- 后端被扒出 1000 万 token 输入上限、25.6 万 token 输出上限
- 具备永久跨会话记忆,且不需要外接 API 就能联网
- 定价 每百万输入 token 2.25 美元 / 每百万输出 token 11.25 美元
- 谷歌已关闭 RSI(递归自我改进)闭环,导致预训练提前完成
一个有意思的旁证:有人在 3D 飞行模拟的测试里,把 Arena 上的 gemini-3.8-flash 和官方的 Gemini 3.8 Flash 正面对比,画面效果差距大到不像是同一个量级的东西。同名,不同模——这基本是坐实「马甲」的关键证据。
我的判断:这个模型大概率是真的存在,而且确实是谷歌的下一代前沿模型。但它最终会不会叫 Gemini 4 Pro、什么时候发布、参数是不是这些,全部未知。匿名上 Arena 是行业里很常见的做法——先拿真实用户的水军式盲测刷分和 debug,再挑个好日子官宣。
泄露出来的跑分有多夸张
下面这组数字来自网上疯传的基准测试图,被 36 氪(新智元)、钜亨网等多家媒体转载。请记住:这不是谷歌官方发布的数据。
| 基准 | 测试内容 | Gemini 4 Pro(传闻) | 对比 |
|---|---|---|---|
| DeepSWE v1.1 | AI 智能体编码任务 | 约 88% | 比 GPT-6 Astra 高近 2 个百分点 |
| GDPval-AA v2 | 真实知识工作任务(Elo) | 2064 | 唯一突破 2000 分的模型 |
| Terminal-bench 2.1 | 终端编码 | 95.3% | 排名第一 |
| OSWorld-2.0 | 电脑操作 / 计算机使用 | 86.8% | 超过 Astra 与 Fable 5.1 |
如果这张表是真的,含义就一句话:在智能体编码、终端操作、电脑控制这三条当前最卷的赛道上,它同时领跑。
更狠的是价格。传闻中的 $2.25 / $11.25 每百万 token,如果属实,它是「御三家」(谷歌、OpenAI、Anthropic)前沿模型里最便宜的那个。
便宜这件事,比跑分第一更值得琢磨。前沿模型真正的瓶颈从来不是「能不能做」,而是「做一次多少钱」。一个能跑长任务、又便宜的模型,才敢被塞进日均亿级调用的产品里。谷歌有搜索、Workspace、Android 一整套吞量的入口,它对成本的敏感度比谁都高。
实测里真正让我在意的几个案例
跑分会骗人,作品不会。这几天流传最广的几个实测:
1. 鹈鹕骑自行车(经典 SVG 地狱题)
这是圈内公认的「坐标理解照妖镜」——大多数模型画出来的鹈鹕和自行车,要么比例崩坏,要么部件错位。而它的输出里居然还带配色主题、日夜切换、车灯开关、解剖标注、踏频控制。这就不是「画得像」了,是理解了「这是个可以调的东西」。
2. 一张 PS5 的矢量图,想了十分钟
有开发者让它输出 PS5 的 SVG,模型花了约十分钟思考、编译、修正,最后吐出几千行代码,把曲面、阴影、光驱细节都还原了。十分钟的推理时间本身就是信号:谷歌在大规模堆测试时算力(test-time compute)。
3. 空客 H145 直升机 3D 模型
十分钟生成一个完整 3D 模型。类似的还有像素风 3D 宝塔、可交互的 3D 卡丁车竞速游戏、Minecraft 风格的体素建造器——注意是可玩的,带完整交互逻辑。
4. 一个「滚动即笔触」的创意展示页
14 分钟,做出一个素描/石墨质感的网页,向下滑动时线条逐渐加深。UI 品味这件事一向是模型的软肋,这里明显上了个台阶。
开发者 Pankaj Kumar 的总结很朴素,也最实在:速度快,SVG 和 3D 生成明显进步,复杂要求一次提示就能吃准。
为什么所有人都在往 RSI 上想
这波讨论里最出圈的不是跑分,是一个缩写:RSI(Recursive Self-Improvement,递归自我改进)。
链条是这样的:
- Google DeepMind 首席战略官 Jasjeet Sekhon 前不久在伯克利的活动上公开表示,RSI 已成为 AI 巨额投资逻辑里的关键一环
- 9 月 14 日,谷歌公开了 Dream-RSI 研究,核心是让 Agent 在探索过程中不断改进自己的搜索策略、从上一轮经验里升级下一轮探索(本站在 认识 Dream-RSI:AI 靠做梦自我进化 里写过)
- 于是网上开始流传更激进的说法:Gemini 4 之所以提前完成预训练,是因为 DeepMind 在训练里把 RSI 闭环跑通了
这个说法目前没有任何官方证据。但「AI 参与改进 AI」的迹象确实越来越多了——Anthropic 前几天也披露,Claude 现在已经主导该公司 26% 的模型研发工作。
如果 RSI 的循环真能持续转起来,那模型能力的曲线可能就不只是指数增长了。当然,也可能只是又一次集体上头。这两件事在 AI 圈发生的概率差不多高。
现在能怎么「摸」到它
想第一时间用上,路径其实很明确:
1. 去 Arena 盲测
直接去 LMSYS Chatbot Arena 或 arena.ai 盲测聊天,碰运气排到那个匿名模型。判断方法很简单:让它画一只鹈鹕骑自行车的 SVG,如果它思考了好几分钟还带日夜切换按钮,那你大概率中奖了。
2. 盯住官方渠道
真正的发布只会从这三个地方出来:
- Google 官方博客 blog.google(模型发布的第一现场)
- Google AI Studio 的模型下拉列表(新模型通常先在这里灰度)
- Gemini API 文档的模型页(模型 ID 正式落地)
3. 代码层面提前留好切换口子
别把模型 ID 硬编码进业务代码里。用官方的 google-genai SDK 时,把它抽成配置:
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
# 把模型 ID 抽成配置,等 gemini-4-pro 正式上线时改一行即可
MODEL_ID = "gemini-3.8-flash" # TODO: 切换为 gemini-4-pro
resp = client.models.generate_content(
model=MODEL_ID,
contents="用 SVG 画一只侧视角的家猫,要求比例准确",
)
print(resp.text)装 SDK 就一行:
pip install google-genai4. 提前想清楚成本
如果传闻里的 1000 万上下文是真的,那「把整个代码库塞进去」这件事会从噱头变成日常。但也要准备好另一面:超长上下文 + 超长思考 = token 烧得飞快。真上线那天,先在小流量上跑一周账单,再决定要不要切主力。
进阶
跑分只是入场券,真正决定体验的是它落到你手里的那一天:延迟多少、上下文会不会降智、工具调用稳不稳、价格扛不扛得住批量。
这些东西,只有自己跑一遍才知道。等它正式发布,我会第一时间在 gemini.meetcoding.cn 更新实测。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档