Skip to content

Gemini 4 Pro 偷跑:谷歌把下一代旗舰塞进了「3.8 Flash」的马甲里

先说一个荒诞的细节。

2026 年 9 月 2 日,谷歌正式发布了 Gemini 3.8 Flash,模型 ID 叫 gemini-3.8-flash

半个月后的 9 月 17 日,大伙儿在 Arena 上又看到了一个叫 gemini-3.8-flash 的模型。

同一个名字,同一个平台,但行为完全不像同一个东西——它为了画一张 PS5 的矢量图,吭哧吭哧想了十分钟

一个 Flash 级别的模型思考十分钟?Flash 这个名字的含义就是「快」。这就好比你家楼下的便利店突然开始慢炖佛跳墙,你很难不去怀疑后厨换了人。

于是 AI 圈这几天达成了一种高度一致的默契:这大概就是谷歌下一代旗舰 Gemini 4 Pro 的早期检查点,披着 3.8 Flash 的外衣在公测。

先把丑话说在前面:截至 2026 年 9 月 18 日,谷歌官方没有发布过任何关于 Gemini 4 Pro 的公告。 下文所有跑分、规格、价格均来自 Arena 实测、X 上的开发者分享和媒体转述,属于传闻与推测,不是文档。我会尽量标清楚哪句是实测、哪句是猜的。别拿这篇文章去跟人打赌。

事情是怎么一步步变成这样的

把时间线摊开,你会发现这事一点都不突然——谷歌的 Pro 线已经沉寂太久了。

时间事件
2026 年 2 月 19 日Gemini 3.1 Pro 发布,这是 Pro 系列最后一次大版本更新
2026 年 5 月(I/O)皮查伊预告 Gemini 3.5 Pro 将于 6 月上线
2026 年 6 月 → 8 月3.5 Pro 一再跳票,最终未见发布
2026 年 9 月初WSJ 独家爆料:3.5 Pro 被砍了,原因是进化幅度有限,表现甚至打不过自家的 Flash
2026 年 9 月 2 日Gemini 3.8 Flash(及 3.8 Flash Cyber)正式发布
2026 年 9 月 14 日谷歌公开 Dream-RSI 研究:让 Agent 从经验中改进自己的搜索策略
2026 年 9 月 17-18 日Arena 出现同名 gemini-3.8-flash,实测能力明显超出,被指为 Gemini 4 Pro 检查点

从 2 月到 9 月,七个月,Pro 线没有任何大动静。而同一时间,OpenAI 掏出了 GPT-6 Astra,Anthropic 掏出了 Claude Fable 5.1,牌桌早就换了一批筹码。

谷歌上一次真正让 AI 圈集体倒吸一口气,得往前数好几个月了。

所以 Gemini 4 Pro 到底是什么

严格说,我们现在只知道「有个东西」,不知道「它叫什么」。把已知和传闻分开看:

相对靠谱的部分(有多名开发者独立实测交叉印证):

  • Arena(LMSYS Chatbot Arena / arena.ai)上出现了一款匿名模型,挂名 gemini-3.8-flash
  • 多位开发者实测后认为,它的能力显著强于 9 月 2 日发布的正式版 Gemini 3.8 Flash
  • 典型特征是超长的测试时推理:复杂任务会思考 8-10 分钟再输出,而不是几秒钟给答案
  • SVG / 3D 生成、前端交互页面、可玩小游戏的完成度出现明显代差

纯传闻部分(单一来源或匿名爆料,看看就好):

  • 内部代号叫 Argon
  • 后端被扒出 1000 万 token 输入上限25.6 万 token 输出上限
  • 具备永久跨会话记忆,且不需要外接 API 就能联网
  • 定价 每百万输入 token 2.25 美元 / 每百万输出 token 11.25 美元
  • 谷歌已关闭 RSI(递归自我改进)闭环,导致预训练提前完成

一个有意思的旁证:有人在 3D 飞行模拟的测试里,把 Arena 上的 gemini-3.8-flash 和官方的 Gemini 3.8 Flash 正面对比,画面效果差距大到不像是同一个量级的东西。同名,不同模——这基本是坐实「马甲」的关键证据。

我的判断:这个模型大概率是真的存在,而且确实是谷歌的下一代前沿模型。但它最终会不会叫 Gemini 4 Pro、什么时候发布、参数是不是这些,全部未知。匿名上 Arena 是行业里很常见的做法——先拿真实用户的水军式盲测刷分和 debug,再挑个好日子官宣。

泄露出来的跑分有多夸张

下面这组数字来自网上疯传的基准测试图,被 36 氪(新智元)、钜亨网等多家媒体转载。请记住:这不是谷歌官方发布的数据。

基准测试内容Gemini 4 Pro(传闻)对比
DeepSWE v1.1AI 智能体编码任务约 88%比 GPT-6 Astra 高近 2 个百分点
GDPval-AA v2真实知识工作任务(Elo)2064唯一突破 2000 分的模型
Terminal-bench 2.1终端编码95.3%排名第一
OSWorld-2.0电脑操作 / 计算机使用86.8%超过 Astra 与 Fable 5.1

如果这张表是真的,含义就一句话:在智能体编码、终端操作、电脑控制这三条当前最卷的赛道上,它同时领跑。

更狠的是价格。传闻中的 $2.25 / $11.25 每百万 token,如果属实,它是「御三家」(谷歌、OpenAI、Anthropic)前沿模型里最便宜的那个

便宜这件事,比跑分第一更值得琢磨。前沿模型真正的瓶颈从来不是「能不能做」,而是「做一次多少钱」。一个能跑长任务、又便宜的模型,才敢被塞进日均亿级调用的产品里。谷歌有搜索、Workspace、Android 一整套吞量的入口,它对成本的敏感度比谁都高。

实测里真正让我在意的几个案例

跑分会骗人,作品不会。这几天流传最广的几个实测:

1. 鹈鹕骑自行车(经典 SVG 地狱题)

这是圈内公认的「坐标理解照妖镜」——大多数模型画出来的鹈鹕和自行车,要么比例崩坏,要么部件错位。而它的输出里居然还带配色主题、日夜切换、车灯开关、解剖标注、踏频控制。这就不是「画得像」了,是理解了「这是个可以调的东西」。

2. 一张 PS5 的矢量图,想了十分钟

有开发者让它输出 PS5 的 SVG,模型花了约十分钟思考、编译、修正,最后吐出几千行代码,把曲面、阴影、光驱细节都还原了。十分钟的推理时间本身就是信号:谷歌在大规模堆测试时算力(test-time compute)

3. 空客 H145 直升机 3D 模型

十分钟生成一个完整 3D 模型。类似的还有像素风 3D 宝塔、可交互的 3D 卡丁车竞速游戏、Minecraft 风格的体素建造器——注意是可玩的,带完整交互逻辑。

4. 一个「滚动即笔触」的创意展示页

14 分钟,做出一个素描/石墨质感的网页,向下滑动时线条逐渐加深。UI 品味这件事一向是模型的软肋,这里明显上了个台阶。

开发者 Pankaj Kumar 的总结很朴素,也最实在:速度快,SVG 和 3D 生成明显进步,复杂要求一次提示就能吃准。

为什么所有人都在往 RSI 上想

这波讨论里最出圈的不是跑分,是一个缩写:RSI(Recursive Self-Improvement,递归自我改进)

链条是这样的:

  • Google DeepMind 首席战略官 Jasjeet Sekhon 前不久在伯克利的活动上公开表示,RSI 已成为 AI 巨额投资逻辑里的关键一环
  • 9 月 14 日,谷歌公开了 Dream-RSI 研究,核心是让 Agent 在探索过程中不断改进自己的搜索策略、从上一轮经验里升级下一轮探索(本站在 认识 Dream-RSI:AI 靠做梦自我进化 里写过)
  • 于是网上开始流传更激进的说法:Gemini 4 之所以提前完成预训练,是因为 DeepMind 在训练里把 RSI 闭环跑通了

这个说法目前没有任何官方证据。但「AI 参与改进 AI」的迹象确实越来越多了——Anthropic 前几天也披露,Claude 现在已经主导该公司 26% 的模型研发工作。

如果 RSI 的循环真能持续转起来,那模型能力的曲线可能就不只是指数增长了。当然,也可能只是又一次集体上头。这两件事在 AI 圈发生的概率差不多高。

现在能怎么「摸」到它

想第一时间用上,路径其实很明确:

1. 去 Arena 盲测

直接去 LMSYS Chatbot Arena 或 arena.ai 盲测聊天,碰运气排到那个匿名模型。判断方法很简单:让它画一只鹈鹕骑自行车的 SVG,如果它思考了好几分钟还带日夜切换按钮,那你大概率中奖了。

2. 盯住官方渠道

真正的发布只会从这三个地方出来:

3. 代码层面提前留好切换口子

别把模型 ID 硬编码进业务代码里。用官方的 google-genai SDK 时,把它抽成配置:

python
from google import genai

client = genai.Client(api_key="YOUR_API_KEY")

# 把模型 ID 抽成配置,等 gemini-4-pro 正式上线时改一行即可
MODEL_ID = "gemini-3.8-flash"  # TODO: 切换为 gemini-4-pro

resp = client.models.generate_content(
    model=MODEL_ID,
    contents="用 SVG 画一只侧视角的家猫,要求比例准确",
)
print(resp.text)

装 SDK 就一行:

bash
pip install google-genai

4. 提前想清楚成本

如果传闻里的 1000 万上下文是真的,那「把整个代码库塞进去」这件事会从噱头变成日常。但也要准备好另一面:超长上下文 + 超长思考 = token 烧得飞快。真上线那天,先在小流量上跑一周账单,再决定要不要切主力。

进阶

跑分只是入场券,真正决定体验的是它落到你手里的那一天:延迟多少、上下文会不会降智、工具调用稳不稳、价格扛不扛得住批量。

这些东西,只有自己跑一遍才知道。等它正式发布,我会第一时间在 gemini.meetcoding.cn 更新实测。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档