Gemini 3.8 Flash 模型介绍
上一次 Gemini 3.7 Flash 发布是 8 月 13 日。21 天后,9 月 2 日,Google DeepMind 又发了一款——Gemini 3.8 Flash,外加一个专攻网络安全的孪生兄弟 Gemini 3.8 Flash Cyber。
这是六周内的第三款 Flash。3.6 Flash 在 7 月 21 日,3.7 Flash 在 8 月 13 日,3.8 Flash 在 9 月 2 日。间隔稳定得像是设了定时任务。
说实话,我看着这个节奏有点恍惚。以前我们追模型发布会,一年等一次,还得提前囤好瓜子。现在倒好,Gemini 更新得比我手机上的 App 还勤——你刚把 3.7 的 prompt 调顺,3.8 就敲门了。
但换个角度想:这说明 Flash 这条线对谷歌来说已经不是"实验品",而是真正压在生产流水线上的主力。搜索的 AI 模式、Gemini App 免费层、AI Studio、Antigravity,全靠它扛量。谷歌有十足的动力让它每周变强一点。
今天这篇,把 3.8 Flash 是什么、强在哪、真实效果如何、怎么上手,一次性说清楚。
什么是 Gemini 3.8 Flash
Gemini 3.8 Flash 是 Google DeepMind 于 2026 年 9 月 2 日发布的通用主力模型,模型 ID 为 gemini-3.8-flash,基于 3.7 Flash 迭代而来。
官方对它的定位是:"our most intelligent workhorse model"(迄今最聪明的主力干活模型),专门为长程软件工程(long-horizon software engineering)、自主智能体(autonomous agents)和复杂企业工作流而设计。
它和 3.7 Flash 的核心区别,用谷歌官方博客的原话说是:"3.8 Flash works harder."(3.8 Flash 干活更卖力。)
具体表现是:遇到复杂任务时,它会多走几步推理、反复调用工具、边做边检查自己的结果,而不是像上一代那样急着吐出一个答案。官方把这叫"长时间运行的智能体循环"(long-running agentic loops)——模型会递归地评估和打磨自己的输出。
这句话听起来像套话,但体感差异很明显。用过 3.7 Flash 写复杂代码的人大概都有过这种体验:它跑得飞快,但也经常"想当然"——代码一甩就完事,跑不跑得通它不太管。3.8 Flash 明显更"轴"一点,会自己回头验一遍。代价是token 花得更多,后面会细说。
Gemini 3.8 Flash 的核心特点
- 百万级上下文窗口:输入上限 1,048,576 token(约 100 万),输出上限 65,536 token(64K)。整本技术书、几小时视频、一个中等规模代码库,一次塞进去。
- 原生多模态输入:支持文本、图片、音频、视频、PDF 五种输入,输出为文本。同一条管线处理看视频、读财报、听录音、解析图纸。
- 三档可调推理强度:
low/medium/high,接口结构和 3.7 Flash 一致。简单问答调低省钱,复杂 Agent 任务调高换质量。 - 长程智能体循环:官方这次的主打。模型会自主拆任务、调工具、检查中间结果、再修正,适合跑起来就没人盯的自动化流程。
- 工具调用全家桶:支持函数调用(Function Calling)、搜索即工具(Search as a tool)、计算机操作(Computer use)、结构化输出、系统指令、上下文缓存。
- 速度依然是 Flash 级:通过 Google API 输出速度约 304.6 tokens/秒,而同价位的推理模型中位数只有 70.8 tokens/秒——快了 4 倍多。
- 全渠道铺开:Gemini App(AI Pro / Ultra 订阅)、Search 的 AI Mode、Gemini in Google Sheets、Google AI Studio、Gemini API、Android Studio、Google Antigravity、Gemini Enterprise 全部上线。第三方生态里,Cursor 在发布当天就接入了,LiteLLM 也是 day-zero 支持。
能拿它干什么(附真实案例与数据)
一条 prompt 生成一个能玩的 DOS 版 Google Maps。 官方演示:在 Antigravity 里给一句话指令,3.8 Flash 直接造出一个完整可玩的 DOS 风格地图程序,带地点查询、路线规划和街景。不是截图,是真能跑的程序。
一条 prompt 生成可玩的 3D 游戏。 同样在 Antigravity 里,用一句循环指令生成一个 3D 城堡关卡,你扮演巫师在里面解谜冒险,场景贴图用 Nano Banana 实时生成。
硬件拆解可视化。 官方在 AI Studio 里做的 Demo 叫 Hardware Anatomy:输入一台设备,3.8 Flash 用 Three.js 生成物理比例准确的 3D 拆解图,带一个"拆解滑块",可以把设备一层层炸开看内部构造。
真实地形剖面交互图。 接入美国地质调查局(USGS)的真实数据集,生成的地形图支持实时剖面、2D 投影和科学解释——数据是真的,不是编的。
企业里的实际收益。 安全公司 Wiz 在内部渗透测试基准上实测:3.8 Flash Cyber 比其他前沿模型召回率高 7.5~9.7 个百分点,而成本只有 1/2.3 到 1/5.2。谷歌内部 Chrome 安全团队的实测结果是:正确漏洞补丁的数量是最佳商用模型的 2.6 倍。
开发者社区的真实反馈。 Simon Willison 用 3.8 Flash 做了个 HTML 小实验,13 秒跑完,花了 1.8 美分。Vals AI 的 Vibe Code Bench 测试显示,50 个生成的应用里"零分废品"从 3.7 的 5 个降到 1 个。
基准测试:全线上涨,但不是全都第一
下面是官方模型卡(2026 年 9 月)公布的数据,领先项已加粗:
| 基准测试 | 测的是什么 | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | 长程软件工程 | 73.7% | 65.3% | 74.0% | 53.8% | 72.7% | 69.6% |
| Terminal-bench 2.1 | 终端智能体编码 | 89.4% | 85.8% | 89.1% | 80.4% | 88.8% | 87.4% |
| OSWorld-2.0 | 计算机操作(Agentic) | 59.0% | 50.6% | 75.4% | 42.6% | 62.6% | 50.2% |
| Terminal-bench 4.0 | 通用智能体能力 | 19.1% | 11.2% | 51.8% | 12.4% | 37.3% | 23.6% |
| Vals Finance Agent v2 | 金融分析任务 | 61.4% | 59.0% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey 法律 Agent | 复杂法律工作流 | 10.0% | 8.8% | 6.7% | 5.0% | 2.5% | 0.8% |
| HLE-Verified | 跨学科专家推理 | 54.9% | 53.6% | 54.4% | 31.0% | 54.5% | 51.1% |
| GDPVal-AA v2 | 知识工作(Elo) | 1545 | 1482 | 1824 | 1584 | 1710 | 1528 |
| GDP.PDF | 专家级 PDF 理解 | 35.0% | 34.0% | 37.0% | 28.0% | 40.0% | 29.0% |
| CharXiv Reasoning | 复杂图表信息综合 | 86.2% | 84.5% | 83.7% | 70.1% | 85.8% | 85.9% |
| LVBench | 长视频理解 | 87.8%(agentic) | 85.4% | 75.4% | 68.5% | 82.1% | 78.9% |
| LABBench2 | 生物真实研究任务 | 86.2% | 82.1% | 84.2% | 80.1% | 82.1% | 81.2% |
这张表我盯了很久,结论是这样的:在有明确目标、可以分步骤推进的任务上(写代码、跑终端、做金融/法律分析、读长视频),3.8 Flash 已经摸到甚至超过了 Opus 5 这样的旗舰模型——DeepSWE 只差 0.3 个百分点,Terminal-bench 2.1 反超 0.3 个点,法律 Agent 直接是 Opus 5 的 1.5 倍。
但在"通用智能体能力"这种需要长程规划、判断和从错误中恢复的开放式任务上,差距还是肉眼可见的:Terminal-bench 4.0 只有 19.1%,Opus 5 是 51.8%,接近三倍;OSWorld 计算机操作 59.0% vs 75.4%;GDPVal 的 Elo 差了快 300 分。
所以我的判断很明确:3.8 Flash 是"有边界的工程任务"的性价比之王,不是"什么都能干"的万能选手。 别拿它去替代旗舰模型跑无人值守的开放任务,那是花钱买教训。
一个必须说的坑:单价没涨,但账单涨了
这是本次发布最容易被忽略的一点,也是我觉得最值得提醒小白的地方。
token 单价确实和 3.7 Flash 一模一样,但 Artificial Analysis 实测:高推理档位下,完成单个任务的成本从 3.7 的 $0.40 涨到了 $0.58,贵了约 40%。原因是输出 token 多了约 30%,加上智能体跑的轮次更多。单任务耗时也从 2.2 分钟变成 2.5 分钟。
翻译成人话:模型"更努力"是真的,但"更努力"是要烧钱的。 它多想的那几步,账算在你头上。
这也是为什么谷歌把推理强度做成三档可选。如果你跑的是海量简单请求,老老实实调
low,别让模型在"你好"这种问题上深度思考。
另外一个兄弟:Gemini 3.8 Flash Cyber
同场发布的还有 Gemini 3.8 Flash Cyber,是基于同一底座训练的网络安全专用模型,专攻漏洞发现和自动打补丁。
关键数据:
| 测试项 | 成绩 | 说明 |
|---|---|---|
| CyberGym(漏洞发现) | 86.2% pass@1 | 超过 3.5 Flash Cyber 及更大的前沿模型 |
| CWE-Bench(自动打补丁) | 47.2% pass@1 | 处于帕累托最优前沿,接近头部模型的 47.8%,成本更低 |
| 内部 20 种语言漏洞发现 | > 70% | 覆盖 C/C++ 之外的 20 种编程语言复杂代码库 |
| Chrome 安全团队实测 | 2.6 倍 | 正确漏洞补丁数是最佳商用模型的 2.6 倍 |
| Wiz 渗透测试召回率 | +7.5~9.7 个百分点 | 同时成本低 2.3~5.2 倍 |
谷歌云漏洞研究团队用它,不到两小时挖出一个严重漏洞——这类工作人工通常要几个月。
但你大概率用不上它。 Flash Cyber 通过全新的 Fairwind Program 定向开放,首批只面向:国家网络安全机构、关键基础设施运营方、广泛使用的开源软件维护者、Google Cloud 客户和网络安全合作方。它配套谷歌的漏洞修复智能体 CodeMender,可以在企业自己的安全云环境里,几分钟内生成可直接部署的补丁——而不是几周。
谷歌在这件事上的态度我挺认同:明确说了优先做漏洞修复,而不是漏洞利用。模型能力开放给防守方,不开放给攻击方。在 AI 安全这个议题上,这种克制比跑分更值得尊重。
价格怎么算
| 计费项 | 入门价(2026-12-31 前) | 常规价(2027-01-01 起) |
|---|---|---|
| 输入(每百万 token) | $0.75 | $1.50 |
| 输出(每百万 token) | $3.75 | $7.50 |
入门价到 2026 年 12 月 31 日截止,2027 年 1 月 1 日起翻倍。这个价格和 3.7 Flash 完全一致,算是"加量不加价"。
横向比一下就知道有多狠:Claude Opus 5 输出要 $25/百万 token,是 3.8 Flash 的 6.6 倍;GPT-5.6 Sol 输出 $20/百万,也贵了 5 倍多。
我的建议:如果你已经在用 3.7 Flash,直接升,接口兼容、价格不变,几乎没有迁移成本。 如果你还在观望,现在到年底这段时间是最便宜的窗口,先跑起来再说。
快速上手 Gemini 3.8 Flash
完全不懂代码的新手:打开 Gemini App 或 Google AI Studio,直接对话就行,零配置。AI Pro / Ultra 订阅用户已经默认可用。
开发者:在 AI Studio 的模型选择器里选 gemini-3.8-flash,或者直接调 Gemini API。
最简 Python 调用:
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="用三段话解释一下什么是 MoE 混合专家架构",
)
print(response.text)想控制推理强度(省钱的关键),加上 thinking 配置:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="帮我重构这个函数,要求保持接口不变并补充单元测试",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="high") # low / medium / high
),
)
print(response.text)从 3.7 Flash 迁移要改几个地方?一个。 把模型 ID 从 gemini-3.7-flash 换成 gemini-3.8-flash,API 完全兼容,参数结构都没动。
唯一需要注意的是 token 消耗:如果你的 Agent 循环是按 3.7 的成本预算写的,切到 3.8 之后预算可能要上调 30%~40%。建议先把 thinking_level 设成 medium 跑一轮压测,看看实际账单再决定。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档