Gemini 3.6 Flash 模型介绍
2026年7月21日,谷歌 DeepMind 悄然上线了 Gemini 3.6 Flash。没有铺天盖地的发布会,没有 I/O 大会的聚光灯——但这个"小更新",可能是开发者真正该关注的那一个。
为什么?因为它把 3.5 Flash 的输出价格直接砍了 17%,还顺手解决了前代"话太多"的老毛病。
谷歌的模型命名越来越像手机迭代了:大版本号是能力跃迁,小版本号是体验打磨。3.6 Flash 就是那个"打磨到位"的版本。
什么是 Gemini 3.6 Flash
Gemini 3.6 Flash 是谷歌 DeepMind 于 2026年7月21日 正式发布的生产级模型(GA,Stable 稳定版),模型 ID 为 gemini-3.6-flash。
它的定位非常明确:为智能体(Agentic)时代设计的主力工作模型。官方称其为 "workhorse model"——翻译过来就是"干活的马",承担日常复杂工作的主力任务。
核心关键词有三个:
- 速度与智能的平衡:在保持前沿智能水平的同时,提供更高的推理速度和更低的成本
- 智能体原生:擅长代码生成、智能体执行和多步推理循环
- 空间推理:在空间理解和推理任务上有显著提升
同一天发布的还有两款模型:
| 模型 | 模型 ID | 定位 |
|---|---|---|
| Gemini 3.6 Flash | gemini-3.6-flash | 主力工作模型,速度与智能平衡 |
| Gemini 3.5 Flash-Lite | gemini-3.5-flash-lite | 最快最便宜,高吞吐量场景 |
| Gemini 3.5 Flash Cyber | — | 网络安全专用,暂不公开 |
值得注意的是,市场翘首以盼的旗舰 Gemini 3.5 Pro 再次缺席,仍处于封闭开发阶段。而据 Alphabet Q2 财报透露,大量算力已倾斜到 Gemini 4 的预训练中。
Gemini 3.6 Flash 的核心特点
1. 更省 Token,更低价格
这是 3.6 Flash 最实在的升级。对比前代 3.5 Flash:
| 指标 | Gemini 3.5 Flash | Gemini 3.6 Flash | 变化 |
|---|---|---|---|
| 输入价格(每百万Token) | $1.50 | $1.50 | 持平 |
| 输出价格(每百万Token) | $9.00 | $7.50 | ↓ 17% |
| 输出Token消耗 | — | — | ↓ 17% |
| 上下文缓存价格 | $0.15 | $0.15 | 持平 |
简单算笔账:如果你每天输出 100 万 Token,3.5 Flash 花费 $9,3.6 Flash 只要 $7.5。一个月下来省 $45,一年省 $540。对高频调用的开发者来说,这不是小钱。
2. 解决了"话太多"的问题
3.5 Flash 有一个被开发者广泛吐槽的问题:输出过于冗长(output verbosity)。明明三句话能说清的事,非要写五段。
3.6 Flash 直接针对这个问题做了优化——输出更精炼,Token 消耗减少 17%。这不仅仅是省钱,更重要的是智能体执行效率的提升。在多步 Agent 循环中,每一步的输出都是下一步的输入,冗长的输出会导致上下文膨胀、延迟增加、成本翻倍。
3. 智能体与编码能力强化
3.6 Flash 专为智能体时代设计,在以下场景表现突出:
- 代码生成:支持复杂编码循环和迭代
- 智能体执行:快速 Agentic 循环,适合需要频繁工具调用的场景
- 空间推理:对物理世界和空间关系的理解更强
4. 完整的能力支持
| 能力 | 支持情况 |
|---|---|
| 输入类型 | 文本、图片、视频、音频、PDF |
| 输出类型 | 文本 |
| 思考(Thinking) | ✅ 支持 |
| 函数调用(Function Calling) | ✅ 支持 |
| 代码执行 | ✅ 支持 |
| 文件搜索 | ✅ 支持 |
| Google 搜索接地 | ✅ 支持 |
| 结构化输出 | ✅ 支持 |
| URL 上下文 | ✅ 支持 |
| 计算机使用(Computer Use) | ✅ 预览版 |
| Google Maps 接地 | ✅ 支持 |
| 上下文缓存 | ✅ 支持 |
| 批量 API | ✅ 支持 |
| Flex/Priority 推理 | ✅ 支持 |
| 图片生成 | ❌ 不支持 |
| 音频生成 | ❌ 不支持 |
| Live API | ❌ 不支持 |
5. 超长上下文窗口
| 参数 | 数值 |
|---|---|
| 输入Token限制 | 1,048,576(约100万) |
| 输出Token限制 | 65,536(约6.5万) |
100 万 Token 的上下文窗口意味着可以一次性输入整本书籍、几小时的视频或庞大的代码库。
三款 Flash 模型怎么选
同一天发布的三款 Flash 模型,定位各有侧重:
| 模型 | 输入价格 | 输出价格 | 适合场景 |
|---|---|---|---|
| 3.6 Flash | $1.50 | $7.50 | 日常复杂任务的主力模型,智能体循环、编码 |
| 3.5 Flash | $1.50 | $9.00 | 需要最强智能体和编码能力的场景 |
| 3.5 Flash-Lite | $0.30 | $2.50 | 高吞吐量自动化、子智能体(subagent) |
选型建议:
- 日常开发选 3.6 Flash——能力够用,价格最优
- 需要极致智能选 3.5 Flash——贵但有道理
- 大批量低延迟选 3.5 Flash-Lite——5倍价差,量力而行
- 都有免费层,可以先用后买
快速上手 Gemini 3.6 Flash
通过 Google AI Studio
- 访问 Google AI Studio(需要科学上网)
- 在模型选择器中选择
gemini-3.6-flash - 直接开始对话
通过 API 调用
from google import genai
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="解释一下什么是 MoE 架构",
)
print(response.text)启用思考模式
3.6 Flash 支持思考(Thinking)能力,可以通过 thinking_level 参数控制推理深度:
from google import genai
from google.genai import types
client = genai.Client()
response = client.models.generate_content(
model="gemini-3.6-flash",
contents="分析这段代码的时间复杂度:[代码]",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.text)💡 小贴士:
thinking_level支持low和high两个等级。简单任务用low省钱省时间,复杂推理用high获得更深的分析。
进阶
Gemini 3.6 Flash 已经在 Google AI Studio 和 Gemini API 中正式可用,免费层和付费层均已开放。如果你正在使用 3.5 Flash,迁移到 3.6 Flash 几乎零成本——模型 ID 换一下就行,API 接口完全兼容。
更多 Google AI 最新动态和中文教程,持续更新中。
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档