Skip to content

Gemini 3.6 Flash 模型介绍

2026年7月21日,谷歌 DeepMind 悄然上线了 Gemini 3.6 Flash。没有铺天盖地的发布会,没有 I/O 大会的聚光灯——但这个"小更新",可能是开发者真正该关注的那一个。

为什么?因为它把 3.5 Flash 的输出价格直接砍了 17%,还顺手解决了前代"话太多"的老毛病。

谷歌的模型命名越来越像手机迭代了:大版本号是能力跃迁,小版本号是体验打磨。3.6 Flash 就是那个"打磨到位"的版本。

什么是 Gemini 3.6 Flash

Gemini 3.6 Flash 是谷歌 DeepMind 于 2026年7月21日 正式发布的生产级模型(GA,Stable 稳定版),模型 ID 为 gemini-3.6-flash

它的定位非常明确:为智能体(Agentic)时代设计的主力工作模型。官方称其为 "workhorse model"——翻译过来就是"干活的马",承担日常复杂工作的主力任务。

核心关键词有三个:

  • 速度与智能的平衡:在保持前沿智能水平的同时,提供更高的推理速度和更低的成本
  • 智能体原生:擅长代码生成、智能体执行和多步推理循环
  • 空间推理:在空间理解和推理任务上有显著提升

同一天发布的还有两款模型:

模型模型 ID定位
Gemini 3.6 Flashgemini-3.6-flash主力工作模型,速度与智能平衡
Gemini 3.5 Flash-Litegemini-3.5-flash-lite最快最便宜,高吞吐量场景
Gemini 3.5 Flash Cyber网络安全专用,暂不公开

值得注意的是,市场翘首以盼的旗舰 Gemini 3.5 Pro 再次缺席,仍处于封闭开发阶段。而据 Alphabet Q2 财报透露,大量算力已倾斜到 Gemini 4 的预训练中。

Gemini 3.6 Flash 的核心特点

1. 更省 Token,更低价格

这是 3.6 Flash 最实在的升级。对比前代 3.5 Flash:

指标Gemini 3.5 FlashGemini 3.6 Flash变化
输入价格(每百万Token)$1.50$1.50持平
输出价格(每百万Token)$9.00$7.50↓ 17%
输出Token消耗↓ 17%
上下文缓存价格$0.15$0.15持平

简单算笔账:如果你每天输出 100 万 Token,3.5 Flash 花费 $9,3.6 Flash 只要 $7.5。一个月下来省 $45,一年省 $540。对高频调用的开发者来说,这不是小钱。

2. 解决了"话太多"的问题

3.5 Flash 有一个被开发者广泛吐槽的问题:输出过于冗长(output verbosity)。明明三句话能说清的事,非要写五段。

3.6 Flash 直接针对这个问题做了优化——输出更精炼,Token 消耗减少 17%。这不仅仅是省钱,更重要的是智能体执行效率的提升。在多步 Agent 循环中,每一步的输出都是下一步的输入,冗长的输出会导致上下文膨胀、延迟增加、成本翻倍。

3. 智能体与编码能力强化

3.6 Flash 专为智能体时代设计,在以下场景表现突出:

  • 代码生成:支持复杂编码循环和迭代
  • 智能体执行:快速 Agentic 循环,适合需要频繁工具调用的场景
  • 空间推理:对物理世界和空间关系的理解更强

4. 完整的能力支持

能力支持情况
输入类型文本、图片、视频、音频、PDF
输出类型文本
思考(Thinking)✅ 支持
函数调用(Function Calling)✅ 支持
代码执行✅ 支持
文件搜索✅ 支持
Google 搜索接地✅ 支持
结构化输出✅ 支持
URL 上下文✅ 支持
计算机使用(Computer Use)✅ 预览版
Google Maps 接地✅ 支持
上下文缓存✅ 支持
批量 API✅ 支持
Flex/Priority 推理✅ 支持
图片生成❌ 不支持
音频生成❌ 不支持
Live API❌ 不支持

5. 超长上下文窗口

参数数值
输入Token限制1,048,576(约100万)
输出Token限制65,536(约6.5万)

100 万 Token 的上下文窗口意味着可以一次性输入整本书籍、几小时的视频或庞大的代码库。

三款 Flash 模型怎么选

同一天发布的三款 Flash 模型,定位各有侧重:

模型输入价格输出价格适合场景
3.6 Flash$1.50$7.50日常复杂任务的主力模型,智能体循环、编码
3.5 Flash$1.50$9.00需要最强智能体和编码能力的场景
3.5 Flash-Lite$0.30$2.50高吞吐量自动化、子智能体(subagent)

选型建议

  • 日常开发选 3.6 Flash——能力够用,价格最优
  • 需要极致智能选 3.5 Flash——贵但有道理
  • 大批量低延迟选 3.5 Flash-Lite——5倍价差,量力而行
  • 都有免费层,可以先用后买

快速上手 Gemini 3.6 Flash

通过 Google AI Studio

  1. 访问 Google AI Studio(需要科学上网)
  2. 在模型选择器中选择 gemini-3.6-flash
  3. 直接开始对话

通过 API 调用

Python
from google import genai

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="解释一下什么是 MoE 架构",
)

print(response.text)

启用思考模式

3.6 Flash 支持思考(Thinking)能力,可以通过 thinking_level 参数控制推理深度:

Python
from google import genai
from google.genai import types

client = genai.Client()

response = client.models.generate_content(
    model="gemini-3.6-flash",
    contents="分析这段代码的时间复杂度:[代码]",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)

print(response.text)

💡 小贴士thinking_level 支持 lowhigh 两个等级。简单任务用 low 省钱省时间,复杂推理用 high 获得更深的分析。

进阶

Gemini 3.6 Flash 已经在 Google AI Studio 和 Gemini API 中正式可用,免费层和付费层均已开放。如果你正在使用 3.5 Flash,迁移到 3.6 Flash 几乎零成本——模型 ID 换一下就行,API 接口完全兼容。

更多 Google AI 最新动态和中文教程,持续更新中。

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档