Gemini 3.8 Live 与 Extended Thinking:语音助手终于学会了边说话边干活
先说一个所有人都经历过、但没人当回事的场景。
你对着手机说完一句话,然后——沉默。
一秒、两秒,屏幕上那个小圆圈转啊转。等它终于开口,你刚才想说的后半句已经忘了一半。
人类对话里,这个间隔的合理值是 200 毫秒左右。超过 400 毫秒,你就会觉得对方反应慢;超过 1 秒,你会怀疑他是不是在敷衍你。
而我们居然容忍智能语音助手"思考"两秒钟,还觉得挺自然。
2026 年 9 月 15 日,谷歌发布的两款模型,冲的就是这件事。
什么是 Gemini 3.8 Live
Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,是谷歌目前最先进的实时语音对话模型(官方原话:most advanced live dialogue models),由 Gemini Audio 团队的 Tom Ouyang 和 Malini Jaganathan 发布。
两者分工明确:
- Gemini 3.8 Live:面向规模化部署和成本优化。兼顾对话智能、流畅交流和视觉理解,主打高并发、低单价
- Gemini 3.8 Live Extended Thinking:面向高复杂度任务。一边推理一边说话,适合需要多步推理、后台执行的活儿
顺带一个容易踩的认知坑:这俩名字里带 "Live",但底层不是 Flash 系列,模型卡上写得很清楚,它们基于 Gemini 3 Pro 构建。别按 Flash 的心智去估它的成本和能力。
核心变革:拆掉了那根"传话筒"
以前的语音助手(包括很多现在还在跑的),走的是一条叫**级联架构(cascaded architecture)**的路子:
你说话 → ASR 转成文字 → 大模型读文字生成文字 → TTS 转成语音 → 你听到三段流水线,每段都要时间,而且每段都在丢信息。你的语气、停顿、犹豫、画面里的东西,在第一段就被抹平成一个字符串了。
3.8 Live 是原生 speech-to-speech:音频进,音频出,中间没有转文字这一步。
这个改变带来一个体验上的质变——它能处理你中途插话。因为模型没有"等你说完再转录"这个阶段,你一句话说到一半改主意,它当场就能接住。
对比一下核心参数:
| 项目 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
|---|---|---|
| 定位 | 规模化、低成本 | 高复杂度、多步推理 |
| 底层 | Gemini 3 Pro | Gemini 3 Pro |
| 上下文窗口 | 128,000 token | 128,000 token |
| 输出上限 | 64,000 token | 64,000 token |
| 语言 | 97 种,对话中自动切换 | 97 种,对话中自动切换 |
| 推理强度 | 默认 | 可配置 thinking_level:low / medium / high |
| 函数调用 | 异步,默认 NON_BLOCKING,可选调度 | 异步,仅支持 NON_BLOCKING |
五个让你省心的地方
官方把这次的能力拆成五条,我按"实际开发中哪个最救命"排了个序:
- 异步函数调用(Asynchronous function calling):这是最狠的一条。模型可以在后台跑 API 和工具调用,同时继续跟你说话。以前 tool call 期间语音流必须挂起或者塞 filler 词,现在它对答如流,任务在后台默默跑完
- 视觉上下文(Visual context):近实时处理摄像头画面,同时听懂你说的和看到的。注意 Live API 的规格是 JPEG 图片,最多 1 帧/秒
- 字母数字精度(Alphanumeric precision):能准确解析确认码、理赔号、技术参数。做过语音客服系统的都知道这有多重要——老 ASR 把 "AB12C3" 听成 "AB 一三 C" 是家常便饭
- 多语言(Multilingual):97 种以上语言,对话中途自动检测并切换,还能保持口音一致性。一句中文夹一句英文它也认
- 增量内容更新(Incremental content updates):实时音频流和结构化数据混着返回,响应是带上下文的
Extended Thinking 额外多了个有意思的行为:它会用早期口头提示(比如 "Let me check that…")自然地接住你的请求,然后边干活边播报进度。这个设计比转圈等待高明太多了。
我的立场:这五条里真正值钱的是第一条和第三条。前四条里的视觉和语言,别人也在卷;但"边说话边跑工具"加上"确认码不会听错",是直接决定一套语音客服系统能不能上生产的两件事。
Benchmark:一分之差,四倍之差
Extended Thinking 在 Artificial Analysis 的**语音到语音质量指数(Speech to Speech Quality Index)**上拿了 82.6 分,总榜第一。
尴尬的是,OpenAI 五天前刚发布了 GPT-Live-1。
这张表值得细看:
| 评测项 | Gemini 3.8 Live Extended Thinking | OpenAI GPT-Live-1(Astra, medium) |
|---|---|---|
| Speech to Speech 质量指数 | 82.6 | 81.5 |
| Big Bench Audio(语音推理) | 98% | 90% |
| τ-Voice(客服任务完成率) | 68.6% | 67.9% |
| Full Duplex Bench(打断与停顿) | 91.9% | 94.9% |
| 首个音频响应时间(TTFA) | 1.35 秒 | 1.34 秒 |
| 每小时输入音频成本 | $3.50 | $5.83 |
谷歌的其他成绩:Sierra 的 τ-Voice-banking 35.1%,Big Bench Audio 97.7%。Gemini 3.8 Live 则在 Speech Agent Arena(人类偏好评测)拿到第二名。在 ServiceNow 的 EVA-Bench 语音智能体基准上,谷歌称两款模型推高了复杂工作流的帕累托前沿(该评测跑在 Gemini Enterprise Agent Platform 的 Live API 上)。
几个需要你自己判断的地方:
质量榜差 1.1 分,谷歌把它叫"总体第一",但没说差距。而在 Full Duplex Bench(打断处理)上 GPT-Live-1 是 94.9% 对 91.9%,明显领先——这正是最影响"像不像真人聊天"的那个指标。
另外 Artificial Analysis 自己也注明了:GPT-Live-1 那一行只跑了一次,其他模型大多跑三次。也就是说 OpenAI 那一列噪声更大,别把它当成精确结论。
真正的差距在钱上:$3.50 对 $5.83,接近一倍。
还有个坑,我必须提前告诉你:两个模型官方价目表是同一行,但账单能差四倍。
Extended Thinking 会生成 thinking token,按输出费率计费。Artificial Analysis 在同一组固定任务上实测:Extended Thinking 每小时输入音频 $3.50,纯 Gemini 3.8 Live 只要 $0.84。
同样的标价,四倍的发票。
真实场景:官方演示里藏着它的能力边界
谷歌放了一堆演示视频,挑几个我觉得信息量最大的说:
Gemini 3.8 Live 这边:
- 实时员工入职引导:摄像头对着办公环境,员工边问边答,模型看着画面给回应
- 近实时下棋:这个演示挺刁钻的,要求模型持续跟踪快速变化的视觉状态
- 纯语音生成整套商业计划和定制化营销工具包
- Search Live 里的分步排障:真人维修设备的场景,一步一步口述指导
Extended Thinking 这边:
- 把草图 + 实时语音反馈变成可用的 React 组件:我承认这个 Demo 有点秀,但它展示的是"视觉 + 推理 + 代码生成"在一段不中断对话里跑完
- 通过异步函数调用协调多步餐厅预订,全程对话不中断
- 在 Google Workspace 里跨 Docs Live、Gmail Live、Keep Live 工作
冷静一句:演示视频和真实使用之间,通常隔着三到五个"它没听错但理解反了"。看到这种丝滑 Demo,先想想你自己的网络抖动、背景噪音和用户的塑料普通话再说。
快速上手
第一步:零成本先玩起来
直接开 ai.studio/live,选模型 gemini-3.8-live 或 gemini-3.8-live-extended-thinking,点麦克风就能聊。不用写代码,不用信用卡。
想抄完整的样例应用,官方仓库在 github.com/google-gemini/gemini-live-api-examples。
第二步:搞清 Live API 的物理规格
这块官方文档写得很细,做接入前必须知道:
- 传输:有状态的 WebSocket 长连接,不是轮询
- 音频输入:raw 16-bit PCM,16kHz 单声道
- 音频输出:raw 16-bit PCM,24kHz
- 视觉输入:JPEG,最多 1 帧/秒
- 文本:支持
- 两种部署形态
- server-to-server:你的后端把客户端流转发给 Live API(推荐,API Key 不暴露)
- client-to-server:前端直连 WebSocket(延迟更低,但要处理鉴权)
一句提醒:生产环境老实走 server-to-server。API Key 放在前端等于把银行卡贴在公告栏上,这事我见过太多团队踩。
第三步:Python 最小骨架
from google import genai
from google.genai import types
client = genai.Client(api_key="YOUR_API_KEY")
config = types.LiveConnectConfig(
response_modalities=["AUDIO"],
speech_config=types.SpeechConfig(
voice_config=types.VoiceConfig(
prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Puck")
)
),
)
# Extended Thinking 才需要:配置推理强度
# config.thinking_config = types.ThinkingConfig(thinking_level="medium")
async with client.aio.live.connect(
model="gemini-3.8-live", # 或 gemini-3.8-live-extended-thinking
config=config,
) as session:
async for response in session.receive():
if response.data:
play_audio(response.data) # 24kHz 16-bit PCM 裸流发声人可以用 Google TTS 的任意音色,在 speechConfig 里填 voice_name 就行。
第四步:如果你不想自己搭媒体管线
实时音视频的基础设施(回声消除、丢包补偿、抖动缓冲)是另一套坑。官方合作平台已经把 Live API 接好了:
Agora · Fishjam · LangChain · LiveKit · Pipecat · Vercel · Vision Agents
企业侧,谷歌宣布与 Salesforce、Genspark、Lumeris 合作,他们看中的都是同一件事:延迟、流畅度和工具调用。
第五步:注意会话时长这道硬墙
这条官方文档有明示,很多人是部署后才发现:
- 纯音频会话:最长 15 分钟
- 音频 + 视频会话:最长 2 分钟
加上 128K 上下文窗口,长对话是被"时钟"和"窗口"双重限制的。做长会话要在应用层自己做会话续接。
价格:把账算清楚
| 项目 | 费率(付费档) |
|---|---|
| 文本输入 | $0.75 / 百万 token |
| 文本输出(含 thinking token) | $4.50 / 百万 token |
| 音频输入 | $3.00 / 百万 token,约 $0.005 / 分钟 |
| 音频输出(含 thinking token) | $12.00 / 百万 token,约 $0.018 / 分钟 |
| 图像 / 视频输入 | $1.00 / 百万 token,约 $0.002 / 分钟 |
补充三条容易忽略的:
- 免费档真实存在,通过 Google AI Studio 可用。代价是免费档的输入数据会被用于改进谷歌产品,付费档不会
- Search grounding 每月前 5,000 次免费(所有 Gemini 3.x 共享额度),超出后 $14 / 千次
- 官方$0.018/分钟那个数字带星号,它是基于 token 单价折算的估值,不是固定费率
给你个算账的锚点:同样一组任务,Extended Thinking 实测成本约 $3.50/小时输入音频,而 Gemini 3.8 Live 只要 $0.84。如果你的场景主要是闲聊、问答、简单指令,用 3.8 Live;只有真的需要多步推理时才切 Extended Thinking,并且把 thinking_level 先压到 low 试。
我自己的选择策略:默认全部走 Gemini 3.8 Live,只对明确标记为"复杂多步"的意图路由到 Extended Thinking。别一上来全场 Extended Thinking,那账单会教你做人。
我在哪能用上
这次的分发铺得很开,但也意味着入口很乱,我帮你理一遍:
| 渠道 | Gemini 3.8 Live | Extended Thinking |
|---|---|---|
| Gemini API | ✅ 已上线 | ✅ 已上线 |
| Google AI Studio | ✅ 已上线(含免费档) | ✅ 已上线 |
| Search Live | ✅ 所有人可用 | — |
| Gemini Live(App) | — | ✅ |
| Google Workspace · Docs | — | ✅ Google AI Pro / Ultra 订阅用户 |
| Google Workspace · Gmail、Keep | — | ✅ 所有 Google AI 订阅用户 |
| Gemini Enterprise | ✅ 私有预览 | ✅ 私有预览 |
| Gemini Enterprise for CX | 即将推出 | 即将推出 |
| Workspace 商业版 | — | 即将推出 |
国内用户照例注意:以上服务存在地区限制,动手前先确认服务可用性。
顺带一提:Gemini 3.5 Transcribe
同一批发布的还有 Gemini 3.5 Transcribe(上个月就出了),谷歌这次一并推:
- 85+ 语言,平均词错误率(WER)流式 4.0%、非流式 2.6%
- 自动语码转换:句内、句间中英文混说不用手动配置
- 自定义词汇偏置:传
custom_vocabulary列表,最多 1,000 个词,把识别拉向你的行业黑话、公司名、专有名词 - 智能转写模式:自动去除填充词("那个…嗯…")、自我修正、输出结构化排版,直接可读
- 通过 Interactions API 还能转写最长 1 小时的音频文件,带时间戳和说话人标注
如果你只需要"听写",不需要"对话",Transcribe 比 Live 便宜得多,别用错工具。
顺手把谷歌现在的音频全家桶列一下,免得选型时漏:Gemini 3.5 Live Translate(70+ 语言语音到语音翻译)、Gemini 3.1 Flash TTS(可配置语音生成)、Lyria 3.5(音乐生成)。
最后两句实话
语音 AI 这两年一直在解决一个伪装成技术问题的问题:如何让机器不打断你。
级联架构的解法是"等你把话说完",代价是每次停顿都要付 1.5 秒 latency。3.8 Live 的解法是——它一直在听,也一直在处理能力范围内提前想。
还有个细节我认为比 benchmark 第一名更能说明方向:所有生成的音频都带 SynthID 数字水印,嵌在波形里听不出来,但可被检测。谷歌在造假成本几乎为零的时代,把"这是我生成的"这件事做进了产品底层。
这个设计,比多一分的性能更值得鼓掌。
至于 82.6 和 81.5 谁更强?说实话,差 1.1 分的排行榜名次,对你要做的那个客服机器人来说,重要性远低于**"确认码会不会听错"和"一千路并发每小时要花多少钱"**。
先去 ai.studio/live 开麦聊十分钟,比看十张 benchmark 表有用。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档