Skip to content

Gemini 3.8 Live 与 Extended Thinking:语音助手终于学会了边说话边干活

先说一个所有人都经历过、但没人当回事的场景。

你对着手机说完一句话,然后——沉默。

一秒、两秒,屏幕上那个小圆圈转啊转。等它终于开口,你刚才想说的后半句已经忘了一半。

人类对话里,这个间隔的合理值是 200 毫秒左右。超过 400 毫秒,你就会觉得对方反应慢;超过 1 秒,你会怀疑他是不是在敷衍你。

而我们居然容忍智能语音助手"思考"两秒钟,还觉得挺自然。

2026 年 9 月 15 日,谷歌发布的两款模型,冲的就是这件事。

什么是 Gemini 3.8 Live

Gemini 3.8 LiveGemini 3.8 Live Extended Thinking,是谷歌目前最先进的实时语音对话模型(官方原话:most advanced live dialogue models),由 Gemini Audio 团队的 Tom Ouyang 和 Malini Jaganathan 发布。

两者分工明确:

  • Gemini 3.8 Live:面向规模化部署和成本优化。兼顾对话智能、流畅交流和视觉理解,主打高并发、低单价
  • Gemini 3.8 Live Extended Thinking:面向高复杂度任务。一边推理一边说话,适合需要多步推理、后台执行的活儿

顺带一个容易踩的认知坑:这俩名字里带 "Live",但底层不是 Flash 系列,模型卡上写得很清楚,它们基于 Gemini 3 Pro 构建。别按 Flash 的心智去估它的成本和能力。

核心变革:拆掉了那根"传话筒"

以前的语音助手(包括很多现在还在跑的),走的是一条叫**级联架构(cascaded architecture)**的路子:

你说话 → ASR 转成文字 → 大模型读文字生成文字 → TTS 转成语音 → 你听到

三段流水线,每段都要时间,而且每段都在丢信息。你的语气、停顿、犹豫、画面里的东西,在第一段就被抹平成一个字符串了。

3.8 Live 是原生 speech-to-speech:音频进,音频出,中间没有转文字这一步。

这个改变带来一个体验上的质变——它能处理你中途插话。因为模型没有"等你说完再转录"这个阶段,你一句话说到一半改主意,它当场就能接住。

对比一下核心参数:

项目Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
定位规模化、低成本高复杂度、多步推理
底层Gemini 3 ProGemini 3 Pro
上下文窗口128,000 token128,000 token
输出上限64,000 token64,000 token
语言97 种,对话中自动切换97 种,对话中自动切换
推理强度默认可配置 thinking_level:low / medium / high
函数调用异步,默认 NON_BLOCKING,可选调度异步,仅支持 NON_BLOCKING

五个让你省心的地方

官方把这次的能力拆成五条,我按"实际开发中哪个最救命"排了个序:

  • 异步函数调用(Asynchronous function calling):这是最狠的一条。模型可以在后台跑 API 和工具调用,同时继续跟你说话。以前 tool call 期间语音流必须挂起或者塞 filler 词,现在它对答如流,任务在后台默默跑完
  • 视觉上下文(Visual context):近实时处理摄像头画面,同时听懂你说的和看到的。注意 Live API 的规格是 JPEG 图片,最多 1 帧/秒
  • 字母数字精度(Alphanumeric precision):能准确解析确认码、理赔号、技术参数。做过语音客服系统的都知道这有多重要——老 ASR 把 "AB12C3" 听成 "AB 一三 C" 是家常便饭
  • 多语言(Multilingual):97 种以上语言,对话中途自动检测并切换,还能保持口音一致性。一句中文夹一句英文它也认
  • 增量内容更新(Incremental content updates):实时音频流和结构化数据混着返回,响应是带上下文的

Extended Thinking 额外多了个有意思的行为:它会用早期口头提示(比如 "Let me check that…")自然地接住你的请求,然后边干活边播报进度。这个设计比转圈等待高明太多了。

我的立场:这五条里真正值钱的是第一条和第三条。前四条里的视觉和语言,别人也在卷;但"边说话边跑工具"加上"确认码不会听错",是直接决定一套语音客服系统能不能上生产的两件事。

Benchmark:一分之差,四倍之差

Extended Thinking 在 Artificial Analysis 的**语音到语音质量指数(Speech to Speech Quality Index)**上拿了 82.6 分,总榜第一。

尴尬的是,OpenAI 五天前刚发布了 GPT-Live-1。

这张表值得细看:

评测项Gemini 3.8 Live Extended ThinkingOpenAI GPT-Live-1(Astra, medium)
Speech to Speech 质量指数82.681.5
Big Bench Audio(语音推理)98%90%
τ-Voice(客服任务完成率)68.6%67.9%
Full Duplex Bench(打断与停顿)91.9%94.9%
首个音频响应时间(TTFA)1.35 秒1.34 秒
每小时输入音频成本$3.50$5.83

谷歌的其他成绩:Sierra 的 τ-Voice-banking 35.1%,Big Bench Audio 97.7%。Gemini 3.8 Live 则在 Speech Agent Arena(人类偏好评测)拿到第二名。在 ServiceNow 的 EVA-Bench 语音智能体基准上,谷歌称两款模型推高了复杂工作流的帕累托前沿(该评测跑在 Gemini Enterprise Agent Platform 的 Live API 上)。

几个需要你自己判断的地方:

质量榜差 1.1 分,谷歌把它叫"总体第一",但没说差距。而在 Full Duplex Bench(打断处理)上 GPT-Live-1 是 94.9% 对 91.9%,明显领先——这正是最影响"像不像真人聊天"的那个指标。

另外 Artificial Analysis 自己也注明了:GPT-Live-1 那一行只跑了一次,其他模型大多跑三次。也就是说 OpenAI 那一列噪声更大,别把它当成精确结论。

真正的差距在钱上:$3.50 对 $5.83,接近一倍。

还有个坑,我必须提前告诉你:两个模型官方价目表是同一行,但账单能差四倍。

Extended Thinking 会生成 thinking token,按输出费率计费。Artificial Analysis 在同一组固定任务上实测:Extended Thinking 每小时输入音频 $3.50,纯 Gemini 3.8 Live 只要 $0.84

同样的标价,四倍的发票。

真实场景:官方演示里藏着它的能力边界

谷歌放了一堆演示视频,挑几个我觉得信息量最大的说:

Gemini 3.8 Live 这边:

  • 实时员工入职引导:摄像头对着办公环境,员工边问边答,模型看着画面给回应
  • 近实时下棋:这个演示挺刁钻的,要求模型持续跟踪快速变化的视觉状态
  • 纯语音生成整套商业计划和定制化营销工具包
  • Search Live 里的分步排障:真人维修设备的场景,一步一步口述指导

Extended Thinking 这边:

  • 把草图 + 实时语音反馈变成可用的 React 组件:我承认这个 Demo 有点秀,但它展示的是"视觉 + 推理 + 代码生成"在一段不中断对话里跑完
  • 通过异步函数调用协调多步餐厅预订,全程对话不中断
  • 在 Google Workspace 里跨 Docs Live、Gmail Live、Keep Live 工作

冷静一句:演示视频和真实使用之间,通常隔着三到五个"它没听错但理解反了"。看到这种丝滑 Demo,先想想你自己的网络抖动、背景噪音和用户的塑料普通话再说。

快速上手

第一步:零成本先玩起来

直接开 ai.studio/live,选模型 gemini-3.8-livegemini-3.8-live-extended-thinking,点麦克风就能聊。不用写代码,不用信用卡。

想抄完整的样例应用,官方仓库在 github.com/google-gemini/gemini-live-api-examples

第二步:搞清 Live API 的物理规格

这块官方文档写得很细,做接入前必须知道:

  • 传输:有状态的 WebSocket 长连接,不是轮询
  • 音频输入:raw 16-bit PCM,16kHz 单声道
  • 音频输出:raw 16-bit PCM,24kHz
  • 视觉输入JPEG,最多 1 帧/秒
  • 文本:支持
  • 两种部署形态
    • server-to-server:你的后端把客户端流转发给 Live API(推荐,API Key 不暴露)
    • client-to-server:前端直连 WebSocket(延迟更低,但要处理鉴权)

一句提醒:生产环境老实走 server-to-server。API Key 放在前端等于把银行卡贴在公告栏上,这事我见过太多团队踩。

第三步:Python 最小骨架

python
from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    speech_config=types.SpeechConfig(
        voice_config=types.VoiceConfig(
            prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Puck")
        )
    ),
)

# Extended Thinking 才需要:配置推理强度
# config.thinking_config = types.ThinkingConfig(thinking_level="medium")

async with client.aio.live.connect(
    model="gemini-3.8-live",    # 或 gemini-3.8-live-extended-thinking
    config=config,
) as session:
    async for response in session.receive():
        if response.data:
            play_audio(response.data)   # 24kHz 16-bit PCM 裸流

发声人可以用 Google TTS 的任意音色,在 speechConfig 里填 voice_name 就行。

第四步:如果你不想自己搭媒体管线

实时音视频的基础设施(回声消除、丢包补偿、抖动缓冲)是另一套坑。官方合作平台已经把 Live API 接好了:

Agora · Fishjam · LangChain · LiveKit · Pipecat · Vercel · Vision Agents

企业侧,谷歌宣布与 SalesforceGensparkLumeris 合作,他们看中的都是同一件事:延迟、流畅度和工具调用。

第五步:注意会话时长这道硬墙

这条官方文档有明示,很多人是部署后才发现:

  • 纯音频会话:最长 15 分钟
  • 音频 + 视频会话:最长 2 分钟

加上 128K 上下文窗口,长对话是被"时钟"和"窗口"双重限制的。做长会话要在应用层自己做会话续接。

价格:把账算清楚

项目费率(付费档)
文本输入$0.75 / 百万 token
文本输出(含 thinking token$4.50 / 百万 token
音频输入$3.00 / 百万 token,约 $0.005 / 分钟
音频输出(含 thinking token$12.00 / 百万 token,约 $0.018 / 分钟
图像 / 视频输入$1.00 / 百万 token,约 $0.002 / 分钟

补充三条容易忽略的:

  • 免费档真实存在,通过 Google AI Studio 可用。代价是免费档的输入数据会被用于改进谷歌产品,付费档不会
  • Search grounding 每月前 5,000 次免费(所有 Gemini 3.x 共享额度),超出后 $14 / 千次
  • 官方$0.018/分钟那个数字带星号,它是基于 token 单价折算的估值,不是固定费率

给你个算账的锚点:同样一组任务,Extended Thinking 实测成本约 $3.50/小时输入音频,而 Gemini 3.8 Live 只要 $0.84。如果你的场景主要是闲聊、问答、简单指令,用 3.8 Live;只有真的需要多步推理时才切 Extended Thinking,并且把 thinking_level 先压到 low 试。

我自己的选择策略:默认全部走 Gemini 3.8 Live,只对明确标记为"复杂多步"的意图路由到 Extended Thinking。别一上来全场 Extended Thinking,那账单会教你做人。

我在哪能用上

这次的分发铺得很开,但也意味着入口很乱,我帮你理一遍:

渠道Gemini 3.8 LiveExtended Thinking
Gemini API✅ 已上线✅ 已上线
Google AI Studio✅ 已上线(含免费档)✅ 已上线
Search Live✅ 所有人可用
Gemini Live(App)
Google Workspace · Docs✅ Google AI Pro / Ultra 订阅用户
Google Workspace · Gmail、Keep✅ 所有 Google AI 订阅用户
Gemini Enterprise✅ 私有预览✅ 私有预览
Gemini Enterprise for CX即将推出即将推出
Workspace 商业版即将推出

国内用户照例注意:以上服务存在地区限制,动手前先确认服务可用性。

顺带一提:Gemini 3.5 Transcribe

同一批发布的还有 Gemini 3.5 Transcribe(上个月就出了),谷歌这次一并推:

  • 85+ 语言,平均词错误率(WER)流式 4.0%非流式 2.6%
  • 自动语码转换:句内、句间中英文混说不用手动配置
  • 自定义词汇偏置:传 custom_vocabulary 列表,最多 1,000 个词,把识别拉向你的行业黑话、公司名、专有名词
  • 智能转写模式:自动去除填充词("那个…嗯…")、自我修正、输出结构化排版,直接可读
  • 通过 Interactions API 还能转写最长 1 小时的音频文件,带时间戳和说话人标注

如果你只需要"听写",不需要"对话",Transcribe 比 Live 便宜得多,别用错工具。

顺手把谷歌现在的音频全家桶列一下,免得选型时漏:Gemini 3.5 Live Translate(70+ 语言语音到语音翻译)、Gemini 3.1 Flash TTS(可配置语音生成)、Lyria 3.5(音乐生成)。

最后两句实话

语音 AI 这两年一直在解决一个伪装成技术问题的问题:如何让机器不打断你。

级联架构的解法是"等你把话说完",代价是每次停顿都要付 1.5 秒 latency。3.8 Live 的解法是——它一直在听,也一直在处理能力范围内提前想

还有个细节我认为比 benchmark 第一名更能说明方向:所有生成的音频都带 SynthID 数字水印,嵌在波形里听不出来,但可被检测。谷歌在造假成本几乎为零的时代,把"这是我生成的"这件事做进了产品底层。

这个设计,比多一分的性能更值得鼓掌。

至于 82.6 和 81.5 谁更强?说实话,差 1.1 分的排行榜名次,对你要做的那个客服机器人来说,重要性远低于**"确认码会不会听错""一千路并发每小时要花多少钱"**。

先去 ai.studio/live 开麦聊十分钟,比看十张 benchmark 表有用。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档