---
url: /live/gemini_3_8_live_models.md
description: >-
  2026年9月15日谷歌发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时语音对话模型，原生
  speech-to-speech 架构、97种语言、128K上下文、异步函数调用。Speech-to-Speech
  质量指数82.6分登顶，音频输入$0.005/分钟。本文带你一次看懂它强在哪、怎么用。
---

# Gemini 3.8 Live 与 Extended Thinking：语音助手终于学会了边说话边干活

先说一个所有人都经历过、但没人当回事的场景。

你对着手机说完一句话，然后——**沉默。**

一秒、两秒，屏幕上那个小圆圈转啊转。等它终于开口，你刚才想说的后半句已经忘了一半。

人类对话里，这个间隔的合理值是 **200 毫秒**左右。超过 400 毫秒，你就会觉得对方反应慢；超过 1 秒，你会怀疑他是不是在敷衍你。

而我们居然容忍智能语音助手"思考"两秒钟，还觉得挺自然。

2026 年 9 月 15 日，谷歌发布的两款模型，冲的就是这件事。

## 什么是 Gemini 3.8 Live

**Gemini 3.8 Live** 和 **Gemini 3.8 Live Extended Thinking**，是谷歌目前最先进的**实时语音对话模型**（官方原话：most advanced live dialogue models），由 Gemini Audio 团队的 Tom Ouyang 和 Malini Jaganathan 发布。

两者分工明确：

* **Gemini 3.8 Live**：面向**规模化部署和成本优化**。兼顾对话智能、流畅交流和视觉理解，主打高并发、低单价
* **Gemini 3.8 Live Extended Thinking**：面向**高复杂度任务**。一边推理一边说话，适合需要多步推理、后台执行的活儿

> 顺带一个容易踩的认知坑：这俩名字里带 "Live"，但**底层不是 Flash 系列**，模型卡上写得很清楚，它们基于 **Gemini 3 Pro** 构建。别按 Flash 的心智去估它的成本和能力。

### 核心变革：拆掉了那根"传话筒"

以前的语音助手（包括很多现在还在跑的），走的是一条叫\*\*级联架构（cascaded architecture）\*\*的路子：

```
你说话 → ASR 转成文字 → 大模型读文字生成文字 → TTS 转成语音 → 你听到
```

三段流水线，每段都要时间，而且每段都在丢信息。你的语气、停顿、犹豫、画面里的东西，在第一段就被抹平成一个字符串了。

3.8 Live 是**原生 speech-to-speech**：音频进，音频出，中间没有转文字这一步。

这个改变带来一个体验上的质变——**它能处理你中途插话**。因为模型没有"等你说完再转录"这个阶段，你一句话说到一半改主意，它当场就能接住。

对比一下核心参数：

| 项目 | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| --- | --- | --- |
| 定位 | 规模化、低成本 | 高复杂度、多步推理 |
| 底层 | Gemini 3 Pro | Gemini 3 Pro |
| 上下文窗口 | 128,000 token | 128,000 token |
| 输出上限 | 64,000 token | 64,000 token |
| 语言 | 97 种，对话中自动切换 | 97 种，对话中自动切换 |
| 推理强度 | 默认 | 可配置 `thinking_level`：low / medium / high |
| 函数调用 | 异步，默认 `NON_BLOCKING`，可选调度 | 异步，仅支持 `NON_BLOCKING` |

## 五个让你省心的地方

官方把这次的能力拆成五条，我按"实际开发中哪个最救命"排了个序：

* **异步函数调用（Asynchronous function calling）**：这是最狠的一条。模型可以在后台跑 API 和工具调用，**同时继续跟你说话**。以前 tool call 期间语音流必须挂起或者塞 filler 词，现在它对答如流，任务在后台默默跑完
* **视觉上下文（Visual context）**：近实时处理摄像头画面，同时听懂你说的和看到的。注意 Live API 的规格是 **JPEG 图片，最多 1 帧/秒**
* **字母数字精度（Alphanumeric precision）**：能准确解析**确认码、理赔号、技术参数**。做过语音客服系统的都知道这有多重要——老 ASR 把 "AB12C3" 听成 "AB 一三 C" 是家常便饭
* **多语言（Multilingual）**：97 种以上语言，**对话中途自动检测并切换**，还能保持口音一致性。一句中文夹一句英文它也认
* **增量内容更新（Incremental content updates）**：实时音频流和结构化数据混着返回，响应是带上下文的

Extended Thinking 额外多了个有意思的行为：它会用**早期口头提示**（比如 "Let me check that…"）自然地接住你的请求，然后**边干活边播报进度**。这个设计比转圈等待高明太多了。

> 我的立场：这五条里真正值钱的是**第一条和第三条**。前四条里的视觉和语言，别人也在卷；但"边说话边跑工具"加上"确认码不会听错"，是直接决定一套语音客服系统能不能上生产的两件事。

## Benchmark：一分之差，四倍之差

Extended Thinking 在 Artificial Analysis 的\*\*语音到语音质量指数（Speech to Speech Quality Index）\*\*上拿了 **82.6 分**，总榜第一。

尴尬的是，OpenAI 五天前刚发布了 GPT-Live-1。

这张表值得细看：

| 评测项 | Gemini 3.8 Live Extended Thinking | OpenAI GPT-Live-1（Astra, medium） |
| --- | --- | --- |
| Speech to Speech 质量指数 | **82.6** | 81.5 |
| Big Bench Audio（语音推理） | **98%** | 90% |
| τ-Voice（客服任务完成率） | **68.6%** | 67.9% |
| Full Duplex Bench（打断与停顿） | 91.9% | **94.9%** |
| 首个音频响应时间（TTFA） | 1.35 秒 | **1.34 秒** |
| 每小时输入音频成本 | **$3.50** | $5.83 |

**谷歌的其他成绩**：Sierra 的 τ-Voice-banking **35.1%**，Big Bench Audio **97.7%**。Gemini 3.8 Live 则在 Speech Agent Arena（人类偏好评测）拿到**第二名**。在 ServiceNow 的 **EVA-Bench** 语音智能体基准上，谷歌称两款模型推高了复杂工作流的**帕累托前沿**（该评测跑在 Gemini Enterprise Agent Platform 的 Live API 上）。

几个需要你自己判断的地方：

> 质量榜差 **1.1 分**，谷歌把它叫"总体第一"，但没说差距。而在 **Full Duplex Bench**（打断处理）上 GPT-Live-1 是 **94.9% 对 91.9%**，明显领先——这正是最影响"像不像真人聊天"的那个指标。
>
> 另外 Artificial Analysis 自己也注明了：GPT-Live-1 那一行**只跑了一次**，其他模型大多跑三次。也就是说 OpenAI 那一列噪声更大，别把它当成精确结论。
>
> 真正的差距在钱上：**$3.50 对 $5.83**，接近一倍。

还有个坑，我必须提前告诉你：**两个模型官方价目表是同一行**，但账单能差四倍。

Extended Thinking 会生成 thinking token，**按输出费率计费**。Artificial Analysis 在同一组固定任务上实测：Extended Thinking **每小时输入音频 $3.50**，纯 Gemini 3.8 Live 只要 **$0.84**。

同样的标价，四倍的发票。

## 真实场景：官方演示里藏着它的能力边界

谷歌放了一堆演示视频，挑几个我觉得信息量最大的说：

**Gemini 3.8 Live 这边：**

* **实时员工入职引导**：摄像头对着办公环境，员工边问边答，模型看着画面给回应
* **近实时下棋**：这个演示挺刁钻的，要求模型持续跟踪快速变化的视觉状态
* **纯语音生成整套商业计划和定制化营销工具包**
* **Search Live 里的分步排障**：真人维修设备的场景，一步一步口述指导

**Extended Thinking 这边：**

* **把草图 + 实时语音反馈变成可用的 React 组件**：我承认这个 Demo 有点秀，但它展示的是"视觉 + 推理 + 代码生成"在一段不中断对话里跑完
* **通过异步函数调用协调多步餐厅预订**，全程对话不中断
* **在 Google Workspace 里跨 Docs Live、Gmail Live、Keep Live 工作**

> 冷静一句：演示视频和真实使用之间，通常隔着三到五个"它没听错但理解反了"。看到这种丝滑 Demo，先想想你自己的网络抖动、背景噪音和用户的塑料普通话再说。

## 快速上手

### 第一步：零成本先玩起来

直接开 [ai.studio/live](https://ai.studio/live)，选模型 `gemini-3.8-live` 或 `gemini-3.8-live-extended-thinking`，点麦克风就能聊。**不用写代码，不用信用卡。**

想抄完整的样例应用，官方仓库在 [github.com/google-gemini/gemini-live-api-examples](https://github.com/google-gemini/gemini-live-api-examples)。

### 第二步：搞清 Live API 的物理规格

这块官方文档写得很细，做接入前必须知道：

* **传输**：有状态的 **WebSocket** 长连接，不是轮询
* **音频输入**：raw **16-bit PCM，16kHz** 单声道
* **音频输出**：raw **16-bit PCM，24kHz**
* **视觉输入**：**JPEG，最多 1 帧/秒**
* **文本**：支持
* **两种部署形态**
  * **server-to-server**：你的后端把客户端流转发给 Live API（推荐，API Key 不暴露）
  * **client-to-server**：前端直连 WebSocket（延迟更低，但要处理鉴权）

> 一句提醒：生产环境老实走 server-to-server。API Key 放在前端等于把银行卡贴在公告栏上，这事我见过太多团队踩。

### 第三步：Python 最小骨架

```python
from google import genai
from google.genai import types

client = genai.Client(api_key="YOUR_API_KEY")

config = types.LiveConnectConfig(
    response_modalities=["AUDIO"],
    speech_config=types.SpeechConfig(
        voice_config=types.VoiceConfig(
            prebuilt_voice_config=types.PrebuiltVoiceConfig(voice_name="Puck")
        )
    ),
)

# Extended Thinking 才需要：配置推理强度
# config.thinking_config = types.ThinkingConfig(thinking_level="medium")

async with client.aio.live.connect(
    model="gemini-3.8-live",    # 或 gemini-3.8-live-extended-thinking
    config=config,
) as session:
    async for response in session.receive():
        if response.data:
            play_audio(response.data)   # 24kHz 16-bit PCM 裸流
```

发声人可以用 Google TTS 的任意音色，在 `speechConfig` 里填 `voice_name` 就行。

### 第四步：如果你不想自己搭媒体管线

实时音视频的基础设施（回声消除、丢包补偿、抖动缓冲）是另一套坑。官方合作平台已经把 Live API 接好了：

**Agora** · **Fishjam** · **LangChain** · **LiveKit** · **Pipecat** · **Vercel** · **Vision Agents**

企业侧，谷歌宣布与 **Salesforce**、**Genspark**、**Lumeris** 合作，他们看中的都是同一件事：延迟、流畅度和工具调用。

### 第五步：注意会话时长这道硬墙

这条官方文档有明示，很多人是部署后才发现：

* **纯音频会话**：最长 **15 分钟**
* **音频 + 视频会话**：最长 **2 分钟**

加上 128K 上下文窗口，长对话是被"时钟"和"窗口"双重限制的。做长会话要在应用层自己做会话续接。

## 价格：把账算清楚

| 项目 | 费率（付费档） |
| --- | --- |
| 文本输入 | $0.75 / 百万 token |
| 文本输出（**含 thinking token**） | $4.50 / 百万 token |
| 音频输入 | $3.00 / 百万 token，约 **$0.005 / 分钟** |
| 音频输出（**含 thinking token**） | $12.00 / 百万 token，约 **$0.018 / 分钟** |
| 图像 / 视频输入 | $1.00 / 百万 token，约 $0.002 / 分钟 |

补充三条容易忽略的：

* **免费档真实存在**，通过 Google AI Studio 可用。代价是免费档的输入数据会被用于改进谷歌产品，付费档不会
* **Search  grounding** 每月前 **5,000 次免费**（所有 Gemini 3.x 共享额度），超出后 **$14 / 千次**
* 官方$0.018/分钟那个数字带星号，它是基于 token 单价折算的估值，不是固定费率

**给你个算账的锚点**：同样一组任务，Extended Thinking 实测成本约 **$3.50/小时输入音频**，而 Gemini 3.8 Live 只要 **$0.84**。如果你的场景主要是闲聊、问答、简单指令，用 3.8 Live；只有真的需要多步推理时才切 Extended Thinking，并且把 `thinking_level` 先压到 `low` 试。

> 我自己的选择策略：默认全部走 Gemini 3.8 Live，只对明确标记为"复杂多步"的意图路由到 Extended Thinking。别一上来全场 Extended Thinking，那账单会教你做人。

## 我在哪能用上

这次的分发铺得很开，但也意味着**入口很乱**，我帮你理一遍：

| 渠道 | Gemini 3.8 Live | Extended Thinking |
| --- | --- | --- |
| Gemini API | ✅ 已上线 | ✅ 已上线 |
| Google AI Studio | ✅ 已上线（含免费档） | ✅ 已上线 |
| Search Live | ✅ 所有人可用 | — |
| Gemini Live（App） | — | ✅ |
| Google Workspace · Docs | — | ✅ Google AI Pro / Ultra 订阅用户 |
| Google Workspace · Gmail、Keep | — | ✅ 所有 Google AI 订阅用户 |
| Gemini Enterprise | ✅ 私有预览 | ✅ 私有预览 |
| Gemini Enterprise for CX | 即将推出 | 即将推出 |
| Workspace 商业版 | — | 即将推出 |

国内用户照例注意：以上服务存在地区限制，动手前先确认服务可用性。

## 顺带一提：Gemini 3.5 Transcribe

同一批发布的还有 **Gemini 3.5 Transcribe**（上个月就出了），谷歌这次一并推：

* **85+ 语言**，平均词错误率（WER）**流式 4.0%**、**非流式 2.6%**
* **自动语码转换**：句内、句间中英文混说不用手动配置
* **自定义词汇偏置**：传 `custom_vocabulary` 列表，**最多 1,000 个词**，把识别拉向你的行业黑话、公司名、专有名词
* **智能转写模式**：自动去除填充词（"那个…嗯…"）、自我修正、输出结构化排版，直接可读
* 通过 Interactions API 还能转写**最长 1 小时**的音频文件，带时间戳和说话人标注

如果你只需要"听写"，不需要"对话"，Transcribe 比 Live 便宜得多，别用错工具。

顺手把谷歌现在的音频全家桶列一下，免得选型时漏：**Gemini 3.5 Live Translate**（70+ 语言语音到语音翻译）、**Gemini 3.1 Flash TTS**（可配置语音生成）、**Lyria 3.5**（音乐生成）。

## 最后两句实话

语音 AI 这两年一直在解决一个伪装成技术问题的问题：**如何让机器不打断你。**

级联架构的解法是"等你把话说完"，代价是每次停顿都要付 1.5 秒 latency。3.8 Live 的解法是——**它一直在听，也一直在处理能力范围内提前想**。

还有个细节我认为比 benchmark 第一名更能说明方向：所有生成的音频都带 **SynthID 数字水印**，嵌在波形里听不出来，但可被检测。谷歌在造假成本几乎为零的时代，把"这是我生成的"这件事做进了产品底层。

这个设计，比多一分的性能更值得鼓掌。

至于 82.6 和 81.5 谁更强？说实话，差 1.1 分的排行榜名次，对你要做的那个客服机器人来说，重要性远低于\*\*"确认码会不会听错"**和**"一千路并发每小时要花多少钱"\*\*。

先去 ai.studio/live 开麦聊十分钟，比看十张 benchmark 表有用。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
