---
url: /tts/what_is_gemini_tts.md
description: >-
  2026年9月23日谷歌发布 Gemini 3.8 Flash TTS 与 3.8 Flash-Lite TTS
  两款语音合成模型，30个预设音色升级为无限声音库，2000+生产级音色，30秒样本复刻声线，支持逐行剧本指导和原生双人对谈。Hume AI
  声音设计榜71.4分第一，1小时音频最低约0.54美元。本文带你一次看懂它强在哪、怎么用、有哪些坑。
---

# 认识 Gemini 3.8 TTS：从"选个音色"到"设计一个人"

先说一件让我挺羞耻的事。

我做播客三年多，最贵的成本不是麦克风，不是剪辑软件，是**配音**。

一集三十分钟，找人录，几百块起步；自己录，两小时打底，还得祈祷那几天别感冒。我也试过 AI 配音——结果你肯定猜到了：三秒钟就能听出来是机器。那种熟悉的、礼貌的、永远不带情绪的"播报腔"，像一个永远在念说明书的人。

问题从来不是"AI 能不能说话"，而是\*\*"AI 能不能像某个人那样说话"\*\*。

2026 年 9 月 23 日，谷歌冲着这个问题来了。

## 什么是 Gemini 3.8 TTS

**Gemini 3.8 Flash TTS** 和 **Gemini 3.8 Flash-Lite TTS**，是谷歌目前**最具表现力的音频生成模型**（官方原话：our most expressive audio generation models yet），由 Gemini Audio 团队发布，署名人是集团产品经理 Leland Rechis 和研究科学总监 **Alan Cowen**。

这个名字值得停一下。Alan Cowen 此前是主攻"情感人工智能（Empathic AI）"的初创公司 **Hume AI** 的创始人，今年才加入 Google DeepMind。让一个研究情绪的人来带语音项目，谷歌的意图基本写在脸上了——**它要的不是字正腔圆，是情绪。**

有意思的是，这次的跑分榜用的恰好就是 Hume AI 的基准。前创业者带着老东家的尺子来量新产品，这个画面本身挺有意思。

先分清两款：

* **Gemini 3.8 Flash TTS**：旗舰版，面向**深度创意指导和角色设计**。游戏、沉浸式有声书、播客、互动媒体。给你一整套"vocal studio"
* **Gemini 3.8 Flash-Lite TTS**：轻量版，面向**高并发、成本敏感的规模化**。批量配音、长视频配音、音频内容创作、客服语音智能体

一句话选型：**要"演"，用 Flash；要"量"，用 Flash-Lite。**

## 它有哪些特点

官方把能力拆成了好几块，我按"哪个最颠覆"排了个序。

* **生成式声音设计（Generative Voice Design）**：这是最狠的一条。**不用预先录任何东西**，直接用自然语言描述角色，模型从零给你造一个声音出来。官方示例是"a dramatic, fire-breathing dragon"（一条戏很多的喷火龙），中文语境下你可以写"一个凌晨 2 点疲惫不堪、说英语带浓重德语口音的柏林人"。覆盖 **100 多种语言和方言**
* **从 30 个声音到无限声音库**：官方原话是 *Scale up from 30 original voices to an infinite library*。以前你在下拉菜单里挑预设音色，现在你是在**设计一个不存在的人**
* **2000+ 生产级音色（Expansive voice library）**：不想从零设计也行，直接挑现成的。值得一提的是它覆盖了区域变体——**墨西哥西班牙语、魁北克法语、苏格兰英语**。做过本地化的都知道，"西班牙语"和"墨西哥西班牙语"是两回事
* **声音复刻（Voice Replication）**：**30 秒**参考音频就能重建一个稳定的声线画像。这个数字是这次发布里最让人后背发凉的一条，后面单说
* **逐行演绎（Direct performance line by line）**：你可以自己写"舞台指示"，从"冷静的客服"一路切到"低语的悬疑场景"
* **非语言表达标记**：脚本里直接插 `<laughs>`（笑）、`<sigh>`（叹气）、`<gasp>`（喘息），还有 `|mhm|`、`|yeah|` 这类附和词。做喜剧节奏和反应停顿，这些标记比调语速有用一百倍
* **原生双说话人（Native two-speaker scene staging）**：**一份脚本**，直接生成两个人的对话，带自然的轮流说话。播客对谈、广播剧，以前要合成两次再剪，现在一次成型
* **长音频一致性**：官方称可在**数小时连续音频**里保持音质、自然节奏和角色音色，说话人漂移最小。长音频最怕的就是说到后半段声音"变了一个人"
* **声音重混（Voice Remixing，即将推出）**：选中一个音色，再单独微调**音色、音高、语速、口音**。可以用提示词改，比如"加一点轻微的美国南方口音"、"让表达柔和一些"

> 我的立场：这一堆能力里，真正改变工作流的是**逐行演绎 + 原生双说话人**。生成式声音设计很酷，但它更像玩具；而"一份脚本直接出双人对话"是能直接砍掉后期工时的东西。

## 能用它干嘛：几个真实场景

**有声书与播客。** 这是最直白的受益场景。以前一本三十万字的有声书，要么找配音演员录几十小时，要么用 AI 捏着鼻子听"播报腔"。现在可以一个脚本分配多个角色音色，逐行加情绪，数小时连续输出音色不漂。成本这块后面算，会让你有点意外。

**游戏与互动媒体。** NPC 对话一直是块硬骨头——预录成本爆炸，而通用 TTS 又没有角色感。Flash TTS 的定位明确写了 gaming 和 interactive media，从零造一个"喷火龙"的音色，这在以前是不可能的。

**全球化本地化配音。** 这是 Flash-Lite TTS 的主场，也是我觉得商业价值最大的一块。谷歌点名的合作方里，**Linguana、Ollang、Wondercraft、HeyGen、99.co、Figma** 都在做全球配音和媒体本地化。当你能精准指定"墨西哥西班牙语"而不是笼统的"西班牙语"，一部剧集进拉美市场的观感完全不一样。

**客服语音智能体。** 这条容易被忽略，但可能是量最大的。Flash-Lite TTS 主打的就是"expressive voice agents"。以前的 IVR 语音你一听就想挂电话，因为它不会"听"——现在能插 `|mhm|` 这种附和标记，机器终于学会了在对话里点头。

**渠道落地情况：**

| 你是谁 | 用哪款 | 在哪用 |
| --- | --- | --- |
| 开发者 | 两款都有 | Gemini API、Google AI Studio |
| 企业 | 两款都有 | Gemini Enterprise（即将通过 API 开放） |
| 普通用户 | Flash TTS | Gemini Notebook |
| 普通用户 | Flash-Lite TTS | Google Vids |

生态这边，**Agora、LiveKit、Pipecat、Vercel** 已经支持通过 Gemini API 构建和部署语音生成。如果你在做实时语音应用，不用自己搭管道了。

## 初体验：怎么上手

最省事的路径是打开 AI Studio 的语音生成工作区，选模型，输文本，听效果：

* Flash TTS：`aistudio.google.com/generate-speech?model=gemini-3.8-flash-tts`
* Flash-Lite TTS：`aistudio.google.com/generate-speech?model=gemini-3.8-flash-lite-tts`

开发者走 API，用 `google-genai` SDK，模型 ID 填 `gemini-3.8-flash-tts` 或 `gemini-3.8-flash-lite-tts`，大致是这么个结构：

```python
from google import genai

client = genai.Client(api_key="YOUR_API_KEY")

response = client.models.generate_content(
    model="gemini-3.8-flash-tts",
    contents="""
    你好，这里是深夜电台。
    <sigh> 又是一个加完班的周二。
    |mhm| 我懂，真的懂。
    不过今晚的月亮不错，要不要听首歌？
    """,
    config={
        "speech_config": {
            "voice_config": {
                "prebuilt_voice_config": {"voice_name": "YOUR_VOICE"}
            }
        }
    },
)
```

几个上手建议：

* **别只用文字描述情绪，直接用标记。** `<laughs>`、`<sigh>`、`|mhm|` 这些标签的效果，比你写"请带着疲惫的语气说"要可控得多
* **先挑现成音色，再考虑造声音。** 2000+ 生产级音色里大概率有能用的，从零设计留给真正需要"角色"的场景
* **双人对话用一份脚本**。别手动拆成两段分别合成再拼，那样节奏会散
* **具体的参数以官方文档为准**（`aistudio.google.com/docs/speech-generation`），音频模型这块迭代很快，参数名容易变

## 价格：一小时音频不到四块钱

这部分是我觉得最被低估的。

2026 年底前的 API 优惠价：

| 项目 | Flash TTS | Flash-Lite TTS |
| --- | --- | --- |
| 文本输入 | $0.50 / 百万 Token | $0.50 / 百万 Token |
| 音频输出 | $9.00 / 百万 Token | $6.00 / 百万 Token |

谷歌给的折算是 **1 秒音频 ≈ 25 个音频 Token**。按这个算，连续生成一小时音频的纯输出费用：

* Flash TTS ≈ **$0.81**
* Flash-Lite TTS ≈ **$0.54**（折合人民币约 3.8 元）

即便 2027 年恢复标准价（Flash TTS 回到 $18 / 百万 Token，Flash-Lite 回到 $12 / 百万 Token），也仍在很低的水位。

> 三十分钟的一期播客，音频输出成本不到两块钱。三年前我为一集付费几百块。这个落差让我有点恍惚——当然，钱省了，活儿也卷了。

注意这是**纯音频输出 Token 的理论折算**，没算重试和其他开销。

## 跑分很漂亮，但别急着开香槟

成绩单确实硬：

* **Hume AI Voice Design Benchmark**：Flash TTS 综合 **71.4 分**，总榜第一；口音建模 **60.8 分**领先
* **Hume AI Overall Quality Index**：Flash TTS 第一，Flash-Lite TTS 第二
* **Voice Arena 双盲偏好测试**：在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语、印地语等语种位居前列

但 benchmark 不等于生产体验，几个已知的边界得提前知道：

* 部分高频段音频仍能观察到**微小的合成杂音**
* 极端长文本连续渲染的后期，少数样例出现**轻微声线漂移**
* 模型卡自己承认：仍可能出现**偏离文本或发音异常**，高负载下可能**延迟或超时**

还有两条限制必须提醒国内用户：

**地区限制。** 声音复刻功能在**美国伊利诺伊州、德克萨斯州、欧洲经济区（EEA）、英国、瑞士、印度**暂不开放。动手前先确认你的账号所在地。

**声音复刻的门禁。** 30 秒样本能复刻声线这件事，确实让人后背发凉。谷歌的防线是：被复刻者必须先录一段**口头同意声明**，系统把这段授权录音与参考音频做**声纹比对**，一致才允许生成。同时所有 Gemini Audio 生成的音频都织入了**听不出来的 SynthID 水印**，并附带 **C2PA 数字凭证**用于追溯。

> 30 秒。这是一个人发一条语音消息的时长。
>
> 技术往前走的时候，身份验证也得跟着往前走。谷歌这套"口头授权 + 声纹比对 + 水印追溯"的组合，是目前我见过相对认真的一种答案——但它也只是个开始。授权机制、责任认定、版权仲裁，这些恐怕要整个行业头疼很多年。

## 顺带一提：谷歌的音频全家桶

如果你在选型，别只盯着这一款。谷歌现在的音频产品线已经排得很满了：

* **Gemini 3.8 Live / Extended Thinking**（9 月 15 日）：实时语音对话，边说边干活
* **Gemini 3.5 Transcribe**（8 月）：语音转写，85+ 语言，流式词错误率 4.0%
* **Gemini 3.5 Live Translate**：语音到语音翻译
* **Gemini 3.8 Flash TTS / Flash-Lite TTS**（本次）：文本转语音
* **Lyria**：音乐生成

**听写用 Transcribe，对话用 Live，念稿用 TTS，配乐用 Lyria。** 别用错工具，四者的价格差着一个数量级。

## 最后两句实话

这次发布真正的转折点，不是 71.4 分，也不是一小时五毛四。

是那句 *Scale up from 30 original voices to an infinite library*。

过去十几年，TTS 的交互范式是**选择**——给你一个下拉菜单，你从里面挑一个"最接近的"。这个范式默认了一件事：你想要的声音，必须先存在。

Gemini 3.8 TTS 把范式换成了**设计**。你想要的声音不存在？那就造一个。给它一段人设描述，它给你一个人。

从"选"到"造"，这一步跨过去，配音这件事的性质就变了。它不再是一个资源调度问题（找谁录、什么时候录、多少钱），而变成了一个创作问题（这个角色应该是什么样的声音）。

至于那个让人不安的 30 秒——我倾向于这么看：**能复刻声音的技术早晚会出现，区别只在于出现的时候，水印和授权机制有没有一起到位。** 谷歌至少把这两样一起交付了。

先去 AI Studio 敲一段带 `<sigh>` 的台词听听。那声叹息值不值得，耳朵比 benchmark 表诚实。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
