认识 Gemini 3.8 TTS:从"选个音色"到"设计一个人"
先说一件让我挺羞耻的事。
我做播客三年多,最贵的成本不是麦克风,不是剪辑软件,是配音。
一集三十分钟,找人录,几百块起步;自己录,两小时打底,还得祈祷那几天别感冒。我也试过 AI 配音——结果你肯定猜到了:三秒钟就能听出来是机器。那种熟悉的、礼貌的、永远不带情绪的"播报腔",像一个永远在念说明书的人。
问题从来不是"AI 能不能说话",而是**"AI 能不能像某个人那样说话"**。
2026 年 9 月 23 日,谷歌冲着这个问题来了。
什么是 Gemini 3.8 TTS
Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,是谷歌目前最具表现力的音频生成模型(官方原话:our most expressive audio generation models yet),由 Gemini Audio 团队发布,署名人是集团产品经理 Leland Rechis 和研究科学总监 Alan Cowen。
这个名字值得停一下。Alan Cowen 此前是主攻"情感人工智能(Empathic AI)"的初创公司 Hume AI 的创始人,今年才加入 Google DeepMind。让一个研究情绪的人来带语音项目,谷歌的意图基本写在脸上了——它要的不是字正腔圆,是情绪。
有意思的是,这次的跑分榜用的恰好就是 Hume AI 的基准。前创业者带着老东家的尺子来量新产品,这个画面本身挺有意思。
先分清两款:
- Gemini 3.8 Flash TTS:旗舰版,面向深度创意指导和角色设计。游戏、沉浸式有声书、播客、互动媒体。给你一整套"vocal studio"
- Gemini 3.8 Flash-Lite TTS:轻量版,面向高并发、成本敏感的规模化。批量配音、长视频配音、音频内容创作、客服语音智能体
一句话选型:要"演",用 Flash;要"量",用 Flash-Lite。
它有哪些特点
官方把能力拆成了好几块,我按"哪个最颠覆"排了个序。
- 生成式声音设计(Generative Voice Design):这是最狠的一条。不用预先录任何东西,直接用自然语言描述角色,模型从零给你造一个声音出来。官方示例是"a dramatic, fire-breathing dragon"(一条戏很多的喷火龙),中文语境下你可以写"一个凌晨 2 点疲惫不堪、说英语带浓重德语口音的柏林人"。覆盖 100 多种语言和方言
- 从 30 个声音到无限声音库:官方原话是 Scale up from 30 original voices to an infinite library。以前你在下拉菜单里挑预设音色,现在你是在设计一个不存在的人
- 2000+ 生产级音色(Expansive voice library):不想从零设计也行,直接挑现成的。值得一提的是它覆盖了区域变体——墨西哥西班牙语、魁北克法语、苏格兰英语。做过本地化的都知道,"西班牙语"和"墨西哥西班牙语"是两回事
- 声音复刻(Voice Replication):30 秒参考音频就能重建一个稳定的声线画像。这个数字是这次发布里最让人后背发凉的一条,后面单说
- 逐行演绎(Direct performance line by line):你可以自己写"舞台指示",从"冷静的客服"一路切到"低语的悬疑场景"
- 非语言表达标记:脚本里直接插
<laughs>(笑)、<sigh>(叹气)、<gasp>(喘息),还有|mhm|、|yeah|这类附和词。做喜剧节奏和反应停顿,这些标记比调语速有用一百倍 - 原生双说话人(Native two-speaker scene staging):一份脚本,直接生成两个人的对话,带自然的轮流说话。播客对谈、广播剧,以前要合成两次再剪,现在一次成型
- 长音频一致性:官方称可在数小时连续音频里保持音质、自然节奏和角色音色,说话人漂移最小。长音频最怕的就是说到后半段声音"变了一个人"
- 声音重混(Voice Remixing,即将推出):选中一个音色,再单独微调音色、音高、语速、口音。可以用提示词改,比如"加一点轻微的美国南方口音"、"让表达柔和一些"
我的立场:这一堆能力里,真正改变工作流的是逐行演绎 + 原生双说话人。生成式声音设计很酷,但它更像玩具;而"一份脚本直接出双人对话"是能直接砍掉后期工时的东西。
能用它干嘛:几个真实场景
有声书与播客。 这是最直白的受益场景。以前一本三十万字的有声书,要么找配音演员录几十小时,要么用 AI 捏着鼻子听"播报腔"。现在可以一个脚本分配多个角色音色,逐行加情绪,数小时连续输出音色不漂。成本这块后面算,会让你有点意外。
游戏与互动媒体。 NPC 对话一直是块硬骨头——预录成本爆炸,而通用 TTS 又没有角色感。Flash TTS 的定位明确写了 gaming 和 interactive media,从零造一个"喷火龙"的音色,这在以前是不可能的。
全球化本地化配音。 这是 Flash-Lite TTS 的主场,也是我觉得商业价值最大的一块。谷歌点名的合作方里,Linguana、Ollang、Wondercraft、HeyGen、99.co、Figma 都在做全球配音和媒体本地化。当你能精准指定"墨西哥西班牙语"而不是笼统的"西班牙语",一部剧集进拉美市场的观感完全不一样。
客服语音智能体。 这条容易被忽略,但可能是量最大的。Flash-Lite TTS 主打的就是"expressive voice agents"。以前的 IVR 语音你一听就想挂电话,因为它不会"听"——现在能插 |mhm| 这种附和标记,机器终于学会了在对话里点头。
渠道落地情况:
| 你是谁 | 用哪款 | 在哪用 |
|---|---|---|
| 开发者 | 两款都有 | Gemini API、Google AI Studio |
| 企业 | 两款都有 | Gemini Enterprise(即将通过 API 开放) |
| 普通用户 | Flash TTS | Gemini Notebook |
| 普通用户 | Flash-Lite TTS | Google Vids |
生态这边,Agora、LiveKit、Pipecat、Vercel 已经支持通过 Gemini API 构建和部署语音生成。如果你在做实时语音应用,不用自己搭管道了。
初体验:怎么上手
最省事的路径是打开 AI Studio 的语音生成工作区,选模型,输文本,听效果:
- Flash TTS:
aistudio.google.com/generate-speech?model=gemini-3.8-flash-tts - Flash-Lite TTS:
aistudio.google.com/generate-speech?model=gemini-3.8-flash-lite-tts
开发者走 API,用 google-genai SDK,模型 ID 填 gemini-3.8-flash-tts 或 gemini-3.8-flash-lite-tts,大致是这么个结构:
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
response = client.models.generate_content(
model="gemini-3.8-flash-tts",
contents="""
你好,这里是深夜电台。
<sigh> 又是一个加完班的周二。
|mhm| 我懂,真的懂。
不过今晚的月亮不错,要不要听首歌?
""",
config={
"speech_config": {
"voice_config": {
"prebuilt_voice_config": {"voice_name": "YOUR_VOICE"}
}
}
},
)几个上手建议:
- 别只用文字描述情绪,直接用标记。
<laughs>、<sigh>、|mhm|这些标签的效果,比你写"请带着疲惫的语气说"要可控得多 - 先挑现成音色,再考虑造声音。 2000+ 生产级音色里大概率有能用的,从零设计留给真正需要"角色"的场景
- 双人对话用一份脚本。别手动拆成两段分别合成再拼,那样节奏会散
- 具体的参数以官方文档为准(
aistudio.google.com/docs/speech-generation),音频模型这块迭代很快,参数名容易变
价格:一小时音频不到四块钱
这部分是我觉得最被低估的。
2026 年底前的 API 优惠价:
| 项目 | Flash TTS | Flash-Lite TTS |
|---|---|---|
| 文本输入 | $0.50 / 百万 Token | $0.50 / 百万 Token |
| 音频输出 | $9.00 / 百万 Token | $6.00 / 百万 Token |
谷歌给的折算是 1 秒音频 ≈ 25 个音频 Token。按这个算,连续生成一小时音频的纯输出费用:
- Flash TTS ≈ $0.81
- Flash-Lite TTS ≈ $0.54(折合人民币约 3.8 元)
即便 2027 年恢复标准价(Flash TTS 回到 $18 / 百万 Token,Flash-Lite 回到 $12 / 百万 Token),也仍在很低的水位。
三十分钟的一期播客,音频输出成本不到两块钱。三年前我为一集付费几百块。这个落差让我有点恍惚——当然,钱省了,活儿也卷了。
注意这是纯音频输出 Token 的理论折算,没算重试和其他开销。
跑分很漂亮,但别急着开香槟
成绩单确实硬:
- Hume AI Voice Design Benchmark:Flash TTS 综合 71.4 分,总榜第一;口音建模 60.8 分领先
- Hume AI Overall Quality Index:Flash TTS 第一,Flash-Lite TTS 第二
- Voice Arena 双盲偏好测试:在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语、印地语等语种位居前列
但 benchmark 不等于生产体验,几个已知的边界得提前知道:
- 部分高频段音频仍能观察到微小的合成杂音
- 极端长文本连续渲染的后期,少数样例出现轻微声线漂移
- 模型卡自己承认:仍可能出现偏离文本或发音异常,高负载下可能延迟或超时
还有两条限制必须提醒国内用户:
地区限制。 声音复刻功能在美国伊利诺伊州、德克萨斯州、欧洲经济区(EEA)、英国、瑞士、印度暂不开放。动手前先确认你的账号所在地。
声音复刻的门禁。 30 秒样本能复刻声线这件事,确实让人后背发凉。谷歌的防线是:被复刻者必须先录一段口头同意声明,系统把这段授权录音与参考音频做声纹比对,一致才允许生成。同时所有 Gemini Audio 生成的音频都织入了听不出来的 SynthID 水印,并附带 C2PA 数字凭证用于追溯。
30 秒。这是一个人发一条语音消息的时长。
技术往前走的时候,身份验证也得跟着往前走。谷歌这套"口头授权 + 声纹比对 + 水印追溯"的组合,是目前我见过相对认真的一种答案——但它也只是个开始。授权机制、责任认定、版权仲裁,这些恐怕要整个行业头疼很多年。
顺带一提:谷歌的音频全家桶
如果你在选型,别只盯着这一款。谷歌现在的音频产品线已经排得很满了:
- Gemini 3.8 Live / Extended Thinking(9 月 15 日):实时语音对话,边说边干活
- Gemini 3.5 Transcribe(8 月):语音转写,85+ 语言,流式词错误率 4.0%
- Gemini 3.5 Live Translate:语音到语音翻译
- Gemini 3.8 Flash TTS / Flash-Lite TTS(本次):文本转语音
- Lyria:音乐生成
听写用 Transcribe,对话用 Live,念稿用 TTS,配乐用 Lyria。 别用错工具,四者的价格差着一个数量级。
最后两句实话
这次发布真正的转折点,不是 71.4 分,也不是一小时五毛四。
是那句 Scale up from 30 original voices to an infinite library。
过去十几年,TTS 的交互范式是选择——给你一个下拉菜单,你从里面挑一个"最接近的"。这个范式默认了一件事:你想要的声音,必须先存在。
Gemini 3.8 TTS 把范式换成了设计。你想要的声音不存在?那就造一个。给它一段人设描述,它给你一个人。
从"选"到"造",这一步跨过去,配音这件事的性质就变了。它不再是一个资源调度问题(找谁录、什么时候录、多少钱),而变成了一个创作问题(这个角色应该是什么样的声音)。
至于那个让人不安的 30 秒——我倾向于这么看:能复刻声音的技术早晚会出现,区别只在于出现的时候,水印和授权机制有没有一起到位。 谷歌至少把这两样一起交付了。
先去 AI Studio 敲一段带 <sigh> 的台词听听。那声叹息值不值得,耳朵比 benchmark 表诚实。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档