认识 Gemini 3.5 Transcribe:语音转文字终于学会「改口误」了
我先给你念一段真实发生过的话,你猜猜传统语音识别会把它转成什么:
"嗯……那个……我们下周二——啊不对,周三下午三点,在 A 座 1204 开个会,就是那个……关于订单 ID 八七二九三的那批货。"
传统转写会非常"忠诚"地把这段话一个字不落地交给你,包括你所有的犹豫:
嗯 那个 我们 下 周二 啊 不对 周三 下午 三点 在 A 座 1204 开个会 就是 那个 关于 订单 ID 八七二九三 的 那批 货
然后你还得自己读一遍,手动删掉"嗯""那个""啊不对",把"周二"改成"周三",补上标点。
这就是过去十年语音转写的真实体验:它只是个听写员,不是个编辑。 它忠实记录了你说话的过程,而不是你想表达的意思。
2026 年 8 月 26 日,谷歌发布了 Gemini 3.5 Transcribe,主打的恰恰是这个被所有人忽略、又被所有人嫌弃的环节。
转写准确率的战争其实早就打完了——差一个百分点,人类看不出来。真正没被解决的是:转出来的东西不能直接交给人看。
Gemini 3.5 Transcribe 是什么
Gemini 3.5 Transcribe 是谷歌的语音转文字(speech-to-text, STT)模型,官方称其为"迄今最精确的语音转写模型"。
先说清楚它的位置,免得跟别的概念混在一起:
- 它不是 Gemini Live(那个是边听边对话的语音交互产品)
- 它不是文本转语音(TTS)
- 它干的活很单纯:把音频变成可以直接用的文本
但在"单纯"的活里,它干得挺聪明。
从模型血缘上讲,它属于 Gemini 3.5 Audio 家族——这个家族有三个成员:Live Translate(实时翻译)、Transcribe(转写)和 Transcribe Live(实时流式转写)。三个都基于 Gemini 3 Pro 构建,DeepMind 在 2026 年 8 月发布了对应的模型卡片。
上下文窗口方面,Transcribe 和 Transcribe Live 是 96K token 输入 / 32K token 输出,比 Live Translate 的 128K/64K 小一圈——因为转写的输出是文本,用不着那么大。
它的前任是谷歌自己的 Chirp 3。谷歌这次给出的对比数据是:相比 Chirp 3,最终转写完成时间缩短了 70%。这个数字比准确率更值得注意,我后面会讲为什么。
它有哪些特点
先把硬指标摆上桌。以下数据来自谷歌官方博客,由第三方机构 Artificial Analysis 测得,注意这是谷歌自己引用的数字,不是独立审计:
| 指标 | 数值 | 说明 |
|---|---|---|
| 流式词错率(WER) | 4.0% | 边说边转的场景 |
| 非流式词错率(WER) | 2.6% | 已录好的音频 |
| 转写完成时间 | 比 Chirp 3 快 70% | 官方口径 |
| FLEURS 多语言(流式) | 5.50% WER | 覆盖其支持最好的一批语言 |
| FLEURS 多语言(非流式) | 5.04% WER | 同上 |
| 支持语言 | 85+ | 自动检测,含地区口音与方言 |
但真正让它不一样的,是下面这几条"软能力":
- 智能转写(Smart Transcription):这是它的招牌。自动清理口头禅("嗯""啊""那个")、自动修正口误(你说"下周二——不对,周三",它直接给你"周三")、自动加格式(标点、分段、大小写)。出来的东西是成稿,不是原始录音的文字版。
- 自定义词表(Custom Vocabulary):你给它一份专业术语表,它会照着改。医疗名词、产品代号、内部黑话、以及字母数字混排的字符串(邮政编码、订单号)这类传统转写最容易翻车的东西,都在补强范围内。
- 说话人分离:录音转写能标注最多 3 个说话人,并给出词级时间戳(每个词出现在第几秒)。超过 3 人属于实验性支持。
- 函数调用:转写过程中可以把活派给别的 Gemini 模型——比如让它生成一张图、读一份文件。目前这个能力在 macOS 版 Gemini 应用里已经可用。
- 实时语言切换:说着说着换个语言,它能跟得上,不用你手动声明。
- 噪声环境鲁棒性:官方强调在嘈杂真实环境、以及复杂术语场景下的表现,这是它拿来跟传统 ASR 划界线的地方。
4.0% 和 2.6% 这两个数字,说实话,用户感知不强。但"不用我再通读一遍删'嗯'"这件事,用户一秒就能感知到。
能用它干嘛:几个真实场景
场景一:会议纪要,从"记录"变成"能发"
以前的会议转写,交给你的是一份"流水账"。你拿到手还得做三件事:删口头禅、分说话人、理出待办。
3.5 Transcribe 直接把前两件做了。它能标注最多 3 位发言人的身份,并带上词级时间戳——意味着你可以点击文本跳回录音的对应位置。
谷歌提到的早期企业客户里,vivo、Intellitek Health、Lingopal 已经在测。这几个名字很有代表性:Intellitek Health 是医疗场景,医疗转写恰恰是"专业术语 + 高准确率要求 + 合规敏感"三重叠加的硬骨头——自定义词表在这里是刚需,不是加分项。
场景二:实时字幕与语音 Agent
流式转写这条线走的是 Live API,模型 ID gemini-3.5-transcribe-live,官方给的是亚秒级延迟。
这个延迟数字决定了它能不能用在"对话"场景。做语音 Agent 的都知道,超过 1 秒的延迟会让用户开始重复自己说过的话,然后整个交互就崩了。
生态这边已经有实打实的接入:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 都在往 Gemini Live API 上接。这些平台负责实时媒体流那一层,你只需要关心业务界面。
一堆实时通信框架抢着接入,比任何 benchmark 都更能说明"这东西能上生产"。榜单可以刷,集成不会骗人。
场景三:语音直接当输入法用
这条线更贴近普通人。谷歌把 3.5 Transcribe 塞进了好几个日常入口:
- Gboard(Android):新功能 Rambler,把你说的话直接变成格式整洁的文字,滤掉口头禅。还能用语音改错别字、换写作风格。
- Google Antigravity:经你授权后,它会结合屏幕上下文和聊天历史来提升转写准确度——文件名、Agent 的思考过程、当前活跃文档里的词,都能认。这个组合很妙,属于"IDE 里的语音输入终于能用"的关键一步。
- Google AI Studio:Build 模式下可以用嘴 vibe coding,边说边生成应用。
- macOS 版 Gemini 应用:语音命令 + 屏幕上下文,可以总结本地文件、在光标处生成图片。
- Chrome:语音输入到任意网页输入框,官方说"coming soon"。
我个人觉得 Antigravity 那一套"屏幕上下文 + 语音"是最被低估的。语音输入最大的坑从来不是"听不清",是"听不懂你在说什么专有名词"。IDE 里那些 useEffect、那些文件名、那些变量名——通用转写模型全军覆没。把屏幕上下文喂进去,等于给转写模型开了天眼。
初体验:怎么上手
目前模型处于**公开预览(public preview)**阶段,通过 Google AI Studio 的 Gemini API 和 Gemini Enterprise Agent Platform 开放。
它拆成了两套 API,选哪个取决于你的音频是"正在发生"还是"已经录好":
| 实时流式 | 预录音频 | |
|---|---|---|
| API | Live API | Interactions API |
| 模型 ID | gemini-3.5-transcribe-live | gemini-3.5-transcribe |
| 适用 | 语音 Agent、实时字幕、交互式语音 | 会议录音、通话记录、归档音频 |
| 亮点 | 亚秒级延迟、双向流 | 说话人分离、词级时间戳 |
先用 Python 跑通一个预录音频的转写,大概长这样(基于公开预览的 SDK 形态,以官方文档为准):
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
# 上传你的音频文件
audio_file = client.files.upload(file="meeting.mp3")
# 用 gemini-3.5-transcribe 转写
response = client.models.generate_content(
model="gemini-3.5-transcribe",
contents=[
"请转写这段会议录音,标注说话人,并整理出待办事项。",
audio_file,
],
)
print(response.text)想做实时流式,就换 Live API 那条路:
from google import genai
client = genai.Client(api_key="YOUR_API_KEY")
async with client.aio.live.connect(
model="gemini-3.5-transcribe-live"
) as session:
# 持续把麦克风音频帧送进去,实时拿到文本
async for text in session.receive():
print(text, end="", flush=True)几条实操提醒:
- 别自己再写一个"清理层"。 这是它最大的价值所在。很多团队现有的链路是"Whisper/Deepgram 转写 → 再调一次 LLM 洗一遍 → 格式化",3.5 Transcribe 想把中间那一步直接吃掉。你评估它的时候,比的不是 WER 差那零点几个点,而是能不能把你现有的清理环节整个删掉。
- 先喂词表。 有行业术语、产品名、订单号这类东西,务必用自定义词表,提效非常明显。
- 注意地区可用性。 文档提示上传视频/音频的编辑类能力并非所有地区都开放,接入前先确认你所在区域。
- 3 人以上的说话人分离是实验性的,别把它放在关键业务流程上。
- 定价目前没有单独公开,沿用 Gemini API 现有费率。上线前记得自己算一遍账。
一个冷静的提醒:谷歌这次发布没有给出跟 Whisper、Deepgram、AssemblyAI、ElevenLabs Scribe 的横向对比。它的所有数字都是"我比我的上一代强"。想换栈的团队,请务必拿自己的音频跑一遍,别信宣传稿。多语言那组 FLEURS 数据(5.50% / 5.04%)也提醒了一件事:中文等非英语语种的准确率,跟它最好的英语成绩还有 2–3 个百分点的差距。
进阶
Gemini 3.5 Transcribe 是"Gemini 3.5 Audio"家族的一员,想顺着这条线往下挖,我们站点这几篇可以接着看:
- 什么是 Gemini Live——跟它共用 Live API 的"边听边聊"那位
- 什么是 Google AI Studio——拿 API Key、跑 Build 模式语音 vibe coding 的地方
- Antigravity(反重力)——把语音 + 屏幕上下文玩得最花的那个 IDE
- 认识 Google DeepMind——Gemini 3.5 Audio 和它背后的模型家族
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档