Skip to content

认识 Gemini 3.5 Transcribe:语音转文字终于学会「改口误」了

我先给你念一段真实发生过的话,你猜猜传统语音识别会把它转成什么:

"嗯……那个……我们下周二——啊不对,周三下午三点,在 A 座 1204 开个会,就是那个……关于订单 ID 八七二九三的那批货。"

传统转写会非常"忠诚"地把这段话一个字不落地交给你,包括你所有的犹豫:

嗯 那个 我们 下 周二 啊 不对 周三 下午 三点 在 A 座 1204 开个会 就是 那个 关于 订单 ID 八七二九三 的 那批 货

然后你还得自己读一遍,手动删掉"嗯""那个""啊不对",把"周二"改成"周三",补上标点。

这就是过去十年语音转写的真实体验:它只是个听写员,不是个编辑。 它忠实记录了你说话的过程,而不是你想表达的意思。

2026 年 8 月 26 日,谷歌发布了 Gemini 3.5 Transcribe,主打的恰恰是这个被所有人忽略、又被所有人嫌弃的环节。

转写准确率的战争其实早就打完了——差一个百分点,人类看不出来。真正没被解决的是:转出来的东西不能直接交给人看。

Gemini 3.5 Transcribe 是什么

Gemini 3.5 Transcribe 是谷歌的语音转文字(speech-to-text, STT)模型,官方称其为"迄今最精确的语音转写模型"。

先说清楚它的位置,免得跟别的概念混在一起:

  • 它不是 Gemini Live(那个是边听边对话的语音交互产品)
  • 它不是文本转语音(TTS)
  • 它干的活很单纯:把音频变成可以直接用的文本

但在"单纯"的活里,它干得挺聪明。

从模型血缘上讲,它属于 Gemini 3.5 Audio 家族——这个家族有三个成员:Live Translate(实时翻译)、Transcribe(转写)和 Transcribe Live(实时流式转写)。三个都基于 Gemini 3 Pro 构建,DeepMind 在 2026 年 8 月发布了对应的模型卡片

上下文窗口方面,Transcribe 和 Transcribe Live 是 96K token 输入 / 32K token 输出,比 Live Translate 的 128K/64K 小一圈——因为转写的输出是文本,用不着那么大。

它的前任是谷歌自己的 Chirp 3。谷歌这次给出的对比数据是:相比 Chirp 3,最终转写完成时间缩短了 70%。这个数字比准确率更值得注意,我后面会讲为什么。

它有哪些特点

先把硬指标摆上桌。以下数据来自谷歌官方博客,由第三方机构 Artificial Analysis 测得,注意这是谷歌自己引用的数字,不是独立审计:

指标数值说明
流式词错率(WER)4.0%边说边转的场景
非流式词错率(WER)2.6%已录好的音频
转写完成时间比 Chirp 3 快 70%官方口径
FLEURS 多语言(流式)5.50% WER覆盖其支持最好的一批语言
FLEURS 多语言(非流式)5.04% WER同上
支持语言85+自动检测,含地区口音与方言

但真正让它不一样的,是下面这几条"软能力":

  • 智能转写(Smart Transcription):这是它的招牌。自动清理口头禅("嗯""啊""那个")、自动修正口误(你说"下周二——不对,周三",它直接给你"周三")、自动加格式(标点、分段、大小写)。出来的东西是成稿,不是原始录音的文字版。
  • 自定义词表(Custom Vocabulary):你给它一份专业术语表,它会照着改。医疗名词、产品代号、内部黑话、以及字母数字混排的字符串(邮政编码、订单号)这类传统转写最容易翻车的东西,都在补强范围内。
  • 说话人分离:录音转写能标注最多 3 个说话人,并给出词级时间戳(每个词出现在第几秒)。超过 3 人属于实验性支持。
  • 函数调用:转写过程中可以把活派给别的 Gemini 模型——比如让它生成一张图、读一份文件。目前这个能力在 macOS 版 Gemini 应用里已经可用。
  • 实时语言切换:说着说着换个语言,它能跟得上,不用你手动声明。
  • 噪声环境鲁棒性:官方强调在嘈杂真实环境、以及复杂术语场景下的表现,这是它拿来跟传统 ASR 划界线的地方。

4.0% 和 2.6% 这两个数字,说实话,用户感知不强。但"不用我再通读一遍删'嗯'"这件事,用户一秒就能感知到。

能用它干嘛:几个真实场景

场景一:会议纪要,从"记录"变成"能发"

以前的会议转写,交给你的是一份"流水账"。你拿到手还得做三件事:删口头禅、分说话人、理出待办。

3.5 Transcribe 直接把前两件做了。它能标注最多 3 位发言人的身份,并带上词级时间戳——意味着你可以点击文本跳回录音的对应位置。

谷歌提到的早期企业客户里,vivo、Intellitek Health、Lingopal 已经在测。这几个名字很有代表性:Intellitek Health 是医疗场景,医疗转写恰恰是"专业术语 + 高准确率要求 + 合规敏感"三重叠加的硬骨头——自定义词表在这里是刚需,不是加分项。

场景二:实时字幕与语音 Agent

流式转写这条线走的是 Live API,模型 ID gemini-3.5-transcribe-live,官方给的是亚秒级延迟

这个延迟数字决定了它能不能用在"对话"场景。做语音 Agent 的都知道,超过 1 秒的延迟会让用户开始重复自己说过的话,然后整个交互就崩了。

生态这边已经有实打实的接入:Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents 都在往 Gemini Live API 上接。这些平台负责实时媒体流那一层,你只需要关心业务界面。

一堆实时通信框架抢着接入,比任何 benchmark 都更能说明"这东西能上生产"。榜单可以刷,集成不会骗人。

场景三:语音直接当输入法用

这条线更贴近普通人。谷歌把 3.5 Transcribe 塞进了好几个日常入口:

  • Gboard(Android):新功能 Rambler,把你说的话直接变成格式整洁的文字,滤掉口头禅。还能用语音改错别字、换写作风格。
  • Google Antigravity:经你授权后,它会结合屏幕上下文和聊天历史来提升转写准确度——文件名、Agent 的思考过程、当前活跃文档里的词,都能认。这个组合很妙,属于"IDE 里的语音输入终于能用"的关键一步。
  • Google AI Studio:Build 模式下可以用嘴 vibe coding,边说边生成应用。
  • macOS 版 Gemini 应用:语音命令 + 屏幕上下文,可以总结本地文件、在光标处生成图片。
  • Chrome:语音输入到任意网页输入框,官方说"coming soon"。

我个人觉得 Antigravity 那一套"屏幕上下文 + 语音"是最被低估的。语音输入最大的坑从来不是"听不清",是"听不懂你在说什么专有名词"。IDE 里那些 useEffect、那些文件名、那些变量名——通用转写模型全军覆没。把屏幕上下文喂进去,等于给转写模型开了天眼。

初体验:怎么上手

目前模型处于**公开预览(public preview)**阶段,通过 Google AI Studio 的 Gemini APIGemini Enterprise Agent Platform 开放。

它拆成了两套 API,选哪个取决于你的音频是"正在发生"还是"已经录好":

实时流式预录音频
APILive APIInteractions API
模型 IDgemini-3.5-transcribe-livegemini-3.5-transcribe
适用语音 Agent、实时字幕、交互式语音会议录音、通话记录、归档音频
亮点亚秒级延迟、双向流说话人分离、词级时间戳

先用 Python 跑通一个预录音频的转写,大概长这样(基于公开预览的 SDK 形态,以官方文档为准):

python
from google import genai

client = genai.Client(api_key="YOUR_API_KEY")

# 上传你的音频文件
audio_file = client.files.upload(file="meeting.mp3")

# 用 gemini-3.5-transcribe 转写
response = client.models.generate_content(
    model="gemini-3.5-transcribe",
    contents=[
        "请转写这段会议录音,标注说话人,并整理出待办事项。",
        audio_file,
    ],
)

print(response.text)

想做实时流式,就换 Live API 那条路:

python
from google import genai

client = genai.Client(api_key="YOUR_API_KEY")

async with client.aio.live.connect(
    model="gemini-3.5-transcribe-live"
) as session:
    # 持续把麦克风音频帧送进去,实时拿到文本
    async for text in session.receive():
        print(text, end="", flush=True)

几条实操提醒:

  1. 别自己再写一个"清理层"。 这是它最大的价值所在。很多团队现有的链路是"Whisper/Deepgram 转写 → 再调一次 LLM 洗一遍 → 格式化",3.5 Transcribe 想把中间那一步直接吃掉。你评估它的时候,比的不是 WER 差那零点几个点,而是能不能把你现有的清理环节整个删掉
  2. 先喂词表。 有行业术语、产品名、订单号这类东西,务必用自定义词表,提效非常明显。
  3. 注意地区可用性。 文档提示上传视频/音频的编辑类能力并非所有地区都开放,接入前先确认你所在区域。
  4. 3 人以上的说话人分离是实验性的,别把它放在关键业务流程上。
  5. 定价目前没有单独公开,沿用 Gemini API 现有费率。上线前记得自己算一遍账。

一个冷静的提醒:谷歌这次发布没有给出跟 Whisper、Deepgram、AssemblyAI、ElevenLabs Scribe 的横向对比。它的所有数字都是"我比我的上一代强"。想换栈的团队,请务必拿自己的音频跑一遍,别信宣传稿。多语言那组 FLEURS 数据(5.50% / 5.04%)也提醒了一件事:中文等非英语语种的准确率,跟它最好的英语成绩还有 2–3 个百分点的差距。

进阶

Gemini 3.5 Transcribe 是"Gemini 3.5 Audio"家族的一员,想顺着这条线往下挖,我们站点这几篇可以接着看:

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档