认识 Gemini 3.8 Live Avatar:语音助手终于有了一张脸
我妈从来不跟家里的智能音箱说话。
不是不会用,我教过她三次。她的原话是:"跟一个看不见的人说话,别扭。"
当时我觉得这是老年人特有的执拗。后来自己做了一次语音客服的接入,看到后台数据才反应过来——这根本不是老年人的问题,是所有人的问题。 语音机器人上线后,平均通话时长几乎没变,但满意度掉了二十多个点。用户不是嫌它笨,是嫌它"不像在跟人打交道"。
所以当我看到 Live Avatar 的时候,第一反应其实挺刻薄的:又来?
"数字人"这三个字在国内已经被做烂了。你在直播间看到过那种——嘴在动,声音在响,但嘴型跟发音对不上,表情永远定格在"亲切微笑"。那不叫数字人,那叫会动的证件照。
但把谷歌这次的东西看完,我的刻薄收回了一半。尤其是看到模型卡里那句"只能持续几分钟的连续交互"——一个厂商愿意主动写下"我的东西只能干几分钟",说明它至少想清楚了边界。 这比吹"7×24 小时不知疲倦"要诚实得多。
什么是 Gemini 3.8 Live Avatar
Gemini 3.8 Live with Live Avatar,发布于 2026 年 9 月 24 日,是上周(9 月 15 日)刚发布的实时对话模型 Gemini 3.8 Live 的一项新能力。官方对它的定义是给对话式 AI 加上一层 "近乎实时的视觉呈现"(real-time visual presence)。
技术上讲,它做了一件听起来简单、实际上很难的事:把实时对话能力和低延迟流式视频原生耦合在一起——官方原话是 natively coupling our live dialogue capabilities with low-latency streaming video。注意"原生耦合"这四个字,不是先把语音生成出来、再拿去驱动一张脸的两段式管线,而是一个端到端的东西。这也是它和市面上大部分"TTS + 数字人驱动"拼装方案的真正分界线。
结果就是一个会听、会看、会说,并且带着一张动态脸的对话体验:
- 听:实时接收你的语音输入
- 看:同时理解摄像头画面和屏幕共享内容
- 说:用同步的语音、唇形和表情回应你
公告署名的两位是 Shuo-yiin Chang(张硕尹,研究科学家) 和 CJ Zheng(软件工程师),代表 Gemini Audio 团队 发布。Google Cloud 那条 GA 公告则由 Gemini Live 组产品经理 Fabien Blanc-paques 署名。
先说清楚定位:这是企业功能,不是玩具。 它首次在 Google Cloud Next 2026 上预览,2026 年 9 月 24 日起在 Gemini Enterprise 正式可用(GA),目前通过美国和欧盟的端点提供服务。谷歌没有宣布消费级版本。
它有哪些特点
我按"哪个最颠覆"排了个序。
- 精确的唇形同步(precise lip-syncing):这是 Live Avatar 的立身之本。不是"嘴在动",是嘴型跟发音真的对得上。做过数字人的都知道这两个之间的差距有多大
- 自然的表情与流畅的话轮切换(natural expressions, fluid turn-taking):它知道什么时候该闭嘴。被打断了能保持对话上下文,能在中断后恢复——这一点在企业场景里比唇形同步还重要
- 97 种语言无缝切换:这是我认为最被低估的一条。原生多语言 speech-to-speech 同步,唇形和表情会随语言动态调整,在 97 种语言之间切换时不降低视频保真度,也不引入视觉漂移。做过本地化的都知道"视觉漂移"有多难搞——换个语言嘴型就开始飘,是这类系统的通病
- 异步工具调用(asynchronous tool calling):一边跟你说话,一边在后台触发工具调用和拉数据,对话流不中断。官方演示是给酒店客人办入住——它嘴上还在回答你的问题,后台已经把入住手续办完了
- 预设头像库 + 自定义头像:预设库里有不同外观、声音和表现力的角色可选;企业也可以从一张高质量参考图出发生成完整可动的形象,保留参考对象的相似度、品牌风格或角色身份
- 全部署形态覆盖:网页、移动端、交互式 kiosk(就是商场里那种立式触摸屏)都能上
- SynthID 水印:所有输出都织入不可感知的水印,直接嵌进音频和视频里,用于标识 AI 生成内容
一张参考图,就能生成一个会说话、会看摄像头、能帮你办入住的人。
这句话里的技术含量,和这句话里的风险含量,其实是同一个数量级。
真实场景:官方演示和客户怎么说
光看功能列表没意思,我们看它实际被怎么用。
场景一:保险理赔受理。 Google Cloud 的演示里,客户用摄像头展示损失情况,头像一边看一边问;与此同时,由 Google Agent Development Kit(ADK) 构建的 agent 团队在后台验证保单、应用受理规则、组装理赔员文件包。前台一个人在说话,后台一个团队在干活——这是我对 Live Avatar 印象最深的一幅画面。
场景二:购车助理。 Cox Automotive 为 Autotrader 做了一款 AI 购物助理,用实时屏幕高亮加工具调用,引导购车者做车辆搜索、比价和分期。执行副总裁兼首席产品官 Marianne Johnson 的说法很实在:
购物者越来越期待用自己的语言描述需求,而不是通过筛选和菜单。
场景三:百万级通话量验证。 Equal AI CEO Akhilesh Damaraju 说,公司的个人 AI 每天处理超过 100 万通实时通话,覆盖九种印度语言,而 Gemini 3.8 Live 改进了中断处理、多语言对话和工具调用的可靠性。这个量级不是 demo,这是生产环境。
另外两家也值得记一下:Salesforce 产品副总裁 Bob Van Osten 表示 Agentforce 正与 Gemini 3.8 Live 结合,把实时多模态和 agentic AI 捏在一起;Specs 的软件工程师 Eric Walsh 提到语音活动检测(VAD)和延迟的改进对他们平台是重要一步。
顺带补一个口径:在 Artificial Analysis 的 Speech-to-Speech Quality Index 榜上,Gemini 3.8 Live Extended Thinking 以 82.6 分排第一,标准版 Gemini 3.8 Live 排第五。Live Avatar 是架在标准版之上的视觉层。
快速上手:现在到底谁能用
先泼一盆冷水,再说怎么玩。
门槛一:你得是 Gemini Enterprise 客户。 目前 GA 只开在 Gemini Enterprise,走美国和欧盟端点,包含预置吞吐量、企业合规和严格的数据治理。Extended Thinking 仍处于私密预览(private preview),别指望现在就用上。
门槛二:自定义头像要白名单。 从预设头像库里挑一个直接用没问题;想基于参考图生成自己的品牌形象,需要企业白名单许可——Google Cloud 把这道白名单和验证流程描述为防止身份冒用的保障。想要的话,找你的销售代表。
门槛三:钱包。 具体费率在 Google Cloud 定价页查,谷歌这次没公布完整公开的价目表,网上流传的数字先别信。
能用的话,路径是这样的:
- 打开 Gemini Enterprise 控制台的多模态 Live 体验页:
console.cloud.google.com/agent-platform/studio/multimodal-live,先零代码感受一下延迟和唇形 - 想接进自己的系统,看 Live API 文档:
docs.cloud.google.com/gemini-enterprise-agent-platform/models/live-api - 要预置吞吐量、定制部署架构、自定义头像白名单——联系你的销售代表,这三条都是走人工的
冷静看:几个必须知道的边界
这部分我觉得比功能列表重要。模型卡里写得挺坦白:
- 只能持续几分钟的连续交互,不是数小时的长时使用。别想着拿它做 7×24 直播
- 输出上限 24K tokens:Live Avatar 变体输出音频、视频和文本,但受限于 24K tokens 的输出上限(输入侧支持音频、图像、视频、文本,上下文窗口可达 128K tokens)
- 基于 Gemini 3 Pro,知识截止时间是 2025 年 1 月。问它之后的事会瞎编
- 已知局限包括可能出现幻觉,以及偶发的慢速或超时
- 前沿安全评估:相较 Gemini 3.7 Flash,没有发现显著的新功能或实质性性能提升。谷歌据此判断 Gemini 3.8 Audio 系列不太可能在其前沿安全框架下达到任何已跟踪或关键能力水平
还有一条不是技术边界,是现实边界:用户愿不愿意跟一张合成的脸说话?
技术能做不等于用户接受。如果你要部署,至少要提前想清楚三件事——客户能不能接受跟合成面孔对话、你要怎么向对方披露这是 AI、以及白名单规则对自建形象有什么要求。这三件事没想清楚之前,先别急着上线。
顺便把谷歌现在的音频产品线理一下,别用错工具:
- Gemini 3.8 Live(9/15):实时语音对话
- Gemini 3.8 Live with Live Avatar(9/24):实时语音 + 视觉形象
- Gemini 3.8 Flash TTS / Flash-Lite TTS(9/23):文本转语音,念稿
- Gemini 3.5 Transcribe:语音转写
对话用 Live,有脸用 Avatar,念稿用 TTS,听写用 Transcribe。
最后两句实话
我妈那句"跟看不见的人说话别扭",本质上说的是一件事:人和人之间的信任,很大一部分是靠脸建立的。 我们判断对方有没有在听、有没有听懂、有没有敷衍,靠的不是用词,是表情和时机。
所以 Live Avatar 真正做的事,不是"给语音助手加了个动画"。它是把对话里那部分非语言的信息补回来了——嘴型对不对得上、该不该闭嘴、被打断之后能不能接上。这三个问题,任何一个做不好,都会让人立刻意识到"对面是个机器"。
至于那张脸带来的风险,我的看法跟上次聊声音复刻时一样:这类技术早晚会出现,区别只在于它出现的时候,水印和授权机制有没有一起到位。 谷歌这次至少把 SynthID 织进了每一帧音视频,还把自定义头像锁在企业白名单后面。这不是完美的答案,但它是一个认真的开始。
最后提醒一句:几分钟,不是几小时。 想清楚你要它干的那件事是不是真的只需要几分钟——如果是,它可能正合适。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档