---
url: /live/gemini_3_8_live_avatar.md
description: >-
  2026年9月24日谷歌发布 Gemini 3.8 Live with Live Avatar，把实时语音对话与低延迟流式视频原生耦合，AI
  客服第一次有了唇形同步的自然面孔。支持97种语言无缝切换、后台异步工具调用、预设与自定义头像，已在 Gemini Enterprise
  正式可用。本文带你一次看懂它是什么、能干什么、有哪些坑。
---

# 认识 Gemini 3.8 Live Avatar：语音助手终于有了一张脸

我妈从来不跟家里的智能音箱说话。

不是不会用，我教过她三次。她的原话是："跟一个看不见的人说话，别扭。"

当时我觉得这是老年人特有的执拗。后来自己做了一次语音客服的接入，看到后台数据才反应过来——**这根本不是老年人的问题，是所有人的问题。** 语音机器人上线后，平均通话时长几乎没变，但满意度掉了二十多个点。用户不是嫌它笨，是嫌它"不像在跟人打交道"。

所以当我看到 Live Avatar 的时候，第一反应其实挺刻薄的：**又来？**

"数字人"这三个字在国内已经被做烂了。你在直播间看到过那种——嘴在动，声音在响，但嘴型跟发音对不上，表情永远定格在"亲切微笑"。那不叫数字人，那叫会动的证件照。

但把谷歌这次的东西看完，我的刻薄收回了一半。尤其是看到模型卡里那句"只能持续几分钟的连续交互"——**一个厂商愿意主动写下"我的东西只能干几分钟"，说明它至少想清楚了边界。** 这比吹"7×24 小时不知疲倦"要诚实得多。

## 什么是 Gemini 3.8 Live Avatar

**Gemini 3.8 Live with Live Avatar**，发布于 **2026 年 9 月 24 日**，是上周（9 月 15 日）刚发布的实时对话模型 **Gemini 3.8 Live** 的一项新能力。官方对它的定义是给对话式 AI 加上一层 **"近乎实时的视觉呈现"（real-time visual presence）**。

技术上讲，它做了一件听起来简单、实际上很难的事：**把实时对话能力和低延迟流式视频原生耦合在一起**——官方原话是 *natively coupling our live dialogue capabilities with low-latency streaming video*。注意"原生耦合"这四个字，不是先把语音生成出来、再拿去驱动一张脸的两段式管线，而是一个端到端的东西。这也是它和市面上大部分"TTS + 数字人驱动"拼装方案的真正分界线。

结果就是一个**会听、会看、会说**，并且带着一张动态脸的对话体验：

* **听**：实时接收你的语音输入
* **看**：同时理解摄像头画面和屏幕共享内容
* **说**：用同步的语音、唇形和表情回应你

公告署名的两位是 **Shuo-yiin Chang（张硕尹，研究科学家）** 和 **CJ Zheng（软件工程师）**，代表 **Gemini Audio 团队** 发布。Google Cloud 那条 GA 公告则由 Gemini Live 组产品经理 **Fabien Blanc-paques** 署名。

先说清楚定位：**这是企业功能，不是玩具。** 它首次在 **Google Cloud Next 2026** 上预览，2026 年 9 月 24 日起在 **Gemini Enterprise** 正式可用（GA），目前通过**美国和欧盟的端点**提供服务。谷歌**没有宣布消费级版本**。

## 它有哪些特点

我按"哪个最颠覆"排了个序。

* **精确的唇形同步（precise lip-syncing）**：这是 Live Avatar 的立身之本。不是"嘴在动"，是嘴型跟发音真的对得上。做过数字人的都知道这两个之间的差距有多大
* **自然的表情与流畅的话轮切换（natural expressions, fluid turn-taking）**：它知道什么时候该闭嘴。被打断了能保持对话上下文，能在中断后恢复——这一点在企业场景里比唇形同步还重要
* **97 种语言无缝切换**：这是我认为最被低估的一条。原生多语言 **speech-to-speech 同步**，唇形和表情会**随语言动态调整**，在 97 种语言之间切换时**不降低视频保真度，也不引入视觉漂移**。做过本地化的都知道"视觉漂移"有多难搞——换个语言嘴型就开始飘，是这类系统的通病
* **异步工具调用（asynchronous tool calling）**：一边跟你说话，一边在后台触发工具调用和拉数据，**对话流不中断**。官方演示是给酒店客人办入住——它嘴上还在回答你的问题，后台已经把入住手续办完了
* **预设头像库 + 自定义头像**：预设库里有不同外观、声音和表现力的角色可选；企业也可以从**一张高质量参考图**出发生成完整可动的形象，保留参考对象的相似度、品牌风格或角色身份
* **全部署形态覆盖**：网页、移动端、交互式 kiosk（就是商场里那种立式触摸屏）都能上
* **SynthID 水印**：所有输出都织入**不可感知的水印**，直接嵌进音频和视频里，用于标识 AI 生成内容

> 一张参考图，就能生成一个会说话、会看摄像头、能帮你办入住的人。
>
> 这句话里的技术含量，和这句话里的风险含量，其实是同一个数量级。

## 真实场景：官方演示和客户怎么说

光看功能列表没意思，我们看它实际被怎么用。

**场景一：保险理赔受理。** Google Cloud 的演示里，客户用摄像头展示损失情况，头像一边看一边问；与此同时，由 **Google Agent Development Kit（ADK）** 构建的 agent 团队在后台验证保单、应用受理规则、组装理赔员文件包。**前台一个人在说话，后台一个团队在干活**——这是我对 Live Avatar 印象最深的一幅画面。

**场景二：购车助理。** **Cox Automotive** 为 **Autotrader** 做了一款 AI 购物助理，用实时屏幕高亮加工具调用，引导购车者做车辆搜索、比价和分期。执行副总裁兼首席产品官 **Marianne Johnson** 的说法很实在：

> 购物者越来越期待用自己的语言描述需求，而不是通过筛选和菜单。

**场景三：百万级通话量验证。** **Equal AI** CEO **Akhilesh Damaraju** 说，公司的个人 AI **每天处理超过 100 万通实时通话**，覆盖**九种印度语言**，而 Gemini 3.8 Live 改进了中断处理、多语言对话和工具调用的可靠性。这个量级不是 demo，这是生产环境。

另外两家也值得记一下：**Salesforce** 产品副总裁 **Bob Van Osten** 表示 Agentforce 正与 Gemini 3.8 Live 结合，把实时多模态和 agentic AI 捏在一起；**Specs** 的软件工程师 **Eric Walsh** 提到语音活动检测（VAD）和延迟的改进对他们平台是重要一步。

顺带补一个口径：在 Artificial Analysis 的 **Speech-to-Speech Quality Index** 榜上，**Gemini 3.8 Live Extended Thinking 以 82.6 分排第一**，标准版 Gemini 3.8 Live 排第五。Live Avatar 是架在标准版之上的视觉层。

## 快速上手：现在到底谁能用

先泼一盆冷水，再说怎么玩。

**门槛一：你得是 Gemini Enterprise 客户。** 目前 GA 只开在 Gemini Enterprise，走美国和欧盟端点，包含预置吞吐量、企业合规和严格的数据治理。**Extended Thinking 仍处于私密预览（private preview）**，别指望现在就用上。

**门槛二：自定义头像要白名单。** 从预设头像库里挑一个直接用没问题；想基于参考图生成自己的品牌形象，**需要企业白名单许可**——Google Cloud 把这道白名单和验证流程描述为防止身份冒用的保障。想要的话，找你的销售代表。

**门槛三：钱包。** 具体费率在 Google Cloud 定价页查，谷歌这次没公布完整公开的价目表，网上流传的数字先别信。

能用的话，路径是这样的：

1. 打开 **Gemini Enterprise 控制台**的多模态 Live 体验页：`console.cloud.google.com/agent-platform/studio/multimodal-live`，先零代码感受一下延迟和唇形
2. 想接进自己的系统，看 **Live API 文档**：`docs.cloud.google.com/gemini-enterprise-agent-platform/models/live-api`
3. 要预置吞吐量、定制部署架构、自定义头像白名单——**联系你的销售代表**，这三条都是走人工的

## 冷静看：几个必须知道的边界

这部分我觉得比功能列表重要。模型卡里写得挺坦白：

* **只能持续几分钟的连续交互**，不是数小时的长时使用。别想着拿它做 7×24 直播
* **输出上限 24K tokens**：Live Avatar 变体输出音频、视频和文本，但受限于 24K tokens 的输出上限（输入侧支持音频、图像、视频、文本，上下文窗口可达 **128K tokens**）
* **基于 Gemini 3 Pro**，知识截止时间是 **2025 年 1 月**。问它之后的事会瞎编
* 已知局限包括**可能出现幻觉**，以及**偶发的慢速或超时**
* **前沿安全评估**：相较 Gemini 3.7 Flash，没有发现显著的新功能或实质性性能提升。谷歌据此判断 Gemini 3.8 Audio 系列不太可能在其前沿安全框架下达到任何已跟踪或关键能力水平

还有一条不是技术边界，是现实边界：**用户愿不愿意跟一张合成的脸说话？**

技术能做不等于用户接受。如果你要部署，至少要提前想清楚三件事——客户能不能接受跟合成面孔对话、你要怎么向对方披露这是 AI、以及白名单规则对自建形象有什么要求。这三件事没想清楚之前，先别急着上线。

顺便把谷歌现在的音频产品线理一下，别用错工具：

* **Gemini 3.8 Live**（9/15）：实时语音对话
* **Gemini 3.8 Live with Live Avatar**（9/24）：实时语音 + 视觉形象
* **Gemini 3.8 Flash TTS / Flash-Lite TTS**（9/23）：文本转语音，念稿
* **Gemini 3.5 Transcribe**：语音转写

**对话用 Live，有脸用 Avatar，念稿用 TTS，听写用 Transcribe。**

## 最后两句实话

我妈那句"跟看不见的人说话别扭"，本质上说的是一件事：**人和人之间的信任，很大一部分是靠脸建立的。** 我们判断对方有没有在听、有没有听懂、有没有敷衍，靠的不是用词，是表情和时机。

所以 Live Avatar 真正做的事，不是"给语音助手加了个动画"。它是把**对话里那部分非语言的信息**补回来了——嘴型对不对得上、该不该闭嘴、被打断之后能不能接上。这三个问题，任何一个做不好，都会让人立刻意识到"对面是个机器"。

至于那张脸带来的风险，我的看法跟上次聊声音复刻时一样：**这类技术早晚会出现，区别只在于它出现的时候，水印和授权机制有没有一起到位。** 谷歌这次至少把 SynthID 织进了每一帧音视频，还把自定义头像锁在企业白名单后面。这不是完美的答案，但它是一个认真的开始。

最后提醒一句：**几分钟，不是几小时。** 想清楚你要它干的那件事是不是真的只需要几分钟——如果是，它可能正合适。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
