Skip to content

Gemini 智能体视频理解:让 AI 学会「拖进度条」,一小时视频少烧 88% Token

你有没有过这种体验:一段 90 分钟的会议录像,你只想问一句「谁在第 47 分钟提了预算」——

然后模型乖乖地把 5400 帧,一帧不落,全看了一遍。

它不是笨,它是没有别的选择。在 2026 年 9 月 1 日之前,Gemini 处理视频的方式只有一种:按固定帧率从头扫到尾,默认每秒抽 1 帧,配上音轨,一股脑塞进上下文,然后一次性作答。

这就好比你想在《大英百科全书》里查一个词,却被告知「好的,请把整套书先通读一遍,读完了我们再聊」。

更扎心的是账:一小时视频,按低分辨率算大约 36 万输入 Token;换成高分辨率,直接飙到 108 万。而你可能只关心其中的 3 秒钟。

2026 年 9 月 1 日,谷歌给 Gemini API 加了一个新开关,把这件事彻底改了。

智能体视频理解是什么

智能体视频理解(Agentic Video Understanding) 是 Gemini API 新增的一种视频处理模式:模型不再被动地按固定帧率吞掉整条视频,而是自己决定要看什么、看多细、通过哪种模态看——画面帧、音频,还是转写字幕。

官方口径的三个数字很能说明问题:

  • Token 消耗最高降低 88%
  • 分析成本最高降低 66%
  • 准确率最高提升 7%

这次上线的具体信息,先捋清楚:

项目内容
发布时间2026 年 9 月 1 日(美国时间)
支持模型gemini-3.7-flashgemini-3.6-flashgemini-3.5-flash-lite
可用平台Google AI Studio、Gemini Enterprise Agent Platform 的 Gemini API
支持输入本地上传视频、公开 YouTube 视频链接
收费方式标准 Gemini API Token 定价,不收额外功能费
启用方式视频输入对象里设置 processing: "agentic"

有一点必须说清楚,免得搞混:这是视频「理解」,不是视频「生成」。这三个模型是「视频进、文本出」。你要生成或编辑视频,那是 Gemini Omni Flash 那条线的事,两条完全不同的路。

以前是「模型被视频看」,现在是「模型去看视频」。主语换了一下,整个成本结构就变了。

它到底是怎么「看」视频的

谷歌把内部流程叫做 Think, Act, Observe(思考—行动—观察)循环,拆开看就四步:

  • 先放个指针(Pass by reference)。初始上下文里只放视频 ID、时长、容器元数据这些轻量信息,不把整条视频塞进去
  • 规划(Plan)。模型根据你问的问题,判断哪些时间点、哪些模态可能藏着答案
  • 取片段(Fetch slices)。它可以去检索带时间戳的转写文本,可以拉音轨,也可以只加载某一段的帧序列。官方给的两个典型采样率:0.1 FPS 用于快速略读5–10 FPS 用于查快速运动
  • 观察、再重复(Observe and repeat)。取回来的材料变成新的上下文,模型觉得不够就再取一轮,直到它认为够写出答案了

如果你想知道自己的请求到底有没有真的走智能体导航,去看响应里的 interaction.steps。出现了 processing_call(模型请求了某段视频或字幕)和配套的 processing_result(取回来的东西),就说明动态导航跑起来了。没出现?那你可能白测了。

这里有个前情提要:这套思路不是第一次出现。2026 年 1 月,谷歌给 Gemini 3 Flash 上过 agentic vision——模型自己写 Python 代码去缩放、裁剪、标注图像,看着结果再决定下一步。这次不过是把同样的循环,从图片搬到了视频时间轴上。

88% 这个数字,是哪儿来的

谷歌给的是三个标准长视频基准的对比(Gemini 3.7 Flash,开智能体模式 vs 静态 1 FPS 处理):

基准测试静态处理 Token智能体 Token降幅静态准确率智能体准确率变化
Minerva80.9K33.6K-58.4%73.7%79.0%+5.3
1H-VideoQA397.6K47.7K-88.0%87.5%88.5%+1.0
LVBench300.3K36.0K-88.0%85.1%88.6%+3.5

注意看 Minerva 那一行:降幅只有 58.4%,但准确率涨了 5.3 个百分点——这是三个里面涨得最多的。这说明一件事:智能体模式不是单纯在「省」,它把省下来的预算花在了刀刃上。

再看一个官方给的成本账。静态模式下低分辨率每秒约 100 个 Token,一小时就是 36 万输入 Token。按 Gemini 3.7 Flash / 3.6 Flash 的标准价 $0.75 / 百万输入 Token(2026 年 12 月 31 日前有效),光输入就要 $0.27

打满 88% 折扣后,输入变成约 4.32 万 Token,约合 $0.032

但我得给你泼盆冷水——88% 是上限,不是全场打折券

  • 智能体探索过程会产生 thinking Token,按输出价计费
  • 它实际加载的字幕、音频、帧会变成 工具调用 Token
  • 问题问得越宽泛、画面越密集,它就越可能多看一些

所以真正的账要这么算:省下来的输入 Token,减去多出来的思考和工具调用 Token。我见过太多人只盯着一个字段就宣布「省了 88%」,然后看到月底账单人傻了。

能拿它干什么

官方列了四类新活,每一类都对应一个曾经特别贵、或者干脆做不到的场景。

一、亚秒级时刻检索

1 FPS 的采样,意味着每帧之间隔着一整秒。镜头切在这一秒中间?动作发生在这一秒中间?漏了。

智能体模式可以对感兴趣的时间窗口用更高帧率重新采样,精准定位状态变化和剪辑点。对自动化视频编辑来说,这是从「大概在 3 分 20 秒左右」变成「第 3 分 20.4 秒,第 3 分 20.4 帧」的区别。

二、长视频「大海捞针」

这是被改动最大的一块。数小时的录像里找一个事件、一句话、一个论点——以前你得先烧掉几百万 Token 把整条视频塞进上下文,现在模型先翻字幕目录,锁定范围,再针对性调帧。

受益最明显的是长内容:官方点名的范围是 10 分钟教学视频到 90 分钟讲座,乃至数小时录像

三、异常检测

先粗扫,发现某个时间窗口「有点不对劲」,再回去高帧率细看快速运动和细微视觉伪影。质检、巡检、安防录像这类场景,天然就是这个工作流。

四、动作与物体计数

随时间推移精确追踪重复的物理动作和不同物体。工厂里数一皮带的产品、健身房里数一组动作、仓库里数托盘——这类活以前要么靠人盯,要么靠专门的视觉方案。

几个真实的工作流

我不编客户名单,但下面这几种用法是能立刻落地的,你可以自己对号入座:

  • 培训部门:上传一场两小时的内部 workshop 录像,问「主讲讲的三个核心流程分别是什么,各自配了什么例子」,再追问「关于升级上报,他具体怎么说的」。模型先从字幕入手,遇到有 PPT 或实操演示的地方再调帧,剩下的部分一眼都不看
  • 用户研究:一小时的访谈录像,问「受访者提到注册流程卡住的所有时刻,给出时间戳」。答案带时间戳,研究员能回到原始录像核对——这点很关键,检索不等于验证
  • 媒体档案:把一场两小时的发布会录像丢进去,问「什么时候提到了某个产品名」。编辑拿到的是候选时刻和时间戳,而不是一份含糊的全场摘要
  • 制造业质检:先用智能体模式在长录像里定位「防护门被打开」的区间,再把那一小段切出来用静态模式逐帧复核。先用智能体找街区,再用静态验门牌,这个组合比任何单一模式都靠谱
  • 教育产品:围绕一场讲座建一个 interaction,学生后续追问时传 previous_interaction_id。服务端保留视频上下文,产品不用每轮重放整段对话

快速上手

第一步:装 SDK、配 Key

去 Google AI Studio 建一个 API Key,塞进环境变量:

bash
export GEMINI_API_KEY="YOUR_API_KEY"
pip install -U google-genai

第二步:上传视频 + 开智能体模式

python
import time
from google import genai

client = genai.Client()

# 上传长视频(超过 20MB 一律走 Files API,别用 inline)
video_file = client.files.upload(file="path/to/lecture.mp4")

while video_file.state.name == "PROCESSING":
    time.sleep(2)
    video_file = client.files.get(name=video_file.name)

# 关键:processing 写在「视频对象」里,不是写在请求上
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": video_file.uri,
            "mime_type": video_file.mime_type,
            "processing": "agentic"        # ← 就这一行
        },
        {"type": "text", "text": "这段录像里提出的三个主要论点是什么?"}
    ]
)
print(interaction.output_text)

三个容易写错的地方:

  • processing 必须写在视频输入对象内部,写在请求级别是不生效的。这也是它的好处——一条请求里可以混着来:一个 45 分钟的录播走 agentic,旁边一个 10 秒的对照片段走 static,各管各的
  • 视频放前面,文字 prompt 放后面。官方推荐这个顺序
  • Interactions APIclient.interactions.create),而不是老的 GenerateContent。虽然两个接口都支持,但只有 Interactions 的响应会暴露 processing_call / processing_result,你能验证模式真的生效了

第三步:验证一下,别盲信

python
for step in interaction.steps:
    print(step.type)   # 看到 processing_call / processing_result 才算真跑起来了

第四步:一个请求里混用两种模式

python
interaction = client.interactions.create(
    model="gemini-3.7-flash",
    input=[
        {
            "type": "video",
            "uri": long_lecture.uri,
            "mime_type": "video/mp4",
            "processing": "agentic"      # 长录播:让模型自己找
        },
        {
            "type": "video",
            "uri": short_clip.uri,
            "mime_type": "video/mp4",
            "processing": "static"       # 短片段:逐帧扫,稳
        },
        {"type": "text", "text": "对比两段内容对同一问题的说法是否一致"}
    ]
)

如果你用的是 Vertex AI,对应的字段叫 mediaProcessing,取值是 AGENTIC / STATIC,写在 part 上:

json
{
  "fileData": { "mimeType": "video/mp4", "fileUri": "gs://..." },
  "mediaProcessing": "AGENTIC"
}

什么时候别用它

热度归热度,该泼的冷水还是得泼。智能体模式不是静态模式的替代品,它是第二个选项。

下面这几种情况,静态模式反而更好:

  • 短视频(5 分钟以内)且对延迟敏感。智能体模式要先推理、要发内部工具调用、要等材料回来,官方自己承认这会略微增加首 Token 时间。30 秒的产品短片?别折腾了
  • 你已经知道精确区间start_offsetend_offset、自定义 fps 这些控制只在静态模式下生效。既然你已经知道是第 12 分 30 秒到第 15 分,直接用静态模式切一段,又快又便宜又可预测
  • 需要全时间线一致性扫描。逐帧过一遍反而更保险

还有几个实操的坑:

  • 上传限制。请求总量超过 20MB 就走 Files API。免费账户单文件上限 2GB,付费 20GB。官方文档自己在这块有前后矛盾的地方(对比表写 inline 可到 100MB,细则又写 20MB),按保守的 20MB 走
  • YouTube 链接只支持公开视频,私密和不公开的链接不行。免费层每天 YouTube 输入上限 8 小时
  • 上下文容量。100 万 Token 上下文的模型,最多处理约 3 小时低分辨率视频,或 1 小时高分辨率视频
  • 无状态请求有陷阱。用 previous_interaction_id 是有状态的,服务端帮你留着视频上下文;如果你走无状态,就必须把每一轮的 processing_callprocessing_result 原样回传。漏了不会报错,但视频上下文就没了,追问质量断崖式下跌——这是最阴的一个坑
  • 批量任务走 Batch API,半价
  • 检索不等于验证。医疗、法律、安全、合规,或者要求帧级精确的判断,让 Gemini 帮你定位证据,最后拍板必须留给人或确定性系统

还有个时间点要记住

价格这件事值得单独提醒一句:Gemini 3.7 Flash 和 3.6 Flash 目前是 $0.75 / 百万输入 Token、$3.75 / 百万输出 Token,这是到 2026 年 12 月 31 日为止的推广价,从 2027 年 1 月 1 日起双双翻倍。Gemini 3.5 Flash-Lite 是 $0.30 / $2.50。

也就是说,现在正是试错成本最低的窗口期。想测的场景,今年测完。

按照谷歌的路线图,这个能力接下来会往下沉:很快会推给 Gemini 应用里所有 Flash 和 Flash-Lite 模型的用户;未来几个月内,YouTube 观看页的 Ask YouTube 也会用上它,给出更贴着画面内容的回答。

一个好的工程决策,不是「用最新的」,而是「知道什么时候不用最新的」。智能体视频理解最好的用法,可能是在你那条长视频管线上,只给超过 10 分钟的那部分打开它。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档