Gemini 智能体视频理解:让 AI 学会「拖进度条」,一小时视频少烧 88% Token
你有没有过这种体验:一段 90 分钟的会议录像,你只想问一句「谁在第 47 分钟提了预算」——
然后模型乖乖地把 5400 帧,一帧不落,全看了一遍。
它不是笨,它是没有别的选择。在 2026 年 9 月 1 日之前,Gemini 处理视频的方式只有一种:按固定帧率从头扫到尾,默认每秒抽 1 帧,配上音轨,一股脑塞进上下文,然后一次性作答。
这就好比你想在《大英百科全书》里查一个词,却被告知「好的,请把整套书先通读一遍,读完了我们再聊」。
更扎心的是账:一小时视频,按低分辨率算大约 36 万输入 Token;换成高分辨率,直接飙到 108 万。而你可能只关心其中的 3 秒钟。
2026 年 9 月 1 日,谷歌给 Gemini API 加了一个新开关,把这件事彻底改了。
智能体视频理解是什么
智能体视频理解(Agentic Video Understanding) 是 Gemini API 新增的一种视频处理模式:模型不再被动地按固定帧率吞掉整条视频,而是自己决定要看什么、看多细、通过哪种模态看——画面帧、音频,还是转写字幕。
官方口径的三个数字很能说明问题:
- Token 消耗最高降低 88%
- 分析成本最高降低 66%
- 准确率最高提升 7%
这次上线的具体信息,先捋清楚:
| 项目 | 内容 |
|---|---|
| 发布时间 | 2026 年 9 月 1 日(美国时间) |
| 支持模型 | gemini-3.7-flash、gemini-3.6-flash、gemini-3.5-flash-lite |
| 可用平台 | Google AI Studio、Gemini Enterprise Agent Platform 的 Gemini API |
| 支持输入 | 本地上传视频、公开 YouTube 视频链接 |
| 收费方式 | 标准 Gemini API Token 定价,不收额外功能费 |
| 启用方式 | 在视频输入对象里设置 processing: "agentic" |
有一点必须说清楚,免得搞混:这是视频「理解」,不是视频「生成」。这三个模型是「视频进、文本出」。你要生成或编辑视频,那是 Gemini Omni Flash 那条线的事,两条完全不同的路。
以前是「模型被视频看」,现在是「模型去看视频」。主语换了一下,整个成本结构就变了。
它到底是怎么「看」视频的
谷歌把内部流程叫做 Think, Act, Observe(思考—行动—观察)循环,拆开看就四步:
- 先放个指针(Pass by reference)。初始上下文里只放视频 ID、时长、容器元数据这些轻量信息,不把整条视频塞进去
- 规划(Plan)。模型根据你问的问题,判断哪些时间点、哪些模态可能藏着答案
- 取片段(Fetch slices)。它可以去检索带时间戳的转写文本,可以拉音轨,也可以只加载某一段的帧序列。官方给的两个典型采样率:0.1 FPS 用于快速略读,5–10 FPS 用于查快速运动
- 观察、再重复(Observe and repeat)。取回来的材料变成新的上下文,模型觉得不够就再取一轮,直到它认为够写出答案了
如果你想知道自己的请求到底有没有真的走智能体导航,去看响应里的 interaction.steps。出现了 processing_call(模型请求了某段视频或字幕)和配套的 processing_result(取回来的东西),就说明动态导航跑起来了。没出现?那你可能白测了。
这里有个前情提要:这套思路不是第一次出现。2026 年 1 月,谷歌给 Gemini 3 Flash 上过 agentic vision——模型自己写 Python 代码去缩放、裁剪、标注图像,看着结果再决定下一步。这次不过是把同样的循环,从图片搬到了视频时间轴上。
88% 这个数字,是哪儿来的
谷歌给的是三个标准长视频基准的对比(Gemini 3.7 Flash,开智能体模式 vs 静态 1 FPS 处理):
| 基准测试 | 静态处理 Token | 智能体 Token | 降幅 | 静态准确率 | 智能体准确率 | 变化 |
|---|---|---|---|---|---|---|
| Minerva | 80.9K | 33.6K | -58.4% | 73.7% | 79.0% | +5.3 |
| 1H-VideoQA | 397.6K | 47.7K | -88.0% | 87.5% | 88.5% | +1.0 |
| LVBench | 300.3K | 36.0K | -88.0% | 85.1% | 88.6% | +3.5 |
注意看 Minerva 那一行:降幅只有 58.4%,但准确率涨了 5.3 个百分点——这是三个里面涨得最多的。这说明一件事:智能体模式不是单纯在「省」,它把省下来的预算花在了刀刃上。
再看一个官方给的成本账。静态模式下低分辨率每秒约 100 个 Token,一小时就是 36 万输入 Token。按 Gemini 3.7 Flash / 3.6 Flash 的标准价 $0.75 / 百万输入 Token(2026 年 12 月 31 日前有效),光输入就要 $0.27。
打满 88% 折扣后,输入变成约 4.32 万 Token,约合 $0.032。
但我得给你泼盆冷水——88% 是上限,不是全场打折券。
- 智能体探索过程会产生 thinking Token,按输出价计费
- 它实际加载的字幕、音频、帧会变成 工具调用 Token
- 问题问得越宽泛、画面越密集,它就越可能多看一些
所以真正的账要这么算:省下来的输入 Token,减去多出来的思考和工具调用 Token。我见过太多人只盯着一个字段就宣布「省了 88%」,然后看到月底账单人傻了。
能拿它干什么
官方列了四类新活,每一类都对应一个曾经特别贵、或者干脆做不到的场景。
一、亚秒级时刻检索
1 FPS 的采样,意味着每帧之间隔着一整秒。镜头切在这一秒中间?动作发生在这一秒中间?漏了。
智能体模式可以对感兴趣的时间窗口用更高帧率重新采样,精准定位状态变化和剪辑点。对自动化视频编辑来说,这是从「大概在 3 分 20 秒左右」变成「第 3 分 20.4 秒,第 3 分 20.4 帧」的区别。
二、长视频「大海捞针」
这是被改动最大的一块。数小时的录像里找一个事件、一句话、一个论点——以前你得先烧掉几百万 Token 把整条视频塞进上下文,现在模型先翻字幕目录,锁定范围,再针对性调帧。
受益最明显的是长内容:官方点名的范围是 10 分钟教学视频到 90 分钟讲座,乃至数小时录像。
三、异常检测
先粗扫,发现某个时间窗口「有点不对劲」,再回去高帧率细看快速运动和细微视觉伪影。质检、巡检、安防录像这类场景,天然就是这个工作流。
四、动作与物体计数
随时间推移精确追踪重复的物理动作和不同物体。工厂里数一皮带的产品、健身房里数一组动作、仓库里数托盘——这类活以前要么靠人盯,要么靠专门的视觉方案。
几个真实的工作流
我不编客户名单,但下面这几种用法是能立刻落地的,你可以自己对号入座:
- 培训部门:上传一场两小时的内部 workshop 录像,问「主讲讲的三个核心流程分别是什么,各自配了什么例子」,再追问「关于升级上报,他具体怎么说的」。模型先从字幕入手,遇到有 PPT 或实操演示的地方再调帧,剩下的部分一眼都不看
- 用户研究:一小时的访谈录像,问「受访者提到注册流程卡住的所有时刻,给出时间戳」。答案带时间戳,研究员能回到原始录像核对——这点很关键,检索不等于验证
- 媒体档案:把一场两小时的发布会录像丢进去,问「什么时候提到了某个产品名」。编辑拿到的是候选时刻和时间戳,而不是一份含糊的全场摘要
- 制造业质检:先用智能体模式在长录像里定位「防护门被打开」的区间,再把那一小段切出来用静态模式逐帧复核。先用智能体找街区,再用静态验门牌,这个组合比任何单一模式都靠谱
- 教育产品:围绕一场讲座建一个 interaction,学生后续追问时传
previous_interaction_id。服务端保留视频上下文,产品不用每轮重放整段对话
快速上手
第一步:装 SDK、配 Key
去 Google AI Studio 建一个 API Key,塞进环境变量:
export GEMINI_API_KEY="YOUR_API_KEY"
pip install -U google-genai第二步:上传视频 + 开智能体模式
import time
from google import genai
client = genai.Client()
# 上传长视频(超过 20MB 一律走 Files API,别用 inline)
video_file = client.files.upload(file="path/to/lecture.mp4")
while video_file.state.name == "PROCESSING":
time.sleep(2)
video_file = client.files.get(name=video_file.name)
# 关键:processing 写在「视频对象」里,不是写在请求上
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": video_file.uri,
"mime_type": video_file.mime_type,
"processing": "agentic" # ← 就这一行
},
{"type": "text", "text": "这段录像里提出的三个主要论点是什么?"}
]
)
print(interaction.output_text)三个容易写错的地方:
processing必须写在视频输入对象内部,写在请求级别是不生效的。这也是它的好处——一条请求里可以混着来:一个 45 分钟的录播走agentic,旁边一个 10 秒的对照片段走static,各管各的- 视频放前面,文字 prompt 放后面。官方推荐这个顺序
- 用 Interactions API(
client.interactions.create),而不是老的 GenerateContent。虽然两个接口都支持,但只有 Interactions 的响应会暴露processing_call/processing_result,你能验证模式真的生效了
第三步:验证一下,别盲信
for step in interaction.steps:
print(step.type) # 看到 processing_call / processing_result 才算真跑起来了第四步:一个请求里混用两种模式
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": long_lecture.uri,
"mime_type": "video/mp4",
"processing": "agentic" # 长录播:让模型自己找
},
{
"type": "video",
"uri": short_clip.uri,
"mime_type": "video/mp4",
"processing": "static" # 短片段:逐帧扫,稳
},
{"type": "text", "text": "对比两段内容对同一问题的说法是否一致"}
]
)如果你用的是 Vertex AI,对应的字段叫 mediaProcessing,取值是 AGENTIC / STATIC,写在 part 上:
{
"fileData": { "mimeType": "video/mp4", "fileUri": "gs://..." },
"mediaProcessing": "AGENTIC"
}什么时候别用它
热度归热度,该泼的冷水还是得泼。智能体模式不是静态模式的替代品,它是第二个选项。
下面这几种情况,静态模式反而更好:
- 短视频(5 分钟以内)且对延迟敏感。智能体模式要先推理、要发内部工具调用、要等材料回来,官方自己承认这会略微增加首 Token 时间。30 秒的产品短片?别折腾了
- 你已经知道精确区间。
start_offset、end_offset、自定义fps这些控制只在静态模式下生效。既然你已经知道是第 12 分 30 秒到第 15 分,直接用静态模式切一段,又快又便宜又可预测 - 需要全时间线一致性扫描。逐帧过一遍反而更保险
还有几个实操的坑:
- 上传限制。请求总量超过 20MB 就走 Files API。免费账户单文件上限 2GB,付费 20GB。官方文档自己在这块有前后矛盾的地方(对比表写 inline 可到 100MB,细则又写 20MB),按保守的 20MB 走
- YouTube 链接只支持公开视频,私密和不公开的链接不行。免费层每天 YouTube 输入上限 8 小时
- 上下文容量。100 万 Token 上下文的模型,最多处理约 3 小时低分辨率视频,或 1 小时高分辨率视频
- 无状态请求有陷阱。用
previous_interaction_id是有状态的,服务端帮你留着视频上下文;如果你走无状态,就必须把每一轮的processing_call和processing_result原样回传。漏了不会报错,但视频上下文就没了,追问质量断崖式下跌——这是最阴的一个坑 - 批量任务走 Batch API,半价
- 检索不等于验证。医疗、法律、安全、合规,或者要求帧级精确的判断,让 Gemini 帮你定位证据,最后拍板必须留给人或确定性系统
还有个时间点要记住
价格这件事值得单独提醒一句:Gemini 3.7 Flash 和 3.6 Flash 目前是 $0.75 / 百万输入 Token、$3.75 / 百万输出 Token,这是到 2026 年 12 月 31 日为止的推广价,从 2027 年 1 月 1 日起双双翻倍。Gemini 3.5 Flash-Lite 是 $0.30 / $2.50。
也就是说,现在正是试错成本最低的窗口期。想测的场景,今年测完。
按照谷歌的路线图,这个能力接下来会往下沉:很快会推给 Gemini 应用里所有 Flash 和 Flash-Lite 模型的用户;未来几个月内,YouTube 观看页的 Ask YouTube 也会用上它,给出更贴着画面内容的回答。
一个好的工程决策,不是「用最新的」,而是「知道什么时候不用最新的」。智能体视频理解最好的用法,可能是在你那条长视频管线上,只给超过 10 分钟的那部分打开它。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档