Gemini Omni 1.1 Flash 来了:AI 视频终于治好了「金鱼记忆」
1 秒钟能装下什么?
大概够你说完一句"你好",或者够镜头推过一扇门。
这就是上一代 Gemini Omni Flash 在续拍视频时,能回看的全部上下文——最后 1 秒。
你让它接着上一条视频往下拍,它乖乖照做了,然后交给你一个东西:门后面站着的人换了张脸,房间的灯光从暖黄变成了冷白,上一句台词营造的情绪消失得干干净净。你盯着屏幕,脑子里只有一个念头——它压根不记得刚才发生了什么。
所以过去大家做 AI 视频,基本就是一句话:生成,不满意,重来,再花钱。 抽卡。
2026 年 8 月 27 日,谷歌发布了 Gemini Omni 1.1 Flash,把那个数字从 1 秒改成了 10 秒。
别小看这 9 秒的差距。它不是参数表上一行不起眼的更新,它是"玩具"和"工具"之间的那道坎。
Gemini Omni 1.1 Flash 是什么
Gemini Omni 1.1 Flash 是谷歌原生多模态视频生成与编辑模型的生产就绪(production-ready)版本更新,API 模型名为 gemini-omni-1.1-flash,通过 Google AI Studio 的 Gemini API 提供。
先捋一下时间线,免得混乱:
- 2026 年 6 月 30 日,初代 Gemini Omni Flash 公开预览,主打"对话式改视频"——你说一句话,它改画面里指定的那一处,其余原样保留
- 2026 年 8 月 27 日,Omni 1.1 Flash 发布,补上了初代最被人诟病的几块短板:记不住、接不长、控不住首尾、出不了高分辨率
Google DeepMind 两位产品经理 Anish Nangia 和 Alisa Fortin 在官方博客里对这次更新的定位很直接:给开发者更多对生成视频的控制权。
初代 Omni Flash 解决的是"能不能改";1.1 解决的是"能不能接得上、控得住、交得了活"。前者是可用性问题,后者是能不能进生产流程的问题。
至于效果,谷歌自己的说法是:Omni 1.1 Flash 在第三方评测机构 Arena 的文生视频榜上排名第一(Google 官方口径 1515 分),图生视频榜排名第二。榜单这东西看看就好,但它至少说明一件事——这次不是小修小补。
这次到底更新了什么
五个变化,每一个都戳在痛点上。
- 场景延长:上下文从 1 秒涨到 10 秒。模型现在能分析此前最多 10 秒的画面再往下续,而不是只看最后 1 秒。角色的脸、衣服、站位,灯光的方向和色温,镜头正在往哪动,全都还在
- 最长可以接到 40 秒。以 10 秒为一个增量往后延长,初始生成一次 + 四次延长 = 40 秒上限。距离"一整场戏"还差得远,但相比此前单段最长 10 秒、且一续就崩,这是质变
- 首尾帧插值。你指定一个镜头的起始帧和结束帧,模型在两帧之间生成连续的中间画面。环绕运镜、缩放转场、无缝循环素材,这类原本只能靠剪辑师手工磨的活,现在可以钉住两头让它自己算
- 视频参考:最多 3 秒。可以把一小段视频塞进多模态输入里,让新镜头沿用它的动作、运镜和节奏,或者反过来——给不同角色套用同一段舞蹈动作
- 360p 草稿 + 4K 放大。新增 360p 草稿模式,官方数据:比标准 720p 最快快 60%,成本约为三分之一;定稿后再升到 1080p 或 4K 输出
我个人的判断:首尾帧插值和 360p 草稿,是这五个里面最被低估的两个。
首尾帧把"抽卡"变成了"打靶"——你终于能控制一个镜头从哪里开始、到哪里结束,而不是祈祷它落在对的地方。
360p 草稿则是把成本结构给改了。以前你调 prompt 的每一次试错都得按成品价付钱,现在草稿价只有三分之一。
便宜的试错,才是创作自由的真正前提。昂贵的试错只会让人不敢试。
能拿它干什么
一条广告片的成本账
这是 1.1 最实在的落地场景。假设你要出一条 30 秒的产品视频:
| 环节 | 做法 | 成本估算 |
|---|---|---|
| 分镜试错 | 360p 草稿,跑 10 版 | 30 秒 × $0.03 × 10 = $9 |
| 定稿生成 | 720p 出成品 | 30 秒 × $0.10 = $3 |
| 交付母版 | 升到 4K | 30 秒 × $0.30 = $9 |
| 合计 | 约 $21 |
21 美元,换来一条可交付的 30 秒 4K 产品视频,以及十次试错机会。
做个对照:一条外拍素材的预算,现在够你跑几十条创意测试。创意测试的量变,才是转化率质变的前提——这句话在传统广告业成立了几十年,现在轮到 AI 视频了。
多角色一致性的连续镜头
官方博客里那个 demo 我很喜欢:上传三段舞蹈视频,再上传三张角色图(狗、章鱼、熊),让三个角色分别跳参考视频里的舞蹈,最后合成一个没有剪辑点的连续镜头。
这件事在过去几乎不可能。跨镜头保持角色一致,是 AI 视频的老大难,而"同一场景多角色 + 无剪辑点"更是难上加难。现在它靠"3 秒视频参考 + 角色图"两条腿站住了。
大厂已经在用了
这次官方直接把客户名单摆了出来,而且都附了具体引述:
- Adobe Firefly:已集成 Gemini Omni Flash,用于视频编辑能力
- Figma Weave:创意总监 Itay Schiff 的说法是,有了 extensions、更丰富的参考素材和 4K,团队的工作从"生成视频"变成了"真正导演视频"
- GMI Cloud:市场副总裁 Louisa Guo 认为,对教育和解释类内容来说,AI 视频的可靠性比单一炫技功能更重要
- Runway:首席创意官 Jamie Umpherson 关注的是"让用户能在不同创意之间快速切换"
Figma 那句"从生成视频到导演视频",我觉得是这次更新最好的注脚。
价格怎么算
官方按生成视频的秒数计费,四档分辨率:
| 分辨率 | 价格/秒 | 10 秒片段 | 30 秒片段 |
|---|---|---|---|
| 360p(草稿) | $0.03 | $0.30 | $0.90 |
| 720p | $0.10 | $1.00 | $3.00 |
| 1080p | $0.15 | $1.50 | $4.50 |
| 4K | $0.30 | $3.00 | $9.00 |
横向对比一下同门师兄:官方定价表中 Veo 3.1 Lite 的 720p 是 $0.05/秒,Veo 3.1 Fast 的 4K 是 $0.30/秒。
也就是说,Omni 1.1 Flash 在 720p 这一档比 Veo 3.1 Lite 贵一倍,但它贵出来的部分买的是对话式编辑 + 场景延长 + 首尾帧控制。值不值,取决于你要的是"便宜地出一段",还是"可控地磨一段"。
我的建议一如既往:调 prompt 阶段一律 360p,定稿了再上分辨率。 别拿 4K 的价格去试错,那是跟自己的钱包过不去。
快速上手
先选入口
| 入口 | 适合谁 | 说明 |
|---|---|---|
| Google AI Studio | 开发者、想调参的人 | 直接选 gemini-omni-1.1-flash 模型 |
| Gemini API | 要接进自己产品 | 模型名 gemini-omni-1.1-flash |
| Google Flow | AI Plus / Pro / Ultra 订阅者 | 全功能已上线 |
| Gemini 应用 | 同上订阅者 | 场景延长功能已开放 |
| Gemini Enterprise Agent Platform | 企业部署 | 通过 Agent Platform API |
第一步:360p 草稿先跑起来
import base64
from google import genai
client = genai.Client()
# 草稿阶段:360p,快 60%,成本三分之一
draft = client.interactions.create(
model="gemini-omni-1.1-flash",
input="一颗玻璃弹珠在多米诺式连锁轨道上飞快滚动,一镜到底,镜头平滑跟随",
response_format={"type": "video", "resolution": "360p"}
)
with open("draft_360p.mp4", "wb") as f:
f.write(base64.b64decode(draft.output_video.data))对着草稿反复调 prompt,满意了再改成 resolution: "720p" 甚至 "4k" 出成品。
第二步:场景延长,一次接 10 秒
核心就是 previous_interaction_id ——把上一轮的 id 传进去,模型会自动回看此前最多 10 秒的上下文:
# 第 1 轮:生成初始片段
shot1 = client.interactions.create(
model="gemini-omni-1.1-flash",
input="一位红发女子的特写,一束红光打在侧脸上"
)
# 第 2 轮:接着拍,只需描述"接下来发生什么"
shot2 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=shot1.id,
input="镜头微微横摇,画面里多出一个卷发男人的背影,他说“我也看见了”,配乐压上来"
)
# 第 3 轮:继续延长
shot3 = client.interactions.create(
model="gemini-omni-1.1-flash",
previous_interaction_id=shot2.id,
input="镜头缓缓拉出,两个人原来站在一座积满灰尘的地下墓穴里"
)三次续拍,累计约 40 秒。注意看这几句 prompt 的共同点——它们都只描述增量,不重复描述整个画面。这是场景延长能保持一致的写法要点。
第三步:首尾帧钉住一个镜头
给模型两张关键帧,让它算中间那段运动:
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
input=[
{"type": "image", "data": base64_first_frame, "mime_type": "image/jpeg"},
{"type": "image", "data": base64_last_frame, "mime_type": "image/jpeg"},
{"type": "text", "text": "在这两个关键帧之间生成连续运动,摄影机向前推进的同时镜头拉远,一镜不断"}
]
)环绕运镜、dolly zoom、无缝循环,都是这个模式的菜。
第四步:视频参考,让动作跨镜头复用
interaction = client.interactions.create(
model="gemini-omni-1.1-flash",
input=[
{"type": "video", "data": base64_ref_clip, "mime_type": "video/mp4"}, # 最长 3 秒
{"type": "image", "data": base64_character, "mime_type": "image/png"},
{"type": "text", "text": "让这个角色表演参考视频中的舞蹈动作,保持角色外观一致"}
]
)一个提醒:Omni 走的是 Interactions API(
client.interactions.create),不是 Veo 那套generate_videos+ 轮询 operation。这也是它能做多轮延长和编辑的底层原因。
需要说明的是,上面的代码基于官方博客公布的接口形态整理,预览期 API 字段仍可能调整,动手前建议对照官方文档 ai.google.dev/gemini-api/docs/omni 确认一遍。
初代 Omni Flash 和 Veo 3.1,现在怎么选
这是最多人纠结的问题,直接上表:
| 维度 | Omni 1.1 Flash | 初代 Omni Flash | Veo 3.1 |
|---|---|---|---|
| 单段时长 | 10 秒,可延至 40 秒 | 最长 10 秒 | 4 / 6 / 8 秒 |
| 视频延长 | 支持,10 秒增量 | 不支持 | 支持,最长 148 秒 |
| 首尾帧插值 | 支持 | 不支持 | 支持 |
| 分辨率 | 360p / 720p / 1080p / 4K | 720p | 720p / 1080p / 4K |
| 对话式编辑 | 支持 | 支持 | 不支持 |
| 视频参考 | 支持,最长 3 秒 | 不稳定 | 支持 |
| 720p 价格 | $0.10/秒 | $0.10/秒 | Lite $0.05/秒 |
| 定位 | 生产就绪 | 公开预览 | 预览 |
三句话记:
- 要反复改、要接长、要控首尾 → Omni 1.1 Flash
- 要接得更长(超过 40 秒)、要走成熟生产路径 → Veo 3.1
- 还在用初代 Omni → 没什么理由不升了,同样的 720p 价格,白得一堆能力
工程上的老建议还是那句:抽一个 VideoProvider 接口出来,底下挂多套实现,按需求路由。别把任何一家模型的 SDK 细节泄漏进业务代码——这个行业三个月一变,你现在押注的 API 明年可能就改名了。
还有几个坑要提醒
热度归热度,该踩的坑还是得提前说:
- 40 秒是累计上限,不是单段上限。要拿到 40 秒得老老实实续四次,每次都得重新付钱
- 4K 是放大,不是原生 4K 生成。它的价值在于交付环节,别指望放大能凭空变出细节
- 视频参考上限 3 秒。想复用一段长动作,目前做不到
- 预览期接口会变。官方自己都标注了 production-ready,但 API 字段调整是常态
- 中文 prompt 支持仍不完整。英语最稳,中文能跑但要接受抽卡率高一点
- 地区限制。欧洲经济区、瑞士、英国用户在编辑自己上传的视频时有额外限制
写在最后
回头看 2026 年视频生成这条赛道的节奏,脉络其实很清楚:
2024 年大家比**"能不能动",2025 年比"像不像真的",到 2026 年,战场已经完全转移到"能不能控"**上了。
因为真实的创作从来不是一次成型的。专业剪辑师改十版是常态,摄影师为了一个运镜等一天的光也是常态。AI 视频之前之所以一直停在"玩具"阶段,从来不是因为画质不够好,而是因为每一次修改都等于重新掷骰子。
Omni 1.1 Flash 做的事,是把"掷骰子"变成"接着上一句往下说"。
十秒的记忆听起来不多。但对一个一直在失忆的模型来说,这已经够它讲完一个有起承转合的小故事了。
对新手最实在的建议:先别碰 API。打开 Google Flow 或者 Gemini 应用,生一条视频,然后试着让它接着往下拍。那一次"它居然记得上一段"的错愕感,比读十篇技术文档都直观。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档