Skip to content

Gemini Omni 1.1 Flash 来了:AI 视频终于治好了「金鱼记忆」

1 秒钟能装下什么?

大概够你说完一句"你好",或者够镜头推过一扇门。

这就是上一代 Gemini Omni Flash 在续拍视频时,能回看的全部上下文——最后 1 秒

你让它接着上一条视频往下拍,它乖乖照做了,然后交给你一个东西:门后面站着的人换了张脸,房间的灯光从暖黄变成了冷白,上一句台词营造的情绪消失得干干净净。你盯着屏幕,脑子里只有一个念头——它压根不记得刚才发生了什么。

所以过去大家做 AI 视频,基本就是一句话:生成,不满意,重来,再花钱。 抽卡。

2026 年 8 月 27 日,谷歌发布了 Gemini Omni 1.1 Flash,把那个数字从 1 秒改成了 10 秒

别小看这 9 秒的差距。它不是参数表上一行不起眼的更新,它是"玩具"和"工具"之间的那道坎。

Gemini Omni 1.1 Flash 是什么

Gemini Omni 1.1 Flash 是谷歌原生多模态视频生成与编辑模型的生产就绪(production-ready)版本更新,API 模型名为 gemini-omni-1.1-flash,通过 Google AI Studio 的 Gemini API 提供。

先捋一下时间线,免得混乱:

  • 2026 年 6 月 30 日,初代 Gemini Omni Flash 公开预览,主打"对话式改视频"——你说一句话,它改画面里指定的那一处,其余原样保留
  • 2026 年 8 月 27 日,Omni 1.1 Flash 发布,补上了初代最被人诟病的几块短板:记不住、接不长、控不住首尾、出不了高分辨率

Google DeepMind 两位产品经理 Anish Nangia 和 Alisa Fortin 在官方博客里对这次更新的定位很直接:给开发者更多对生成视频的控制权

初代 Omni Flash 解决的是"能不能改";1.1 解决的是"能不能接得上、控得住、交得了活"。前者是可用性问题,后者是能不能进生产流程的问题。

至于效果,谷歌自己的说法是:Omni 1.1 Flash 在第三方评测机构 Arena 的文生视频榜上排名第一(Google 官方口径 1515 分),图生视频榜排名第二。榜单这东西看看就好,但它至少说明一件事——这次不是小修小补。

这次到底更新了什么

五个变化,每一个都戳在痛点上。

  • 场景延长:上下文从 1 秒涨到 10 秒。模型现在能分析此前最多 10 秒的画面再往下续,而不是只看最后 1 秒。角色的脸、衣服、站位,灯光的方向和色温,镜头正在往哪动,全都还在
  • 最长可以接到 40 秒。以 10 秒为一个增量往后延长,初始生成一次 + 四次延长 = 40 秒上限。距离"一整场戏"还差得远,但相比此前单段最长 10 秒、且一续就崩,这是质变
  • 首尾帧插值。你指定一个镜头的起始帧结束帧,模型在两帧之间生成连续的中间画面。环绕运镜、缩放转场、无缝循环素材,这类原本只能靠剪辑师手工磨的活,现在可以钉住两头让它自己算
  • 视频参考:最多 3 秒。可以把一小段视频塞进多模态输入里,让新镜头沿用它的动作、运镜和节奏,或者反过来——给不同角色套用同一段舞蹈动作
  • 360p 草稿 + 4K 放大。新增 360p 草稿模式,官方数据:比标准 720p 最快快 60%,成本约为三分之一;定稿后再升到 1080p 或 4K 输出

我个人的判断:首尾帧插值和 360p 草稿,是这五个里面最被低估的两个。

首尾帧把"抽卡"变成了"打靶"——你终于能控制一个镜头从哪里开始、到哪里结束,而不是祈祷它落在对的地方。

360p 草稿则是把成本结构给改了。以前你调 prompt 的每一次试错都得按成品价付钱,现在草稿价只有三分之一。

便宜的试错,才是创作自由的真正前提。昂贵的试错只会让人不敢试。

能拿它干什么

一条广告片的成本账

这是 1.1 最实在的落地场景。假设你要出一条 30 秒的产品视频:

环节做法成本估算
分镜试错360p 草稿,跑 10 版30 秒 × $0.03 × 10 = $9
定稿生成720p 出成品30 秒 × $0.10 = $3
交付母版升到 4K30 秒 × $0.30 = $9
合计约 $21

21 美元,换来一条可交付的 30 秒 4K 产品视频,以及十次试错机会。

做个对照:一条外拍素材的预算,现在够你跑几十条创意测试。创意测试的量变,才是转化率质变的前提——这句话在传统广告业成立了几十年,现在轮到 AI 视频了。

多角色一致性的连续镜头

官方博客里那个 demo 我很喜欢:上传三段舞蹈视频,再上传三张角色图(狗、章鱼、熊),让三个角色分别跳参考视频里的舞蹈,最后合成一个没有剪辑点的连续镜头

这件事在过去几乎不可能。跨镜头保持角色一致,是 AI 视频的老大难,而"同一场景多角色 + 无剪辑点"更是难上加难。现在它靠"3 秒视频参考 + 角色图"两条腿站住了。

大厂已经在用了

这次官方直接把客户名单摆了出来,而且都附了具体引述:

  • Adobe Firefly:已集成 Gemini Omni Flash,用于视频编辑能力
  • Figma Weave:创意总监 Itay Schiff 的说法是,有了 extensions、更丰富的参考素材和 4K,团队的工作从"生成视频"变成了"真正导演视频"
  • GMI Cloud:市场副总裁 Louisa Guo 认为,对教育和解释类内容来说,AI 视频的可靠性比单一炫技功能更重要
  • Runway:首席创意官 Jamie Umpherson 关注的是"让用户能在不同创意之间快速切换"

Figma 那句"从生成视频到导演视频",我觉得是这次更新最好的注脚。

价格怎么算

官方按生成视频的秒数计费,四档分辨率:

分辨率价格/秒10 秒片段30 秒片段
360p(草稿)$0.03$0.30$0.90
720p$0.10$1.00$3.00
1080p$0.15$1.50$4.50
4K$0.30$3.00$9.00

横向对比一下同门师兄:官方定价表中 Veo 3.1 Lite 的 720p 是 $0.05/秒,Veo 3.1 Fast 的 4K 是 $0.30/秒

也就是说,Omni 1.1 Flash 在 720p 这一档比 Veo 3.1 Lite 贵一倍,但它贵出来的部分买的是对话式编辑 + 场景延长 + 首尾帧控制。值不值,取决于你要的是"便宜地出一段",还是"可控地磨一段"。

我的建议一如既往:调 prompt 阶段一律 360p,定稿了再上分辨率。 别拿 4K 的价格去试错,那是跟自己的钱包过不去。

快速上手

先选入口

入口适合谁说明
Google AI Studio开发者、想调参的人直接选 gemini-omni-1.1-flash 模型
Gemini API要接进自己产品模型名 gemini-omni-1.1-flash
Google FlowAI Plus / Pro / Ultra 订阅者全功能已上线
Gemini 应用同上订阅者场景延长功能已开放
Gemini Enterprise Agent Platform企业部署通过 Agent Platform API

第一步:360p 草稿先跑起来

python
import base64
from google import genai

client = genai.Client()

# 草稿阶段:360p,快 60%,成本三分之一
draft = client.interactions.create(
    model="gemini-omni-1.1-flash",
    input="一颗玻璃弹珠在多米诺式连锁轨道上飞快滚动,一镜到底,镜头平滑跟随",
    response_format={"type": "video", "resolution": "360p"}
)

with open("draft_360p.mp4", "wb") as f:
    f.write(base64.b64decode(draft.output_video.data))

对着草稿反复调 prompt,满意了再改成 resolution: "720p" 甚至 "4k" 出成品。

第二步:场景延长,一次接 10 秒

核心就是 previous_interaction_id ——把上一轮的 id 传进去,模型会自动回看此前最多 10 秒的上下文:

python
# 第 1 轮:生成初始片段
shot1 = client.interactions.create(
    model="gemini-omni-1.1-flash",
    input="一位红发女子的特写,一束红光打在侧脸上"
)

# 第 2 轮:接着拍,只需描述"接下来发生什么"
shot2 = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=shot1.id,
    input="镜头微微横摇,画面里多出一个卷发男人的背影,他说“我也看见了”,配乐压上来"
)

# 第 3 轮:继续延长
shot3 = client.interactions.create(
    model="gemini-omni-1.1-flash",
    previous_interaction_id=shot2.id,
    input="镜头缓缓拉出,两个人原来站在一座积满灰尘的地下墓穴里"
)

三次续拍,累计约 40 秒。注意看这几句 prompt 的共同点——它们都只描述增量,不重复描述整个画面。这是场景延长能保持一致的写法要点。

第三步:首尾帧钉住一个镜头

给模型两张关键帧,让它算中间那段运动:

python
interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    input=[
        {"type": "image", "data": base64_first_frame, "mime_type": "image/jpeg"},
        {"type": "image", "data": base64_last_frame, "mime_type": "image/jpeg"},
        {"type": "text", "text": "在这两个关键帧之间生成连续运动,摄影机向前推进的同时镜头拉远,一镜不断"}
    ]
)

环绕运镜、dolly zoom、无缝循环,都是这个模式的菜。

第四步:视频参考,让动作跨镜头复用

python
interaction = client.interactions.create(
    model="gemini-omni-1.1-flash",
    input=[
        {"type": "video", "data": base64_ref_clip, "mime_type": "video/mp4"},  # 最长 3 秒
        {"type": "image", "data": base64_character, "mime_type": "image/png"},
        {"type": "text", "text": "让这个角色表演参考视频中的舞蹈动作,保持角色外观一致"}
    ]
)

一个提醒:Omni 走的是 Interactions APIclient.interactions.create),不是 Veo 那套 generate_videos + 轮询 operation。这也是它能做多轮延长和编辑的底层原因。

需要说明的是,上面的代码基于官方博客公布的接口形态整理,预览期 API 字段仍可能调整,动手前建议对照官方文档 ai.google.dev/gemini-api/docs/omni 确认一遍

初代 Omni Flash 和 Veo 3.1,现在怎么选

这是最多人纠结的问题,直接上表:

维度Omni 1.1 Flash初代 Omni FlashVeo 3.1
单段时长10 秒,可延至 40 秒最长 10 秒4 / 6 / 8 秒
视频延长支持,10 秒增量不支持支持,最长 148 秒
首尾帧插值支持不支持支持
分辨率360p / 720p / 1080p / 4K720p720p / 1080p / 4K
对话式编辑支持支持不支持
视频参考支持,最长 3 秒不稳定支持
720p 价格$0.10/秒$0.10/秒Lite $0.05/秒
定位生产就绪公开预览预览

三句话记:

  • 要反复改、要接长、要控首尾 → Omni 1.1 Flash
  • 要接得更长(超过 40 秒)、要走成熟生产路径 → Veo 3.1
  • 还在用初代 Omni → 没什么理由不升了,同样的 720p 价格,白得一堆能力

工程上的老建议还是那句:抽一个 VideoProvider 接口出来,底下挂多套实现,按需求路由。别把任何一家模型的 SDK 细节泄漏进业务代码——这个行业三个月一变,你现在押注的 API 明年可能就改名了。

还有几个坑要提醒

热度归热度,该踩的坑还是得提前说:

  • 40 秒是累计上限,不是单段上限。要拿到 40 秒得老老实实续四次,每次都得重新付钱
  • 4K 是放大,不是原生 4K 生成。它的价值在于交付环节,别指望放大能凭空变出细节
  • 视频参考上限 3 秒。想复用一段长动作,目前做不到
  • 预览期接口会变。官方自己都标注了 production-ready,但 API 字段调整是常态
  • 中文 prompt 支持仍不完整。英语最稳,中文能跑但要接受抽卡率高一点
  • 地区限制。欧洲经济区、瑞士、英国用户在编辑自己上传的视频时有额外限制

写在最后

回头看 2026 年视频生成这条赛道的节奏,脉络其实很清楚:

2024 年大家比**"能不能动",2025 年比"像不像真的",到 2026 年,战场已经完全转移到"能不能控"**上了。

因为真实的创作从来不是一次成型的。专业剪辑师改十版是常态,摄影师为了一个运镜等一天的光也是常态。AI 视频之前之所以一直停在"玩具"阶段,从来不是因为画质不够好,而是因为每一次修改都等于重新掷骰子。

Omni 1.1 Flash 做的事,是把"掷骰子"变成"接着上一句往下说"。

十秒的记忆听起来不多。但对一个一直在失忆的模型来说,这已经够它讲完一个有起承转合的小故事了。

对新手最实在的建议:先别碰 API。打开 Google Flow 或者 Gemini 应用,生一条视频,然后试着让它接着往下拍。那一次"它居然记得上一段"的错愕感,比读十篇技术文档都直观。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档