Skip to content

一分钟带你了解什么是Gemini Omni Flash

AI 生视频这件事,卡住大家的从来不是"生不出来"。

改不了

举个真实的例子。你花了 1 美元,生成一条 10 秒的小提琴独奏视频,画面 98 分,光影、构图、氛围全对,就一个问题:手里那把小提琴太抢戏,你想让它消失。

过去你只有一条路——回去改 prompt,重新抽卡,再花 1 美元。然后新出来的这条,小提琴没了,但主角换了张脸。再抽,再花钱。做过 AI 视频的都懂这种痛:每一次修改都是一次重新赌博。

Gemini Omni Flash 的做法是,你接着上一句话说:

"Make the violin invisible."(把小提琴变透明。)

就完事了。人还是那个人,光还是那道光,只有小提琴没了。

Gemini Omni Flash 是什么

Gemini Omni Flash 是谷歌的原生多模态视频生成与编辑模型,模型代码 gemini-omni-flash-preview

它在 2026 年 Google I/O 上首次亮相,当时官方说开发者 API "未来数周内"上线——这话通常要打个折。但这次没跳票:2026 年 6 月 30 日,它正式在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上进入公开预览

它跟 Veo 那一代视频模型的分界线,在于"原生"两个字。Veo 是一个专门做视频的模型;Omni Flash 是把 Gemini 的多模态推理能力直接长在了视频生成上——文本、图片、音频、视频进同一个模型,出来的东西自带 Gemini 的世界知识。

换句话说,它不只是"知道苹果长什么样",它还知道苹果从桌上掉下去该怎么弹、以什么速度落地。物理常识、历史背景、叙事逻辑,这些是 Gemini 本来就有的东西,现在被接到了视频这条管线上。

顺便说个容易被忽略的信号:Gemini API 官方文档现在已经把 Omni Flash 列为视频生成的默认推荐模型,而不是 Veo。 这个位置的变动,比任何 benchmark 都说明问题。

它的特点

  • 对话式视频编辑:这是它最硬的一块长板。基于 Interactions API,你可以用自然语言一轮一轮地改视频,没提到的部分原样保留,不用整段重新生成。目前一个会话最多可以叠 3 次连续编辑
  • 多模态参考:文字、图片、视频混着当输入。可以传多张参考图锁死主体外观,让角色跨镜头不"变脸"
  • 世界知识加持:物理规律、生物常识、叙事逻辑,模型自己懂,不用你在 prompt 里手把手教
  • 原生音频输出:默认给你配一条合适的音轨,环境音、背景乐、节拍都能用提示词点名
  • 文字与动作同步:视频里要出现可读的文字、并且跟画面动作对上节奏,一句提示就行
  • 720p / 24 FPS / 3–10 秒:当前 API 的输出规格,横屏 16:9 默认,也支持竖屏 9:16
  • 百万级上下文:上下文窗口 1,048,576 token,输入可以塞很多参考素材
  • SynthID + C2PA 双重溯源:所有输出打不可见水印、附内容凭证,可以在 Gemini App、Chrome 里的 Gemini 或搜索中验证

能拿它干什么

电商产品视频,从静图到成片的流水线。 这是目前落地最直接的场景。谷歌自己放了个 demo 应用叫 Omni Product Studio:先用图像模型出静态产品图,选中一张,Omni 把它变成一条电影感的电商视频。整条链路的成本是什么量级?一条满额 10 秒视频,输出费用大约 1 美元。以前一条外拍素材的预算,现在够你跑几百条创意测试。

社交与娱乐特效。 官方博客里那条演示视频挺有意思:一个人对着手机做了四个"数字魔术"——从屏幕里掏出一个 3D 气球字、把屏幕里的水倒进真实的玻璃杯。角落还放着原始拍摄画面,让你看清特效是怎么加上去的。这类"实拍 + 对话式加特效"的玩法,是 Omni 相比纯文生视频最不一样的地方。消费端已经能用了:Gemini 应用、Google Flow,以及 YouTube Shorts 和 YouTube Create(18 岁以上免费)

空间与室内设计预览。 demo 应用 Space Lift 的路子:上传一张房间照片,先批量生成不同风格的设计概念图,挑中一个,点视频按钮,Omni 把它变成一段有镜头运动的空间巡览。装修之前先"走进去看看"——这个需求真实存在,而且以前只能靠三维建模师做,周期按周算。

旅行与内容营销。 demo 应用 Anywhere:自拍或上传一张照片,图像模型把你瞬移到几十个地标前,点一下,Omni 把静图变成那个地点的动态短片。这三个 demo 都在 AI Studio 里可以直接 remix,改改就是你自己的产品原型。

值得说一句的是,这几个案例有个共同套路:图像模型出帧 + Omni Flash 动起来。6 月 30 日同场上线的 Nano Banana 2 Litegemini-3.1-flash-lite-image)就是配套的那一半——4 秒出图、每千分辨率图 0.034 美元。快速出图选帧、选中的帧再喂给 Omni,这是目前性价比最高的一条生成式媒体流水线。

快速上手

先说入口,按你的身份挑:

入口适合谁地址
Gemini 应用完全新手,想先看效果gemini.google.com
Google Flow做影视创作、多镜头叙事flow.google
YouTube Shorts / Create短视频创作者(18+ 免费)youtube.com
Google AI Studio开发者试参数、不想先写代码aistudio.google.com
Gemini API要接进自己的产品ai.google.dev
Gemini Enterprise Agent Platform企业级部署console.cloud.google.com

最简单的文生视频,Python 长这样:

python
import base64
from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="一颗玻璃弹珠在多米诺式连锁轨道上飞快滚动,一镜到底,镜头平滑跟随"
)

with open("marble.mp4", "wb") as f:
    f.write(base64.b64decode(interaction.output_video.data))

注意这里用的是 client.interactions.create——不是 Veo 那套 generate_videos + 轮询 operation。Omni 走的是 Interactions API,这也是它能做多轮编辑的底层原因。

想要竖屏,加一个 response_format

python
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="霓虹灯与飞行汽车的未来都市,赛博朋克风格",
    response_format={"type": "video", "aspect_ratio": "9:16"}
)

重点来了,对话式编辑——把上一轮的 id 传进 previous_interaction_id

python
# 第一轮:生成
res1 = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="一位女士在户外拉小提琴"
)

# 第二轮:接着改,不用重新描述整个画面
res2 = client.interactions.create(
    model="gemini-omni-flash-preview",
    previous_interaction_id=res1.id,
    input="把小提琴变透明"
)

这四行代码,就是 Omni Flash 存在的全部理由。

图生视频也很简单,图片和文字一起丢进 input,再指定任务类型:

python
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input=[
        {"type": "image", "data": base64_image, "mime_type": "image/jpeg"},
        {"type": "text", "text": "让这张草图变成真实拍摄的画面,草图只用来指导运动方向,最终视频里不要出现草图本身"}
    ],
    generation_config={"video_config": {"task": "image_to_video"}}
)

支持的任务类型一共四种:text_to_video(文生视频)、image_to_video(图生视频)、reference_to_video(多参考图生成特定主体)、edit(有状态编辑)。

价格怎么算

官方口径很清爽:视频输出 0.10 美元/秒,跟 Veo 3.1 Fast 同价。

拆开看 token 计费的话是这样:

项目付费层价格
输入(文本 / 图片 / 视频 / 音频)$1.50 / 百万 token
文本输出$9.00 / 百万 token
视频输出$17.50 / 百万 token

720p 视频按 5,792 token/秒 折算,$17.50 × 5792 ÷ 1,000,000 ≈ $0.10/秒,对得上。

两个必须提前知道的事:

  1. 没有免费额度。Omni Flash 只对付费层开放,别指望白嫖 API。想零成本试水,去 Gemini 应用或 YouTube Create
  2. 预览期没有 Batch 半价通道。也就是说暂时没有"能等就更便宜"这个杠杆

一条满额 10 秒的片子,输出成本约 1 美元(输入 token 另算)。我的建议跟做图一样:调 prompt 阶段短一点、少几轮,定稿了再出满额。

上手前必须知道的限制

预览版就是预览版,官方把边界写得很清楚。这些是产品约束,不是临时 bug,设计功能时就得吃进去:

  • 单段最长 10 秒,这是当前硬上限,更长时长在路线图上
  • 不支持上传音频参考(输出仍然自带同步音轨)
  • 不支持场景延伸和视频插值(首尾帧之间自动补中间,这是 Veo 的活)
  • 短视频参考不稳:API schema 接受不超过 3 秒的视频参考,但官方明说模型目前处理不正确——别用
  • 切镜头、大幅运镜时角色一致性可能漂移,官方承认在改进中。对策是多留一轮编辑,或者把参考素材收得更紧
  • 不支持语音编辑,不支持跨多个视频交叉引用推理
  • 不支持系统指令、temperature、top_p、停止序列、负面提示。想排除什么,直接在提示词里写"不要出现 X"
  • 不支持 YouTube 视频作为媒体来源
  • 地区限制:欧洲经济区、瑞士、英国用户无法编辑自己上传的视频(只能编辑模型生成的视频);含未成年人的图片在这些地区也不支持上传编辑
  • 语言:英语完整支持,其他语言"可能有效但结果不定"。中文 prompt 能跑,但要接受抽卡率高一点

还有一个工程细节容易踩:视频超过 4MB 时,加 response_format={"type": "video", "delivery": "uri"} 用 URI 方式取回,别硬塞进响应体。

Omni Flash 和 Veo 3.1,到底用哪个

这是最多人问的问题。直接上表:

维度Gemini Omni FlashVeo 3.1
架构Omni 原生多模态家族专用视频模型
APIInteractions APIgenerate_videos + 轮询
修改方式原生对话式编辑,改哪说哪重写 prompt、整段重生成
单段时长最长 10 秒4 / 6 / 8 秒
视频延伸不支持支持,最长可接到 148 秒
首尾帧插值不支持支持
分辨率720p720p / 1080p / 4K
价格$0.10/秒Fast $0.10/秒,标准版 $0.40 起
成熟度公开预览预览(生产路径成熟)

一句话记:要反复改,用 Omni;要接长、要 4K、要控首尾帧,用 Veo。

工程上的干净做法是抽一个 VideoProvider 接口出来,底下挂两套实现,按需求路由。别把任何一个模型的 SDK 细节泄漏到业务代码里——预览版接口是会变的。

写在最后

视频生成这条赛道,节奏很清楚:2024 年比"能不能动",2025 年比"像不像真的",到 2026 年,战场已经全面转移到 "能不能改" 上了。

因为真实的创作从来不是一次成型的。专业剪辑师改十版是常态,而 AI 视频过去每改一版都要重新抽卡——这才是它一直停在"玩具"阶段的真正原因,不是画质。

Omni Flash 把"改"这件事变成了对话。它现在还有一堆限制:10 秒、720p、没有免费额度、中文 prompt 也不算完整支持。但方向是对的,而且是那种一旦体验过就回不去的对的。

对新手最实在的建议:先别碰 API。打开 Gemini 应用或者 YouTube Create,生一条视频,然后试着用一句话改它。那一次修改带来的感受,比读十篇技术文档都直观。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档