---
url: /omni/what_is_gemini_omni_flash.md
description: >-
  Gemini Omni Flash 是谷歌原生多模态视频生成与编辑模型，2026 年 6 月 30 日起在 Gemini API 与 AI Studio
  公开预览，支持对话式改视频，720p 输出 0.10 美元每秒。
---

# 一分钟带你了解什么是Gemini Omni Flash

AI 生视频这件事，卡住大家的从来不是"生不出来"。

是**改不了**。

举个真实的例子。你花了 1 美元，生成一条 10 秒的小提琴独奏视频，画面 98 分，光影、构图、氛围全对，就一个问题：手里那把小提琴太抢戏，你想让它消失。

过去你只有一条路——回去改 prompt，重新抽卡，再花 1 美元。然后新出来的这条，小提琴没了，但主角换了张脸。再抽，再花钱。做过 AI 视频的都懂这种痛：**每一次修改都是一次重新赌博。**

Gemini Omni Flash 的做法是，你接着上一句话说：

> "Make the violin invisible."（把小提琴变透明。）

就完事了。人还是那个人，光还是那道光，只有小提琴没了。

## Gemini Omni Flash 是什么

Gemini Omni Flash 是谷歌的**原生多模态视频生成与编辑模型**，模型代码 `gemini-omni-flash-preview`。

它在 2026 年 Google I/O 上首次亮相，当时官方说开发者 API "未来数周内"上线——这话通常要打个折。但这次没跳票：**2026 年 6 月 30 日**，它正式在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 上进入**公开预览**。

它跟 Veo 那一代视频模型的分界线，在于"原生"两个字。Veo 是一个专门做视频的模型；Omni Flash 是**把 Gemini 的多模态推理能力直接长在了视频生成上**——文本、图片、音频、视频进同一个模型，出来的东西自带 Gemini 的世界知识。

> 换句话说，它不只是"知道苹果长什么样"，它还知道苹果从桌上掉下去该怎么弹、以什么速度落地。物理常识、历史背景、叙事逻辑，这些是 Gemini 本来就有的东西，现在被接到了视频这条管线上。

顺便说个容易被忽略的信号：**Gemini API 官方文档现在已经把 Omni Flash 列为视频生成的默认推荐模型，而不是 Veo。** 这个位置的变动，比任何 benchmark 都说明问题。

## 它的特点

* **对话式视频编辑**：这是它最硬的一块长板。基于 Interactions API，你可以用自然语言一轮一轮地改视频，没提到的部分原样保留，不用整段重新生成。目前一个会话最多可以叠 **3 次连续编辑**
* **多模态参考**：文字、图片、视频混着当输入。可以传多张参考图锁死主体外观，让角色跨镜头不"变脸"
* **世界知识加持**：物理规律、生物常识、叙事逻辑，模型自己懂，不用你在 prompt 里手把手教
* **原生音频输出**：默认给你配一条合适的音轨，环境音、背景乐、节拍都能用提示词点名
* **文字与动作同步**：视频里要出现可读的文字、并且跟画面动作对上节奏，一句提示就行
* **720p / 24 FPS / 3–10 秒**：当前 API 的输出规格，横屏 `16:9` 默认，也支持竖屏 `9:16`
* **百万级上下文**：上下文窗口 1,048,576 token，输入可以塞很多参考素材
* **SynthID + C2PA 双重溯源**：所有输出打不可见水印、附内容凭证，可以在 Gemini App、Chrome 里的 Gemini 或搜索中验证

## 能拿它干什么

**电商产品视频，从静图到成片的流水线。** 这是目前落地最直接的场景。谷歌自己放了个 demo 应用叫 **Omni Product Studio**：先用图像模型出静态产品图，选中一张，Omni 把它变成一条电影感的电商视频。整条链路的成本是什么量级？一条满额 10 秒视频，输出费用大约 **1 美元**。以前一条外拍素材的预算，现在够你跑几百条创意测试。

**社交与娱乐特效。** 官方博客里那条演示视频挺有意思：一个人对着手机做了四个"数字魔术"——从屏幕里掏出一个 3D 气球字、把屏幕里的水倒进真实的玻璃杯。角落还放着原始拍摄画面，让你看清特效是怎么加上去的。这类"实拍 + 对话式加特效"的玩法，是 Omni 相比纯文生视频最不一样的地方。消费端已经能用了：Gemini 应用、Google Flow，以及 **YouTube Shorts 和 YouTube Create（18 岁以上免费）**。

**空间与室内设计预览。** demo 应用 **Space Lift** 的路子：上传一张房间照片，先批量生成不同风格的设计概念图，挑中一个，点视频按钮，Omni 把它变成一段有镜头运动的空间巡览。装修之前先"走进去看看"——这个需求真实存在，而且以前只能靠三维建模师做，周期按周算。

**旅行与内容营销。** demo 应用 **Anywhere**：自拍或上传一张照片，图像模型把你瞬移到几十个地标前，点一下，Omni 把静图变成那个地点的动态短片。这三个 demo 都在 AI Studio 里可以直接 remix，改改就是你自己的产品原型。

值得说一句的是，这几个案例有个共同套路：**图像模型出帧 + Omni Flash 动起来**。6 月 30 日同场上线的 **Nano Banana 2 Lite**（`gemini-3.1-flash-lite-image`）就是配套的那一半——4 秒出图、每千分辨率图 0.034 美元。快速出图选帧、选中的帧再喂给 Omni，这是目前性价比最高的一条生成式媒体流水线。

## 快速上手

先说入口，按你的身份挑：

| 入口 | 适合谁 | 地址 |
|---|---|---|
| Gemini 应用 | 完全新手，想先看效果 | gemini.google.com |
| Google Flow | 做影视创作、多镜头叙事 | flow.google |
| YouTube Shorts / Create | 短视频创作者（18+ 免费） | youtube.com |
| Google AI Studio | 开发者试参数、不想先写代码 | aistudio.google.com |
| Gemini API | 要接进自己的产品 | ai.google.dev |
| Gemini Enterprise Agent Platform | 企业级部署 | console.cloud.google.com |

最简单的文生视频，Python 长这样：

```python
import base64
from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="一颗玻璃弹珠在多米诺式连锁轨道上飞快滚动，一镜到底，镜头平滑跟随"
)

with open("marble.mp4", "wb") as f:
    f.write(base64.b64decode(interaction.output_video.data))
```

注意这里用的是 `client.interactions.create`——不是 Veo 那套 `generate_videos` + 轮询 operation。**Omni 走的是 Interactions API**，这也是它能做多轮编辑的底层原因。

想要竖屏，加一个 `response_format`：

```python
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="霓虹灯与飞行汽车的未来都市，赛博朋克风格",
    response_format={"type": "video", "aspect_ratio": "9:16"}
)
```

重点来了，**对话式编辑**——把上一轮的 `id` 传进 `previous_interaction_id`：

```python
# 第一轮：生成
res1 = client.interactions.create(
    model="gemini-omni-flash-preview",
    input="一位女士在户外拉小提琴"
)

# 第二轮：接着改，不用重新描述整个画面
res2 = client.interactions.create(
    model="gemini-omni-flash-preview",
    previous_interaction_id=res1.id,
    input="把小提琴变透明"
)
```

这四行代码，就是 Omni Flash 存在的全部理由。

图生视频也很简单，图片和文字一起丢进 `input`，再指定任务类型：

```python
interaction = client.interactions.create(
    model="gemini-omni-flash-preview",
    input=[
        {"type": "image", "data": base64_image, "mime_type": "image/jpeg"},
        {"type": "text", "text": "让这张草图变成真实拍摄的画面，草图只用来指导运动方向，最终视频里不要出现草图本身"}
    ],
    generation_config={"video_config": {"task": "image_to_video"}}
)
```

支持的任务类型一共四种：`text_to_video`（文生视频）、`image_to_video`（图生视频）、`reference_to_video`（多参考图生成特定主体）、`edit`（有状态编辑）。

### 价格怎么算

官方口径很清爽：**视频输出 0.10 美元/秒**，跟 Veo 3.1 Fast 同价。

拆开看 token 计费的话是这样：

| 项目 | 付费层价格 |
|---|---|
| 输入（文本 / 图片 / 视频 / 音频） | $1.50 / 百万 token |
| 文本输出 | $9.00 / 百万 token |
| 视频输出 | $17.50 / 百万 token |

720p 视频按 **5,792 token/秒** 折算，$17.50 × 5792 ÷ 1,000,000 ≈ **$0.10/秒**，对得上。

两个必须提前知道的事：

1. **没有免费额度**。Omni Flash 只对付费层开放，别指望白嫖 API。想零成本试水，去 Gemini 应用或 YouTube Create
2. **预览期没有 Batch 半价通道**。也就是说暂时没有"能等就更便宜"这个杠杆

一条满额 10 秒的片子，输出成本约 1 美元（输入 token 另算）。我的建议跟做图一样：**调 prompt 阶段短一点、少几轮，定稿了再出满额。**

### 上手前必须知道的限制

预览版就是预览版，官方把边界写得很清楚。这些是**产品约束，不是临时 bug**，设计功能时就得吃进去：

* **单段最长 10 秒**，这是当前硬上限，更长时长在路线图上
* **不支持上传音频参考**（输出仍然自带同步音轨）
* **不支持场景延伸和视频插值**（首尾帧之间自动补中间，这是 Veo 的活）
* **短视频参考不稳**：API schema 接受不超过 3 秒的视频参考，但官方明说模型目前处理不正确——别用
* **切镜头、大幅运镜时角色一致性可能漂移**，官方承认在改进中。对策是多留一轮编辑，或者把参考素材收得更紧
* **不支持语音编辑**，不支持跨多个视频交叉引用推理
* **不支持系统指令、temperature、top\_p、停止序列、负面提示**。想排除什么，直接在提示词里写"不要出现 X"
* **不支持 YouTube 视频作为媒体来源**
* **地区限制**：欧洲经济区、瑞士、英国用户无法编辑自己上传的视频（只能编辑模型生成的视频）；含未成年人的图片在这些地区也不支持上传编辑
* **语言**：英语完整支持，其他语言"可能有效但结果不定"。中文 prompt 能跑，但要接受抽卡率高一点

还有一个工程细节容易踩：视频超过 4MB 时，加 `response_format={"type": "video", "delivery": "uri"}` 用 URI 方式取回，别硬塞进响应体。

## Omni Flash 和 Veo 3.1，到底用哪个

这是最多人问的问题。直接上表：

| 维度 | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| 架构 | Omni 原生多模态家族 | 专用视频模型 |
| API | Interactions API | `generate_videos` + 轮询 |
| 修改方式 | **原生对话式编辑**，改哪说哪 | 重写 prompt、整段重生成 |
| 单段时长 | 最长 10 秒 | 4 / 6 / 8 秒 |
| 视频延伸 | 不支持 | 支持，最长可接到 148 秒 |
| 首尾帧插值 | 不支持 | 支持 |
| 分辨率 | 720p | 720p / 1080p / 4K |
| 价格 | $0.10/秒 | Fast $0.10/秒，标准版 $0.40 起 |
| 成熟度 | 公开预览 | 预览（生产路径成熟） |

一句话记：**要反复改，用 Omni；要接长、要 4K、要控首尾帧，用 Veo。**

工程上的干净做法是抽一个 `VideoProvider` 接口出来，底下挂两套实现，按需求路由。别把任何一个模型的 SDK 细节泄漏到业务代码里——预览版接口是会变的。

## 写在最后

视频生成这条赛道，节奏很清楚：2024 年比"能不能动"，2025 年比"像不像真的"，到 2026 年，战场已经全面转移到 **"能不能改"** 上了。

因为真实的创作从来不是一次成型的。专业剪辑师改十版是常态，而 AI 视频过去每改一版都要重新抽卡——这才是它一直停在"玩具"阶段的真正原因，不是画质。

Omni Flash 把"改"这件事变成了对话。它现在还有一堆限制：10 秒、720p、没有免费额度、中文 prompt 也不算完整支持。但方向是对的，而且是那种**一旦体验过就回不去**的对的。

对新手最实在的建议：先别碰 API。打开 Gemini 应用或者 YouTube Create，生一条视频，然后试着用一句话改它。那一次修改带来的感受，比读十篇技术文档都直观。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
