---
url: /veo/what_is_veo.md
description: >-
  Veo 是谷歌 DeepMind 的视频生成模型，最新版本 Veo 3.1 支持原生音频、4K 分辨率、首尾帧插值和视频延伸，最低 0.05
  美元每秒即可生成带声音的 AI 视频。
---

# 一分钟带你了解什么是Google Veo

先算一笔账。

你要拍一条 8 秒的产品广告：找摄影师、租设备、布光、剪辑、配音效，这一套下来，便宜的几千块，讲究点的几万块，周期按周算。

现在换个方式：敲一段话，等 11 秒，你拿到一条 8 秒的 720P 视频，**自带环境音、音效甚至人物对白**，花费 0.4 美元——不到 3 块钱人民币。

这就是 Veo。谷歌在图像领域有 Imagen，在视频领域的答案，就是它。

## Veo 是什么

Veo 是 Google DeepMind 推出的视频生成模型，2024 年 5 月的 I/O 大会上首次亮相，到今天已经迭代到 **Veo 3.1**。

它跟早期那批"文生视频"玩具最大的区别在于一件事：**声音是模型自己生出来的，不是后期贴上去的。**

> 从 Veo 3 开始，音频就是"永远开启"的能力——环境噪声、音效、人物对话，跟画面一起生成，天然同步。

这事听起来简单，做起来是另一回事。市面上大部分视频模型交给你的是一段默片，你还得自己找配乐、对口型。Veo 直接把这一步吃掉了。

在 MovieGenBench、VBench 这些基准的人类偏好评测里，Veo 3.1 在文本生视频、图像生视频、文本生音视频三条线上都排在前面（数据更新于 2025 年 10 月）。当然，基准这东西看看就好，真正决定体验的还是你自己那条 prompt。

## Veo 3.1 的特点

* **原生音频生成**：音效、环境音、对白一次成型，音画同步。短句台词偶尔还会有点飘，官方也承认这块仍在打磨
* **4K 输出**：支持 720p、1080p、4K 三档，24fps
* **首尾帧插值**：给一张开始的图、一张结束的图，中间的过渡它自己补
* **参考图控制**：最多传 3 张参考图，锁住角色长相、物体外观、画面风格，跨镜头不"变脸"
* **视频延伸**：一次接 7 秒，最多接 20 次，最终能拼到 **148 秒**——这是目前 Veo 相比其他模型最硬的一块长板
* **镜头语言控制**：推、拉、摇、移，包括无人机俯冲这类运镜，都能用自然语言指挥
* **画面编辑**：外绘扩展画幅、增删物体，会自动处理阴影和比例
* **SynthID 水印**：所有生成视频都打上不可见水印，可溯源

### 一个必须知道的变化

如果你打算走 API，这里有个 2026 年的重要转向：**Gemini API 现在把 `Gemini Omni Flash` 列为视频生成的默认推荐模型，而不是 Veo。**

两者的分工是这样的：

| | Gemini Omni Flash | Veo 3.1 |
|---|---|---|
| 定位 | 默认首选 | 专项能力补充 |
| 强项 | 视频连贯性、多模态输入推理、角色一致性、**多轮对话式修改** | 场景延伸、首尾帧控制、已有管线集成 |
| 典型玩法 | "把小提琴变透明"——说一句改一次 | 8 秒不够？再接 7 秒 |
| 视频延伸 | 不支持 | 支持，最长 148 秒 |

一句话记：**要反复改，用 Omni；要接长、要控首尾帧，用 Veo。**

## 能拿它干什么

**广告与电商素材**。这是目前落地最快的场景。产品图丢进去，加一句运镜描述，出一条 8 秒竖屏（9:16）短视频，直接投信息流。以前一条素材的成本够现在跑几百条 A/B 测试。

**影视分镜与概念验证**。导演脑子里的画面，过去要靠画师出分镜，现在可以直接生成动态预览。谷歌专门做了个叫 **Flow** 的 AI 影视创作工具，就是冲这个场景去的。

**第三方工具集成**。2026 年 2 月，Adobe 把 Veo 接进了 **Firefly 视频编辑器**，可选 Veo 2、Veo 3.1、Veo 3.1 Fast 三档模型，让用户自己在质量、速度、成本之间找平衡。一个模型能被 Adobe 这种级别的老牌厂商摆进主力产品线，本身就说明了产能是可用的，不只是 Demo 好看。

**企业内容生产**。Google Vids 把 Veo 塞进了办公场景——培训视频、内部通知、产品说明，套个模板就能出片。

## 快速上手

Veo 有一堆入口，按你的角色挑：

| 入口 | 适合谁 | 地址 |
|---|---|---|
| Gemini App | 完全新手，想先看看效果 | gemini.google.com/veo |
| Google Flow | 做影视创作、要多镜头叙事 | labs.google/flow |
| Google AI Studio | 开发者试参数，不想写代码 | aistudio.google.com |
| Google Vids | 办公、企业培训视频 | docs.google.com/videos |
| Gemini API | 要接进自己的产品 | ai.google.dev |

想直接写代码的，Python 长这样：

```python
import time
from google import genai

client = genai.Client()

operation = client.models.generate_videos(
    model="veo-3.1-generate-preview",
    prompt="无人机俯瞰大峡谷的日落，镜头缓缓推向太阳，随后加速俯冲进峡谷内部",
)

# 视频生成是异步长任务，得轮询
while not operation.done:
    print("生成中...")
    time.sleep(10)
    operation = client.operations.get(operation)

video = operation.response.generated_videos[0]
client.files.download(file=video.video)
video.video.save("grand_canyon.mp4")
```

三个新手最容易踩的坑，提前说：

1. **生成是异步的**，最快 11 秒，高峰期能拖到 6 分钟。别写成同步调用干等
2. **视频只在服务端存 2 天**，过期直接删。生成完记得马上下载到本地
3. **时长有硬约束**：只能选 4、6、8 秒。一旦用了 1080p、4K、参考图或视频延伸，**必须是 8 秒**

### 价格，以及怎么选型号

Veo 3.1 分三档，没有免费额度，全部按秒计费（付费层）：

| 型号 | 720p | 1080p | 4K |
|---|---|---|---|
| Veo 3.1 | $0.40/秒 | $0.40/秒 | $0.60/秒 |
| Veo 3.1 Fast | $0.10/秒 | $0.12/秒 | $0.30/秒 |
| Veo 3.1 Lite | $0.05/秒 | $0.08/秒 | 不支持 |

换算成人话：一条 8 秒视频，Lite 720p 花 **0.4 美元**，标准版 4K 花 **4.8 美元**，差 12 倍。

我的建议很直接：**调 prompt 的阶段一律用 Lite 或 Fast，试到满意了再用标准版出终稿。** 拿 4K 标准版调参数，是在烧钱买心理安慰。

另外提醒一句，`veo-3.1-*` 三个型号目前都是 **Preview 状态**，接口可能变、限流可能收紧。而 Veo 3、Veo 3 Fast、Veo 2 已经标记为 **Deprecated（已弃用）**，新项目别再往上接了。

## 写在最后

视频生成这条赛道，2024 年大家比的是"能不能动"，2025 年比的是"像不像真的"，到 2026 年，战场已经转移到\*\*"能不能改"和"能不能长"\*\*上了。

Veo 3.1 的 148 秒延伸和 Omni Flash 的多轮对话编辑，正好是这两个方向上的两块拼图。谷歌把它们同时放在 Gemini API 里，意图挺明显：不指望一个模型通吃，而是让你按需求挑工具。

对小白来说，先别管 API，去 Gemini App 里敲一句话生成一条视频，那 11 秒的等待，比读十篇文章都值。

## 进阶

更多开源技术干货和学习资料，关注公众号「遇码」，领取专属福利。
