一分钟带你了解什么是Google Veo
先算一笔账。
你要拍一条 8 秒的产品广告:找摄影师、租设备、布光、剪辑、配音效,这一套下来,便宜的几千块,讲究点的几万块,周期按周算。
现在换个方式:敲一段话,等 11 秒,你拿到一条 8 秒的 720P 视频,自带环境音、音效甚至人物对白,花费 0.4 美元——不到 3 块钱人民币。
这就是 Veo。谷歌在图像领域有 Imagen,在视频领域的答案,就是它。
Veo 是什么
Veo 是 Google DeepMind 推出的视频生成模型,2024 年 5 月的 I/O 大会上首次亮相,到今天已经迭代到 Veo 3.1。
它跟早期那批"文生视频"玩具最大的区别在于一件事:声音是模型自己生出来的,不是后期贴上去的。
从 Veo 3 开始,音频就是"永远开启"的能力——环境噪声、音效、人物对话,跟画面一起生成,天然同步。
这事听起来简单,做起来是另一回事。市面上大部分视频模型交给你的是一段默片,你还得自己找配乐、对口型。Veo 直接把这一步吃掉了。
在 MovieGenBench、VBench 这些基准的人类偏好评测里,Veo 3.1 在文本生视频、图像生视频、文本生音视频三条线上都排在前面(数据更新于 2025 年 10 月)。当然,基准这东西看看就好,真正决定体验的还是你自己那条 prompt。
Veo 3.1 的特点
- 原生音频生成:音效、环境音、对白一次成型,音画同步。短句台词偶尔还会有点飘,官方也承认这块仍在打磨
- 4K 输出:支持 720p、1080p、4K 三档,24fps
- 首尾帧插值:给一张开始的图、一张结束的图,中间的过渡它自己补
- 参考图控制:最多传 3 张参考图,锁住角色长相、物体外观、画面风格,跨镜头不"变脸"
- 视频延伸:一次接 7 秒,最多接 20 次,最终能拼到 148 秒——这是目前 Veo 相比其他模型最硬的一块长板
- 镜头语言控制:推、拉、摇、移,包括无人机俯冲这类运镜,都能用自然语言指挥
- 画面编辑:外绘扩展画幅、增删物体,会自动处理阴影和比例
- SynthID 水印:所有生成视频都打上不可见水印,可溯源
一个必须知道的变化
如果你打算走 API,这里有个 2026 年的重要转向:Gemini API 现在把 Gemini Omni Flash 列为视频生成的默认推荐模型,而不是 Veo。
两者的分工是这样的:
| Gemini Omni Flash | Veo 3.1 | |
|---|---|---|
| 定位 | 默认首选 | 专项能力补充 |
| 强项 | 视频连贯性、多模态输入推理、角色一致性、多轮对话式修改 | 场景延伸、首尾帧控制、已有管线集成 |
| 典型玩法 | "把小提琴变透明"——说一句改一次 | 8 秒不够?再接 7 秒 |
| 视频延伸 | 不支持 | 支持,最长 148 秒 |
一句话记:要反复改,用 Omni;要接长、要控首尾帧,用 Veo。
能拿它干什么
广告与电商素材。这是目前落地最快的场景。产品图丢进去,加一句运镜描述,出一条 8 秒竖屏(9:16)短视频,直接投信息流。以前一条素材的成本够现在跑几百条 A/B 测试。
影视分镜与概念验证。导演脑子里的画面,过去要靠画师出分镜,现在可以直接生成动态预览。谷歌专门做了个叫 Flow 的 AI 影视创作工具,就是冲这个场景去的。
第三方工具集成。2026 年 2 月,Adobe 把 Veo 接进了 Firefly 视频编辑器,可选 Veo 2、Veo 3.1、Veo 3.1 Fast 三档模型,让用户自己在质量、速度、成本之间找平衡。一个模型能被 Adobe 这种级别的老牌厂商摆进主力产品线,本身就说明了产能是可用的,不只是 Demo 好看。
企业内容生产。Google Vids 把 Veo 塞进了办公场景——培训视频、内部通知、产品说明,套个模板就能出片。
快速上手
Veo 有一堆入口,按你的角色挑:
| 入口 | 适合谁 | 地址 |
|---|---|---|
| Gemini App | 完全新手,想先看看效果 | gemini.google.com/veo |
| Google Flow | 做影视创作、要多镜头叙事 | labs.google/flow |
| Google AI Studio | 开发者试参数,不想写代码 | aistudio.google.com |
| Google Vids | 办公、企业培训视频 | docs.google.com/videos |
| Gemini API | 要接进自己的产品 | ai.google.dev |
想直接写代码的,Python 长这样:
import time
from google import genai
client = genai.Client()
operation = client.models.generate_videos(
model="veo-3.1-generate-preview",
prompt="无人机俯瞰大峡谷的日落,镜头缓缓推向太阳,随后加速俯冲进峡谷内部",
)
# 视频生成是异步长任务,得轮询
while not operation.done:
print("生成中...")
time.sleep(10)
operation = client.operations.get(operation)
video = operation.response.generated_videos[0]
client.files.download(file=video.video)
video.video.save("grand_canyon.mp4")三个新手最容易踩的坑,提前说:
- 生成是异步的,最快 11 秒,高峰期能拖到 6 分钟。别写成同步调用干等
- 视频只在服务端存 2 天,过期直接删。生成完记得马上下载到本地
- 时长有硬约束:只能选 4、6、8 秒。一旦用了 1080p、4K、参考图或视频延伸,必须是 8 秒
价格,以及怎么选型号
Veo 3.1 分三档,没有免费额度,全部按秒计费(付费层):
| 型号 | 720p | 1080p | 4K |
|---|---|---|---|
| Veo 3.1 | $0.40/秒 | $0.40/秒 | $0.60/秒 |
| Veo 3.1 Fast | $0.10/秒 | $0.12/秒 | $0.30/秒 |
| Veo 3.1 Lite | $0.05/秒 | $0.08/秒 | 不支持 |
换算成人话:一条 8 秒视频,Lite 720p 花 0.4 美元,标准版 4K 花 4.8 美元,差 12 倍。
我的建议很直接:调 prompt 的阶段一律用 Lite 或 Fast,试到满意了再用标准版出终稿。 拿 4K 标准版调参数,是在烧钱买心理安慰。
另外提醒一句,veo-3.1-* 三个型号目前都是 Preview 状态,接口可能变、限流可能收紧。而 Veo 3、Veo 3 Fast、Veo 2 已经标记为 Deprecated(已弃用),新项目别再往上接了。
写在最后
视频生成这条赛道,2024 年大家比的是"能不能动",2025 年比的是"像不像真的",到 2026 年,战场已经转移到**"能不能改"和"能不能长"**上了。
Veo 3.1 的 148 秒延伸和 Omni Flash 的多轮对话编辑,正好是这两个方向上的两块拼图。谷歌把它们同时放在 Gemini API 里,意图挺明显:不指望一个模型通吃,而是让你按需求挑工具。
对小白来说,先别管 API,去 Gemini App 里敲一句话生成一条视频,那 11 秒的等待,比读十篇文章都值。
进阶
更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。
Gemini 中文文档