Skip to content

一分钟带你了解什么是Google Veo

先算一笔账。

你要拍一条 8 秒的产品广告:找摄影师、租设备、布光、剪辑、配音效,这一套下来,便宜的几千块,讲究点的几万块,周期按周算。

现在换个方式:敲一段话,等 11 秒,你拿到一条 8 秒的 720P 视频,自带环境音、音效甚至人物对白,花费 0.4 美元——不到 3 块钱人民币。

这就是 Veo。谷歌在图像领域有 Imagen,在视频领域的答案,就是它。

Veo 是什么

Veo 是 Google DeepMind 推出的视频生成模型,2024 年 5 月的 I/O 大会上首次亮相,到今天已经迭代到 Veo 3.1

它跟早期那批"文生视频"玩具最大的区别在于一件事:声音是模型自己生出来的,不是后期贴上去的。

从 Veo 3 开始,音频就是"永远开启"的能力——环境噪声、音效、人物对话,跟画面一起生成,天然同步。

这事听起来简单,做起来是另一回事。市面上大部分视频模型交给你的是一段默片,你还得自己找配乐、对口型。Veo 直接把这一步吃掉了。

在 MovieGenBench、VBench 这些基准的人类偏好评测里,Veo 3.1 在文本生视频、图像生视频、文本生音视频三条线上都排在前面(数据更新于 2025 年 10 月)。当然,基准这东西看看就好,真正决定体验的还是你自己那条 prompt。

Veo 3.1 的特点

  • 原生音频生成:音效、环境音、对白一次成型,音画同步。短句台词偶尔还会有点飘,官方也承认这块仍在打磨
  • 4K 输出:支持 720p、1080p、4K 三档,24fps
  • 首尾帧插值:给一张开始的图、一张结束的图,中间的过渡它自己补
  • 参考图控制:最多传 3 张参考图,锁住角色长相、物体外观、画面风格,跨镜头不"变脸"
  • 视频延伸:一次接 7 秒,最多接 20 次,最终能拼到 148 秒——这是目前 Veo 相比其他模型最硬的一块长板
  • 镜头语言控制:推、拉、摇、移,包括无人机俯冲这类运镜,都能用自然语言指挥
  • 画面编辑:外绘扩展画幅、增删物体,会自动处理阴影和比例
  • SynthID 水印:所有生成视频都打上不可见水印,可溯源

一个必须知道的变化

如果你打算走 API,这里有个 2026 年的重要转向:Gemini API 现在把 Gemini Omni Flash 列为视频生成的默认推荐模型,而不是 Veo。

两者的分工是这样的:

Gemini Omni FlashVeo 3.1
定位默认首选专项能力补充
强项视频连贯性、多模态输入推理、角色一致性、多轮对话式修改场景延伸、首尾帧控制、已有管线集成
典型玩法"把小提琴变透明"——说一句改一次8 秒不够?再接 7 秒
视频延伸不支持支持,最长 148 秒

一句话记:要反复改,用 Omni;要接长、要控首尾帧,用 Veo。

能拿它干什么

广告与电商素材。这是目前落地最快的场景。产品图丢进去,加一句运镜描述,出一条 8 秒竖屏(9:16)短视频,直接投信息流。以前一条素材的成本够现在跑几百条 A/B 测试。

影视分镜与概念验证。导演脑子里的画面,过去要靠画师出分镜,现在可以直接生成动态预览。谷歌专门做了个叫 Flow 的 AI 影视创作工具,就是冲这个场景去的。

第三方工具集成。2026 年 2 月,Adobe 把 Veo 接进了 Firefly 视频编辑器,可选 Veo 2、Veo 3.1、Veo 3.1 Fast 三档模型,让用户自己在质量、速度、成本之间找平衡。一个模型能被 Adobe 这种级别的老牌厂商摆进主力产品线,本身就说明了产能是可用的,不只是 Demo 好看。

企业内容生产。Google Vids 把 Veo 塞进了办公场景——培训视频、内部通知、产品说明,套个模板就能出片。

快速上手

Veo 有一堆入口,按你的角色挑:

入口适合谁地址
Gemini App完全新手,想先看看效果gemini.google.com/veo
Google Flow做影视创作、要多镜头叙事labs.google/flow
Google AI Studio开发者试参数,不想写代码aistudio.google.com
Google Vids办公、企业培训视频docs.google.com/videos
Gemini API要接进自己的产品ai.google.dev

想直接写代码的,Python 长这样:

python
import time
from google import genai

client = genai.Client()

operation = client.models.generate_videos(
    model="veo-3.1-generate-preview",
    prompt="无人机俯瞰大峡谷的日落,镜头缓缓推向太阳,随后加速俯冲进峡谷内部",
)

# 视频生成是异步长任务,得轮询
while not operation.done:
    print("生成中...")
    time.sleep(10)
    operation = client.operations.get(operation)

video = operation.response.generated_videos[0]
client.files.download(file=video.video)
video.video.save("grand_canyon.mp4")

三个新手最容易踩的坑,提前说:

  1. 生成是异步的,最快 11 秒,高峰期能拖到 6 分钟。别写成同步调用干等
  2. 视频只在服务端存 2 天,过期直接删。生成完记得马上下载到本地
  3. 时长有硬约束:只能选 4、6、8 秒。一旦用了 1080p、4K、参考图或视频延伸,必须是 8 秒

价格,以及怎么选型号

Veo 3.1 分三档,没有免费额度,全部按秒计费(付费层):

型号720p1080p4K
Veo 3.1$0.40/秒$0.40/秒$0.60/秒
Veo 3.1 Fast$0.10/秒$0.12/秒$0.30/秒
Veo 3.1 Lite$0.05/秒$0.08/秒不支持

换算成人话:一条 8 秒视频,Lite 720p 花 0.4 美元,标准版 4K 花 4.8 美元,差 12 倍。

我的建议很直接:调 prompt 的阶段一律用 Lite 或 Fast,试到满意了再用标准版出终稿。 拿 4K 标准版调参数,是在烧钱买心理安慰。

另外提醒一句,veo-3.1-* 三个型号目前都是 Preview 状态,接口可能变、限流可能收紧。而 Veo 3、Veo 3 Fast、Veo 2 已经标记为 Deprecated(已弃用),新项目别再往上接了。

写在最后

视频生成这条赛道,2024 年大家比的是"能不能动",2025 年比的是"像不像真的",到 2026 年,战场已经转移到**"能不能改"和"能不能长"**上了。

Veo 3.1 的 148 秒延伸和 Omni Flash 的多轮对话编辑,正好是这两个方向上的两块拼图。谷歌把它们同时放在 Gemini API 里,意图挺明显:不指望一个模型通吃,而是让你按需求挑工具。

对小白来说,先别管 API,去 Gemini App 里敲一句话生成一条视频,那 11 秒的等待,比读十篇文章都值。

进阶

更多开源技术干货和学习资料,关注公众号「遇码」,领取专属福利。

Gemini中文文档