Google 多模态影像旗舰,Veo 3 原生音画同步,MovieGenBench 夺冠
模型介绍
Veo 是 Google DeepMind 的视频生成旗舰:2024 年 12 月发布 Veo 2(8 秒、真实动态);2025 年 5 月发布 Veo 3,成为首个原生生成同步音频(环境声、音乐、对白)的视频模型;2025 年 10 月迭代出 Veo 3.1,增强提示遵循与音画质量,MovieGenBench 综合偏好第一。模型经 Gemini App、Flow 制片工具与 Vertex AI / Gemini API 提供,主打「电影感 + 原生对白音效 + 可控运镜」。
模型基本信息
开发机构Google DeepMind
模型版本Veo 1 / 2 / 3 / 3.1(3.1 Fast)
参数规模未公开(闭源)
模型类型文生视频 / 图生视频 + 音画一体生成
许可证闭源(Gemini / Vertex AI 订阅服务)
上下文长度N/A(视频)
发布日期2024-12(Veo 2);2025-05(Veo 3)
模型架构未公开(视频扩散模型,官方未披露细节)
模型能力
中文能力强
英文能力很强
代码能力N/A
推理能力N/A
长文本能力N/A
视觉能力文生视频 + 图生视频 + 音画同步 + 续写
工具调用N/A
模型版本
Veo 2闭源(8秒)Veo 3闭源(原生音频)Veo 3.1闭源(增强提示遵循与音频)Veo 3.1 Fast闭源(速度版)
模型获取
部署方式
Gemini App(Ultra 订阅)Flow 制片工具Vertex AI / Gemini API
推荐配置
入门Gemini Ultra 订阅试用
进阶Vertex AI 付费 API(Veo 3.1)
专业Flow 制片的专业影视工作流
为什么选择这个模型
- MovieGenBench 综合偏好第一
- 原生生成同步音频与对白,独树一帜
- 提示遵循、真实纹理与运镜控制出色
- 背靠 Gemini 生态,API 与工具链完善
模型优点
- 音画同步能力业界标杆
- 物理规律与细节真实度高
- 支持基图/视频提示与续写扩展
- Vertex AI 企业接入门槛清晰
- SynthID 水印合规可控
模型缺点
- 闭源,无本地部署
- 访问受地域/订阅限制(美国起步)
- 成本较高,按秒计费
- 生成长度有限,长片需手工编排
适合场景
- 影视级短片与广告素材制作
- 需要原生对白/音效的叙事项目
- GCP 企业的生成式视频工作流
- 用 Flow 做多镜头电影制作
不适合场景
- 免费或低成本批量生成
- 国内直连不便的独立创作者
- 需要本地可控与数据自主的场景
部署教程
vLLM
Veo 为闭源云端服务,无本地部署。使用方式:Gemini App(Ultra 订阅)直接生成;开发者通过 Vertex AI 或 Gemini API 的 veo-3.1 接口调用文生视频/图生视频/文生音视频,按输出时长计费
智算工坊实验室
实测速度云端生成,通常数分钟内
显存占用不适用(云端)
功耗不适用(云端)
不同 GPU 对比不适用,无需本地显卡
常见问题 FAQ
Veo 3 和 Veo 3.1 有什么区别?
Veo 3.1 在提示遵循、音频质量与图生视频输出上进一步提升,并加入 3.1 Fast 速度档;二者同为 Google 主推的音视频一体旗舰。
怎么使用 Veo?
个人可订阅 Gemini Ultra 在 Gemini App / Flow 中使用;开发者走 Vertex AI 或 Gemini API(paid preview)。国内访问需留意网络与合规要求。
Veo 单段能生成多长?
官方原生约 8 秒单段,通过剪辑/续写能力可扩展到更长的镜头序列(旗舰工作流通常按镜头拼接)。
相关模型
数据来源
- https://deepmind.google/models/veo/
- https://blog.google/innovation-and-ai/products/generative-media-models-io-2025/
- https://developers.googleblog.com/en/introducing-veo-3-1-and-new-creative-capabilities-in-the-gemini-api/