Gemini

Google

API 当前可用

Veo 3.1 Fast

通过文字、图片或参考图生成带原生音频的 720p 视频,支持 4、6 或 8 秒时长。

视频生成

模型指南

关于 Veo 3.1 Fast

通过文字、图片或参考图生成带原生音频的 720p 视频,支持 4、6 或 8 秒时长。

为什么选择 Veo 3.1 Fast?

Veo 3.1 是 Google DeepMind 面向电影感视频生成的旗舰模型,重点提升提示词遵循、运动与物理真实感、画面一致性和原生音频。Wizzx 当前开放的是后端 model key 为 veo3Veo Fast 档位,输出规格为 720p,时长可选 4、6 或 8 秒。

核心优势对结果的影响
原生音频在同一份提示词中描述对白、环境声、音效或音乐意图
提示词遵循用结构化镜头描述控制主体、动作、摄影机、光线和声音
运动与物理连贯性更适合依赖物体互动和可信运动来表达创意的画面
多种起始方式可从文字生成、让首帧图片动起来,或使用视觉参考引导视频

选择合适的生成模式

模式适用情况
文生视频希望模型根据文字从零设计完整镜头
图生视频已有首帧画面,需要定义运动、镜头变化和声音
参考图生视频最多三张图片用于约束主体、风格或场景;Wizzx 当前要求该模式使用 8 秒时长

Wizzx 当前开放范围

  • 模型档位: veo3_fast
  • 分辨率: 720p
  • 时长: 4、6 或 8 秒
  • 宽高比: 16:9、9:16 或 Auto
  • 视觉输入: 根据模式提供首尾帧,或最多三张参考图

这些是 Wizzx 当前实际开放的控件,并不代表所有 Veo 产品的完整能力范围。上方价格卡片仍直接读取 Wizzx 后端目录。

把提示词写成一份镜头简报

  1. 主体与场景: 镜头中是谁或什么,发生在什么环境?
  2. 动作: 在选定时长内,描述一个能够清楚展开的主要动作或事件。
  3. 摄影机: 写明景别和镜头运动,例如固定近景、缓慢推进、手持跟拍或航拍揭示。
  4. 光线与视觉语言: 只有在服务创意时,再补充时间、光线方向、配色、质感和类型风格。
  5. 声音: 对白使用引号标出,环境声和音效分开描述。

文生视频示例: 日出前安静的社区面包店。烘焙师把一盘可颂送入烤箱,摄影机缓慢掠过洒有面粉的操作台。室内暖色钨丝灯与窗外冷蓝街灯形成对比。轻微烤箱风扇声、金属烤盘摩擦声、远处送货卡车声;不要音乐。

图生视频示例: 保持人物面部、服装和霓虹店面不变。雨水落下,路面倒影缓慢移动,摄影机以轻微手持感向前推进。人物看向镜头后微微一笑。保留城市环境声和雨声,不要对白。

最适合的项目

  • 广告短镜头和社交视频概念
  • 产品动态测试与电影感氛围探索
  • 需要保留起始构图的图片动画
  • 带同步视听意图的分镜和预演

原生音频是 Veo 的核心特点,但 Google 也说明自然、稳定的语音,尤其是较长对白,仍在持续改进。建议保持对白简短,并将语音表现与视觉结果分别评估。

资料来源

后端定价

以下价格由 API 直接发布。

模型身份、计费单位与全部价格档位均读取自后端目录。

Fast · 720p

120

积分 / 秒

= $0.12 美元 / 秒

官方价: $0.1520%

duration
4, 6, 8
model
veo3_fast
resolution
720p

1 积分 = $0.001 美元;最终扣费以 API 实际返回为准。

当前仅开放 veo3_fast 720p;duration 支持 4/6/8 秒,默认 8 秒;reference-to-video 仅支持 8 秒

返回全部模型