Fast · 720p
120
积分 / 秒
= $0.12 美元 / 秒
官方价: $0.15−20%
- duration
- 4, 6, 8
- model
- veo3_fast
- resolution
- 720p
模型指南
通过文字、图片或参考图生成带原生音频的 720p 视频,支持 4、6 或 8 秒时长。
Veo 3.1 是 Google DeepMind 面向电影感视频生成的旗舰模型,重点提升提示词遵循、运动与物理真实感、画面一致性和原生音频。Wizzx 当前开放的是后端 model key 为 veo3 的 Veo Fast 档位,输出规格为 720p,时长可选 4、6 或 8 秒。
| 核心优势 | 对结果的影响 |
|---|---|
| 原生音频 | 在同一份提示词中描述对白、环境声、音效或音乐意图 |
| 提示词遵循 | 用结构化镜头描述控制主体、动作、摄影机、光线和声音 |
| 运动与物理连贯性 | 更适合依赖物体互动和可信运动来表达创意的画面 |
| 多种起始方式 | 可从文字生成、让首帧图片动起来,或使用视觉参考引导视频 |
| 模式 | 适用情况 |
|---|---|
| 文生视频 | 希望模型根据文字从零设计完整镜头 |
| 图生视频 | 已有首帧画面,需要定义运动、镜头变化和声音 |
| 参考图生视频 | 最多三张图片用于约束主体、风格或场景;Wizzx 当前要求该模式使用 8 秒时长 |
veo3_fast这些是 Wizzx 当前实际开放的控件,并不代表所有 Veo 产品的完整能力范围。上方价格卡片仍直接读取 Wizzx 后端目录。
文生视频示例: 日出前安静的社区面包店。烘焙师把一盘可颂送入烤箱,摄影机缓慢掠过洒有面粉的操作台。室内暖色钨丝灯与窗外冷蓝街灯形成对比。轻微烤箱风扇声、金属烤盘摩擦声、远处送货卡车声;不要音乐。
图生视频示例: 保持人物面部、服装和霓虹店面不变。雨水落下,路面倒影缓慢移动,摄影机以轻微手持感向前推进。人物看向镜头后微微一笑。保留城市环境声和雨声,不要对白。
原生音频是 Veo 的核心特点,但 Google 也说明自然、稳定的语音,尤其是较长对白,仍在持续改进。建议保持对白简短,并将语音表现与视觉结果分别评估。
后端定价
模型身份、计费单位与全部价格档位均读取自后端目录。
120
积分 / 秒
= $0.12 美元 / 秒
官方价: $0.15−20%
1 积分 = $0.001 美元;最终扣费以 API 实际返回为准。
当前仅开放 veo3_fast 720p;duration 支持 4/6/8 秒,默认 8 秒;reference-to-video 仅支持 8 秒