返回博客
BananaBanana Teamtutorialvideoveoprompts

Veo 3.1 提示词指南:写出真正有效的提示词

实用的 Veo 3.1 提示词指南:七要素结构、镜头运动术语、音频提示,以及低至每部视频 $0.10 的真实前后对比视频。

Veo 3.1 提示词指南:写出真正有效的提示词

Veo 3.1 提示词是一段简短的场景描述,用于告诉 Google 的视频模型要拍摄什么以及如何拍摄。模型会将你的文本视作一份“导演简报”:它们会从中读取主体、动作、风格、镜头运动、构图、镜头选择和光影,然后用自己的推测来填补你未指定的空白。写好提示词的核心在于:减少让模型猜测的空间。

如果你只想看一段话的极速版:描述一个主体做一个动作,然后加入镜头。一个实用的模板是:"[shot type] of [subject] [doing action] in [setting], [camera movement], [lens or focus], [lighting and mood]"。仅仅养成“加上镜头和光影”这一个习惯,就能抹平枯燥片段与可用素材之间的大部分差距。以下是具体的细节和实证。

自我们推出视频生成功能以来,我每天都在 BananaBanana 上运行 Veo 3.1。懒人提示词与结构化提示词之间的差距,在这里比在我用过的任何图像模型中都要大。图像会宽容模糊,而视频则会加倍惩罚模糊——一次在画面上,一次在动作里。

什么是优秀的 Veo 3.1 提示词?

根据 Google 的 Veo 官方文档,一个强大的提示词包含七个要素:主体(Subject)、动作(Action)、风格(Style)、相机定位(Camera positioning)、构图(Composition)、焦距和镜头效果(Focus and lens effects)以及氛围(Ambiance)。你不需要每次都用齐这七个要素,但你需要清楚自己忽略了哪些,因为模型会即兴发挥剩余的部分。

要素控制内容示例词组
Subject画面中出现的人物或事物"an elderly potter with clay-stained hands"
Action视频片段中发生的事情"shaping a bowl on a spinning wheel"
Style整体美学风格"cinematic documentary style"
Camera相机位置和镜头运动"slow dolly-in at eye level"
Composition画幅构图"close-up"
Lens / focus光学特征(如虚化)"shallow depth of field"
Ambiance光影与色彩氛围"warm window light, dust in the air"

要素s的顺序并不像人们想象的那样重要。我通常会把主体和动作放在最前面,因为这是模型的理解锚点,然后把镜头运动和光影放在最后。更重要的是具体性:写下 “a horse” 相当于让模型在 40 种马匹中扔硬币决定,而 “a chestnut Arabian horse”(一匹栗色阿拉伯马)则不会留给模型随机的选择。

一个诚实的警示:Veo 3.1 在 Google 端有一个提示词重写器(Prompt rewriter),会在生成前扩写简短的提示词,而且你无法完全看到它添加了什么。简短的提示词有时会带回你从未要求过的细节。亲自写明细节,才是把决策权从重写器手中夺回的方法。

Veo 3.1 提示词结构剖析图,分为七个标注要素:主体、动作、风格、相机、构图、镜头与氛围

如何在 Veo 3.1 中控制镜头?

镜头语言是 Veo 3.1 提示词中最具杠杆效应的部分,也是大多数人忽略的部分。模型能理解标准的电影拍摄词汇,因此请直接、字面地使用它们。

相机位置:aerial view(航拍)、eye-level(平视)、low-angle shot(低角度仰拍)、top-down shot(自上而下俯拍)、over-the-shoulder(过肩镜头)。镜头运动:dolly in or out(推拉镜头)、tracking shot(跟镜头/移动拍摄)、pan left or right(左/右摇镜头)、tilt up(仰摇镜头)、slow zoom(慢速变焦)、POV shot(主观视角)。构图:extreme close-up(特写/微距)、close-up(近景)、medium shot(中景)、wide shot(远景)、establishing shot(全景定场镜头)。光学特性:shallow focus(浅焦/浅景深)、deep focus(深焦/全景深)、macro lens(微距镜头)、wide-angle lens(广角镜头)、soft focus(柔焦)。

根据我们的视频生成经验,有两条非常实用的规则。第一,每段剪辑只指定一个镜头运动。一个要求“摇镜头然后推进紧接着仰摇”的提示词,通常只会让你随机得到这三种动作之一,或者得到一个模糊折中的效果。片段只有 4 到 8 秒,只够容纳一个执行完美的镜头运动。第二,当两者冲突时,动作动词会胜过相机名词。如果你的主体在“全力奔跑(sprints)”,但相机指令是“静态远景(static wide shot)”,那么模型会优先表现奔跑,并无论如何都会移动相机。请让两者保持一致。

光影的处理方式也是一样:像电影摄影师那样去命名。诸如 “Golden hour backlight”(黄金时刻逆光)、“cool blue moonlight”(冷蓝色月光)、“harsh overhead fluorescent”(刺眼的头顶荧光灯)和 “flickering torchlight”(摇曳的火把光)都能被模型可靠地识别。而类似 “beautiful lighting”(美丽光影)这种模糊的形容词,在模型眼里等于不存在。

Veo 3.1 提示词的电影相机词汇,展示为单个主体周围的推拉、摇镜头、低角度和航拍位置的分镜图

前后对比:同一个创意,两段提示词

空谈无益,让我们来看在 BananaBanana 上使用 Veo 3.1 Fast 生成的同一个场景。视频无声,时长 6 秒,分辨率 720p。这两个演示片段的总成本仅约 $1。

首先,是大家第一天上手时通常会写的提示词。仅仅是 “A horse running on a beach”:

效果还可以。但请注意,模型自己决定选择了日落场景,这就是提示词重写器在替你做决定。构图保持在很远的远景,镜头没有明确的目的,而这一切都不是你选择的。现在,用七要素结构重写同一个创意:“A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun”:(一匹栗色阿拉伯马在黄金时刻沿着湿漉漉的沙滩奔驰,蹄子踢起海水浪花,低角度跟镜头伴随马匹移动,浅焦/浅景深,落日带来的温暖逆光轮廓光):

同样的主体,同一个模型,同样的价格。第二段视频拥有精心设计的镜头运动、一致的光线方向以及迎光飞溅的浪花,这些都是因为提示词中写明了字句,而非凭运气得来。

在制作这个演示时,有一个教训让我多付出了两次重新生成的代价:该提示词的早期版本以 “cinematic 35mm look” 结尾,而 Veo 字面上理解了胶片引用,在画面中直接渲染出了固定的黑色上下遮幅(letterbox bars)。重复出现了两次。像 “35mm”、“anamorphic” 或 “cinematic film look” 这样的风格词汇可能会拉入整个宽银幕表现形式,连带遮幅条也一起画出来。如果你想要那种氛围但不需要遮幅,请直接描述光线和镜头行为,省去电影胶片类的词汇。

如果你是从一张照片而非纯文本开始,机制会发生一些变化(你的图像会锁定第一帧,提示词只负责描述运动)。我们在单独的 图生视频指南 中介绍了该工作流程。

如何在 Veo 3.1 中添加音频提示词?

Veo 3.1 可以生成原生音频。根据 Google 文档,在 API 中它是默认开启的:包含与画面同步的对话、音效和环境噪声。你可以通过不同的文本约定来分别控制它们。

  • 对话放在双引号中,并附带发言者:A man murmurs, "This must be it."(一个男人低语道:“应该就是这里了。”)
  • 音效则作为事件来陈述:“tires screeching”(轮胎刺耳的摩擦声)、“waves crashing against rocks”(海浪拍打岩石的声音)。
  • 环境噪音则作为氛围进行描述:“faint hum of fluorescent lights”(荧光灯微弱的嗡嗡声)、“distant seagulls”(远处海鸥的叫声)。

Google 自己的提示词示例展示了这一模式:“A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'” 引号内的对话会生成对口型的语音,而 “flickering” 和 “torchlight” 则定下了房间的背景音调。

保持口语台词简短。在我们的测试中,每行如果超过大约 12 个单词,在 8 秒的剪辑中就有可能导致结尾被切断或显得过于仓促。而且对话最好只安排一到两个发声者,而不是一群人,否则重叠的声音听起来会很嘈杂。

在 BananaBanana 上,音频生成是一个开关,并且因为 Google 单独计费,所以它也是单独定价的:在 720p 或 1080p 分辨率下,一个 8 秒的 Veo 3.1 Fast 视频片段无声版为 $0.70,带声音版为 $1.00。上面的演示视频特意制作成了无声版,在视频注定要在静音下自动播放的情况下,这显然是更省钱的实在之举。(如果你希望默认让每个片段都有声音,Omni Flash 模型 采取了相反的策略:音频始终开启,按每秒 $0.10 计费。)

声波、对话气泡和环境噪声符号流入电影胶片画面,展示 Veo 3.1 音频提示词的结构方式

反向提示词、时长与 Veo 3.1 资费

反向提示词的情况确实令人困惑,所以这是我们从 API 端看到的事实。用于 Veo 3.1 的 Gemini API 文档中并没有记录反向提示词参数。然而,BananaBanana 运行的 Vertex AI 终结点确实接受 negativePrompt,并且在我们的生成测试中,它能够明显引导输出方向。所以该字段在我们的生成器中是存在且起效的;只是不要指望它的表现会像一个硬性过滤网那样绝对。

编写反向提示词有一个来自 Google 提示词指南 极其反直觉的规则:千万不要在反向输入框中写入 “no” 或 “don't”。请把不想要的事物作为普通名词直接列出。“Cartoon, low quality, text overlay, watermark” 这样的列举很有效;而写成 “no cartoons” 反而可能适得其反,因为 “cartoon” 这个词依然包含其中。

根据 Google 的文档和我们的生产环境设置,视频时长和画幅格式为:支持 16:9 或 9:16 画幅下的 4、6、7 或 8 秒视频,输出分辨率有 720p、1080p 和 4K。1080p、4K、参考图和视频延长(extension)均要求 8 秒的基础视频长度。延长是 Veo 极易被忽视的强大功能:每次请求会增加 7 秒,最多可以重复 20 次,这就是你如何通过一个提示词链生成超过两分钟视频的秘诀。

目前 BananaBanana 一个 8 秒 720p 片段的资费如下:

模型无声版带声音版
Veo 3.1 Lite$0.20$0.36
Veo 3.1 Fast$0.70$1.00
Veo 3.1$1.40$3.00

一个 4 秒的 Lite 无声片段价格为 $0.10,而每个新账户获得的免费余额足够生成两个这样的片段。所以你的第一个 Veo 视频不需要花一分钱。说实话,在你在 Fast 或完整模型上花真金白银之前,720p 下的 Lite 模型完全足够你用来摸索提示词的结构。完整的资费表可以在 价格页面 上找到。

我个人的默认工作流:先在 Lite 上起草提示词,反复测试迭代直到动作和镜头稳定,然后将最终提示词在 Fast 或 Veo 3.1 上重新跑一次。提示词的优劣能完美地跨层级通用;你所支付的价格,本质上是在为渲染画质买单。

常见问题(FAQ)

Veo 3.1 最佳的提示词结构是什么?

大致顺序为:主体、动作、风格、相机、构图、镜头、氛围。简明模板:"[shot type] of [subject] [action] in [setting], [camera move], [lens], [lighting]"。具体名词优于形容词,且每段片段一个镜头运动优于三个。

Veo 3.1 支持反向提示词吗?

在 Vertex AI 上是支持的:模型接受 negativePrompt 参数并且确实有效,尽管 Gemini API 文档中没有针对 Veo 3.1 列出它。请以纯名词形式书写反向词(例如 “cartoon, blurry, watermark”),切勿写成带有 “no X” 的否定句。

如何让 Veo 3.1 生成语音?

将台词放在引号中,并在提示词里将其与说话者关联起来:A woman whispers, "We're not alone."。Veo 对短台词的对口型效果很好;请让每段视频片段的对话控制在 12 个单词以内。

一部 Veo 3.1 视频最长可以多长?

基础片段为 4 到 8 秒。通过视频延长功能(每次请求增加 7 秒,根据 Google 的文档最多支持 20 次延长),单个提示词链在 720p 分辨率下最高可达到 148 秒。

生成一部 Veo 3.1 视频需要多少钱?

在 BananaBanana 上,价格区间从 $0.10(4 秒无声 720p 的 Veo 3.1 Lite)到 $4.40(带音频的 8 秒 4K 版 Veo 3.1)。处于中间档默认推荐的 8 秒无声 Fast 片段,资费为 $0.70。

tutorialvideoveoprompts