一个好的产品角度
一张平视、均匀布光的图,胜过五张随手拍。反光、运动模糊、一只手挡住半个标签——这些统统会被模型「重建」成瞎编。
使用场景 · AI UGC 视频
所谓 UGC 广告,就是有人手里拿着你的产品,对着手机镜头说话。这里它不是拍出来的,而是生成的:你提供一张产品照和一张人物照,模型先搭出开场画面,再在同一次生成里让它动起来,连人声和房间环境音一并带上。一条片子在 Gemini Omni Flash 上是 $0.30–$1.00,带声音的 Veo 3.1 最高 $3.00,开场画面 $0.11,而且全程没有订阅。
AI UGC 视频就是一条用户内容形式的短广告:一个人对着手机镜头说话,手里拿着产品,场景是厨房或客厅而不是摄影棚——只不过它由视频模型生成,而不是找达人拍摄。制作过程只有三次调用:产品和人物的参考图、一张锁定「谁出镜、手里拿什么」的静帧,然后由视频模型带着同步语音让这张静帧动起来。这里用到两个模型。Gemini Omni Flash 更便宜也更新:谷歌的模型卡把真实世界物理模拟列进它的能力,把复杂运动列进尚存的短板——这跟我看到的一致,普通的拿放动作大多过得去,复杂的动作则是碰运气。Veo 3.1 则是当整个镜头都押在「物体必须表现正常」时才请出来的那一个。单条片子,Omni Flash 是 $0.30–$1.00,Veo 3.1 Fast 是 $1.00,完整版 Veo 3.1 带声音八秒是 $3.00,4K 最高 $4.40。而且渲染只要几分钟,不是一份达人 brief 通常要吃掉的两到四周。
上面那条片的账单,不四舍五入:产品参考图 $0.11,人物参考图 $0.11,把两者合到一起的首帧 $0.11,八秒 Omni Flash $0.80——合计 $1.13。再往下那条竖版六秒的花了 $0.60。单独重录配音是每 200 个字符 $0.01,差不多一句话一美分。新账号送 $0.20,够做一张参考图加一张首帧——足够你在为视频付钱之前,先看看这个人物立不立得住。
但这是第一条的价格,而第一条不能当成计划。有些片子一次就成;更多的要两三次,因为台词念得平、手做了奇怪的动作,或者衣着被模型拒了。还有一件没人写进价目表的事:一条广告很少只有一个片段。20–30 秒的成片通常是三四条剪在一起——钩子、产品在手、特写、收尾。所以一条成品广告的现实账单是几美元,而不是几美分;如果动作多的镜头改用完整版 Veo 3.1(每条 $3.00),涨得更快。剪起来倒是免费的:ffmpeg 在命令行里就能裁剪、拼接、把音频压到视频上,不用任何剪辑软件。
一张干净的产品图,加一张人物照。输入里模糊的、被裁掉的、打光奇怪的部分,到了视频里会被成倍放大还给你。
拿着两张参考图生成一张静帧——人和产品在一起,构图就照广告开场该有的样子来。Nano Banana Pro 上 $0.11,不满意可以一直重做到顺眼为止。
把这张静帧作为首帧发过去,再描述动作和她要说的那句话。Omni Flash 带音频的 720p 每秒收 $0.10;Veo 3.1 更贵,但当一条片子要连着完成好几个动作时,值得试的是它。



这一步大家最爱跳过,可它恰恰决定了结果。你丢给模型一张模糊的四分之三角度手机随拍,它不会明着报错——它会悄悄把看不见的那一侧编出来,而这个编出来的侧面,就要在屏幕上待满八秒。换成一张平视、布光均匀、标签正对镜头的产品图,同一只瓶子就能挺过首帧、挺过视频、也挺过后面的剪辑。
人物同理。Google 的 Veo 文档说得很直白:选清晰、光线好、角度就是你想要的那个角度的图,并且让不同镜头之间的镜头语言和布光描述保持一致。我做了几十条之后的经验法则是:如果参考肖像和你想要的场景在「光从哪来」这件事上打架,那张脸就会往中间漂,漂到不像同一个人。
一张平视、均匀布光的图,胜过五张随手拍。反光、运动模糊、一只手挡住半个标签——这些统统会被模型「重建」成瞎编。
参考照之间发型、服装、妆容要一致。混着来,模型会取个平均值,做出一张两边都不像的脸。
闪光灯硬光的肖像扔进柔和日光的厨房场景,一看就是拼的。参考图里选的光,得是广告里真的会有的那种光。
Nano Banana Pro 能稳住短标签文字;密密麻麻的成分表会糊成一片纹理。如果字本身很重要,那就老老实实用真包装拍个特写。
参考图不需要按广告的构图来拍。构图是首帧那一步的活儿——跟模型掰扯,掰扯的就是那一步。
从电商详情页上抠下来的 300 像素小图,几乎没给模型留下任何可保留的信息。永远用全分辨率原图。
两条路都能走:你可以把参考照直接交给视频模型,让它自己组画面;也可以先生成一张静帧,再让这张静帧动起来。实操下来第二条更好,原因也很朴素——被要求自己编构图的视频模型,会每一帧都重编一次,而拿到静帧的模型只需要把它接着演下去。在 Gemini Omni Flash 上这个差距大到我已经不再用「只给参考图」的方式拍产品镜头了。
下面两条片子,同一条提示词、同一组参考图、各六秒、各 $0.60。唯一的区别是有没有把一张确认过的静帧当首帧送进去。其他什么都没改,两条也都没有重抽。
只给参考图
从确认过的首帧出发
说句实在话:只用参考图这条路并没有坏——脸的一致性没问题,手里不拿产品的场景往往够用。真要比,那一条的光反而更好看:脸上更柔和,窗户带来的反差更小,因为模型是在搭一个它自己喜欢的房间,而不是接着我们的那张画面往下走。有个前提值得说明,它会改变结论的读法:我们的出镜人物是生成的,不是真人照片,所以模型有余地重新给她布光。真人肖像会把光线和皮肤钉得死得多,只用参考图的路子也就没那么多空间去美化。你在这里买的是控制权,不是画质。到了 Veo 3.1,这个选择已经替你做好了:谷歌的 API 要么收首帧,要么收最多三张参考图,同一个请求里不能两者都要,而且用参考图就只能是八秒。
Omni Flash 最擅长的,恰好就是 UGC 真正生活的那个形式:一个人对着镜头说话。访谈、播客式片段、创始人讲产品、有人拿着一罐东西介绍。嘴型、微动作和房间环境音一次生成,这是从视频模型里拿到同步人声最便宜的方式。它还是两者里更新的一个,而谷歌恰恰是拿物理来卖它的:发布文章讲到对重力、动能和流体力学的直觉理解,模型卡把真实世界物理模拟列为能力,同时点名复杂运动是已知短板。实践中这两半都成立。东西会落下,液体会流动,重量看着也对——直到镜头要求用一个物体完成一串精确动作。
所以分界线不是「说话的人 vs 动作」,而是一条片子要扛多少调度。下面这个测试处在这条刻度的困难一端,不是对两个模型的判决:同一张开场画面、同一段提示词、每个模型各一条——拧开瓶盖、挤压滴管、两滴落进摊开的手心,全部在八秒内完成。
Gemini Omni Flash · 8 秒 · $0.80
Veo 3.1 Fast · 8 秒带音频 · $1.00
口型、房间环境音和人声一起出来,每秒 $0.10。做测评、做口碑证言、做两人对谈,选它没跑。
一个动作 Omni 扛得住;连着四个动作时,片子就开始漏动作了。我们的对比用的是带音频八秒 $1.00 的 Veo 3.1 Fast,完整版 Veo 3.1 是 $3.00——两个都生成一条,留下成立的那条。
Omni 的安全过滤对衣着明显更严:同样的提示词、同样的参考图,穿运动内衣的健身达人在它这儿被拒的次数远高于 Veo 3.1。要么提前规划服装,要么提前换模型。
Omni Flash 是 720p、3–10 秒,你付几秒就是几秒。Veo 3.1 支持 4、6、8 秒,最高到 4K,而且片子还能在第一刀之后往后延。
Omni 的每条片子都带音频,你不要也带。Veo 那边音频是个开关——不带声音渲更便宜,而如果人声本来就打算另外做,这一点就很有用。
被拦下的生成在两个模型上都会自动退款。被拒真正贵的是那四分钟,而不是那一块钱。
Omni Flash 把台词和画面写在同一次生成里,日常英语通常没问题。它容易栽跟头的是名字:自创的产品名、外来词、型号编号——那些连母语者都得被告知怎么读的词。但这个问题真正大的版本是英语以外的语言,而且每个视频模型都有:用俄语测试 Seedance 2.5 的评测者描述过这样一句台词,开头还像样,走着走着就散了——非重读元音弱化不对,重音落错音节,到十五秒的场景结束时,口音更像斯拉夫语的混合体而不是俄语,因为俄语、乌克兰语和白俄罗斯语近到足以让模型把它们揉在一起。有的词吐得干净,下一个词就把整条片子露了馅。如果你的脚本不是英语,先整段听完再签字。
解法是别再向视频模型要人声,单独生成。Gemini 3.1 Flash TTS(gemini-3.1-flash-tts-preview)通过我们的 MCP 服务器跑在同一个余额上:每 200 个字符 $0.01,30 个音色,可以单人也可以两人对话,输出 24 kHz WAV。指导语就用大白话写——人设、语速、口音,以及任何你要求必须念准的词的音标写法。然后在任意剪辑软件里把音轨压到画面上。改写后的台词长度跟原来那条大致持平,口型就还能大差不差对得上;对不上的地方,切一个产品镜头就过去了。
生成的配音 · $0.01
把广告拼起来同样不需要剪辑软件。ffmpeg 能把片段首尾相接,剪掉手做了怪动作的那半秒,把生成的音轨换成你的 TTS 音频,加一个交叉溶解,再导出 9:16 版本——全部用一行命令,免费,任何机器都能跑。它的语法出了名的不友好,而这恰恰让它和模型很配:把你想要的剪法讲给 Claude 或任意 LLM,拿到命令,运行就行。对一条三个片段的 UGC 成片来说,这就是全部的后期——也是这一页上的数字始终停留在生成成本、上面不再叠一层订阅费的原因。
| 模型 | 价格 | 计价单位 | 音频 |
|---|---|---|---|
| Nano Banana Pro参考图与首帧 | $0.11 | 1K–2K 图像 | — |
| Nano Banana 2草稿与变体 | $0.03–$0.13 | 512px–4K 图像 | — |
| Gemini Omni Flash每秒 $0.10 | $0.30–$1.00 | 3–10 秒,720p | 始终开启 |
| Veo 3.1 Fast带音频 | $0.50–$1.00 | 4–8 秒,720p/1080p | 可选 |
| Veo 3.1 Lite最便宜的视频 | $0.10–$0.36 | 4–8 秒,720p | 可选 |
| Gemini 3.1 Flash TTS仅 MCP | $0.01 | 每 200 个字符 | 仅人声 |
Veo 的价格对应 720p 和 1080p;4K 更贵。Omni Flash 按输出的每一秒收 $0.10,所以片长就是价格。完整价目表见定价页。
所有模型和分辨率都列在完整定价页上,Gemini Omni Flash 页面则讲清了这个模型能做什么、不能做什么。
不需要。达人本身也可以生成——本页上你看到的每一个人都出自一句文字提示词,现实中并不存在。如果你确实要用真人的脸,就必须拿到本人许可:肖像权规则对生成视频的约束跟对实拍是一样的,而各平台关于合成肖像的政策比多数人以为的更严。
能,只要你沿用同一组参考照并复用同一张首帧。用同样的参考图重新生成首帧只能做到接近,做不到像素级一致——最稳妥的习惯是把每一张确认过的首帧都存下来,下次直接拿它再动一遍,而不是重新搭一张。
在 TikTok 上是的:它关于编辑类素材和 AI 生成内容的广告政策,要求你要么在 Ads Manager 里打 AIGC 标签,要么自己在创意素材上放可见的声明。Meta 则会对它识别为生成内容的广告自动加上自己的 AI 标签。这两份政策在 2026 年都改过,所以大规模投放前请去查当前版本,别只信一篇博客——包括这一篇。
先从 Gemini Omni Flash 开始,每秒 $0.10 且含音频:拍一个对着镜头说话的人,它既最便宜也最省事,而且是更新的模型,谷歌本身就在主打它的物理表现。但别把这句读成「Omni 不会做动作」:它能倒、能掉落、能把重量演出来。它丢的是一条片子里又长又精确的动作链——在我们那个四动作的滴管测试里,它把瓶子弄丢了,而 Veo 3.1 Fast 保住了。所以钩子或口碑证言用 Omni;靠调度撑起来的镜头,两个模型各生成一条,留下成立的那条,失败的那条也就几美分。
可以,最长 10 秒。上传你的片段,Omni Flash 会以 video-to-video 的方式来改——换光线、换背景、换人手里拿的东西——同时保留这条表演。更长的素材会在生成前被裁到模型的上限。
余额自动退回,Omni Flash 和 Veo 都一样。被拒主要集中在衣着、未成年人和可辨认的真实人物;上面选模型那一节里的服装规则,是最能替你省下重试次数的一条。
可以——同样这些模型都通过我们的 MCP 服务器开放,包括那个压根没有网页界面的语音模型。参考图和首帧可以用任务 ID、公开 URL 或内联 base64 传入,所以整批 UGC 都能由智能体脚本化地跑出来。
按条数算不准,要按拍的次数算。20–30 秒的成片通常是三四个片段剪在一起,每个片段到能用之前一般要试上两三次:念得平、手很怪、被拒。按 Omni Flash 八秒 $0.80 算,一条成品广告落在几美元;动作多的镜头改用完整版 Veo 3.1(每条 $3.00),就会进到几十美元。剪辑本身不增加成本:ffmpeg 在命令行里拼接片段、修剪长度、把配音压上去,而这些命令可以让 LLM 替你写。