Один добрий ракурс товару
Один рівний, добре освітлений кадр кращий за п'ять випадкових. Відблиск, змаз і рука, що закриває половину етикетки, будуть добудовані вигадкою.
Сценарій · AI UGC-відео
UGC-ролик — це коли людина говорить у камеру телефона, тримаючи ваш товар у руках. Тут його не знімають, а генерують: ви приносите фото товару й фото людини, модель збирає перший кадр і оживляє його — разом із голосом і звуком кімнати. Ролик коштує $0.30–$1.00 на Gemini Omni Flash і до $3.00 на Veo 3.1 зі звуком, кадр — $0.11, і жодної підписки.
AI UGC-відео — це коротка реклама у форматі користувацького контенту: людина говорить у камеру телефона, тримає товар, знімає на кухні чи у вітальні, а не в студії, — але все це згенеровано відеомоделлю, а не знято з блогером. Виробництво складається з трьох запитів: референси товару й людини, один кадр, який фіксує, хто в кадрі та що він тримає, і відеомодель, яка оживляє цей кадр разом із синхронною мовою. Моделей тут дві. Gemini Omni Flash — та, що дешевша й новіша: у картці моделі Google симуляція фізики реального світу стоїть серед її вмінь, а складний рух — серед слабких місць, що лишилися. Це збігається з тим, що бачу я: звичайні дії з предметом зазвичай минають, вигадливі — як пощастить. Veo 3.1 беруть тоді, коли весь план тримається на тому, щоб предмет поводився правильно. Один ролик — $0.30–$1.00 на Omni Flash, $1.00 на Veo 3.1 Fast і $3.00 на повній Veo 3.1 за вісім секунд зі звуком, до $4.40 у 4K. І рендериться це пару хвилин замість двох-чотирьох тижнів, які зазвичай з'їдає бриф блогеру.
Рахунок за ролик вище, без округлень: $0.11 за референс товару, $0.11 за людину, $0.11 за перший кадр, який їх поєднує, $0.80 за вісім секунд Omni Flash — разом $1.13. Вертикальна шестисекундна версія нижче коштувала $0.60. Окремий перезапис голосу — $0.01 за 200 символів тексту, приблизно цент за речення. Нові акаунти отримують $0.20 безкоштовно: цього вистачає на референс і перший кадр — подивитися, чи працює персонаж, ще до оплати відео.
Це ціна першого дубля, а перший дубль — не план. Частина роликів виходить з першого разу; багатьом потрібно два-три, бо репліка прозвучала пласко, рука зробила щось дивне або модель забракувала одяг. І є друга річ, яку в прайс ніхто не кладе: реклама рідко складається з одного ролика. Спот на 20–30 секунд — це зазвичай три-чотири дублі, склеєні разом: гачок, товар у руках, крупний план, фінал. Тож реалістичний рахунок за готову рекламу — кілька доларів, а не кілька центів, і він швидко росте, якщо плани з рухом знімати на повній Veo 3.1 по $3.00 за штуку. Склейка при цьому безкоштовна: ffmpeg ріже, з'єднує й кладе звук поверх відео просто з командного рядка, без відеоредактора.
Чистий кадр товару й фото людини. Усе, що на вході розмите, обрізане чи дивно освітлене, повернеться у відео помноженим.
Згенеруйте один кадр одразу з двома референсами — людина з товаром, у тій крупності, з якої має починатися реклама. $0.11 на Nano Banana Pro, і переробляти можна скільки треба.
Надішліть кадр як перший і опишіть рух та репліку. Omni Flash бере $0.10 за секунду 720p зі звуком; Veo 3.1 дорожча — її варто спробувати, коли одному дублю треба втримати кілька дій поспіль.



Саме цей крок зазвичай пропускають, і саме він вирішує результат. Модель, якій дали змазаний кадр флакона у три чверті, не ламається гучно — вона тихо вигадує той бік, якого не бачить, і вигадане потім вісім секунд висить на екрані. Дайте рівно освітлений фронтальний кадр з етикеткою в камеру — і той самий флакон переживе і збірку кадру, і відео, і правку після нього.
З людиною те саме. Документація Google щодо Veo формулює це прямо: беріть чіткі, добре освітлені знімки, що показують об'єкт із потрібного ракурсу, і тримайте однакову мову оптики й світла між кадрами. Моє правило після кількох десятків таких роликів: якщо референс-портрет і задумана сцена розходяться в тому, звідки падає світло, обличчя попливе кудись посередині й перестане бути тією самою людиною.
Один рівний, добре освітлений кадр кращий за п'ять випадкових. Відблиск, змаз і рука, що закриває половину етикетки, будуть добудовані вигадкою.
Тримайте одну зачіску, одяг і макіяж на всіх референсах. Змішані образи усереднюються в обличчя, не схоже на жодне з них.
Портрет зі спалахом, вставлений у кухню з м'яким денним світлом, читається як колаж. Обирайте в референсі те світло, яке реально буде в рекламі.
Nano Banana Pro тримає короткі написи на етикетці; щільний склад перетворюється на текстуру. Якщо шрифт важливий, плануйте окремий макрокадр зі справжньою упаковкою.
Референси не мають бути скомпоновані як реклама. Композиція — завдання першого кадру, і саме там ви сперечаєтеся з моделлю.
Кроп на 300 пікселів із картки маркетплейсу не дає моделі майже нічого. Тільки оригінали в повній роздільності.
Працюють обидва шляхи: можна віддати відеомоделі референси й дозволити їй самій зібрати сцену, а можна спершу згенерувати один кадр і оживити саме його. На практиці друге краще, і причина нудна — модель, якій доручили вигадати композицію, вигадує її щокадру заново, а модель із готовим кадром має лише продовжити його. На Gemini Omni Flash розрив достатньо великий, щоб я перестав використовувати самі лише референси для зйомок із товаром.
Нижче два ролики: один промпт, одні референси, по шість секунд, по $0.60. Різниця лише в тому, чи пішов усередину затверджений кадр. Більше не змінювалося нічого, і жоден ролик не перегенеровувався.
Лише референси
Із затвердженого першого кадру
Чесна версія: варіант без першого кадру не зламаний — обличчя тримається нормально, і для сцени без товару в руках його часто досить. Світло в цьому дублі навіть приємніше: м'якше на обличчі, менше контрасту від вікна, бо модель збирала кімнату, яка подобається їй самій, а не продовжувала нашу. Одне застереження, що змінює прочитання: наша героїня згенерована, а не сфотографована, — модель мала право її переосвітити. Справжній портрет фіксує світло й шкіру значно жорсткіше, і у варіанта «лише референси» лишається менше свободи вас прикрасити. Ви купуєте тут контроль, а не якість. На Veo 3.1 вибір зроблено за вас: API Google приймає або перший кадр, або до трьох референсних зображень, але не те й інше в одному запиті, а референси працюють лише на восьмисекундній тривалості.
Omni Flash дуже добрий рівно в тому форматі, в якому UGC і живе: людина говорить в об'єктив. Інтерв'ю, подкаст, засновник пояснює продукт, хтось тримає банку й розповідає про неї. Модель малює губи, мікрорух і звук кімнати за один прохід — це найдешевший спосіб отримати синхронний голос із відеомоделі. І це новіша з двох моделей, яку Google продає саме через фізику: в анонсі йдеться про інтуїтивне розуміння гравітації, кінетичної енергії та динаміки рідин, а картка моделі називає симуляцію фізики реального світу вмінням — і тут же визнає складний рух відомим слабким місцем. Обидві половини на практиці правдиві. Предмети падають, рідини ллються, вага читається вірно — рівно до моменту, коли плану потрібен ланцюжок точних дій із предметом.
Тож поділ проходить не по лінії «мовна голова проти руху», а по тому, скільки хореографії має втримати один дубль. Тест нижче — складний край цієї шкали, а не вирок якійсь із моделей: один перший кадр, один промпт, по ролику на модель. Завдання: відкрити флакон, стиснути піпетку, дві краплі в розкриту долоню — і все це за вісім секунд.
Gemini Omni Flash · 8 с · $0.80
Veo 3.1 Fast · 8 с зі звуком · $1.00
Губи, звук кімнати й мовлення приходять разом, $0.10 за секунду. Для огляду, відгуку чи діалогу на двох вибір очевидний.
Один рух Omni витягує; на чотирьох поспіль дублі починають губити дії. У нашому порівнянні була Veo 3.1 Fast — $1.00 за вісім секунд зі звуком, повна Veo 3.1 коштує $3.00. Згенеруйте на обох і лишіть той дубль, який вийшов.
Фільтр безпеки Omni помітно суворіший до одягу: фітнес-блогерка у спортивному топі отримує відмову там значно частіше, ніж на Veo 3.1, за того самого промпта й того самого референсу. Плануйте або гардероб, або модель.
Omni Flash — 720p і 3–10 секунд, рівно стільки, за скільки ви платите. Veo 3.1 — 4, 6 або 8 секунд аж до 4K, і його ролики можна продовжувати за межі першого монтажу.
У кожного ролика Omni є звук, просили ви його чи ні. На Veo звук — перемикач, а німий рендер дешевший, що важливо, якщо голос усе одно прийде збоку.
Заблокована генерація повертається на баланс автоматично, на обох моделях. Дорого у відмові не долар, а чотири хвилини.
Omni Flash пише мову тим самим проходом, що й картинку, і з розмовною англійською зазвичай справляється. Спотикається він на іменах: вигадані назви продуктів, іноземні слова, номери моделей — усе, що носієві довелося б пояснювати окремо. Але велика версія цієї проблеми — мови, крім англійської, і вона є в усіх відеомоделей. Російськомовні оглядачі, які тестували Seedance 2.5, описують репліку, що починається пристойно, а дорогою розсипається: ненаголошені голосні редукуються не так, наголос їде не на той склад, і під кінець п'ятнадцятисекундної сцени акцент ближчий до слов'янського гібрида, ніж до російської, — російська, українська та білоруська стоять достатньо близько, щоб модель їх змішала. Частина слів звучить чисто, а наступне видає весь дубль. Якщо ваш скрипт не англійською, дослухайте його до кінця, перш ніж приймати.
Лікується це тим, що голос перестають просити у відеомоделі й генерують окремо. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) працює з того самого балансу через наш MCP-сервер: $0.01 за 200 символів тексту, 30 голосів, один диктор або діалог на двох, WAV 24 кГц на виході. Режисура — звичайною мовою: персона, темп, акцент і фонетичний запис будь-якого слова, яке треба вимовити правильно. Далі доріжка кладеться на ролик у будь-якому редакторі. Тримайте переписану репліку приблизно тієї ж довжини, що й оригінальний дубль, — і губи все ще приблизно збігатимуться; там, де не збіглися, ріжте на товар.
Згенерована озвучка · $0.01
Зібрати рекламу теж можна без редактора. ffmpeg склеює дублі встик, вирізає ті пів секунди, де рука зробила щось не те, міняє згенерований звук на вашу TTS-доріжку, додає кросфейд і вивантажує версію 9:16 — усе це однією командою, безкоштовно, на будь-якій машині. Синтаксис у нього, м'яко кажучи, недружній, і саме тому він добре лягає на зв'язку з моделлю: опишіть потрібну склейку Claude чи будь-якій іншій LLM, отримайте команду, виконайте. Для UGC-спота з трьох роликів це весь постпродакшн — і причина, чому цифри на цій сторінці лишаються ціною генерації, а не обростають ще однією підпискою.
| Модель | Ціна | Одиниця | Звук |
|---|---|---|---|
| Nano Banana Proреференси й перший кадр | $0.11 | зображення 1K–2K | — |
| Nano Banana 2чернетки й варіанти | $0.03–$0.13 | зображення 512px–4K | — |
| Gemini Omni Flash$0.10 за секунду | $0.30–$1.00 | 3–10 с, 720p | завжди увімкнений |
| Veo 3.1 Fastзі звуком | $0.50–$1.00 | 4–8 с, 720p/1080p | за бажанням |
| Veo 3.1 Liteнайдешевше відео | $0.10–$0.36 | 4–8 с, 720p | за бажанням |
| Gemini 3.1 Flash TTSлише через MCP | $0.01 | за 200 символів | лише голос |
Ціни Veo вказано для 720p і 1080p; 4K дорожче. Omni Flash бере $0.10 за кожну секунду результату, тож довжина ролика і є ціна. Повні таблиці — на сторінці цін.
Усі моделі й роздільності перелічено на повній сторінці цін, а сторінка Gemini Omni Flash розбирає, що ця модель уміє й чого не вміє.
Як працює оживлення першого кадру, що писати у промпті руху й де все розвалюється.
Читати гайдЯк довести товар від референсу до готового кадру, зі справжніми промптами.
Читати гайдПрактика з preview-API: що підтримується, що відхиляється й скільки насправді коштує ролик.
Читати гайдНі. Блогера теж можна згенерувати — усі люди на цій сторінці народилися з текстового промпта й ніколи не існували. Якщо ж ви берете обличчя реальної людини, потрібен її дозвіл: правила про зображення особи працюють для згенерованого відео так само, як для зйомки, а політики майданчиків щодо синтетичних двійників суворіші, ніж заведено думати.
Так, якщо ви зберігаєте ті самі референси й перевикористовуєте той самий перший кадр. Перезбирання кадру з тих самих референсів дає близький, але не піксель-у-піксель збіг — надійніше тримати кожен затверджений перший кадр і оживляти його заново, а не збирати наново.
У TikTok — так: його рекламна політика щодо змінених матеріалів і AI-контенту вимагає або мітку AIGC з Ads Manager, або ваш власний видимий дисклеймер на креативі. Meta сама вішає AI-мітку на рекламу, яку розпізнала як згенеровану. Обидві політики змінювалися протягом 2026 року, тож перед великим запуском перевіряйте чинну редакцію, а не блог-пост — включно з цим.
Почніть із Gemini Omni Flash: $0.10 за секунду разом зі звуком. Для людини, яка говорить у камеру, вона і дешевша, і вередує менше, і це новіша модель, фізику якої Google рекламує окремо. Тільки не читайте це як «Omni не вміє в рух»: вона ллє, роняє, передає вагу. Що вона губить — так це довгі ланцюжки точних дій в одному дублі: у нашому тесті з піпеткою з чотирьох дій вона загубила флакон, а Veo 3.1 Fast його втримала. Тож для гачка чи відгуку — Omni. Для плану, побудованого на хореографії, згенеруйте на обох і лишіть вдалий дубль; невдалий коштує копійки.
Так, до 10 секунд. Завантажте свій ролик, і Omni Flash відредагує його як video-to-video — змінить світло, фон, предмет у руках — зберігши сам дубль. Довші вихідники обрізаються до ліміту моделі перед генерацією.
Гроші повернуться на баланс автоматично, і на Omni Flash, і на Veo. Відмови купчаться навколо одягу, неповнолітніх і впізнаваних реальних людей; правило про гардероб із розділу про вибір моделі економить найбільше повторів.
Так — ті самі моделі доступні через наш MCP-сервер, включно з мовленнєвою, у якої вебінтерфейсу немає взагалі. Референси й перші кадри передаються як job ID, публічні посилання або inline base64, тож цілу пачку UGC-роликів можна зібрати скриптом з агента.
Рахуйте дублі, а не ролики. Спот на 20–30 секунд — це зазвичай три-чотири ролики, склеєні разом, і на кожен іде по пару спроб: пласка інтонація, дивний рух руки, відмова моделі. За $0.80 за вісім секунд Omni Flash готова реклама виходить у кілька доларів; якщо плани з рухом знімати на повній Veo 3.1 по $3.00, рахунок іде в десятки. Монтаж не додає нічого: ffmpeg склеює дублі, підрізає їх і кладе озвучку поверх — із командного рядка, а команди за вас напише LLM.
Реєстрація безкоштовна, $0.20 одразу на балансі, поповнення криптою від $1. Перший кадр — приблизно за хвилину, перший ролик — за п'ять.