Сценарій · AI UGC-відео

AI UGC-реклама з двох фотографій

UGC-ролик — це коли людина говорить у камеру телефона, тримаючи ваш товар у руках. Тут його не знімають, а генерують: ви приносите фото товару й фото людини, модель збирає перший кадр і оживляє його — разом із голосом і звуком кімнати. Ролик коштує $0.30–$1.00 на Gemini Omni Flash і до $3.00 на Veo 3.1 зі звуком, кадр — $0.11, і жодної підписки.

Зроблено для цієї сторінки від початку до кінця: два референси → перший кадр у Nano Banana Pro → вісім секунд Gemini Omni Flash, мова й звук кімнати згенеровані разом із картинкою. $1.13 за той дубль, який ви дивитесь. Увімкніть звук.
01Що це

Що таке AI UGC-відео?

AI UGC-відео — це коротка реклама у форматі користувацького контенту: людина говорить у камеру телефона, тримає товар, знімає на кухні чи у вітальні, а не в студії, — але все це згенеровано відеомоделлю, а не знято з блогером. Виробництво складається з трьох запитів: референси товару й людини, один кадр, який фіксує, хто в кадрі та що він тримає, і відеомодель, яка оживляє цей кадр разом із синхронною мовою. Моделей тут дві. Gemini Omni Flash — та, що дешевша й новіша: у картці моделі Google симуляція фізики реального світу стоїть серед її вмінь, а складний рух — серед слабких місць, що лишилися. Це збігається з тим, що бачу я: звичайні дії з предметом зазвичай минають, вигадливі — як пощастить. Veo 3.1 беруть тоді, коли весь план тримається на тому, щоб предмет поводився правильно. Один ролик — $0.30–$1.00 на Omni Flash, $1.00 на Veo 3.1 Fast і $3.00 на повній Veo 3.1 за вісім секунд зі звуком, до $4.40 у 4K. І рендериться це пару хвилин замість двох-чотирьох тижнів, які зазвичай з'їдає бриф блогеру.

Скільки насправді коштує один ролик?

Рахунок за ролик вище, без округлень: $0.11 за референс товару, $0.11 за людину, $0.11 за перший кадр, який їх поєднує, $0.80 за вісім секунд Omni Flash — разом $1.13. Вертикальна шестисекундна версія нижче коштувала $0.60. Окремий перезапис голосу — $0.01 за 200 символів тексту, приблизно цент за речення. Нові акаунти отримують $0.20 безкоштовно: цього вистачає на референс і перший кадр — подивитися, чи працює персонаж, ще до оплати відео.

Це ціна першого дубля, а перший дубль — не план. Частина роликів виходить з першого разу; багатьом потрібно два-три, бо репліка прозвучала пласко, рука зробила щось дивне або модель забракувала одяг. І є друга річ, яку в прайс ніхто не кладе: реклама рідко складається з одного ролика. Спот на 20–30 секунд — це зазвичай три-чотири дублі, склеєні разом: гачок, товар у руках, крупний план, фінал. Тож реалістичний рахунок за готову рекламу — кілька доларів, а не кілька центів, і він швидко росте, якщо плани з рухом знімати на повній Veo 3.1 по $3.00 за штуку. Склейка при цьому безкоштовна: ffmpeg ріже, з'єднує й кладе звук поверх відео просто з командного рядка, без відеоредактора.

02Процес

Дві фотографії на вході, реклама на виході

  1. Принесіть справжні референси

    Чистий кадр товару й фото людини. Усе, що на вході розмите, обрізане чи дивно освітлене, повернеться у відео помноженим.

  2. Зберіть перший кадр

    Згенеруйте один кадр одразу з двома референсами — людина з товаром, у тій крупності, з якої має починатися реклама. $0.11 на Nano Banana Pro, і переробляти можна скільки треба.

  3. Оживіть цей кадр

    Надішліть кадр як перший і опишіть рух та репліку. Omni Flash бере $0.10 за секунду 720p зі звуком; Veo 3.1 дорожча — її варто спробувати, коли одному дублю треба втримати кілька дій поспіль.

Згенерований референс товару: янтарний скляний флакон-крапельниця з кремовою керамічною кришкою на світлому льоні, без бренду
Референс 1 — товар, один чистий ракурс, рівне світло. Nano Banana Pro, $0.11.
Згенерований референс-портрет: дівчина у кремовому в'язаному светрі сидить у світлій вітальні
Референс 2 — людина. Те саме світло й той самий одяг, що потрібні в рекламі.
Згенерований перший кадр UGC-ролика: дівчина з портретного референсу тримає янтарний флакон біля плеча, крупність як зі смартфона
Перший кадр, зібраний одразу з обох референсів, — саме його продовжує відеомодель.
03Референси

Усе далі по ланцюжку настільки добре, наскільки добрий вхід

Саме цей крок зазвичай пропускають, і саме він вирішує результат. Модель, якій дали змазаний кадр флакона у три чверті, не ламається гучно — вона тихо вигадує той бік, якого не бачить, і вигадане потім вісім секунд висить на екрані. Дайте рівно освітлений фронтальний кадр з етикеткою в камеру — і той самий флакон переживе і збірку кадру, і відео, і правку після нього.

З людиною те саме. Документація Google щодо Veo формулює це прямо: беріть чіткі, добре освітлені знімки, що показують об'єкт із потрібного ракурсу, і тримайте однакову мову оптики й світла між кадрами. Моє правило після кількох десятків таких роликів: якщо референс-портрет і задумана сцена розходяться в тому, звідки падає світло, обличчя попливе кудись посередині й перестане бути тією самою людиною.

Один добрий ракурс товару

Один рівний, добре освітлений кадр кращий за п'ять випадкових. Відблиск, змаз і рука, що закриває половину етикетки, будуть добудовані вигадкою.

Одна людина, один образ

Тримайте одну зачіску, одяг і макіяж на всіх референсах. Змішані образи усереднюються в обличчя, не схоже на жодне з них.

Узгодьте світло

Портрет зі спалахом, вставлений у кухню з м'яким денним світлом, читається як колаж. Обирайте в референсі те світло, яке реально буде в рекламі.

Пильнуйте дрібний шрифт

Nano Banana Pro тримає короткі написи на етикетці; щільний склад перетворюється на текстуру. Якщо шрифт важливий, плануйте окремий макрокадр зі справжньою упаковкою.

Композиція — потім

Референси не мають бути скомпоновані як реклама. Композиція — завдання першого кадру, і саме там ви сперечаєтеся з моделлю.

Не давайте недогризок

Кроп на 300 пікселів із картки маркетплейсу не дає моделі майже нічого. Тільки оригінали в повній роздільності.

04Перший кадр

Чому перший кадр кращий за голі референси

Працюють обидва шляхи: можна віддати відеомоделі референси й дозволити їй самій зібрати сцену, а можна спершу згенерувати один кадр і оживити саме його. На практиці друге краще, і причина нудна — модель, якій доручили вигадати композицію, вигадує її щокадру заново, а модель із готовим кадром має лише продовжити його. На Gemini Omni Flash розрив достатньо великий, щоб я перестав використовувати самі лише референси для зйомок із товаром.

Нижче два ролики: один промпт, одні референси, по шість секунд, по $0.60. Різниця лише в тому, чи пішов усередину затверджений кадр. Більше не змінювалося нічого, і жоден ролик не перегенеровувався.

Лише референси

Без першого кадру. Кремова кришка зникає на першій же секунді, флакон перетворюється на інший, темний, а під кінець і зовсім іде з кадру. Обличчя в порядку — світло на ньому, мабуть, навіть краще, ніж у сусідньому дублі. Ламається саме товар.

Із затвердженого першого кадру

Той самий промпт, але старт із кадру, який ми спершу подивилися. Кришка, скло, крупність і дистанція до камери тримаються всі шість секунд — моделі треба було продовжити кадр, а не вгадати його.

Чесна версія: варіант без першого кадру не зламаний — обличчя тримається нормально, і для сцени без товару в руках його часто досить. Світло в цьому дублі навіть приємніше: м'якше на обличчі, менше контрасту від вікна, бо модель збирала кімнату, яка подобається їй самій, а не продовжувала нашу. Одне застереження, що змінює прочитання: наша героїня згенерована, а не сфотографована, — модель мала право її переосвітити. Справжній портрет фіксує світло й шкіру значно жорсткіше, і у варіанта «лише референси» лишається менше свободи вас прикрасити. Ви купуєте тут контроль, а не якість. На Veo 3.1 вибір зроблено за вас: API Google приймає або перший кадр, або до трьох референсних зображень, але не те й інше в одному запиті, а референси працюють лише на восьмисекундній тривалості.

05Вибір моделі

Підбирайте план під модель

Omni Flash дуже добрий рівно в тому форматі, в якому UGC і живе: людина говорить в об'єктив. Інтерв'ю, подкаст, засновник пояснює продукт, хтось тримає банку й розповідає про неї. Модель малює губи, мікрорух і звук кімнати за один прохід — це найдешевший спосіб отримати синхронний голос із відеомоделі. І це новіша з двох моделей, яку Google продає саме через фізику: в анонсі йдеться про інтуїтивне розуміння гравітації, кінетичної енергії та динаміки рідин, а картка моделі називає симуляцію фізики реального світу вмінням — і тут же визнає складний рух відомим слабким місцем. Обидві половини на практиці правдиві. Предмети падають, рідини ллються, вага читається вірно — рівно до моменту, коли плану потрібен ланцюжок точних дій із предметом.

Тож поділ проходить не по лінії «мовна голова проти руху», а по тому, скільки хореографії має втримати один дубль. Тест нижче — складний край цієї шкали, а не вирок якійсь із моделей: один перший кадр, один промпт, по ролику на модель. Завдання: відкрити флакон, стиснути піпетку, дві краплі в розкриту долоню — і все це за вісім секунд.

Gemini Omni Flash · 8 с · $0.80

Флакон відкривається переконливо, піпетка виходить чисто, і краплі справді потрапляють у долоню — з рідиною все добре. Погано з предметом: флакон зникає з нижньої руки рівно тоді, коли розкривається долоня, повертається, щоб його закрили, а завершується ролик порожніми руками. Одна дія з чотирьох випала.

Veo 3.1 Fast · 8 с зі звуком · $1.00

Той самий промпт і той самий перший кадр — і зверніть увагу, це Veo 3.1 Fast, дешева версія, а не старша модель. Флакон вона втримує всі чотири дії. Є пів секунди, де крізь кадр просвічує третя рука, тож «без артефактів» тут теж не вийшло; просто послідовність не розвалилася.

Розмова в камеру → Omni Flash

Губи, звук кімнати й мовлення приходять разом, $0.10 за секунду. Для огляду, відгуку чи діалогу на двох вибір очевидний.

Довгі ланцюжки дій → спробуйте й Veo

Один рух Omni витягує; на чотирьох поспіль дублі починають губити дії. У нашому порівнянні була Veo 3.1 Fast — $1.00 за вісім секунд зі звуком, повна Veo 3.1 коштує $3.00. Згенеруйте на обох і лишіть той дубль, який вийшов.

Одяг змінює вердикт

Фільтр безпеки Omni помітно суворіший до одягу: фітнес-блогерка у спортивному топі отримує відмову там значно частіше, ніж на Veo 3.1, за того самого промпта й того самого референсу. Плануйте або гардероб, або модель.

Довжина й роздільність

Omni Flash — 720p і 3–10 секунд, рівно стільки, за скільки ви платите. Veo 3.1 — 4, 6 або 8 секунд аж до 4K, і його ролики можна продовжувати за межі першого монтажу.

Звук: завжди чи за бажанням

У кожного ролика Omni є звук, просили ви його чи ні. На Veo звук — перемикач, а німий рендер дешевший, що важливо, якщо голос усе одно прийде збоку.

Відмова нічого не коштує

Заблокована генерація повертається на баланс автоматично, на обох моделях. Дорого у відмові не долар, а чотири хвилини.

06Голос і монтаж

Коли голосу потрібен другий дубль

Omni Flash пише мову тим самим проходом, що й картинку, і з розмовною англійською зазвичай справляється. Спотикається він на іменах: вигадані назви продуктів, іноземні слова, номери моделей — усе, що носієві довелося б пояснювати окремо. Але велика версія цієї проблеми — мови, крім англійської, і вона є в усіх відеомоделей. Російськомовні оглядачі, які тестували Seedance 2.5, описують репліку, що починається пристойно, а дорогою розсипається: ненаголошені голосні редукуються не так, наголос їде не на той склад, і під кінець п'ятнадцятисекундної сцени акцент ближчий до слов'янського гібрида, ніж до російської, — російська, українська та білоруська стоять достатньо близько, щоб модель їх змішала. Частина слів звучить чисто, а наступне видає весь дубль. Якщо ваш скрипт не англійською, дослухайте його до кінця, перш ніж приймати.

Лікується це тим, що голос перестають просити у відеомоделі й генерують окремо. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) працює з того самого балансу через наш MCP-сервер: $0.01 за 200 символів тексту, 30 голосів, один диктор або діалог на двох, WAV 24 кГц на виході. Режисура — звичайною мовою: персона, темп, акцент і фонетичний запис будь-якого слова, яке треба вимовити правильно. Далі доріжка кладеться на ролик у будь-якому редакторі. Тримайте переписану репліку приблизно тієї ж довжини, що й оригінальний дубль, — і губи все ще приблизно збігатимуться; там, де не збіглися, ріжте на товар.

Згенерована озвучка · $0.01

Скрипт на 200 символів, прочитаний Gemini 3.1 Flash TTS з одним рядком режисури: доброзичлива молода дівчина, огляд на телефон у себе на кухні, трохи швидше за звичне, вигадана назва бренду — на французький манер. Тринадцять секунд звуку, один цент, без жодної відеомоделі.

Зібрати рекламу теж можна без редактора. ffmpeg склеює дублі встик, вирізає ті пів секунди, де рука зробила щось не те, міняє згенерований звук на вашу TTS-доріжку, додає кросфейд і вивантажує версію 9:16 — усе це однією командою, безкоштовно, на будь-якій машині. Синтаксис у нього, м'яко кажучи, недружній, і саме тому він добре лягає на зв'язку з моделлю: опишіть потрібну склейку Claude чи будь-якій іншій LLM, отримайте команду, виконайте. Для UGC-спота з трьох роликів це весь постпродакшн — і причина, чому цифри на цій сторінці лишаються ціною генерації, а не обростають ще однією підпискою.

07Ціни

Скільки тут коштує UGC-ролик

Ціни за одиницю для моделей, що беруть участь у виробництві AI UGC-відео
МодельЦінаОдиницяЗвук
Nano Banana Proреференси й перший кадр$0.11зображення 1K–2K
Nano Banana 2чернетки й варіанти$0.03–$0.13зображення 512px–4K
Gemini Omni Flash$0.10 за секунду$0.30–$1.003–10 с, 720pзавжди увімкнений
Veo 3.1 Fastзі звуком$0.50–$1.004–8 с, 720p/1080pза бажанням
Veo 3.1 Liteнайдешевше відео$0.10–$0.364–8 с, 720pза бажанням
Gemini 3.1 Flash TTSлише через MCP$0.01за 200 символівлише голос

Ціни Veo вказано для 720p і 1080p; 4K дорожче. Omni Flash бере $0.10 за кожну секунду результату, тож довжина ролика і є ціна. Повні таблиці — на сторінці цін.

Поповнення — криптою, від $1. Депозит від $50 додає 5%, від $100 — 10%, а активний промокод дає ще 10% від тієї ж суми: $100 з кодом перетворюються на $120 на балансі. За $1.13 за восьмисекундний ролик це близько сотні дублів — тобто приблизно 25–30 готових реклам, якщо рахувати перезйомки та склейки з кількох роликів.

Усі моделі й роздільності перелічено на повній сторінці цін, а сторінка Gemini Omni Flash розбирає, що ця модель уміє й чого не вміє.

08Матеріали

Гайди з блогу

09FAQ

Питання, які ставлять насправді

Чи потрібна реальна людина, щоб зняти AI UGC-відео?

Ні. Блогера теж можна згенерувати — усі люди на цій сторінці народилися з текстового промпта й ніколи не існували. Якщо ж ви берете обличчя реальної людини, потрібен її дозвіл: правила про зображення особи працюють для згенерованого відео так само, як для зйомки, а політики майданчиків щодо синтетичних двійників суворіші, ніж заведено думати.

Чи повернеться те саме обличчя в наступний ролик?

Так, якщо ви зберігаєте ті самі референси й перевикористовуєте той самий перший кадр. Перезбирання кадру з тих самих референсів дає близький, але не піксель-у-піксель збіг — надійніше тримати кожен затверджений перший кадр і оживляти його заново, а не збирати наново.

Чи треба позначати, що рекламу згенеровано ШІ?

У TikTok — так: його рекламна політика щодо змінених матеріалів і AI-контенту вимагає або мітку AIGC з Ads Manager, або ваш власний видимий дисклеймер на креативі. Meta сама вішає AI-мітку на рекламу, яку розпізнала як згенеровану. Обидві політики змінювалися протягом 2026 року, тож перед великим запуском перевіряйте чинну редакцію, а не блог-пост — включно з цим.

Яку модель брати для «говорильної голови»?

Почніть із Gemini Omni Flash: $0.10 за секунду разом зі звуком. Для людини, яка говорить у камеру, вона і дешевша, і вередує менше, і це новіша модель, фізику якої Google рекламує окремо. Тільки не читайте це як «Omni не вміє в рух»: вона ллє, роняє, передає вагу. Що вона губить — так це довгі ланцюжки точних дій в одному дублі: у нашому тесті з піпеткою з чотирьох дій вона загубила флакон, а Veo 3.1 Fast його втримала. Тож для гачка чи відгуку — Omni. Для плану, побудованого на хореографії, згенеруйте на обох і лишіть вдалий дубль; невдалий коштує копійки.

Чи можна використати матеріал, знятий мною?

Так, до 10 секунд. Завантажте свій ролик, і Omni Flash відредагує його як video-to-video — змінить світло, фон, предмет у руках — зберігши сам дубль. Довші вихідники обрізаються до ліміту моделі перед генерацією.

Що буде, якщо генерацію відхилять?

Гроші повернуться на баланс автоматично, і на Omni Flash, і на Veo. Відмови купчаться навколо одягу, неповнолітніх і впізнаваних реальних людей; правило про гардероб із розділу про вибір моделі економить найбільше повторів.

Чи можна запускати це з Claude, Cursor або власного скрипта?

Так — ті самі моделі доступні через наш MCP-сервер, включно з мовленнєвою, у якої вебінтерфейсу немає взагалі. Референси й перші кадри передаються як job ID, публічні посилання або inline base64, тож цілу пачку UGC-роликів можна зібрати скриптом з агента.

Скільки коштує вся 30-секундна реклама, а не один ролик?

Рахуйте дублі, а не ролики. Спот на 20–30 секунд — це зазвичай три-чотири ролики, склеєні разом, і на кожен іде по пару спроб: пласка інтонація, дивний рух руки, відмова моделі. За $0.80 за вісім секунд Omni Flash готова реклама виходить у кілька доларів; якщо плани з рухом знімати на повній Veo 3.1 по $3.00, рахунок іде в десятки. Монтаж не додає нічого: ffmpeg склеює дублі, підрізає їх і кладе озвучку поверх — із командного рядка, а команди за вас напише LLM.

Дві фотографії і пара доларів

Реєстрація безкоштовна, $0.20 одразу на балансі, поповнення криптою від $1. Перший кадр — приблизно за хвилину, перший ролик — за п'ять.