Сценарий · AI UGC-видео

AI UGC-реклама из двух фотографий

UGC-ролик — это когда человек говорит в камеру телефона, держа ваш товар в руках. Здесь его не снимают, а генерируют: вы приносите фото товара и фото человека, модель собирает первый кадр и оживляет его — вместе с голосом и звуком комнаты. Ролик стоит $0.30–$1.00 на Gemini Omni Flash и до $3.00 на Veo 3.1 со звуком, кадр — $0.11, и никакой подписки.

Сделано для этой страницы от начала до конца: два референса → первый кадр в Nano Banana Pro → восемь секунд Gemini Omni Flash, речь и звук комнаты сгенерированы вместе с картинкой. $1.13 за тот дубль, который вы смотрите. Включите звук.
01Что это

Что такое AI UGC-видео?

AI UGC-видео — это короткая реклама в формате пользовательского контента: человек говорит в камеру телефона, держит товар, снимает на кухне или в гостиной, а не в студии, — но всё это сгенерировано видеомоделью, а не снято с блогером. Производство состоит из трёх запросов: референсы товара и человека, один кадр, который фиксирует, кто в кадре и что он держит, и видеомодель, оживляющая этот кадр вместе с синхронной речью. Моделей здесь две. Gemini Omni Flash — та, что дешевле и новее: в карточке модели Google симуляция физики реального мира стоит среди её умений, а сложное движение — среди оставшихся слабых мест. Совпадает с тем, что вижу я: обычные действия с предметом обычно проходят, замысловатые — как повезёт. Veo 3.1 берут тогда, когда весь план держится на том, чтобы предмет вёл себя правильно. Один ролик — $0.30–$1.00 на Omni Flash, $1.00 на Veo 3.1 Fast и $3.00 на полной Veo 3.1 за восемь секунд со звуком, до $4.40 в 4K. И рендерится это пару минут вместо двух-четырёх недель, которые обычно съедает бриф блогеру.

Сколько на самом деле стоит один ролик?

Счёт за ролик выше, без округлений: $0.11 за референс товара, $0.11 за человека, $0.11 за первый кадр, который их соединяет, $0.80 за восемь секунд Omni Flash — итого $1.13. Вертикальная шестисекундная версия ниже стоила $0.60. Отдельная перезапись голоса — $0.01 за 200 символов текста, примерно цент за предложение. Новым аккаунтам дают $0.20 бесплатно: этого хватает на референс и первый кадр — посмотреть, работает ли персонаж, ещё до оплаты видео.

Это цена первого дубля, а первый дубль — не план. Часть роликов выходит с первого раза; многим нужно два-три, потому что реплика прозвучала плоско, рука сделала что-то странное или модель забраковала одежду. И есть вторая вещь, которую в прайс никто не кладёт: реклама редко состоит из одного ролика. Спот на 20–30 секунд — это обычно три-четыре дубля, склеенных вместе: зацепка, товар в руках, крупный план, финал. Так что реалистичный счёт за готовую рекламу — несколько долларов, а не несколько центов, и он быстро растёт, если планы с движением снимать на полной Veo 3.1 по $3.00 за штуку. Склейка при этом бесплатна: ffmpeg режет, соединяет и кладёт звук поверх видео прямо из командной строки, без видеоредактора.

02Процесс

Две фотографии на входе, реклама на выходе

  1. Принесите настоящие референсы

    Чистый кадр товара и фото человека. Всё, что во входных данных мягкое, обрезанное или странно освещённое, вернётся в видео умноженным.

  2. Соберите первый кадр

    Сгенерируйте один кадр сразу с двумя референсами — человек с товаром, в той крупности, с которой должна начинаться реклама. $0.11 на Nano Banana Pro, и переделывать можно сколько нужно.

  3. Оживите этот кадр

    Отправьте кадр как первый и опишите движение и реплику. Omni Flash берёт $0.10 за секунду 720p со звуком; Veo 3.1 дороже — её стоит попробовать, когда одному дублю нужно удержать несколько действий подряд.

Сгенерированный референс товара: янтарный стеклянный флакон-капельница с кремовой керамической крышкой на светлом льне, без бренда
Референс 1 — товар, один чистый ракурс, ровный свет. Nano Banana Pro, $0.11.
Сгенерированный референс-портрет: девушка в кремовом вязаном свитере сидит в светлой гостиной
Референс 2 — человек. Тот же свет и та же одежда, что нужны в рекламе.
Сгенерированный первый кадр UGC-ролика: девушка с портретного референса держит янтарный флакон у плеча, крупность как со смартфона
Первый кадр, собранный сразу из обоих референсов, — именно его продолжает видеомодель.
03Референсы

Всё дальше по цепочке настолько хорошо, насколько хорош вход

Именно этот шаг обычно пропускают, и именно он решает результат. Модель, которой дали смазанный кадр флакона в три четверти, не ломается громко — она тихо придумывает ту сторону, которой не видит, и придуманное потом восемь секунд висит на экране. Дайте ровно освещённый фронтальный кадр с этикеткой в камеру — и тот же флакон переживёт и сборку кадра, и видео, и правку после него.

С человеком то же самое. Документация Google по Veo формулирует это прямо: берите чёткие, хорошо освещённые снимки, показывающие объект с нужного ракурса, и держите одинаковый язык оптики и света между кадрами. Моё правило после нескольких десятков таких роликов: если референс-портрет и задуманная сцена расходятся в том, откуда падает свет, лицо уплывёт куда-то посередине и перестанет быть тем же человеком.

Один хороший ракурс товара

Один ровный, хорошо освещённый кадр лучше пяти случайных. Блик, смаз и рука, закрывающая половину этикетки, будут достроены выдумкой.

Один человек, один образ

Держите одну причёску, одежду и макияж на всех референсах. Смешанные образы усредняются в лицо, не похожее ни на один из них.

Согласуйте свет

Портрет со вспышкой, вставленный в кухню с мягким дневным светом, читается как коллаж. Выбирайте в референсе тот свет, который реально будет в рекламе.

Следите за мелким шрифтом

Nano Banana Pro держит короткие надписи на этикетке; плотный состав превращается в текстуру. Если шрифт важен, планируйте отдельный макро-кадр с настоящей упаковкой.

Композиция — потом

Референсы не обязаны быть скомпонованы как реклама. Композиция — задача первого кадра, и именно там вы спорите с моделью.

Не давайте огрызок

Кроп на 300 пикселей с карточки маркетплейса не даёт модели почти ничего. Только оригиналы в полном разрешении.

04Первый кадр

Почему первый кадр лучше голых референсов

Работают оба пути: можно отдать видеомодели референсы и позволить ей самой собрать сцену, а можно сначала сгенерировать один кадр и оживить именно его. На практике второе лучше, и причина скучная — модель, которой поручили придумать композицию, придумывает её каждый кадр заново, а модель с готовым кадром обязана лишь продолжить его. На Gemini Omni Flash разрыв достаточно велик, чтобы я перестал использовать только референсы для съёмок с товаром.

Ниже два ролика: один промпт, одни референсы, по шесть секунд, по $0.60. Разница только в том, ушёл ли внутрь утверждённый кадр. Больше не менялось ничего, и ни один ролик не перегенерировался.

Только референсы

Без первого кадра. Кремовая крышка исчезает на первой же секунде, флакон превращается в другой, тёмный, а к концу и вовсе уходит из кадра. Лицо в порядке — свет на нём, пожалуй, даже лучше, чем в соседнем дубле. Ломается именно товар.

С утверждённого первого кадра

Тот же промпт, но старт с кадра, который мы сначала посмотрели. Крышка, стекло, крупность и дистанция до камеры держатся все шесть секунд — модели нужно было продолжить кадр, а не угадать его.

Честная версия: вариант без первого кадра не сломан — лицо держится нормально, и для сцены без товара в руках его часто достаточно. Свет в этом дубле даже приятнее: мягче на лице, меньше контраста от окна, потому что модель собирала комнату, которая ей самой нравится, а не продолжала нашу. Одна оговорка, которая меняет прочтение: наша героиня сгенерирована, а не сфотографирована, — у модели было право её переосветить. Настоящий портрет фиксирует свет и кожу куда жёстче, и у варианта «только референсы» остаётся меньше свободы вас приукрасить. Вы покупаете здесь контроль, а не качество. На Veo 3.1 выбор сделан за вас: API Google принимает либо первый кадр, либо до трёх референсных изображений, но не то и другое в одном запросе, а референсы работают только на восьмисекундной длительности.

05Выбор модели

Подбирайте план под модель

Omni Flash очень хорош ровно в том формате, в котором UGC и живёт: человек говорит в объектив. Интервью, подкаст, основатель объясняет продукт, кто-то держит банку и рассказывает о ней. Модель рисует губы, микродвижение и звук комнаты за один проход — это самый дешёвый способ получить синхронный голос из видеомодели. И это более новая из двух моделей, которую Google продаёт как раз через физику: в анонсе говорится об интуитивном понимании гравитации, кинетической энергии и динамики жидкостей, а карточка модели называет симуляцию физики реального мира умением — и тут же признаёт сложное движение известным слабым местом. Обе половины на практике правдивы. Предметы падают, жидкости льются, вес читается верно — ровно до момента, когда плану нужна цепочка точных действий с предметом.

Так что деление проходит не по линии «говорящая голова против движения», а по тому, сколько хореографии должен удержать один дубль. Тест ниже — сложный край этой шкалы, а не приговор какой-то из моделей: один первый кадр, один промпт, по ролику на модель. Задача: открыть флакон, сжать пипетку, две капли в раскрытую ладонь — и всё это за восемь секунд.

Gemini Omni Flash · 8 с · $0.80

Флакон открывается убедительно, пипетка выходит чисто, и капли действительно попадают в ладонь — с жидкостью всё хорошо. Плохо с предметом: флакон исчезает из нижней руки ровно в тот момент, когда раскрывается ладонь, возвращается, чтобы его закрыли, а заканчивается ролик пустыми руками. Одно действие из четырёх выпало.

Veo 3.1 Fast · 8 с со звуком · $1.00

Тот же промпт и тот же первый кадр — и обратите внимание, это Veo 3.1 Fast, дешёвая версия, а не старшая модель. Флакон она удерживает все четыре действия. Есть полсекунды, где сквозь кадр просвечивает третья рука, так что «без артефактов» тут тоже не получилось; просто последовательность не развалилась.

Разговор в камеру → Omni Flash

Губы, звук комнаты и речь приходят вместе, $0.10 за секунду. Для обзора, отзыва или диалога на двоих выбор очевиден.

Длинные цепочки действий → попробуйте и Veo

Одно движение Omni вытягивает; на четырёх подряд дубли начинают терять действия. В нашем сравнении была Veo 3.1 Fast — $1.00 за восемь секунд со звуком, полная Veo 3.1 стоит $3.00. Сгенерируйте на обеих и оставьте тот дубль, который получился.

Одежда меняет вердикт

Фильтр безопасности Omni заметно строже к одежде: фитнес-блогерша в спортивном топе получает отказ там гораздо чаще, чем на Veo 3.1, при том же промпте и том же референсе. Планируйте либо гардероб, либо модель.

Длина и разрешение

Omni Flash — 720p и 3–10 секунд, ровно столько, за сколько вы платите. Veo 3.1 — 4, 6 или 8 секунд вплоть до 4K, и его ролики можно продлевать за пределы первой склейки.

Звук: всегда или по желанию

У каждого ролика Omni есть звук, просили вы его или нет. На Veo звук — переключатель, а немой рендер дешевле, что важно, если голос всё равно придёт со стороны.

Отказ ничего не стоит

Заблокированная генерация возвращается на баланс автоматически, на обеих моделях. Дорого в отказе не доллар, а четыре минуты.

06Голос и монтаж

Когда голосу нужен второй дубль

Omni Flash пишет речь тем же проходом, что и картинку, и с разговорным английским обычно справляется. Спотыкается он на именах: выдуманные названия продуктов, иностранные слова, номера моделей — всё, что носителю пришлось бы объяснять отдельно. Но крупная версия этой проблемы — языки кроме английского, и она есть у всех видеомоделей. Русскоязычные обозреватели, тестировавшие Seedance 2.5, описывают реплику, которая начинается прилично, а по дороге рассыпается: безударные гласные редуцируются не так, ударение уезжает не на тот слог, и к концу пятнадцатисекундной сцены акцент ближе к славянскому гибриду, чем к русскому, — русский, украинский и белорусский стоят достаточно близко, чтобы модель их смешала. Часть слов звучит чисто, а следующее выдаёт весь дубль. Если ваш скрипт не на английском, дослушайте его до конца, прежде чем принимать.

Лечится это тем, что голос перестают просить у видеомодели и генерируют отдельно. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) работает с того же баланса через наш MCP-сервер: $0.01 за 200 символов текста, 30 голосов, один диктор или диалог на двоих, WAV 24 кГц на выходе. Режиссура — обычным языком: персона, темп, акцент и фонетическая запись любого слова, которое нужно произнести правильно. Дальше дорожка кладётся на ролик в любом редакторе. Держите переписанную реплику примерно той же длины, что и оригинальный дубль, — и губы всё ещё примерно совпадут; там, где не совпали, режьте на товар.

Сгенерированная озвучка · $0.01

Скрипт на 200 символов, прочитанный Gemini 3.1 Flash TTS с одной строкой режиссуры: дружелюбная молодая девушка, обзор на телефон у себя на кухне, чуть быстрее обычного, выдуманное название бренда — на французский манер. Тринадцать секунд звука, один цент, без всякой видеомодели.

Собрать рекламу тоже можно без редактора. ffmpeg склеивает дубли встык, вырезает те полсекунды, где рука сделала что-то не то, меняет сгенерированный звук на вашу TTS-дорожку, добавляет кроссфейд и выгружает версию 9:16 — всё это одной командой, бесплатно, на любой машине. Синтаксис у него, мягко говоря, недружелюбный, и именно поэтому он хорошо ложится на связку с моделью: опишите нужную склейку Claude или любой другой LLM, получите команду, выполните. Для UGC-спота из трёх роликов это весь постпродакшн — и причина, по которой цифры на этой странице остаются ценой генерации, а не обрастают ещё одной подпиской.

07Цены

Сколько здесь стоит UGC-ролик

Цены за единицу для моделей, участвующих в производстве AI UGC-видео
МодельЦенаЕдиницаЗвук
Nano Banana Proреференсы и первый кадр$0.11изображение 1K–2K
Nano Banana 2черновики и варианты$0.03–$0.13изображение 512px–4K
Gemini Omni Flash$0.10 за секунду$0.30–$1.003–10 с, 720pвсегда включён
Veo 3.1 Fastсо звуком$0.50–$1.004–8 с, 720p/1080pпо желанию
Veo 3.1 Liteсамое дешёвое видео$0.10–$0.364–8 с, 720pпо желанию
Gemini 3.1 Flash TTSтолько через MCP$0.01за 200 символовтолько голос

Цены Veo указаны для 720p и 1080p; 4K дороже. Omni Flash берёт $0.10 за каждую секунду результата, так что длина ролика и есть цена. Полные таблицы — на странице цен.

Пополнение — криптой, от $1. Депозит от $50 добавляет 5%, от $100 — 10%, а активный промокод даёт ещё 10% от той же суммы: $100 с кодом превращаются в $120 на балансе. При $1.13 за восьмисекундный ролик это около сотни дублей — то есть примерно 25–30 готовых реклам, если считать пересъёмки и склейки из нескольких роликов.

Все модели и разрешения перечислены на полной странице цен, а страница Gemini Omni Flash разбирает, что эта модель умеет и чего не умеет.

08Материалы

Гайды из блога

09FAQ

Вопросы, которые задают на самом деле

Нужен ли реальный человек, чтобы снять AI UGC-видео?

Нет. Блогера тоже можно сгенерировать — все люди на этой странице родились из текстового промпта и никогда не существовали. Если же вы берёте лицо реального человека, нужно его разрешение: правила об изображении гражданина работают для сгенерированного видео так же, как для съёмки, а политики площадок по синтетическим двойникам строже, чем принято думать.

Вернётся ли то же лицо в следующий ролик?

Да, если вы храните те же референсы и переиспользуете тот же первый кадр. Пересборка кадра из тех же референсов даёт близкое, но не пиксель-в-пиксель совпадение — надёжнее держать каждый утверждённый первый кадр и оживлять его заново, а не собирать заново.

Нужно ли помечать, что реклама сгенерирована ИИ?

В TikTok — да: его рекламная политика об изменённых материалах и AI-контенте требует либо метку AIGC из Ads Manager, либо ваш собственный видимый дисклеймер на креативе. Meta сама вешает AI-метку на рекламу, которую распознала как сгенерированную. Обе политики менялись в течение 2026 года, так что перед большим запуском проверяйте действующую редакцию, а не блог-пост — включая этот.

Какую модель брать для говорящей головы?

Начните с Gemini Omni Flash: $0.10 за секунду вместе со звуком. Для человека, который говорит в камеру, она и дешевле, и капризничает меньше, и это более новая модель, физику которой Google рекламирует отдельно. Только не читайте это как «Omni не умеет в движение»: она льёт, роняет, передаёт вес. Что она теряет — так это длинные цепочки точных действий в одном дубле: в нашем тесте с пипеткой из четырёх действий она потеряла флакон, а Veo 3.1 Fast его удержала. Так что для зацепки или отзыва — Omni. Для плана, построенного на хореографии, сгенерируйте на обеих и оставьте удачный дубль; неудачный стоит копейки.

Можно ли использовать материал, снятый мной?

Да, до 10 секунд. Загрузите свой ролик, и Omni Flash отредактирует его как video-to-video — изменит свет, фон, предмет в руках — сохранив сам дубль. Более длинные исходники обрезаются до лимита модели перед генерацией.

Что будет, если генерацию отклонят?

Деньги вернутся на баланс автоматически, и на Omni Flash, и на Veo. Отказы кучкуются вокруг одежды, несовершеннолетних и узнаваемых реальных людей; правило про гардероб из раздела о выборе модели экономит больше всего повторов.

Можно ли запускать это из Claude, Cursor или своего скрипта?

Да — те же модели доступны через наш MCP-сервер, включая речевую, у которой веб-интерфейса нет вообще. Референсы и первые кадры передаются как job ID, публичные ссылки или inline base64, так что целую пачку UGC-роликов можно собрать скриптом из агента.

Сколько стоит вся 30-секундная реклама, а не один ролик?

Считайте дубли, а не ролики. Спот на 20–30 секунд — это обычно три-четыре ролика, склеенных вместе, и на каждый уходит по паре попыток: плоская интонация, странное движение руки, отказ модели. При $0.80 за восемь секунд Omni Flash готовая реклама выходит в несколько долларов; если планы с движением снимать на полной Veo 3.1 по $3.00, счёт уходит в десятки. Монтаж не добавляет ничего: ffmpeg склеивает дубли, подрезает их и кладёт озвучку поверх — из командной строки, а команды за вас напишет LLM.

Две фотографии и пара долларов

Регистрация бесплатна, $0.20 сразу на балансе, пополнение криптой от $1. Первый кадр — примерно за минуту, первый ролик — за пять.