AI Image to Video: как оживить фото с помощью ИИ
Как работает генерация видео из фото (AI Image to Video), какую модель выбрать (Veo 3.1, Omni Flash, Wan 3.0, Grok), реальные цены от $0.10, промпты движения, циклы, цепочки до 148 секунд.

Генерация видео из фото (AI image to video) — технология, при которой нейросеть берет один статичный снимок, считает его первым кадром ролика и дорисовывает все, что происходит дальше: движение объектов, пролеты камеры, изменение света, а иногда и звук. Вы загружаете картинку и пишете текстовое описание того, что должно двигаться. На выходе получается короткий ролик, обычно от 4 до 10 секунд, где ваш исходный кадр буквально оживает.
Короткая версия для тех, кто спешит: загрузите фото в генератор BananaBanana, опишите движение и подождите 2–5 минут. Беззвучный 4-секундный ролик на модели Veo 3.1 Lite обойдется всего в $0.10, добавление звука поднимет цену до $0.18, Gemini Omni Flash анимирует фото сразу с полноценным саундтреком от $0.09 (оплата посекундная: от $0.03 в 360p до $0.30 в 4K), а Wan 3.0 делает то же с бесплатным звуком от $0.20 за 4 секунды в 480p. Новые пользователи получают приветственные $0.20, чего хватит на два беззвучных тестовых видео.
В продакшене у нас семь видеомоделей, и каждая принимает фото как первый кадр, поэтому в руководстве разобраны все семь. Написано оно на основе реальных логов генерации, а не рекламных буклетов. И про неудачные дубли мы тоже расскажем. Некоторые факапы учат гораздо лучше, чем идеальные кадры.
Как работает генерация видео из фото?
Под капотом статичное изображение передается модели как опорный кадр. В документации API Gemini по работе с видео указано, что Veo 3.1 поддерживает функции «image-based direction» (управление на основе картинки) и «frame-specific generation» (генерация с привязкой к конкретным кадрам). Простыми словами: ваш исходник направляет весь сюжет ролика, и вы можете жестко зафиксировать нужные кадры там, где вам хочется. Нейросеть считывает сцену, просчитывает физику (как должна пойти рябь по воде на фото или как будут развеваться волосы на ветру) и рендерит кадр за кадром вперед от вашей стартовой точки.
Практическое следствие: самый первый кадр готового видео — это ваше фото, практически пиксель в пиксель. Все, что идет следом — чистая фантазия нейросети. Хорошие промпты не тратят слова на пересказ того, что модель и так видит, а описывают именно то, что нужно дорисовать.
Это на удивление здорово работает для сцен со скрытой динамикой. Портрет начинает дышать и моргать. Пар поднимается над чашкой кофе. Припаркованная машина трогается с места. Но магия пропадает, если на фото нет намека на естественное движение. Попробуйте скормить нейросети плоский рендер товара на белом фоне без указания динамики в промпте — и на выходе вы, скорее всего, получите медленный и слегка дерганый зум. Видео не будет испорчено, но получится откровенно скучным.

Какая модель лучше всего превращает фото в видео?
Все семь доступных на платформе видеомоделей могут использовать изображение в качестве первого кадра. Но они сильно отличаются по возможностям и стоимости. Сначала модели Google:
| Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite | Gemini Omni Flash | |
|---|---|---|---|---|
| Цена (4с, без звука) | $0.70 | $0.35 | $0.10 | — |
| Цена (4с, со звуком) | $1.50 | $0.50 | $0.18 | $0.12 в 360p, $0.40 в 720p |
| Макс. разрешение | 4K | 4K | 1080p | 4K (с апскейлом) |
| Длительность | ровно 4/6/7/8 с | ровно 4/6/7/8 с | ровно 4/6/7/8 с | точно 3–10 с |
| Звук | переключатель | переключатель | переключатель | всегда включен |
| Конечный кадр + циклы | да | да | да | да (Omni 1.1) |
| Продление | до 148 с | до 148 с | нет | до 40 с, плюс редактирование видео |
Мой основной рабочий инструмент — Veo 3.1 Fast. Эта модель предлагает все нужные настройки (точную длительность, фиксацию конечного кадра, продление) за половину стоимости флагмана. При этом для роликов под соцсети разница в качестве по сравнению с топовой Veo 3.1 практически незаметна. Сверхдешевую Lite за $0.10 я использую как черновик — проверить, жизнеспособна ли задумка в движении, прежде чем тратить серьезные бюджеты. Полноценная Veo 3.1 полностью оправдывает свою цену на сложных сценах с водой, тканями или столкновениями объектов, а также когда в техзадании жестко прописано разрешение 4K. Если же звук в ролике так же важен, как и картинка, идеальным выбором будет Omni Flash. Мы подробно разобрали ее возможности в отдельном обзоре API Omni Flash. Там есть свои нюансы, в том числе как посекундная цена растет от 360p до 4K. Предыдущее поколение, Omni Flash 1.0, по-прежнему можно выбрать: 4–10 секунд, и на вход оно берет только первый кадр.
Ролик выше сгенерирован на модели Veo 3.1 Fast через наш рабочий конвейер специально для этой статьи: фотография парусника в рамке стоит на столе, а в промпте мы попросили море внутри кадра начать двигаться при медленном наезде камеры. Снято с первого дубля, без монтажа. Мы намеренно сделали его беззвучным (беззвучный режим в Fast отлично подходит для черновиков). Этот эффект «оживающей фотографии» — как раз то, что нейросеть делает с вашими картинками.
Дальше две модели, которые появились в сентябре, — от Alibaba и xAI:
| Wan 3.0 | Grok Imagine Video 1.5 | |
|---|---|---|
| Цена (4с, со звуком) | $0.20 в 480p, $0.40 в 720p, $0.80 в 1080p | $0.56 в 720p |
| Макс. разрешение | 1080p | 1080p (референсы — только в 720p) |
| Длительность | 4, 6, 8, 10, 15, 20 или 30 с | любое целое число от 4 до 15 с |
| Звук | включен по умолчанию и бесплатно, можно выключить | всегда включен, липсинк реплик |
| Конечный кадр + циклы | да | нет |
| Продление | нет, но 30 с одним дублем | нет |
Wan 3.0 я бы взял для фото, когда ролик должен идти дольше десяти секунд или нужен звук без доплаты. Grok — для фото человека, который потом должен что-то сказать: напишите реплику в кавычках, и губы пойдут за ней. Одно и то же фото воздушного шара (рендер Nano Banana Pro, так что ничьей внешности тут нет) через обе модели, с одним промптом: шар на привязи чуть поднимается, горелка вспыхивает, дымка плывет.
Wan 3.0, шесть секунд в 720p, $0.60. Фото сохранилось почти пиксель в пиксель, шар поднялся на несколько метров, появился трос, которого на снимке не было, а на дорожке — короткие вспышки горелки и пение птиц, и просить об этом дважды не пришлось.
Grok Imagine Video 1.5, шесть секунд в 720p, $0.84. Движение тоньше, верность исходнику та же, и одна деталь из логов, которую стоит знать: файл пришел в 1280×704, а не в честных 720 строк. Для ленты неважно, для композитинга — досадно.
Как сделать видео из фото: пошаговая инструкция
Весь процесс в генераторе займет около минуты вашего времени, не считая рендеринга.
- Переключите генератор в режим видео и выберите модель. Для первых тестов лучше всего подойдет бюджетная Veo 3.1 Lite за $0.10.
- Загрузите картинку для первого кадра в формате JPG или PNG. Она будет автоматически обрезана под выбранный формат видео, так что обратите внимание на края кадра перед отправкой.
- Выберите соотношение сторон: 16:9 или 9:16. Вертикальный формат отлично подходит для TikTok и Reels — нейросеть без проблем справляется с портретной ориентацией кадра.
- Напишите промпт движения (подробнее о нем ниже). При желании можно заполнить поле негативного промпта (до 1000 символов), чтобы указать, чего в кадре быть не должно.
- Укажите длительность и выберите, нужен ли звук. В моделях Veo эти параметры настраиваются точно; в Omni Flash вы можете выбрать любую длительность от 3 до 10 секунд, а звук всегда включен. Wan 3.0 дает до 30 секунд с бесплатным звуком, который можно выключить, а Grok принимает любую длительность от 4 до 15 секунд и всегда говорит.
- Запустите генерацию. Рендеринг занимает примерно 2–5 минут. Вкладку можно спокойно закрывать: готовый ролик будет храниться в вашей истории генераций в течение 30 дней.
Баланс списывается только за успешные генерации. Если рендеринг завершился ошибкой, деньги автоматически вернутся на счет. При создании видео это особенно критично, ведь удачный кадр редко получается с первой попытки.

Как писать промпты движения для генерации видео?
Главное правило: описывайте движение, а не саму сцену. Окружение уже есть на исходном фото. Промпт вроде «женщина в красном пальто стоит на мосту» просто тратит лимит символов на описание того, что нейросеть и так видит. Вариант «она поворачивается к камере и улыбается, ветер развевает ее волосы, медленный наезд камеры» при той же длине содержит исключительно полезные инструкции.
Режиссерские термины творят чудеса при работе с моделями Veo. Наезды камеры (dolly in), круговой облет (orbit), съемка с рук (handheld), статичный штатив (static tripod shot), плавный панорамный сдвиг влево (slow pan left). Эти нейросети явно обучали на профессиональных описаниях кинокадров, поэтому они гораздо лучше понимают язык кинопроизводства, чем абстрактные фразы в духе «сделай динамично». Слово «динамичный» вообще лучше исключить из лексикона — никто, включая саму модель, толком не понимает, что оно значит в конкретный момент.
Один важный урок мы усвоили ценой собственных денег при подготовке демонстрационных роликов: эти модели отлично подхватывают движение, которое уже происходит на первом кадре, но начисто игнорируют действия, запланированные «на потом». Как-то раз мы попросили Omni Flash перевернуть блинчик «где-то в середине ролика» и получили десять секунд неподвижно лежащего блина. Три попытки подряд, по доллару за каждую. Как только мы переписали промпт так, будто действие уже происходит, все получилось с первого раза. Вывод: формулировка «сироп льется на стопку блинов» работает куда лучше, чем «через две секунды сироп начинает литься». И в целом для генерации видео выбирайте такие стартовые фото, на которых нужное движение выглядит естественно с первой секунды.
Несколько проверенных шаблонов, которые всегда дают хороший результат:
- Портреты: «едва заметное дыхание, медленное моргание, затем легкая улыбка; статичная камера». Ролик получается живым, без пугающих искажений лица, которые часто возникают при слишком размашистых движениях.
- Предметная съемка: «медленный облет камеры на 180 градусов вокруг объекта, студийное освещение остается неизменным». Это самый надежный вариант. Старайтесь использовать исходные фото с лаконичным, не перегруженным фоном.
- Пейзажи: четко перечисляйте все движущиеся объекты («облака плывут вправо, трава колышется, свет становится более теплым»). Иначе модель просто сделает банальный и не всегда аккуратный наезд камерой.

Бесшовные циклы, конечные кадры и видео до 148 секунд
В моделях линейки Veo 3.1 можно задать не только первый, но и конечный кадр будущего ролика — как и в Omni 1.1 и Wan 3.0. Загрузите два разных снимка — и модель создаст плавный переход между ними. Так можно легко превратить дневной пейзаж в ночной или показать, как грубый набросок превращается в готовый продукт. А если загрузить одну и ту же фотографию на вход и выход, получится идеально зацикленный ролик. Такие циклы отлично подходят для фонов веб-сайтов или синемаграфики для соцсетей. Пожалуй, это моя любимая фишка, которой незаслуженно редко пользуются.
Еще одна мощная функция Veo — это продление видео. Готовый ролик можно удлинить еще на 7 секунд с помощью нового промпта. Такие цепочки могут длиться до 148 секунд с полным сохранением визуального стиля и персонажей (функция доступна только в Veo 3.1 и Fast; Lite ее не поддерживает). Начать длинную видеоисторию с обычной фотографии — это самый простой способ снять кино без долгой отрисовки раскадровок, который только могут предложить современные API. Но помните, что каждое продление увеличивает общую стоимость проекта, так что рассчитывайте бюджет заранее. Если хватит 30 секунд, Wan 3.0 отрендерит их из вашего фото одним дублем, без склеек и без дрейфа картинки, за $1.50 в 480p или $3.00 в 720p.
У Omni Flash теперь есть собственное продление: каждый шаг добавляет от 3 до 10 секунд к последнему клипу, и такие шаги можно объединять в цепочку примерно до 40 секунд суммарно — потолок ниже, чем 148 секунд у Veo. Вдобавок остается и редактирование в диалоге: опишите изменение для готового клипа («сделай сумерки, остальное оставь как есть») и снова оплатите его секунды. Модель также принимает видео, которые она не генерировала, включая ваши собственные загрузки, и возвращает их той же длины. Другая философия. Редактирование доводит до ума один момент; продление выстраивает единую сюжетную линию.

FAQ
Можно ли превратить фото в видео бесплатно?
Почти. При регистрации нового аккаунта на BananaBanana вы получаете приветственные $0.20 без необходимости привязывать карту. Этой суммы хватит на генерацию двух беззвучных 4-секундных роликов из вашего фото на модели Veo 3.1 Lite. Далее оплата идет за каждый ролик, начиная от $0.10.
Какой самый дешевый вариант API для генерации видео из фото?
На платформе BananaBanana это модель Veo 3.1 Lite: $0.10 за беззвучное 4-секундное видео в разрешении 720p и $0.18 за ролик со звуком. Оплата списывается только за успешные генерации, неудачные попытки возвращаются на баланс автоматически. Никаких подписок или сложных настроек Google Cloud.
Может ли сгенерированное видео быть со звуком?
Да. В моделях линейки Veo 3.1 есть переключатель звука (нейросеть озвучит диалоги, эффекты и фоновые шумы, описанные в промпте). Gemini Omni Flash всегда генерирует аудио, и оно входит в посекундную цену (от $0.03 в 360p до $0.30 в 4K), Wan 3.0 добавляет звук бесплатно, а Grok Imagine Video 1.5 озвучивает реплики, которые вы напишете.
Можно ли анимировать вертикальное фото для TikTok или Reels?
Да, все семь моделей поддерживают формат 9:16, а Grok Imagine Video 1.5 добавляет еще 1:1, 3:2 и 2:3. Загрузите снимок, выберите соотношение сторон 9:16 и учитывайте, что исходное изображение будет обрезано под эти пропорции, так что оставляйте немного свободного пространства сверху кадра.
Какова максимальная длина ИИ-видео, созданного из фото?
Каждый отдельный ролик длится 4–8 секунд на моделях Veo, 3–10 секунд на Omni Flash, 4–15 на Grok и до 30 секунд одним дублем на Wan 3.0. Кроме того, видео на Veo 3.1 и Veo 3.1 Fast можно продлевать шагами по 7 секунд вплоть до 148 секунд с сохранением визуальной преемственности исходного снимка, а Omni 1.1 продлевает примерно до 40.