Назад в блог
BananaBanana Teamtutorialvideoimage-to-video

AI Image to Video: как оживить фото с помощью ИИ

Как работает генерация видео из фото (AI Image to Video), какую модель выбрать (Veo 3.1 vs Omni Flash), реальные цены от $0.10, промпты движения, циклы и видео до 148 секунд.

AI Image to Video: как оживить фото с помощью ИИ

Генерация видео из фото (AI image to video) — технология, при которой нейросеть берет один статичный снимок, считает его первым кадром ролика и дорисовывает все, что происходит дальше: движение объектов, пролеты камеры, изменение света, а иногда и звук. Вы загружаете картинку и пишете текстовое описание того, что должно двигаться. На выходе получается короткий ролик, обычно от 4 до 10 секунд, где ваш исходный кадр буквально оживает.

Короткая версия для тех, кто спешит: загрузите фото в генератор BananaBanana, опишите движение и подождите 2–5 минут. Беззвучный 4-секундный ролик на модели Veo 3.1 Lite обойдется всего в $0.10, добавление звука поднимет цену до $0.18, а Gemini Omni Flash анимирует фото сразу с полноценным саундтреком от $0.30 (счет выставляется по $0.10 за секунду). Новые пользователи получают приветственные $0.20, чего хватит на два беззвучных тестовых видео.

Мы используем в продакшене четыре видеомодели, так что это руководство написано на основе реальных логов генерации, а не рекламных буклетов. И про неудачные дубли мы тоже расскажем. Некоторые факапы учат гораздо лучше, чем идеальные кадры.

Как работает генерация видео из фото?

Под капотом статичное изображение передается модели как опорный кадр. В документации API Gemini по работе с видео указано, что Veo 3.1 поддерживает функции «image-based direction» (управление на основе картинки) и «frame-specific generation» (генерация с привязкой к конкретным кадрам). Простыми словами: ваш исходник направляет весь сюжет ролика, и вы можете жестко зафиксировать нужные кадры там, где вам хочется. Нейросеть считывает сцену, просчитывает физику (как должна пойти рябь по воде на фото или как будут развеваться волосы на ветру) и рендерит кадр за кадром вперед от вашей стартовой точки.

Практическое следствие: самый первый кадр готового видео — это ваше фото, практически пиксель в пиксель. Все, что идет следом — чистая фантазия нейросети. Хорошие промпты не тратят слова на пересказ того, что модель и так видит, а описывают именно то, что нужно дорисовать.

Это на удивление здорово работает для сцен со скрытой динамикой. Портрет начинает дышать и моргать. Пар поднимается над чашкой кофе. Припаркованная машина трогается с места. Но магия пропадает, если на фото нет намека на естественное движение. Попробуйте скормить нейросети плоский рендер товара на белом фоне без указания динамики в промпте — и на выходе вы, скорее всего, получите медленный и слегка дерганый зум. Видео не будет испорчено, но получится откровенно скучным.

Винтажная фотография в руках, изображение внутри которой начинает двигаться и идти рябью — пример анимации в технологии AI image to video

Какая модель лучше всего превращает фото в видео?

Все четыре доступные на платформе видеомодели могут использовать изображение в качестве первого кадра. Но они сильно отличаются по возможностям и стоимости.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Цена (4с, без звука)$0.70$0.35$0.10
Цена (4с, со звуком)$1.50$0.50$0.18$0.40 ($0.10 за секунду)
Макс. разрешение4K4K1080pтолько 720p
Длительностьровно 4/6/7/8 сровно 4/6/7/8 сровно 4/6/7/8 сточно 3–10 с
Звукпереключательпереключательпереключательвсегда включен
Конечный кадр + циклыдададанет
Продление до 148 сдаданетнет, вместо этого чат-редактирование

Мой основной рабочий инструмент — Veo 3.1 Fast. Эта модель предлагает все нужные настройки (точную длительность, фиксацию конечного кадра, продление) за половину стоимости флагмана. При этом для роликов под соцсети разница в качестве по сравнению с топовой Veo 3.1 практически незаметна. Сверхдешевую Lite за $0.10 я использую как черновик — проверить, жизнеспособна ли задумка в движении, прежде чем тратить серьезные бюджеты. Полноценная Veo 3.1 полностью оправдывает свою цену на сложных сценах с водой, тканями или столкновениями объектов, а также когда в техзадании жестко прописано разрешение 4K. Если же звук в ролике так же важен, как и картинка, идеальным выбором будет Omni Flash. Мы подробно разобрали ее возможности в отдельном обзоре API Omni Flash. Там есть свои нюансы, вроде ограничения разрешения в 720p, что, честно говоря, выглядит слабовато при просмотре на полный экран.

Ролик выше сгенерирован на модели Veo 3.1 Fast через наш рабочий конвейер специально для этой статьи: фотография парусника в рамке стоит на столе, а в промпте мы попросили море внутри кадра начать двигаться при медленном наезде камеры. Снято с первого дубля, без монтажа. Мы намеренно сделали его беззвучным (беззвучный режим в Fast отлично подходит для черновиков). Этот эффект «оживающей фотографии» — как раз то, что нейросеть делает с вашими картинками.

Как сделать видео из фото: пошаговая инструкция

Весь процесс в генераторе займет около минуты вашего времени, не считая рендеринга.

  1. Переключите генератор в режим видео и выберите модель. Для первых тестов лучше всего подойдет бюджетная Veo 3.1 Lite за $0.10.
  2. Загрузите картинку для первого кадра в формате JPG или PNG. Она будет автоматически обрезана под выбранный формат видео, так что обратите внимание на края кадра перед отправкой.
  3. Выберите соотношение сторон: 16:9 или 9:16. Вертикальный формат отлично подходит для TikTok и Reels — нейросеть без проблем справляется с портретной ориентацией кадра.
  4. Напишите промпт движения (подробнее о нем ниже). При желании можно заполнить поле негативного промпта (до 1000 символов), чтобы указать, чего в кадре быть не должно.
  5. Укажите длительность и выберите, нужен ли звук. В моделях Veo эти параметры настраиваются точно; в Omni Flash вы можете выбрать любую длительность от 3 до 10 секунд, а звук всегда включен.
  6. Запустите генерацию. Рендеринг занимает примерно 2–5 минут. Вкладку можно спокойно закрывать: готовый ролик будет храниться в вашей истории генераций в течение 30 дней.

Баланс списывается только за успешные генерации. Если рендеринг завершился ошибкой, деньги автоматически вернутся на счет. При создании видео это особенно критично, ведь удачный кадр редко получается с первой попытки.

Раскадровка из трех панелей: загрузка фотографии вручную, панель настроек и готовый видеоплеер — пошаговый процесс генерации видео из картинки

Как писать промпты движения для генерации видео?

Главное правило: описывайте движение, а не саму сцену. Окружение уже есть на исходном фото. Промпт вроде «женщина в красном пальто стоит на мосту» просто тратит лимит символов на описание того, что нейросеть и так видит. Вариант «она поворачивается к камере и улыбается, ветер развевает ее волосы, медленный наезд камеры» при той же длине содержит исключительно полезные инструкции.

Режиссерские термины творят чудеса при работе с моделями Veo. Наезды камеры (dolly in), круговой облет (orbit), съемка с рук (handheld), статичный штатив (static tripod shot), плавный панорамный сдвиг влево (slow pan left). Эти нейросети явно обучали на профессиональных описаниях кинокадров, поэтому они гораздо лучше понимают язык кинопроизводства, чем абстрактные фразы в духе «сделай динамично». Слово «динамичный» вообще лучше исключить из лексикона — никто, включая саму модель, толком не понимает, что оно значит в конкретный момент.

Один важный урок мы усвоили ценой собственных денег при подготовке демонстрационных роликов: эти модели отлично подхватывают движение, которое уже происходит на первом кадре, но начисто игнорируют действия, запланированные «на потом». Как-то раз мы попросили Omni Flash перевернуть блинчик «где-то в середине ролика» и получили десять секунд неподвижно лежащего блина. Три попытки подряд, по доллару за каждую. Как только мы переписали промпт так, будто действие уже происходит, все получилось с первого раза. Вывод: формулировка «сироп льется на стопку блинов» работает куда лучше, чем «через две секунды сироп начинает литься». И в целом для генерации видео выбирайте такие стартовые фото, на которых нужное движение выглядит естественно с первой секунды.

Несколько проверенных шаблонов, которые всегда дают хороший результат:

  • Портреты: «едва заметное дыхание, медленное моргание, затем легкая улыбка; статичная камера». Ролик получается живым, без пугающих искажений лица, которые часто возникают при слишком размашистых движениях.
  • Предметная съемка: «медленный облет камеры на 180 градусов вокруг объекта, студийное освещение остается неизменным». Это самый надежный вариант. Старайтесь использовать исходные фото с лаконичным, не перегруженным фоном.
  • Пейзажи: четко перечисляйте все движущиеся объекты («облака плывут вправо, трава колышется, свет становится более теплым»). Иначе модель просто сделает банальный и не всегда аккуратный наезд камерой.

Режиссерская хлопушка рядом с рукописными заметками к промпту и стрелками, размечающими траекторию движения камеры поверх фотографии — процесс написания промпта движения

Бесшовные циклы, конечные кадры и видео до 148 секунд

В моделях линейки Veo 3.1 можно задать не только первый, но и конечный кадр будущего ролика. Загрузите два разных снимка — и нейросеть создаст плавный переход между ними. Так можно легко превратить дневной пейзаж в ночной или показать, как грубый набросок превращается в готовый продукт. А если загрузить одну и ту же фотографию на вход и выход, получится идеально зацикленный ролик. Такие циклы отлично подходят для фонов веб-сайтов или синемаграфики для соцсетей. Пожалуй, это моя любимая фишка, которой незаслуженно редко пользуются.

Еще одна мощная функция Veo — это продление видео. Готовый ролик можно удлинить еще на 7 секунд с помощью нового промпта. Такие цепочки могут длиться до 148 секунд с полным сохранением визуального стиля и персонажей (функция доступна только в Veo 3.1 и Fast; Lite и Omni Flash ее не поддерживают). Начать длинную видеоисторию с обычной фотографии — это самый простой способ снять кино без долгой отрисовки раскадровок, который только могут предложить современные API. Но помните, что каждое продление увеличивает общую стоимость проекта, так что рассчитывайте бюджет заранее.

В Omni Flash вместо продления реализован другой подход — редактирование: опишите изменение для готового клипа («сделай сумерки, остальное оставь как есть») и снова оплатите его секунды. Модель также принимает видео, которые она не генерировала, включая ваши собственные загрузки, и возвращает их той же длины. Другая философия. Редактирование доводит до ума один момент; продление выстраивает единую сюжетную линию.

Кинопленка, свернутая в идеальный круг на пастельном фоне — символ зацикленного ИИ-видео, которое заканчивается тем же кадром, с которого началось

FAQ

Можно ли превратить фото в видео бесплатно?

Почти. При регистрации нового аккаунта на BananaBanana вы получаете приветственные $0.20 без необходимости привязывать карту. Этой суммы хватит на генерацию двух беззвучных 4-секундных роликов из вашего фото на модели Veo 3.1 Lite. Далее оплата идет за каждый ролик, начиная от $0.10.

Какой самый дешевый вариант API для генерации видео из фото?

На платформе BananaBanana это модель Veo 3.1 Lite: $0.10 за беззвучное 4-секундное видео в разрешении 720p и $0.18 за ролик со звуком. Оплата списывается только за успешные генерации, неудачные попытки возвращаются на баланс автоматически. Никаких подписок или сложных настроек Google Cloud.

Может ли сгенерированное видео быть со звуком?

Да. В моделях линейки Veo 3.1 есть переключатель звука (нейросеть озвучит диалоги, эффекты и фоновые шумы, описанные в промпте). А модель Gemini Omni Flash всегда генерирует аудио, включенное в ее стоимость $0.10 за секунду.

Можно ли анимировать вертикальное фото для TikTok или Reels?

Да, все четыре модели отлично поддерживают формат 9:16. Загрузите снимок, выберите соотношение сторон 9:16 и учитывайте, что исходное изображение будет обрезано под эти пропорции, так что оставляйте немного свободного пространства сверху кадра.

Какова максимальная длина ИИ-видео, созданного из фото?

Каждый отдельный ролик длится от 4 до 8 секунд на моделях Veo (от 3 до 10 секунд, по вашему выбору, на Omni Flash). Однако видео, созданные на моделях Veo 3.1 и Veo 3.1 Fast, можно последовательно продлевать шагами по 7 секунд вплоть до 148 секунд с полным сохранением визуальной преемственности вашего исходного снимка.

tutorialvideoimage-to-video