Назад у блог
BananaBanana Teamtutorialvideoimage-to-video

AI Image to Video: як перетворити будь-яке фото на відео

Як працює AI image to video, яку модель обрати (Veo 3.1 чи Omni Flash), ціни від $0.10 за кліп, промпти руху, цикли та ланцюжки до 148 секунд.

AI Image to Video: як перетворити будь-яке фото на відео

AI image to video — це технологія генерації, де модель бере одне статичне зображення, робить його першим кадром майбутнього ролику й сама домальовує все, що відбувається далі: рух, переміщення камери, зміну освітлення, а іноді й звук. Ви завантажуєте світлину та додаєте текстовий опис того, що саме має рухатися. Нейромережа повертає коротке відео (зазвичай від 4 до 10 секунд), на якому ваше зображення буквально оживає.

Коротко для тих, хто поспішає: завантажуєте світлину в генератор BananaBanana, описуєте рух і чекаєте 2–5 хвилин. Німе 4-секундне відео з вашого фото коштує від $0.10 на моделі Veo 3.1 Lite, версія зі звуком обійдеться у $0.18, а Gemini Omni Flash анімує кадр із повноцінним аудіосупроводом від $0.30 (білінг $0.10 за секунду). Нові акаунти отримують безкоштовні $0.20, чого вистачить на два тестові ролики без звуку.

Ми працюємо з чотирма відеомоделями на реальних серверах, тому цей гайд заснований на справжніх логах генерацій, а не на рекламних обіцянках. Зокрема й на невдалих спробах — деякі з них виявилися значно кориснішими за успішні.

Як працює технологія AI image to video?

Якщо зазирнути під капот, модель отримує статичну картинку як опорний кадр (conditioning frame). У документації Google до Gemini API зазначено, що Veo 3.1 підтримує "image-based direction" (керування на основі зображення) та "frame-specific generation" (генерацію окремих кадрів). Простими словами: ваша світлина задає напрямок для всього ролику, а ви можете чітко закріпити потрібні кадри на таймлайні. Модель аналізує сцену, прораховує фізику (як має колихатися вода або розвіватися волосся на вітрі) і рендерить кадр за кадром, відштовхуючись від початкової точки.

Головний висновок для практики: перший кадр на виході — це ваше фото, майже піксель у піксель. Усе, що йде далі, модель вигадує сама. Тому в хороших промптах слова витрачають саме на опис цих змін, а не на переказування того, що нейромережа й так бачить перед собою.

Це працює просто неймовірно для сюжетів із очевидним прихованим рухом. Портрет починає дихати та кліпати очима. З кави підіймається пара. Припаркована автівка рушає з місця. Але якщо на фото немає натяку на динаміку, результат буде слабшим: якщо завантажити плаский рендер продукту на білому тлі без жодних вказівок про рух у промпті, ви скоріш за все отримаєте повільний і дещо хаотичний наїзд камери. Ролик не буде зіпсований, но вийде нудним.

Стара фотокартка в руках, де зображення всередині починає хвилюватися та рухатися — ілюстрація анімації з фото у відео за допомогою AI

Яка модель найкраще перетворює фото на відео?

Усі чотири відеомоделі на нашій платформі вміють приймати картинку як перший кадр. Різниця полягає лише в їхніх технічних лімітах та вартості генерації.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Ціна (4 с, без звуку)$0.70$0.35$0.10
Ціна (4 с, з аудіо)$1.50$0.50$0.18$0.40 ($0.10 за секунду)
Макс. роздільна здатність4K4K1080pтільки 720p
Тривалістьточно 4/6/7/8 сточно 4/6/7/8 сточно 4/6/7/8 сточно 3–10 с
Аудіоперемикач за виборомперемикач за виборомперемикач за виборомзавжди увімкнено
Останній кадр і зацикленнятактактакні
Подовження до 148 стактакніні, натомість доступне редагування в діалозі

Особисто я зазвичай обираю Veo 3.1 Fast. Ця модель зберігає всі зручні налаштування (точну тривалість, вибір фінального кадру, подовження ролику) за вдвічі меншу ціну порівняно з флагманом. До того ж для соцмереж різниця в якості з топовою Veo 3.1 майже непомітна. Варіант Lite за $0.10 ідеально підходить для швидкої перевірки ідей — так можна дізнатися, чи взагалі воно рухається, перед тим як витрачати більший бюджет. Повна версія Veo 3.1 повністю виправдовує свою ціну, коли у відео є вода, тканина або зіткнення об'єктів, а також якщо технічне завдання вимагає чіткого 4K. Якщо ж звук для вас не менш важливий за картинку, краще обрати Omni Flash. Детальніше ми розібрали цю модель в окремому огляді API Omni Flash — там є все про її ліміти, зокрема про обмеження у 720p, яке, чесно кажучи, трохи засмучує на великих екранах.

Ролик вище згенерований за допомогою Veo 3.1 Fast безпосередньо через нашу платформу спеціально для цієї статті. Ми взяли фото яхти в рамці на письмовому столі й попросили нейромережу оживити море всередині кадру, поки камера повільно наближається. Знято з першого дублю, без жодного монтажу, без звуку (ми часто використовуємо дешевший беззвучний режим Fast для чернеток). Цей ефект «оживання картинки» — саме те, що модель зробить і з вашими завантаженими файлами.

Покрокова інструкція: як зробити відео з фото

Увесь процес у генераторі забере близько хвилини вашого часу (не враховуючи час самого рендерингу).

  1. Перемкніть генератор у режим відео та оберіть модель. Для першого тесту чудово підійде Veo 3.1 Lite за $0.10 — це найдешевший спосіб розібратися.
  2. Завантажте свою світлину як перший кадр. Підійде JPG або PNG. Зображення автоматично підрізається під формат відео, тож перевірте краї перед запуском.
  3. Оберіть формат: 16:9 або 9:16. Вертикальний формат ідеально підходить для TikTok та Reels — модель без проблем адаптує кадр під портретну орієнтацію.
  4. Напишіть промпт для анімації (детальніше про це нижче). За бажанням можна додати негативний промпт довжиною до 1000 символів, щоб виключити небажані деталі.
  5. Налаштуйте тривалість і звуковий супровід. Обидва параметри є точними налаштуваннями на Veo; на Omni Flash ви обираєте будь-яку довжину від 3 до 10 секунд, а звук завжди увімкнений.
  6. Натисніть «Згенерувати». Створення відео триває близько 2–5 хвилин. Ви можете спокійно закрити вкладку браузера — готові результати зберігатимуться у вашій історії протягом 30 днів.

Гроші з балансу списуються лише за успішні генерації. Якщо рендеринг завершився помилкою, кошти повернуться автоматично. У роботі з відео це надзвичайно важливо, адже вам точно доведеться експериментувати та підбирати вдалі варіанти.

Розмітка з трьох панелей: завантаження фото, панель налаштувань і готовий плеєр — демонстрація процесу створення відео з картинки

Як писати промпти руху для анімації фото?

Правило перше: описуйте сам рух, а не декорації. Нейромережа вже бачить усю сцену на завантаженому фото. Промпт на кшталт «жінка у червоному пальті стоїть на мосту» просто дублює очевидне. А от варіант «вона повертається до камери й усміхається, вітер розвіває її волосся, повільний наїзд камери» має таку саму довжину, але дає моделі чітку інструкцію для дій.

Професійні кінематографічні терміни чудово працюють із моделями Veo: dolly in (наїзд), orbit (обліт), handheld (зйомка з рук), static tripod shot (статична камера на штативі), slow pan left (повільне панорамування ліворуч). Відеомоделі явно навчали на описах кінокадрів, тому вони набагато краще розуміють мову операторів, ніж розмиті фрази на кшталт «зроби динамічно». Самого слова «динамічно» краще взагалі уникати — ніхто точно не знає, що воно означає, зокрема й сама нейромережа.

Ось урок, який ми засвоїли на власному гіркому (і дорогому) досвіді, коли створювали демо-кліпи для блогу: ці моделі намагаються утримати стан першого кадру й часто просто ігнорують дії, які за планом мають розпочатися пізніше. Якось ми попросили Omni Flash перевернути млинець «ближче до середини ролику» — і отримали десять секунд нерухомого млинця на сковорідці. Три спроби поспіль, по долару за кожну. Тільки-но ми переписали промпт так, ніби дія вже відбувається, усе запрацювало з першого разу. Тож опис «сироп ллється на панкейки» спрацює набагато краще, ніж «сироп починає литися через дві секунди». І головне: для генерації відео обирайте фото, де запланований рух виглядає природно саме в динаміці.

Кілька перевірених шаблонів, які стабільно дають хороший результат:

  • Портрети: "subtle breathing, a slow blink, then a small smile; camera locked" (легке дихання, повільне кліпання, потім ледь помітна посмішка; нерухома камера). Це оживляє кадр і допомагає уникнути дивних спотворень обличчя, які часто з'являються при різких рухах.
  • Товари: "slow 180-degree orbit around the object, studio lighting stays constant" (повільний обліт камери на 180 градусів навколо об'єкта, студійне освітлення без змін). Це базовий і найнадійніший варіант. Тільки намагайтеся обирати просте тло на вихідному фото.
  • Пейзажі: обов'язково перераховуйте рухомі деталі — наприклад, "clouds drift right, grass sways, light shifts warmer" (хмари пливуть праворуч, трава колишеться, світло стає теплішим). Інакше модель просто використає стандартний наїзд камери.

Режисерська хлопавка поруч із блокнотом, де намальовані стрілки руху камери поверх роздрукованого фото — написання промптів для відео

Цикли, фінальні кадри та відео тривалістю до 148 секунд

Моделі Veo 3.1 підтримують необов'язковий фінальний кадр разом із першим. Якщо завантажити дві різні світлини, нейромережа змонтує плавний перехід між ними. Так можна перетворити денний пейзаж на нічний або показати шлях від ескізу до готового продукту. А якщо завантажити одне й те саме фото як перший і останній кадри, ви отримаєте безшовну петлю — ідеальний варіант для фону вебсайту чи зацикленого синемаграфу для соцмереж. Як на мене, це одна з найбільш недооцінених можливостей платформи.

Подовження роликів — ще одна крута фішка Veo. Готове відео можна продовжити ще на 7 секунд за допомогою нового промпту, а загальна довжина такого ланцюжка може сягати 148 секунд із повним збереженням візуального стилю (це працює лише для Veo 3.1 та Fast; моделі Lite та Omni Flash таку функцію не підтримують). Почати довгу серію кадрів із власного фото — це найближче до створення повноцінного кіно без розкадровки, що взагалі можливо втілити за допомогою сучасних API. Щоправда, це суттєво збільшує витрати, тому прорахуйте бюджет заздалегідь, перш ніж з головою поринути в експерименти.

Модель Omni Flash замість подовження пропонує інтерактивне редагування: ви просто описуєте зміни до готового кліпу (наприклад, "make it dusk, keep everything else the same" — зробити сутінки, залишивши все інше без змін) і знову сплачуєте за його секунди — він також приймає відео, які не генерував, включно з вашими власними завантаженнями, і повертає їх тієї ж довжини. Інша філософія. Редагування уточнює один момент; подовження розвиває історію на таймлайні.

Стрічка з кінокадрами, зігнута в ідеальне коло на пастельному фоні — символ зацикленого AI-відео, що закінчується там само, де й почалося

FAQ

Чи можна безкоштовно перетворити фото на відео?

Майже. Створюючи новий акаунт на BananaBanana, ви отримуєте бонусні $0.20 без необхідності прив'язувати банківську картку. Цього вистачить на два беззвучні 4-секундні відео з вашого фото через модель Veo 3.1 Lite. Надалі діє оплата за кожну генерацію — від $0.10 за кліп.

Який варіант API для перетворення фото на відео є найдешевшим?

На платформі BananaBanana це модель Veo 3.1 Lite: $0.10 за беззвучний 4-секундний ролик у роздільній здатності 720p та $0.18 за варіант зі звуком. Оплата списується лише за успішний результат з автоматичним поверненням коштів у разі помилки. Жодних підписок або складних налаштувань у Google Cloud.

Чи може згенероване відео бути зі звуком?

Так. Моделі Veo 3.1 мають спеціальний перемикач звуку (нейромережа додасть діалоги, ефекти та ембієнт відповідно до вашого промпту). А модель Gemini Omni Flash завжди генерує аудіо, що входить у його ціну $0.10 за секунду.

Чи можна анімувати вертикальне фото для TikTok чи Reels?

Так, усі чотири моделі підтримують формат 9:16. Просто завантажте світлину, виберіть співвідношення сторін 9:16 і врахуйте, що зображення буде підрізане під цей формат. Краще заздалегідь залишити трохи вільного простору з країв оригінального знімка.

Якої максимальної довжини може бути AI-відео, створене з фото?

Окремий кліп триває від 4 до 8 секунд для моделей Veo (3–10 секунд, на ваш вибір, на Omni Flash). Проте ролики, створені у Veo 3.1 та Veo 3.1 Fast, можна поступово подовжувати кроками по 7 секунд — аж до 148 секунд загалом, повністю зберігаючи візуального стилю початкового зображення.

tutorialvideoimage-to-video