Назад в блог
BananaBanana Teamnewsvideoomni-flashapi

Обзор Gemini Omni Flash API: на что на самом деле способна превью-версия

Практический обзор Gemini Omni Flash API: что реально умеет gemini-omni-flash-preview, какие фичи остались эксклюзивом для Flow и сколько на самом деле стоит один ролик.

Обзор Gemini Omni Flash API: на что на самом деле способна превью-версия

Gemini Omni Flash — это первая мультимодальная модель Google класса «any-to-any» (любой формат на входе — любой на выходе), которая выдает видео: вы отправляете текст, картинки или предыдущий результат, а на выходе получаете короткий ролик в разрешении 720p со звуком, который можно редактировать дальше, просто описывая изменения обычными словами. Google выкатила публичную превью-версию 30 июня 2026 года вместе с Nano Banana 2 Lite, а ID модели в API — gemini-omni-flash-preview.

Короткий ответ для тех, кто пришел за главным: API Gemini Omni Flash поддерживает генерацию по тексту (text-to-video), по картинке (image-to-video), по референсу (reference-to-video) с использованием до десяти изображений объекта (которые совмещаются с начальным кадром), диалоговое редактирование и видео-в-видео обработку загруженного клипа. Но здесь нет поддержки 1080p, сидов (seeds), негативных промптов, продления видео (video extension) или возможности отключить звук. Управления длительностью нет и в документации, но это поле присутствует и работает — подробнее об этом ниже. Если вы видели демо Omni Flash внутри Google Flow и ждали такого же набора инструментов от API, то будете разочарованы. Мы внедрили модель в наш генератор прямо в неделю релиза, так что этот обзор построен на реальной работе эндпоинта, а не на обещаниях из маркетинговых буклетов.

Что реально дает API Gemini Omni Flash

API открывает доступ к Omni Flash через Interactions API (interactions.create), а не через эндпоинт generateVideos, который использует Veo. И это важная деталь: интеракции хранят состояние (они stateful). Каждый ответ содержит ID, на который можно сослаться в следующих запросах.

Согласно документации Google по Omni и неделе тестов эндпоинта, сейчас работают пять сценариев:

  • Text-to-video. На входе промпт, на выходе — ролик 720p со звуком.
  • Image-to-video. Ваша картинка становится первым кадром, а промпт описывает движение.
  • Reference-to-video. Изображения объекта помогают сохранить персонажа или товар в новой сцене — запрос принимает до десяти штук, и в отличие от Veo их можно совмещать с начальным кадром.
  • Интерактивное редактирование. Передаете previous_interaction_id и короткую инструкцию, а модель меняет ролик, сохраняя общую композицию.
  • Видео-в-видео редактирование. Отправляете готовое видео в качестве контента с task: "edit", и оно возвращается в новом стиле — ID интеракции не нужен, поэтому способ работает даже с роликами, которые модель никогда не создавала (включая рендеры Veo и видео с телефона). Подвох: длина выхода всегда строго равна длине входа, а сам вход ограничен 10 секундами.

Ролик выше получен напрямую из gemini-omni-flash-preview через наш собственный пайплайн, так что перед вами реальный пример работы, а не глянцевый промо-материал. Всего один текстовый промпт: бумажный кораблик плывет по разлитым чернилам, фраза «single continuous scene» (чтобы модель не дробила видео на монтажные склейки) и строчка «Audio:» с просьбой добавить шелест бумаги и всплески воды. Мы запросили полные 10 секунд. Обязательно включите звук — дорожка тоже сгенерирована ИИ.

Каждое видео длится от 3 до 10 секунд при 24 fps. В документации параметр длительности не указан, и на старте мы думали, что модель решает всё сама. Оказалось, формат запроса тихо принимает значение длительности, и оно выдерживается с точностью до кадра: просите 3 секунды — получаете 3.008 секунды, с оплатой за три. Именно эту настройку мы вывели в генераторе, так что монтаж под музыку больше не рулетка.

Промпт одновременно служит пулом управления для всего, что API не выносит в параметры. Предоставленная сама себе, модель норовит делать монтажные склейки, поэтому фраза «single unbroken shot, no cuts» обосновалась почти в каждом промпте; таймкоды вроде [0-3s] ... [3-6s] ... действительно выполняются; а текст в кавычках выводится на экране с поразительной точностью. В нашем генераторе мы вынесли эти шаблоны в быстрые кнопки в один клик.

Второй сюрприз — звук, и тут всё куда приятнее. Каждое сгенерированное видео идет в комплекте с аудиодорожкой: фоновый шум, звуковые эффекты, иногда даже речь (если попросить). Правда, отключить звук нельзя. Единственный способ им управлять — это текст, поэтому мы дописываем строчку «Audio: ...» в конец промпта, и это работает вполне нормально.

Что есть во Flow, чего нет в API?

Google Flow — это полноценный инструмент для продакшена, построенный поверх нескольких моделей. И этой красивой «обертки» как раз не хватает «голому» API. Во Flow есть Scene Builder для создания последовательностей из нескольких кадров и готовые настройки камеры (крупность плана, ракурс, движение). Кстати, о разрешении: многие путаются, но Flow по умолчанию тоже рендерит в 720p. Версии в 1080p и 4K появляются только на этапе скачивания — как опция экспорта поверх рендера Veo, а не как отдельный режим генерации. В самой модели gemini-omni-flash-preview ничего подобного нет.

Вот честное сравнение после недели тестов обоих вариантов:

ВозможностьFlow / приложение GeminiGemini Omni Flash API
Разрешениерендер 720p; 1080p / 4K доступны при скачиваниитолько 720p, 24 fps
Длина роликаScene Builder склеивает кадры3–10 с, точно
Управление камеройготовые пресеты планов, углов и движениятолько текстом в промпте
Продление видеода (через Veo)не поддерживается
Редактирование видеоРемикс внутри приложенияИнтерактивное или видео-в-видео для любого клипа
Звуквключен, есть настройки в интерфейсевсегда включен, управление только текстом
Сид / негативный промптвсе равно скрыты от пользователяне поддерживается
Роликов за один запроспо одномуодин на интеракцию, без sampleCount

Документация честно предупреждает о части ограничений. В мануалах Google прямо сказано, что продление (extension) и интерполяция видео «не поддерживаются». То же касается системных инструкций, температуры и параметров негативного промпта (разработчики предлагают вписывать нежелательные детали в обычный текст, но по моему опыту это срабатывает примерно в половине случаев). Ссылки на видео-референсы есть в схеме API (с ограничением в 3 секунды), но в документации признается, что модель пока не умеет обрабатывать их корректно.

Так что превью-версия API — это лишь урезанная часть того, на что модель способна в интерфейсах самой Google. Для беты это обычное дело, но все равно неприятно, когда клиент просит выгрузить ролик в 1080p, а твой потолок — 720p.

Разделенная иллюстрация: полноценный пульт режиссера рядом с крошечным пультом ДУ — метафора сравнения Flow и Omni Flash API

Текстовые правки в диалоге — фича, которая реально тащит

Именно на этапе редактирования Omni Flash раскрывается на полную. Вы создаете ролик, оцениваете результат, а затем отправляете уточнение вроде «сделай куртку красной и замедли камеру», прикрепив previous_interaction_id первого видео. Модель пересобирает ролик, внедряя правку и бережно сохраняя большую часть оригинала. Никаких повторных загрузок, масок или таймлайнов.

В документации Gemini Enterprise говорится, что можно делать до трех правок подряд в рамках одной сессии с сохранением контекста. На практике каждое изменение — это полноценный новый рендер в 720p, так что с каждым шагом детали немного «плывут». Лица сохраняются лучше, чем надписи на вывесках. Иногда даже при простой просьбе поменять цвет может слегка измениться сложная динамика кадра.

В продакшене мы столкнулись с одним нюансом: родительские интеракции на стороне Google со временем сгорают. Если попытаться отредактировать ролик, созданный давно, API может выдать ошибку 404. На BananaBanana мы обрабатываем это как истекшее видео и возвращаем средства за попытку, но если вы пишете решение на чистом API, заложите эту логику заранее.

Чат-диалог, где в каждом облачке ответа показан один и тот же кадр видео с небольшим изменением, иллюстрируя текстовые правки ролика

Сколько стоит Gemini Omni Flash?

В анонсе релиза Google указана цена за Omni Flash в размере $0.10 за секунду готового видео: результат на 3 секунды обходится в $0.30, а на 10 секунд — в $1.00.

На BananaBanana мы транслируем этот тариф напрямую: $0.10 за секунду, так что вы выбираете 3 секунды за $0.30 или все десять за $1.00, а правка стоит столько же, сколько новый рендер (и результат выходит ровно той же длины, что и исходник — растянуть или обрезать видео модель не умеет). Генерация картинок в Nano Banana 2 Lite, вышедшей в тот же день, стоит у нас $0.03 за изображение (официальный тариф Google API — $0.034 за картинку в разрешении 1K). Полный прайс-лист доступен в разделе с ценами.

Стоит ли ролик десяти центов за секунду? Если вам нужен черновик со звуком, для которого иначе пришлось бы отдельно генерировать видео и накладывать аудиодорожку, — пожалуй, да, а тест на 3 секунды стоит дешевле клипа Veo. Для беззвучных фоновых кадров — нет. Veo 3.1 Fast делает немые ролики дешевле и в более высоком разрешении.

Что выбрать: Omni Flash или Veo 3.1?

Если коротко: они делят задачи, но совсем не так, как кажется на первый взгляд (дескать, одна модель для черновиков, а другая — для чистовиков).

Перед выбором важно понять одну вещь: разница в качестве кроется не в разрешении. Veo 3.1 гораздо убедительнее справляется с физикой и движением. Вода течет естественно, ткань ложится складками там, где положено, а объекты сталкиваются, а не проходят друг сквозь друга как призраки. Omni Flash тоже справляется с этим, но через раз, и на некоторых кадрах косяки физики сразу бросаются в глаза.

Выбирайте Veo 3.1, если вам нужен честный экспорт в 4K, точная длина клипа (задается в целых секундах от 4 до 8), видео без звука, возможность продления кадра в будущем или контроль над первым и последним кадрами. Последняя фишка сильно недооценена: если скормить одну и ту же картинку на старт и финал, вы получите бесшовную петлю. Именно так создаются идеальные зацикленные фоны. Это мощный рабочий инструмент для любых широкоформатных сцен со сложной физикой.

Выбирайте Omni Flash, если контент готовится под экраны смартфонов. Для TikTok, Shorts или Reels разрешения 720p более чем достаточно (алгоритмы сжатия соцсетей все равно убьют детали), звук уже встроен в тот же проход, а текстовые правки в формате чата экономят кучу времени по сравнению с постоянным переписыванием промптов с нуля. В этой нише Omni Flash — не просто инструмент для набросков, а оптимальный и самый удобный выбор.

Мой личный рабочий процесс после пары дней тестов выглядит так: для горизонтальных клиентских проектов я набрасываю концепт в Omni Flash — трехсекундные дубли по $0.30, — а понравившийся вариант переделываю в чистовом качестве через Veo. А вот вертикальные ролики для соцсетей часто отправляются в публикацию прямо из Omni Flash.

Два съемочных дрона разного размера летят бок о бок над пастельной долиной, символизируя выбор между Omni Flash и Veo 3.1

Обе модели уже доступны в генераторе BananaBanana — можно сравнить их работу на одном и том же промпте без написания кода и настройки аккаунта в Google Cloud. А если вам нужна краткая выжимка этого обзора со всеми возможностями, лимитами и ценами на одной странице, загляните на страницу Gemini Omni.

FAQ

Что такое gemini-omni-flash-preview?

Это идентификатор модели (API ID) для Gemini Omni Flash — интерактивной нейросети Google для генерации видео, которая вышла в публичное превью 30 июня 2026 года. Она создает и редактирует ролики в разрешении 720p длительностью от 3 до 10 секунд со встроенным звуком через Interactions API.

Может ли Gemini Omni Flash создавать видео в 1080p или 4K?

Нет. Через API можно получить только видео в разрешении 720p при 24 fps. Интерфейс Google Flow по умолчанию тоже рендерит в 720p, а более высокое разрешение (1080p и 4K) предлагается при скачивании только для генераций через Veo. Если вам нужен честный экспорт в высоком разрешении, используйте Veo 3.1.

Можно ли настроить длительность видео в Omni Flash API?

Да, хотя в документации этого параметра нет. Формат ответа принимает длительность, и результат совпадает с ней с точностью до кадра: 3 секунды на входе, 3.008 секунды на выходе, с оплатой за три. В генераторе мы вывели этот параметр в виде селектора на 3–10 секунд. Исключение — редактирование: отредактированный клип всегда наследует длину видео, из которого он был сделан.

Всегда ли Omni Flash генерирует аудио?

Да, каждый клип идет со встроенной звуковой дорожкой, и отключить ее параметром нельзя. Описывайте желаемые звуки (или просите «тихий фоновый шум помещения» — «quiet ambient room tone») прямо в тексте промпта.

Умеет ли Omni Flash продлевать или интерполировать готовые видео?

Сделать их длиннее модель не может: продление и интерполяция не поддерживаются, а задача extend в схеме отвечает о том, что модель не поддерживает продление видео. Вместо этого доступно редактирование — либо диалоговое для созданного ею клипа, либо видео-в-видео для любого готового видео, которое вы передадите (включая рендер Veo или вашу запись). Выходное видео сохраняет длину входа.

newsvideoomni-flashapi