Análisis de la API de Gemini Omni Flash: Qué ofrece la vista previa
Análisis práctico de la API de Gemini Omni Flash: soporte real de gemini-omni-flash-preview, exclusivas de Flow y costes reales por clip.

Gemini Omni Flash es el primer modelo multimodal "any-to-any" de Google que genera vídeo: envías texto, imágenes o un resultado anterior, y te devuelve un clip corto en 720p con sonido que puedes seguir editando describiendo cambios en lenguaje natural. Google lo lanzó en vista previa pública el 30 de junio de 2026, junto con Nano Banana 2 Lite, y el id del modelo en la API es gemini-omni-flash-preview.
Respuesta rápida, si solo venías a por una cosa: la API de Gemini Omni Flash admite text-to-video, image-to-video, reference-to-video con hasta diez imágenes de sujeto (que se combinan con un fotograma inicial), edición conversacional y edición vídeo a vídeo de un clip que le envíes. No admite 1080p, seeds, parámetros de prompt negativo, extensión de vídeo ni desactivar el audio. El control de duración tampoco figura en la documentación, pero el campo existe y funciona; más información a continuación. Si viste las demos de Omni Flash dentro de Google Flow y esperabas el mismo conjunto de herramientas en la API, te llevarás una decepción. Lo integramos en nuestro generador durante la semana de lanzamiento, así que este análisis se basa en lo que realmente devuelve el endpoint, no en la página de marketing.
Lo que realmente te ofrece la API de Gemini Omni Flash
La API expone Omni Flash a través de la Interactions API (interactions.create), no mediante el endpoint generateVideos que utiliza Veo. Ese detalle importa porque las interacciones mantienen estado (son stateful). Cada respuesta incluye un id al que puedes hacer referencia más adelante.
Según la documentación de Omni de Google, sumada a una semana probando el endpoint, hoy funcionan cinco tareas:
- Text-to-video. Entra un prompt, sale un clip en 720p con banda sonora incluida.
- Image-to-video. Tu imagen se convierte en el fotograma inicial y el prompt describe el movimiento.
- Reference-to-video. Las imágenes de sujeto mantienen la coherencia de un personaje o producto en una nueva escena: la solicitud acepta hasta diez de ellas y, a diferencia de Veo, se pueden combinar con un fotograma inicial.
- Edición conversacional. Pasa el
previous_interaction_idjunto con una instrucción corta y el modelo modifica el clip manteniendo intacto el resto. - Edición vídeo a vídeo. Envía un vídeo real como contenido con
task: "edit"y vuelve rediseñado, sin necesidad de id de interacción, por lo que funciona con clips que el modelo nunca creó (incluidos renders de Veo o tomas del móvil). La pega: el resultado siempre tiene exactamente la misma duración que la entrada, y la entrada está limitada a 10 segundos.
El clip anterior proviene directamente de gemini-omni-flash-preview a través de nuestro propio pipeline, así que estás viendo una muestra real, no un recurso de prensa. Un solo prompt de texto: un barco de papel a la deriva sobre tinta derramada, "single continuous scene" para evitar que el modelo haga cortes de montaje, y una línea "Audio:" pidiendo crujidos de papel y ondas en el agua. Pedimos los 10 segundos completos. Activa el sonido; el audio también está generado.
Cada clip dura de 3 a 10 segundos a 24 fps. La documentación no enumera ningún parámetro de duración, y al principio asumimos que el modelo decidía solo. Resultó que el formato de solicitud acepta discretamente una duración y es exacta: pides 3 segundos y obtienes 3.008 segundos, facturados por tres. Eso es lo que exponemos en el generador, para que editar al ritmo de la música deje de ser una lotería.
El prompt funciona además como panel de control para todo lo que la API no expone. Si lo dejas solo, el modelo tiende a cortar entre varias tomas, por lo que "single unbroken shot, no cuts" se ha ganado su sitio en la mayoría de los prompts; los rangos de código de tiempo como [0-3s] ... [3-6s] ... sí se cumplen; y el texto entre comillas se muestra como texto en pantalla con notable precisión. En nuestro generador ofrecemos estos snippets con un solo clic.
El audio es la segunda sorpresa, y muy agradable. Cada generación incluye sonido: ruido ambiental, efectos y, a veces, voz si se lo pides. Sin embargo, no se puede desactivar. El único control que tienes es el texto, así que terminamos añadiendo una línea "Audio: ..." a los prompts y funciona bastante bien.
¿Qué tiene Flow que no tenga la API?
Google Flow es una herramienta de producción completa envuelta alrededor de varios modelos, y ese envoltorio es exactamente lo que le falta a la API pura. Flow te ofrece un Scene Builder para secuencias multitoma y controles de cámara preestablecidos (tipo de plano, ángulo, movimiento). Un matiz sobre la resolución: Flow rinde en 720p por defecto. Las versiones en 1080p y 4K aparecen en el paso de descarga, como una opción de exportación sobre el render de Veo, no como un modo de generación diferente. Nada de esas herramientas existe en gemini-omni-flash-preview.
Aquí tienes la comparación honesta tras una semana probando ambos:
| Capacidad | Flow / app Gemini | API de Gemini Omni Flash |
|---|---|---|
| Resolución | Render en 720p; 1080p / 4K al descargar | Solo 720p, 24 fps |
| Duración del clip | Scene Builder encadena tomas | 3–10 s, exacta |
| Controles de cámara | Tipos de plano, ángulos y movimiento preestablecidos | Solo prompt de texto |
| Extender un vídeo | Sí (a través de Veo) | No soportado |
| Editar un vídeo existente | Remix dentro de la app | Conversacional o vídeo a vídeo en cualquier clip |
| Audio | Activado, con controles de interfaz | Siempre activado, control solo por prompt |
| Seed / prompt negativo | Oculto al usuario de todos modos | No soportado |
| Clips por solicitud | Uno por vez | Uno por interacción, sin sampleCount |
La documentación es clara sobre parte de esto. Los docs de Google afirman que la extensión e interpolación de vídeo "no están soportadas", y lo mismo ocurre con las instrucciones del sistema, la temperatura y los parámetros de prompt negativo (sugieren escribir lo negativo en el prompt normal, algo que según mi experiencia funciona la mitad de las veces). Las referencias de vídeo figuran en el esquema de la API con un límite de 3 segundos, pero los docs admiten que el modelo aún no las procesa correctamente.
Así que la API de vista previa es una estrecha porción de lo que el modelo puede hacer en las superficies propias de Google. Es normal para una vista previa. Aun así molesta cuando un cliente pide una exportación en 1080p y el techo está en 720p.

La edición conversacional es la función que realmente cumple
Editar es donde Omni Flash se gana su lugar. Generas un clip, lo miras y luego envías un seguimiento como "haz la chaqueta roja y ralentiza la cámara" con el previous_interaction_id del primer resultado. El modelo reconstruye el vídeo aplicando tu cambio y preservando la mayor parte del original. Sin volver a subir archivos, sin máscaras, sin línea de tiempo.
La documentación de Gemini Enterprise de Google dice que puedes encadenar hasta tres ediciones secuenciales mientras la sesión mantenga el contexto. En la práctica, cada edición es un render nuevo en 720p, por lo que la coherencia se pierde un poco con cada paso. Las caras se mantienen mejor que el texto en los carteles. El movimiento complejo a veces cambia aunque solo hayas pedido un ajuste de color.
Una advertencia con la que topamos en producción: las interacciones padre caducan en el lado de Google. Si intentas editar un clip generado hace tiempo, la API puede devolver un 404 para la interacción referenciada. En BananaBanana mostramos esto como un vídeo caducado y reembolsamos el intento, pero si desarrollas sobre la API pura, tenlo en cuenta.

¿Cuánto cuesta Gemini Omni Flash?
El anuncio de lanzamiento de Google fija el precio de Omni Flash en $0.10 por segundo de vídeo generado: un resultado de 3 segundos cuesta $0.30 y uno de 10 segundos cuesta $1.00.
En BananaBanana trasladamos esa tarifa directamente: $0.10 por segundo, así que eliges 3 segundos por $0.30 o los diez completos por $1.00, y una edición cuesta la misma tarifa porque es un renderizado completo (además vuelve con la misma duración que la fuente; el modelo no puede estirar ni recortar). Nano Banana 2 Lite, que se lanzó el mismo día, cuesta $0.03 por imagen aquí (la tarifa de la API de Google es de $0.034 para una imagen en 1K). La lista de precios completa está en la sección de precios.
¿Valen diez centavos por segundo la pena? Para un borrador con sonido que de otro modo requeriría una pasada de generación de vídeo y trabajo de audio independiente, probablemente sí, y una prueba de 3 segundos cuesta menos que un clip de Veo. Para B-roll silencioso, no. Veo 3.1 Fast hace clips silenciosos más baratos a mayor resolución.
¿Deberías usar Omni Flash o Veo 3.1?
Versión corta: se dividen el trabajo, pero no según la línea "borrador vs final" que podrías esperar.
Una cosa que debes saber antes de elegir: la brecha de calidad entre ellos no es cuestión de resolución. Veo 3.1 renderiza el movimiento y la física de forma más convincente. El agua se comporta de forma natural, la tela se pliega donde debe, los objetos chocan en lugar de atravesarse como fantasmas. Omni Flash acierta a menudo, pero no siempre, y en algunos clips lo notarás sin buscarlo.
Elige Veo 3.1 cuando necesites una exportación real en 4K, una duración exacta (fijas segundos enteros, de 4 a 8; las fracciones no existen), salida silenciosa, extensión posterior o control sobre el primer y último fotograma. Este último par está infravalorado: alimenta la misma imagen como primer y último fotograma y obtienes un bucle perfecto, que es el truco detrás de los fondos en bucle. Es la herramienta de producción para cualquier proyecto panorámico o con mucha física.
Elige Omni Flash cuando el destino sea la pantalla de un móvil. Para TikTok, Shorts o Reels, 720p es sinceramente todo lo que conserva la plataforma tras su compresión, el sonido viene integrado en la misma pasada y la edición conversacional supera a escribir prompts desde cero mientras buscas la idea. En esa categoría no es la herramienta de bocetos: es simplemente la mejor opción.
Mi flujo de trabajo personal tras dos días de pruebas: para trabajo de clientes en formato horizontal sigo haciendo el concepto en Omni Flash —tomas de tres segundos a $0.30— y luego rehago la toma elegida en Veo a calidad final. Para un clip vertical que va directo a redes sociales, la toma de Omni suele publicarse tal cual.

Ambos modelos están disponibles en el generador de BananaBanana, por lo que puedes compararlos con el mismo prompt sin escribir código ni configurar un proyecto en Google Cloud. Y si quieres la versión condensada de este análisis (capacidades, límites y precios en una página), la tienes en la página de Gemini Omni.
FAQ
¿Qué es gemini-omni-flash-preview?
Es el id de modelo en la API para Gemini Omni Flash, el modelo conversacional de generación de vídeo de Google lanzado en vista previa pública el 30 de junio de 2026. Genera y edita clips de 720p de 3 a 10 segundos con audio mediante la Interactions API.
¿Puede Gemini Omni Flash generar vídeo en 1080p o 4K?
No. La API solo emite 720p a 24 fps. Google Flow rinde en 720p por defecto también; sus versiones en 1080p y 4K se ofrecen en el paso de descarga en los renders de Veo. Si necesitas una exportación de alta resolución real, usa Veo 3.1.
¿Puedo fijar la duración del vídeo en la API de Omni Flash?
Sí, aunque no lo verás en la documentación. El formato de respuesta acepta una duración y el resultado coincide al fotograma: 3 segundos solicitados, 3.008 segundos generados, facturados por tres. Lo mostramos como un selector de 3 a 10 segundos en el generador. La excepción es la edición: un clip editado siempre hereda la duración del vídeo del que proviene.
¿Omni Flash siempre genera audio?
Sí, cada clip incluye una banda sonora generada y no hay ningun parámetro para desactivarla. Describe el audio que deseas (or pide "quiet ambient room tone") directamente en el prompt.
¿Puede Omni Flash extender o interpolar vídeos existentes?
No puede hacerlos más largos: la extensión e interpolación no están soportadas, y la tarea extend en el esquema responde "this model does not support video extension". La edición es lo que hace en su lugar: ya sea de forma conversacional, en un clip que haya generado, o de vídeo a vídeo en cualquier vídeo terminado que le pases, incluido un render de Veo o tu propio archivo. El resultado mantiene la duración de la entrada.