Torna al blog
BananaBanana Teamnewsvideoomni-flashapi

Gemini Omni Flash API: cosa fa davvero la preview

Recensione pratica dell'API Gemini Omni Flash: cosa supporta davvero gemini-omni-flash-preview, cosa resta esclusivo di Flow e i costi reali a clip.

Gemini Omni Flash API: cosa fa davvero la preview

Gemini Omni Flash è il primo modello multimodale «any-to-any» di Google che restituisce video: gli mandi testo, immagini o un risultato precedente, e ti restituisce una clip breve con audio, ora selezionabile fino al 4K, che puoi continuare a modificare descrivendo i cambiamenti in linguaggio naturale. Google l'ha rilasciato in public preview il 30 giugno 2026, insieme a Nano Banana 2 Lite, e l'id del modello nell'API è gemini-omni-flash-preview.

Risposta rapida, se sei qui per una cosa sola: l'API Gemini Omni Flash supporta da testo a video, da immagine a video, video da riferimenti con fino a dieci immagini del soggetto (combinabili con un fotogramma iniziale), editing conversazionale e l'editing video-to-video di una clip che gli passi. Non supporta seed, parametri di prompt negativo né la disattivazione dell'audio — la risoluzione ora arriva fino al 4K e nel frattempo è arrivata anche l'estensione della scena, entrambe trattate più sotto. Nemmeno il controllo della durata è nella documentazione, ma il campo esiste e funziona — ne parliamo più avanti. Se hai visto le demo di Omni Flash dentro Google Flow e ti aspettavi lo stesso kit di strumenti dall'API, resterai deluso. L'abbiamo integrato nel nostro generatore nella settimana del lancio, quindi questa recensione si basa su ciò che l'endpoint restituisce davvero, non sulla pagina di marketing.

Cosa ti dà davvero l'API Gemini Omni Flash

L'API espone Omni Flash tramite l'Interactions API (interactions.create), non tramite l'endpoint generateVideos che usa Veo. È un dettaglio che conta, perché le interazioni hanno uno stato. Ogni risposta porta un id che puoi richiamare in seguito.

Secondo la documentazione Omni di Google, più una settimana di prove sull'endpoint, oggi funzionano cinque task:

  • Da testo a video. Entra un prompt, esce una clip fino al 4K, colonna sonora compresa.
  • Da immagine a video. La tua immagine diventa il fotogramma iniziale e il prompt descrive il movimento.
  • Video da riferimenti. Le immagini del soggetto mantengono coerente un personaggio o un prodotto in una nuova scena — la richiesta ne accetta fino a dieci e, a differenza di Veo, si possono combinare con un fotogramma iniziale.
  • Editing conversazionale. Passa previous_interaction_id più una breve istruzione, e il modello modifica la clip mantenendo intatto il resto.
  • Editing video-to-video. Invia un video vero e proprio come contenuto con task: "edit" e ti torna restilizzato — non serve nessun id di interazione, quindi funziona anche su clip che il modello non ha mai creato, compresi render di Veo e riprese fatte col telefono. Il limite: il risultato ha sempre esattamente la stessa durata dell'input, e l'input ha un tetto di 10 secondi.

La clip qui sopra è uscita direttamente da gemini-omni-flash-preview attraverso la nostra pipeline, quindi stai guardando un campione reale, non un materiale per la stampa. Un solo prompt testuale: una barchetta di carta che scivola nell'inchiostro versato, «single continuous scene» per impedire al modello di tagliare, e una riga «Audio:» che chiede fruscio di carta e increspature. Abbiamo chiesto i 10 secondi pieni. Attiva l'audio: è generato anche quello.

Ogni clip dura da 3 a 10 secondi a 24 fps. La documentazione non elenca nessun parametro di durata, e al lancio pensavamo che decidesse il modello — chiedi «a slow pan across a foggy harbor at dawn» e ottieni 9 secondi, o 4, fai tu. Poi si è scoperto che il formato della richiesta accetta comunque una durata, in silenzio, ed è esatta: chiedi 3 secondi e ne ottieni 3,008, fatturati come tre. È quello che esponiamo nel generatore, quindi tutto ciò che va montato sulla musica non è più una lotteria.

Il prompt fa anche da pannello di controllo per tutto ciò che l'API non espone. Lasciato a sé stesso, il modello tende a tagliare tra più inquadrature, quindi «single unbroken shot, no cuts» si guadagna un posto nella maggior parte dei prompt; gli intervalli di timecode come [0-3s] ... [3-6s] ... vengono rispettati; le stringhe tra virgolette vengono rese come testo a schermo con una precisione sorprendente. Il nostro generatore li offre come snippet a un clic, perché continuavamo a scriverli a mano.

L'audio è la seconda sorpresa, e piacevole. Ogni generazione arriva con il suono: rumore ambientale, effetti, a volte parlato se lo chiedi. Però non puoi disattivarlo. L'unico controllo che hai è il testo, così abbiamo preso l'abitudine di aggiungere una riga «Audio: ...» ai prompt, e funziona abbastanza bene.

Cosa ha Flow che l'API non ha?

Google Flow è uno strumento di produzione completo costruito attorno a più modelli, ed è proprio questo involucro che manca all'API nuda. Flow ti dà uno Scene Builder per le sequenze multi-inquadratura e controlli di camera predefiniti (tipo di inquadratura, angolazione, movimento). Una sfumatura sulla risoluzione che molti sbagliano: anche Flow renderizza a 720p di default. Le versioni 1080p e 4K compaiono al momento del download, come opzione di esportazione sopra il render di Veo, non come una modalità di generazione diversa. Niente di questi strumenti esiste in gemini-omni-flash-preview.

Ecco il confronto onesto dopo una settimana di prove su entrambi:

FunzioneFlow / app GeminiAPI Gemini Omni Flash
RisoluzioneRender a 720p; 1080p / 4K al download360p–4K, 24 fps (1080p/4K con upscaling)
Durata della clipLo Scene Builder concatena le inquadrature3–10 s, esatta
Controlli di cameraTipi di inquadratura, angolazioni e movimenti predefinitiSolo prompt testuale
Estendere un videoSì (tramite Veo)Sì, concatenato a passi di 3–10 s fino a 40 s totali
Modificare un video esistenteRemix dentro l'appConversazionale, o video-to-video su qualsiasi clip
AudioAttivo, con controlli nell'interfacciaSempre attivo, controllo solo via prompt
Seed / prompt negativoComunque nascosti all'utenteNon supportati
Clip per richiestaUna alla voltaUna per interazione, niente sampleCount

Su parte di questo la documentazione è trasparente. Google scrive che estensione e interpolazione del video «non sono supportate», e lo stesso vale per system instructions, temperature e parametri di prompt negativo (suggeriscono di scrivere le esclusioni nel prompt normale, cosa che per la mia esperienza funziona forse la metà delle volte). I riferimenti video compaiono nello schema dell'API con un tetto di 3 secondi, ma la documentazione ammette che il modello non li elabora ancora correttamente.

Quindi l'API in preview è una fetta stretta di ciò che il modello sa fare sulle piattaforme di Google. È normale per una preview. Brucia lo stesso quando un cliente chiede un'esportazione in 1080p e il tetto è 720p.

Illustrazione divisa che confronta una console di regia completa con un piccolo telecomando, metafora di Flow contro l'API Omni Flash

L'editing conversazionale è la funzione che mantiene davvero le promesse

L'editing è dove Omni Flash si guadagna il suo posto. Generi una clip, la guardi, poi mandi un seguito tipo «make the jacket red and slow down the camera» con il previous_interaction_id del primo risultato. Il modello ricostruisce il video applicando la modifica e conservando gran parte dell'originale. Niente ricaricamenti, niente maschere, niente timeline.

La documentazione di Gemini Enterprise di Google dice che puoi concatenare fino a tre modifiche consecutive mentre la sessione mantiene il contesto. In pratica ogni modifica è un nuovo render a 720p, quindi la coerenza si perde un po' a ogni passaggio. I volti reggono meglio del testo sulle insegne. I movimenti complessi a volte cambiano anche quando hai chiesto solo un ritocco di colore.

Un'avvertenza in cui siamo incappati in produzione: le interazioni di origine scadono lato Google. Prova a modificare una clip generata un po' di tempo fa e l'API può restituire un 404 per l'interazione a cui fai riferimento. Su BananaBanana lo mostriamo come video scaduto e rimborsiamo il tentativo, ma se costruisci sull'API nuda, mettilo in conto.

Conversazione in chat in cui ogni fumetto di risposta mostra lo stesso fotogramma video con una piccola modifica, a illustrare l'editing video conversazionale

Quanto costa Gemini Omni Flash?

L'annuncio di lancio di Google fissa il prezzo di Omni Flash a $0.10 per secondo di video in uscita: un risultato da 3 secondi costa $0.30, uno da 10 secondi $1.00. Finché la durata sembrava una decisione del modello, lo era anche la tua fattura — stesso prompt, stesse impostazioni, conto diverso.

Su BananaBanana quella tariffa fissa ora è divisa per risoluzione: $0.03/s a 360p, $0.10/s a 720p, $0.15/s a 1080p, $0.30/s in 4K — scegli 3 secondi a 720p per $0.30 o i dieci pieni per $1.00, e una modifica costa la stessa tariffa al secondo perché è un render completo (e torna anche esattamente lunga quanto la sua fonte — il modello non può allungare né accorciare). Nano Banana 2 Lite, lanciato lo stesso giorno, qui costa $0.03 a immagine (la tariffa API di Google è $0.034 per un'immagine 1K). Il listino completo è nella sezione prezzi.

Dieci centesimi al secondo — la tariffa a 720p — sono un buon prezzo? Per una bozza con audio che altrimenti richiederebbe un passaggio di generazione video più un lavoro audio separato, probabilmente sì — e un test da 3 secondi costa meno di una clip Veo. Per del b-roll senza audio, no. Veo 3.1 Fast fa clip senza audio più economiche e a risoluzione più alta.

Meglio Omni Flash o Veo 3.1?

Versione breve: si dividono il lavoro, ma non lungo la linea «bozza contro versione finale» che ti aspetteresti.

Una cosa da sapere prima di scegliere: il divario di qualità tra i due non riguarda davvero la risoluzione. Veo 3.1 rende movimento e fisica in modo più convincente. L'acqua si comporta come dovrebbe, i tessuti si piegano dove devono, gli oggetti si scontrano invece di attraversarsi come fantasmi. Omni Flash ci azzecca spesso, non sempre, e su alcune clip lo noti senza nemmeno cercarlo.

Scegli Veo 3.1 quando ti serve una durata esatta della clip (imposti secondi interi, da 4 a 8; le frazioni non esistono), un risultato senza audio o una fisica più stabile — nel frattempo Omni Flash ha recuperato su esportazione 4K, estensione della scena e controllo del primo e dell'ultimo fotogramma, di cui abbiamo parlato sopra. Quest'ultimo trucco ora funziona su entrambi i modelli: usa la stessa immagine come primo e ultimo fotogramma e ottieni un loop senza stacchi, che è tutto il segreto dei video di sfondo in loop. Veo resta lo strumento di produzione per tutto ciò che è widescreen o carico di fisica.

Scegli Omni Flash quando la destinazione è lo schermo di un telefono. Per TikTok, Shorts o Reels, 720p è onestamente tutto ciò che la piattaforma conserva dopo la propria compressione, l'audio nasce nello stesso passaggio, e l'editing conversazionale batte il riscrivere il prompt da zero mentre insegui l'idea. In quella corsia non è lo strumento per gli schizzi. È semplicemente la scelta migliore.

Il mio flusso personale dopo due giorni: per i lavori widescreen per i clienti abbozzo ancora il concept in Omni Flash — riprese da tre secondi a $0.30 — poi rifaccio quella buona in Veo alla qualità finale. Per una clip verticale che va dritta sui social, spesso la ripresa di Omni esce così com'è.

Due droni con videocamera di dimensioni diverse che volano affiancati sopra una valle color pastello, a rappresentare la scelta tra Omni Flash e Veo 3.1

Entrambi i modelli sono attivi nel generatore di BananaBanana, quindi puoi confrontarli sullo stesso prompt senza scrivere una riga di codice né configurare un progetto Google Cloud. E se vuoi la versione condensata di questa recensione — funzioni, limiti e prezzo in una pagina — la trovi sulla pagina Gemini Omni.

FAQ

Cos'è gemini-omni-flash-preview?

È l'id del modello nell'API per Gemini Omni Flash, il modello di Google per la generazione video conversazionale, rilasciato in public preview il 30 giugno 2026. Genera e modifica clip da 3–10 secondi con audio tramite l'Interactions API, ora con risoluzioni da 360p al 4K.

Gemini Omni Flash può generare video in 1080p o 4K?

Sì, adesso sì. All'inizio l'API usciva solo a 720p; Omni Flash su BananaBanana ora offre 360p, 720p, 1080p e 4K, con 1080p e 4K consegnati tramite upscaling e non come render nativo a risoluzione più alta. Google Flow renderizza ancora a 720p di default; le sue versioni 1080p e 4K sono offerte al momento del download sui render di Veo.

Posso impostare la durata del video nell'API Omni Flash?

Sì, anche se nella documentazione non lo trovi. Il formato della richiesta accetta una durata, e il risultato la rispetta al fotogramma: chiedi 3 secondi, ne escono 3,008, fatturati come tre. Nel generatore la esponiamo come selettore da 3 a 10 secondi. L'eccezione è l'editing — una clip modificata eredita sempre la durata del video da cui è stata ricavata.

Omni Flash genera sempre l'audio?

Sì, ogni clip include una colonna sonora generata e non c'è nessun flag per disattivarla. Descrivi l'audio che vuoi (o chiedi «quiet ambient room tone») direttamente nel prompt.

Omni Flash può estendere o interpolare video esistenti?

Ora sì: l'attuale generazione di Omni Flash supporta l'estensione della scena, aggiungendo continuazioni da 3–10 secondi a una clip fino a 40 secondi in totale (la versione originale rispondeva a un task extend con «this model does not support video extension»). L'editing conversazionale e l'editing video-to-video funzionano come prima, su una clip generata da lui o su qualsiasi video finito che gli passi, compresi un render di Veo o un tuo caricamento; in questi casi la durata resta quella dell'input.

newsvideoomni-flashapi