Da immagine a video con l'AI
Come funziona il passaggio da immagine a video con l'AI, quale modello scegliere (Veo 3.1, Omni Flash, Wan 3.0, Grok), prezzi reali da $0.10 a clip, prompt, loop, catene da 148 secondi.

Da immagine a video con l'AI è una tecnica di generazione in cui un modello prende una singola immagine, la tratta come primo fotogramma di una clip e inventa tutto quello che succede dopo: movimento, movimenti di camera, cambi di luce, a volte anche l'audio. Tu fornisci una foto e una descrizione testuale di cosa deve muoversi. Il modello ti restituisce un video breve, di solito da 4 a 10 secondi, in cui proprio la tua immagine prende vita.
La versione breve, se ti basta questa: carica una foto nel generatore di BananaBanana, descrivi il movimento, aspetta 2–5 minuti. Una clip da 4 secondi senza audio dalla tua foto parte da $0.10 con Veo 3.1 Lite, con l'audio sale a $0.18, Gemini Omni Flash anima una foto con colonna sonora completa da $0.09 (fattura al secondo, da $0.03 a 360p fino a $0.30 in 4K), e Wan 3.0 lo fa con audio gratis da $0.20 per 4 secondi a 480p. I nuovi account ricevono $0.20 di saldo di benvenuto, che bastano per due clip di prova senza audio.
Usiamo sette modelli video in produzione e ognuno accetta una foto come primo fotogramma, quindi questa guida li copre tutti e sette, scritta a partire dai log di generazione reali e non dalle pagine di marketing. Fallimenti compresi. Alcuni insegnano più dei successi.
Come funziona il passaggio da immagine a video con l'AI?
Dietro le quinte, l'immagine viene passata al modello come fotogramma di condizionamento. La documentazione video dell'API Gemini di Google descrive Veo 3.1 come capace di «image-based direction» e «frame-specific generation», che in parole povere significa: la tua immagine guida l'intera clip e puoi fissare fotogrammi precisi dove vuoi. Il modello legge la scena, intuisce la fisica (come si increspa l'acqua della tua foto, come si muovono i capelli nel vento) e genera un fotogramma dopo l'altro partendo dal tuo punto di partenza.
La conseguenza pratica: il primo fotogramma del risultato è la tua foto, quasi pixel per pixel. Tutto quello che viene dopo è inventato. I buoni prompt spendono le parole sull'invenzione, non a ridescrivere ciò che il modello vede già.
Funziona sorprendentemente bene con scene che hanno un movimento implicito evidente. Un ritratto respira e sbatte le palpebre. Il vapore sale dal caffè. Un'auto parcheggiata si allontana. Funziona meno bene quando nella foto non c'è nessun movimento plausibile: dagli un render piatto di un prodotto su sfondo bianco, senza indicazioni di movimento nel prompt, e di solito ottieni uno zoom lento e un po' nervoso. Non è rotto, è solo noioso.

Quale modello trasforma meglio una foto in video?
Tutti e sette i modelli video della piattaforma accettano un'immagine come primo fotogramma. Cambiano i limiti e quanto paghi. Prima i modelli Google:
| Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite | Gemini Omni Flash | |
|---|---|---|---|---|
| Prezzo (4 s, senza audio) | $0.70 | $0.35 | $0.10 | — |
| Prezzo (4 s, con audio) | $1.50 | $0.50 | $0.18 | $0.12 a 360p, $0.40 a 720p |
| Risoluzione massima | 4K | 4K | 1080p | 4K (upscaling) |
| Durata | esatta 4/6/7/8 s | esatta 4/6/7/8 s | esatta 4/6/7/8 s | esatta 3–10 s |
| Audio | attivabile | attivabile | attivabile | sempre attivo |
| Ultimo fotogramma + loop | sì | sì | sì | sì (Omni 1.1) |
| Estensione | fino a 148 s | fino a 148 s | no | fino a 40 s, più editing video |
La mia scelta predefinita è Veo 3.1 Fast. Mantiene i controlli utili (durata esatta, ultimo fotogramma opzionale, estensione) a metà del prezzo del modello di punta, e per i formati da social il divario di qualità rispetto a Veo 3.1 completo si nota di rado. Lite a $0.10 è dove verifico se un'idea si muove davvero prima di spenderci soldi veri. Veo 3.1 completo si guadagna il suo prezzo quando la clip coinvolge acqua, tessuti o collisioni, o quando le specifiche di consegna dicono 4K. Omni Flash è la scelta giusta quando l'audio conta quanto l'immagine; l'abbiamo smontato in una recensione dell'API Omni Flash a parte, se vuoi i dettagli, incluso come il prezzo al secondo cresce da 360p fino al 4K. La generazione Omni precedente, Omni Flash 1.0, si può ancora selezionare da 4 a 10 secondi e accetta solo il primo fotogramma.
La clip qui sopra è una generazione Veo 3.1 Fast dalla nostra pipeline di produzione, fatta per questo articolo: una fotografia incorniciata di una barca a vela su una scrivania, e il prompt chiede che il mare dentro la cornice inizi a muoversi mentre la camera avanza lentamente. Un'unica ripresa, nessun montaggio, senza audio per scelta (il livello senza audio di Fast è quello che usiamo per le bozze). Quell'effetto «foto che si risveglia» è in sostanza ciò che il modello fa ai tuoi caricamenti.
Poi i due modelli arrivati a settembre, da Alibaba e xAI:
| Wan 3.0 | Grok Imagine Video 1.5 | |
|---|---|---|
| Prezzo (4 s, con audio) | $0.20 a 480p, $0.40 a 720p, $0.80 a 1080p | $0.56 a 720p |
| Risoluzione massima | 1080p | 1080p (immagini di riferimento solo a 720p) |
| Durata | 4, 6, 8, 10, 15, 20 o 30 s | qualsiasi numero intero da 4 a 15 s |
| Audio | attivo di default e gratis, si può disattivare | sempre attivo, dialoghi con lip-sync |
| Ultimo fotogramma + loop | sì | no |
| Estensione | no, ma 30 s in un'unica ripresa | no |
Wan 3.0 è quello a cui darei una foto quando la clip deve durare più di dieci secondi o deve avere l'audio senza pagarlo a parte. Grok è per la foto di una persona che poi deve dire qualcosa: scrivi la battuta tra virgolette e la bocca la segue. La stessa foto di una mongolfiera (un render di Nano Banana Pro, quindi nessun volto reale coinvolto) passata a entrambi, con lo stesso prompt che chiede alla mongolfiera ancorata di sollevarsi un po' mentre il bruciatore si accende e la foschia si sposta:
Wan 3.0, sei secondi a 720p, $0.60. Ha mantenuto la foto quasi pixel per pixel, ha sollevato la mongolfiera di qualche metro, ha fatto comparire una fune di ancoraggio che nell'immagine non c'era e ha messo nella traccia brevi fiammate del bruciatore e canto di uccelli senza che nessuno glielo chiedesse.
Grok Imagine Video 1.5, sei secondi a 720p, $0.84. Movimento più sottile, stessa fedeltà alla fonte, e un dettaglio dai log che conviene conoscere: il file è tornato a 1280×704, non a 720 righe vere. Va bene per un feed, è una seccatura se fai compositing.
Come generare un video da una foto, passo per passo
Tutto il flusso nel generatore ti porta via circa un minuto, più il tempo di rendering.
- Passa il generatore in modalità video e scegli un modello. Per un primo tentativo, Veo 3.1 Lite a $0.10 è il modo economico per imparare.
- Carica la foto come primo fotogramma. JPG o PNG, e viene ritagliata sul formato del video, quindi controlla i bordi prima di generare.
- Scegli 16:9 o 9:16. Il verticale va benissimo per TikTok e Reels; il modello gestisce l'inquadratura verticale senza problemi.
- Scrivi il prompt di movimento (sezione successiva) e, se vuoi, un prompt negativo fino a 1.000 caratteri per ciò che non vuoi vedere.
- Scegli la durata e se vuoi l'audio. Su Veo sono entrambe impostazioni esatte; su Omni Flash scegli qualsiasi durata da 3 a 10 secondi e l'audio è sempre attivo. Wan 3.0 arriva fino a 30 secondi con una colonna sonora gratuita che puoi disattivare, e Grok accetta qualsiasi durata da 4 a 15 e parla sempre.
- Genera. I video richiedono più o meno 2–5 minuti. Puoi chiudere la scheda; i risultati ti aspettano nella cronologia per 30 giorni.
Il saldo viene scalato solo quando una generazione va a buon fine. I rendering falliti vengono rimborsati in automatico, e nel video conta più che nelle immagini, perché farai parecchie iterazioni.

Come si scrivono i prompt di movimento da immagine a video?
Regola numero uno: descrivi il movimento, non la scena. La scena è già nella foto. «A woman in a red coat stands on a bridge» spreca il prompt su fatti che il modello conosce già. «She turns toward the camera and smiles as wind lifts her hair, slow dolly-in» ha la stessa lunghezza ed è tutto segnale.
Con Veo le parole di regia fanno un sacco di lavoro. Dolly in, orbit, handheld, static tripod shot, slow pan left. È evidente che i modelli sono stati addestrati su descrizioni di riprese, e rispondono al lessico cinematografico in modo più affidabile che a formule vaghe come «make it dynamic». Io eviterei proprio «dynamic». Nessuno è d'accordo su cosa voglia dire, modello compreso.
Una lezione che abbiamo imparato a caro prezzo producendo le clip demo per questo blog: questi modelli mantengono quello che sta già succedendo nel primo fotogramma e lasciano cadere in silenzio le azioni programmate per dopo. Una volta abbiamo chiesto a Omni Flash di far saltare un pancake «around the middle of the clip» e abbiamo ottenuto dieci secondi di pancake fermo lì. Tre volte di fila, un dollaro per ogni ripresa da dieci secondi. Riscrivere l'azione come già in corso ha risolto al primo tentativo. Quindi: «syrup is pouring onto the stack» batte «syrup starts pouring after two seconds», e nello specifico, da immagine a video, scegli una foto di partenza in cui l'azione che vuoi sia almeno plausibile a metà movimento.
Alcuni schemi che continuano a ripagare:
- Ritratti: «subtle breathing, a slow blink, then a small smile; camera locked» risulta vivo senza la deformazione inquietante che causano i movimenti ampi.
- Prodotti: «slow 180-degree orbit around the object, studio lighting stays constant» è la formula che non delude mai. Tieni semplice lo sfondo nella foto di partenza.
- Paesaggi: nomina gli elementi in movimento («clouds drift right, grass sways, light shifts warmer»), altrimenti ottieni il ripiego dello zoom nervoso.

Loop, ultimi fotogrammi e video da 148 secondi
I modelli Veo 3.1 accettano un ultimo fotogramma opzionale oltre al primo, e lo stesso vale per Omni 1.1 e Wan 3.0. Dai a un modello due foto diverse e genera una transizione tra le due: è così che trasformi uno scatto diurno in uno notturno o uno schizzo in un prodotto finito. Dagli la stessa foto per entrambi e ottieni una clip che finisce dove è iniziata: un loop pulito, pronto per lo sfondo di un sito o per un post in stile cinemagraph. È la mia funzione preferita tra quelle sottoutilizzate della piattaforma.
L'estensione è l'altro asso di Veo. Una clip finita si può proseguire di 7 secondi con un nuovo prompt, e la catena può arrivare fino a 148 secondi in totale con piena continuità visiva (solo Veo 3.1 e Fast; Lite qui non partecipa). Partire con una catena lunga da una foto tua è la cosa più vicina a fare cinema senza storyboard che le API attuali offrono. Però anche i costi si accumulano, quindi fai i conti prima di innamorarti dell'idea. Se ti bastano 30 secondi, Wan 3.0 li genera in un'unica ripresa dalla tua foto, senza cuciture e senza deriva di continuità, a $1.50 a 480p o $3.00 a 720p.
Anche Omni Flash ora ha la sua estensione: ogni passaggio aggiunge da 3 a 10 secondi all'ultima clip, concatenabile fino a circa 40 secondi in totale, un tetto più basso dei 148 di Veo. In più mantiene l'editing conversazionale: descrivi una modifica alla clip finita («make it dusk, keep everything else the same») e paghi di nuovo i suoi secondi — accetta anche video che non ha generato lui, compresi i tuoi caricamenti, e li restituisce della stessa durata. Filosofia diversa. L'editing rifinisce un momento; l'estensione fa crescere una timeline.

FAQ
Posso trasformare una foto in video gratis?
Quasi. Un nuovo account BananaBanana arriva con $0.20 di saldo di benvenuto e senza bisogno di carta, abbastanza per due clip Veo 3.1 Lite da 4 secondi senza audio dalla tua foto. Dopo si paga a clip, da $0.10.
Qual è l'API da immagine a video più economica?
Su BananaBanana è Veo 3.1 Lite: $0.10 per una clip da 4 secondi a 720p senza audio, $0.18 con audio. Il prezzo è per generazione riuscita, con rimborsi automatici sui fallimenti e senza abbonamento né configurazione di Google Cloud.
Il video generato può avere l'audio?
Sì. I modelli Veo 3.1 hanno un interruttore per l'audio (dialoghi, effetti e ambiente descritti nel prompt), Gemini Omni Flash genera sempre l'audio, incluso nel prezzo al secondo (da $0.03 a 360p a $0.30 in 4K), Wan 3.0 aggiunge una colonna sonora gratis e Grok Imagine Video 1.5 pronuncia i dialoghi che scrivi.
Posso animare una foto verticale per TikTok o Reels?
Sì, tutti e sette i modelli supportano il 9:16, e Grok Imagine Video 1.5 aggiunge 1:1, 3:2 e 2:3. Carica la foto, scegli 9:16 e tieni presente che la foto di partenza viene ritagliata su quel formato, quindi lascia un po' di spazio sopra il soggetto nello scatto originale.
Quanto può durare un video AI creato da una foto?
Ogni clip dura 4–8 secondi sui modelli Veo, 3–10 secondi su Omni Flash, 4–15 su Grok e fino a 30 secondi in un'unica ripresa su Wan 3.0. Le clip di Veo 3.1 e Veo 3.1 Fast si possono anche estendere a passi di 7 secondi fino a 148 secondi mantenendo la continuità visiva della foto originale, e Omni 1.1 arriva a circa 40.