Una sola buona angolazione del prodotto
Una foto frontale con luce uniforme vale più di cinque scatti al volo. Riflessi, mosso e una mano che copre metà etichetta vengono tutti ricostruiti di fantasia.
Caso d'uso · Video UGC AI
Un annuncio UGC è una persona che parla alla fotocamera del telefono con il tuo prodotto in mano. Qui non si gira: si genera. Tu porti una foto del prodotto e una della persona, il modello costruisce il primo fotogramma e poi lo anima con la voce e il suono dell'ambiente nello stesso passaggio. Una clip costa da $0.09 a $1.00 con Gemini Omni Flash e fino a $3.00 con Veo 3.1 con audio, il fotogramma costa $0.11 e niente di tutto questo è un abbonamento.
Un video UGC con l'AI è un breve annuncio in formato user-generated content – una persona che parla alla fotocamera del telefono con un prodotto in mano, in cucina o in soggiorno invece che in studio – generato da un modello video invece che girato con un creator. La produzione si riduce a tre chiamate: foto di riferimento del prodotto e della persona, un fotogramma fisso che blocca chi c'è in scena e cosa tiene in mano, poi un modello video che anima quel fotogramma con il parlato sincronizzato. Qui bastano due modelli. Gemini Omni Flash è quello economico ed è anche il più recente: la model card di Google mette la simulazione della fisica reale tra le sue capacità e i movimenti complessi tra i punti deboli rimasti, e corrisponde a quello che vedo io – la manipolazione normale di solito regge, quella elaborata è un testa o croce. Veo 3.1 è quello da usare quando un'inquadratura dipende da come si comporta un oggetto. Una clip costa da $0.09 a $1.00 con Omni Flash, $1.00 con Veo 3.1 Fast e $3.00 con Veo 3.1 completo per otto secondi con audio, fino a $6.00 in 4K – e si genera in un paio di minuti, invece delle due-quattro settimane che di solito si mangia un brief a un creator.
Il conto della clip qui sopra, senza arrotondamenti: $0.11 per il riferimento del prodotto, $0.11 per la persona, $0.11 per il primo fotogramma che li mette insieme, $0.80 per otto secondi di Omni Flash – $1.13 in tutto. Il montaggio verticale da sei secondi più in basso è costato $0.60. Registrare di nuovo la voce a parte costa $0.01 ogni 200 caratteri di copione, circa un centesimo a frase. I nuovi account ricevono $0.20 gratis, che coprono una foto di riferimento e un primo fotogramma: abbastanza per capire se il personaggio funziona prima di pagare il video.
Questo è il prezzo del primo ciak, e contare sul primo ciak non è un piano. Alcune clip escono buone al primo tentativo; molte ne richiedono due o tre, perché una battuta suona piatta, una mano fa qualcosa di strano o il modello rifiuta l'abbigliamento. E poi c'è l'altra cosa che nessuno mette nel prezzo: un annuncio raramente è una clip sola. Uno spot da 20–30 secondi di solito sono tre o quattro riprese montate insieme – hook, prodotto in mano, primo piano, chiusura – quindi il conto realistico per un annuncio finito è qualche dollaro, non qualche centesimo, e sale in fretta se giri le inquadrature piene di movimento su Veo 3.1 completo a $3.00 l'una. Montarle è la parte gratuita: ffmpeg taglia, unisce e mette l'audio sopra il video da riga di comando, senza nessun programma di montaggio.
Una foto pulita del prodotto e una della persona. Tutto quello che nell'input è sfocato, tagliato o illuminato male torna moltiplicato nel video.
Genera un'immagine fissa che contenga entrambi i riferimenti: la persona con il prodotto, inquadrata come deve aprirsi l'annuncio. $0.11 con Nano Banana Pro, e puoi rifarla finché non è giusta.
Invia l'immagine come primo fotogramma e descrivi il movimento e la battuta che dice lei. Omni Flash costa $0.10 al secondo in 720p con audio; Veo 3.1 costa di più ed è quello da provare quando una sola ripresa deve contenere più azioni di fila.



È la parte che tutti saltano, ed è quella che decide il risultato. Un modello a cui dai una foto sfocata di tre quarti di un flacone, scattata col telefono, non sbaglia in modo evidente: si inventa in silenzio il lato che non vede, e quel lato inventato è quello che finisce sullo schermo per otto secondi. Dagli una foto frontale, con luce uniforme e l'etichetta verso l'obiettivo, e lo stesso flacone sopravvive al passaggio del fotogramma, a quello del video e al montaggio successivo.
Per la persona vale lo stesso. La documentazione di Google su Veo lo dice senza giri di parole: scegli immagini nitide e ben illuminate che mostrino il soggetto dall'angolazione che vuoi, e mantieni identici obiettivo e luce tra un'inquadratura e l'altra. La mia regola dopo qualche decina di questi lavori: se il ritratto di riferimento e la scena che hai in mente non sono d'accordo su da dove arriva la luce, il volto finisce a metà strada e smette di sembrare la stessa persona.
Una foto frontale con luce uniforme vale più di cinque scatti al volo. Riflessi, mosso e una mano che copre metà etichetta vengono tutti ricostruiti di fantasia.
Taglio di capelli, abbigliamento e trucco devono essere uguali in tutte le foto di riferimento. Look diversi finiscono per fondersi in un volto che non somiglia a nessuno dei due.
Un ritratto col flash messo in una cucina con luce diurna morbida sembra un fotomontaggio. Scegli per il riferimento la luce che avrà davvero l'annuncio.
Nano Banana Pro regge un testo breve sull'etichetta; un elenco fitto di ingredienti diventa una texture. Se la scritta conta, prevedi un primo piano con la confezione vera.
I riferimenti non devono essere composti come un annuncio. La composizione è compito del primo fotogramma: è lì che discuti con il modello.
Un ritaglio da 300 pixel preso da un annuncio su un marketplace non lascia al modello quasi niente da conservare. Sempre gli originali a piena risoluzione.
Funzionano entrambe le strade: puoi dare al modello video le tue foto di riferimento e lasciargli comporre la scena, oppure generare prima un'immagine fissa e animare quella. In pratica la seconda è migliore, e il motivo è banale: un modello video a cui chiedi di inventare la composizione la reinventa a ogni fotogramma, mentre uno a cui dai un'immagine deve solo portarla avanti. Su Gemini Omni Flash la differenza è così grande che per le inquadrature di prodotto ho smesso di usare solo i riferimenti.
Qui sotto due clip: stesso prompt, stessi riferimenti, sei secondi ciascuna, $0.60 l'una. L'unica differenza è se come primo fotogramma è entrata un'immagine approvata. Nient'altro è cambiato e nessuna delle due è stata rigenerata.
Solo riferimenti
Da un primo fotogramma approvato
A essere onesti: la strada con i soli riferimenti non è rotta. Il volto ha retto bene, e per una scena senza prodotto in mano spesso basta. Anzi, in quella ripresa la luce è persino più bella: più morbida sul viso, meno contrasto dalla finestra, perché il modello componeva una stanza che piaceva a lui invece di continuare la nostra. Una precisazione che cambia la lettura: la nostra creator è generata, non è la foto di una persona reale, quindi il modello aveva margine per rifarle la luce. Un ritratto vero blocca luce e pelle molto di più, e la strada con i soli riferimenti ha meno libertà di abbellirlo. Quello che compri qui è controllo, non qualità. Su Veo 3.1 la scelta è già fatta: l'API di Google accetta o un primo fotogramma o fino a tre immagini di riferimento, mai entrambi nella stessa richiesta, e le immagini di riferimento richiedono la durata di otto secondi.
Omni Flash è bravissimo nel formato in cui l'UGC vive davvero: una persona che parla all'obiettivo. Interviste, pezzi in stile podcast, un founder che spiega un prodotto, qualcuno che tiene in mano un barattolo e lo descrive. E genera la bocca, i micromovimenti e il suono dell'ambiente in un solo passaggio, il che lo rende il modo più economico per ottenere una voce sincronizzata da un modello video. È anche il più recente dei due, e Google lo vende sulla fisica: l'annuncio parla di una comprensione intuitiva di gravità, energia cinetica e fluidodinamica, e la model card elenca la simulazione della fisica reale tra le capacità e i movimenti complessi tra i punti deboli noti. Nella pratica sono vere tutte e due le cose. Gli oggetti cadono, i liquidi si versano, il peso si percepisce correttamente – finché l'inquadratura non chiede una catena di azioni precise con un oggetto.
Quindi la divisione non è tra teste parlanti e movimento, ma tra quanta coreografia deve reggere una singola ripresa. Il test qui sotto è l'estremo difficile di questa scala, non un verdetto su nessuno dei due modelli: stesso primo fotogramma, stesso prompt, un modello per clip – togliere il tappo al flacone, premere la pipetta, due gocce nel palmo aperto, tutto in otto secondi.
Gemini Omni Flash · 8 s · $0.80
Veo 3.1 Fast · 8 s con audio · $1.00
Labiale, suono dell'ambiente e parlato arrivano insieme, $0.10 al secondo. Per una recensione, una testimonianza o un dialogo tra due persone è la scelta ovvia.
Un movimento Omni lo gestisce; quattro di fila è il punto in cui le riprese iniziano a perdere azioni. Nel nostro confronto abbiamo usato Veo 3.1 Fast a $1.00 per otto secondi con audio, Veo 3.1 completo costa $3.00: genera entrambe le versioni e tieni quella che funziona.
Il filtro di sicurezza di Omni è decisamente più severo sui vestiti: una fitness creator in reggiseno sportivo viene rifiutata lì molto più spesso che su Veo 3.1, a parità di prompt e riferimento. Pianifica l'abbigliamento o pianifica il modello.
Omni Flash fa da 3 a 10 secondi per clip, esattamente quanti ne paghi: 720p nella prima generazione del modello, da 360p a 4K su Omni 1.1, che può anche estendere una scena fino a 40 secondi. Veo 3.1 fa 4, 6 o 8 secondi fino al 4K nativo, e le sue clip si possono estendere oltre il primo taglio.
Ogni clip di Omni ha l'audio, che tu l'abbia chiesto o no. Su Veo l'audio è un interruttore: i video senza audio costano meno, e conta quando la voce arriva comunque da un'altra parte.
Una generazione bloccata viene rimborsata automaticamente su entrambi i modelli. La parte costosa di un rifiuto sono i quattro minuti, non il dollaro.
Omni Flash scrive il parlato nello stesso passaggio dell'immagine, e per l'inglese colloquiale di solito va bene. Il punto debole sono i nomi di marca: nomi di prodotto inventati, parole straniere, sigle di modelli, tutto ciò che anche un madrelingua dovrebbe farsi spiegare come si pronuncia. La versione più grande del problema sono le lingue diverse dall'inglese, e ce l'hanno tutti i modelli video: i recensori russofoni che hanno provato Seedance 2.5 descrivono una battuta che parte accettabile e si sfalda strada facendo – vocali atone ridotte male, accento sulla sillaba sbagliata e, alla fine di una scena da quindici secondi, una pronuncia più vicina a un ibrido slavo che al russo, perché russo, ucraino e bielorusso sono abbastanza vicini da farli mescolare al modello. Alcune parole escono pulite, la successiva tradisce l'intera ripresa. Se il tuo copione non è in inglese, ascoltalo tutto prima di approvarlo.
La soluzione è smettere di chiedere la voce al modello video e generarla a parte. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) funziona con lo stesso saldo tramite il nostro server MCP: $0.01 ogni 200 caratteri di copione, 30 voci, un solo speaker o un dialogo tra due persone, in uscita WAV a 24 kHz. Le indicazioni si danno in inglese semplice: personaggio, ritmo, accento e la trascrizione fonetica di ogni parola che deve essere pronunciata bene. Poi metti la traccia sopra la clip in qualsiasi editor. Se la battuta riscritta dura più o meno quanto la ripresa originale, la bocca resta grosso modo in sincrono; dove non lo è, stacca sul prodotto.
Voce fuori campo generata · $0.01
Anche per montare l'annuncio non serve un editor. ffmpeg unisce le riprese una dopo l'altra, taglia il mezzo secondo in cui una mano fa qualcosa di strano, sostituisce l'audio generato con la tua traccia TTS, aggiunge una dissolvenza incrociata ed esporta la versione 9:16 – tutto da riga di comando, gratis, su qualsiasi computer. La sintassi è notoriamente ostica, ed è proprio per questo che si abbina bene a un modello: descrivi a Claude o a un altro LLM il montaggio che vuoi, ricevi il comando, lo esegui. Per uno spot UGC da tre clip questa è tutta la post-produzione, ed è il motivo per cui le cifre di questa pagina restano al costo di generazione invece di aggiungere un abbonamento sopra.
| Modello | Prezzo | Unità | Audio |
|---|---|---|---|
| Nano Banana Proriferimenti e primo fotogramma | $0.11 | immagine 1K–2K | — |
| Nano Banana 2bozze e varianti | $0.03–$0.13 | immagine da 512px a 4K | — |
| Gemini Omni Flash$0.10 al secondo | $0.30–$1.00 | 3–10 s, 720p | sempre attivo |
| Veo 3.1 Fastcon audio | $0.50–$1.00 | 4–8 s, 720p/1080p | a scelta |
| Veo 3.1 Liteil video più economico | $0.10–$0.36 | 4–8 s, 720p | a scelta |
| Gemini 3.1 Flash TTSsolo via MCP | $0.01 | ogni 200 caratteri | solo voce |
I prezzi di Veo sono per 720p e 1080p; il 4K costa di più. Omni Flash fattura $0.10 per ogni secondo generato, quindi la durata della clip è il prezzo. Le tabelle complete sono nella pagina dei prezzi.
Tutti i modelli e le risoluzioni sono nella pagina completa dei prezzi, e la pagina di Gemini Omni Flash spiega cosa quel modello sa fare e cosa no.
Come funziona l'animazione dal primo fotogramma, cosa scrivere nel prompt del movimento e dove si inceppa.
Leggi la guidaCome far arrivare un prodotto intatto dalla foto di riferimento al fotogramma finale, con prompt veri.
Leggi la guidaProva sul campo della API in preview: cosa supporta, cosa rifiuta, quanto costa davvero ogni clip.
Leggi la guidaNo. Anche la creator può essere generata: ogni persona che vedi in questa pagina è uscita da un prompt testuale e non è mai esistita. Se usi il volto di una persona reale, ti serve il suo consenso: le regole sull'immagine valgono per il video generato come per un servizio fotografico, e le policy delle piattaforme sui volti sintetici sono più severe di quanto si pensi.
Sì, se tieni le stesse foto di riferimento e riusi lo stesso primo fotogramma. Rigenerare il fotogramma dagli stessi riferimenti ti porta vicino, ma non identico al pixel: l'abitudine più sicura è conservare ogni primo fotogramma approvato e animarlo di nuovo invece di ricostruirlo.
Su TikTok sì: la sua policy pubblicitaria sui media modificati e sui contenuti generati con l'AI richiede l'etichetta AIGC di Ads Manager oppure un tuo disclaimer visibile nella creatività. Meta applica automaticamente le proprie etichette AI agli annunci che riconosce come generati. Entrambe le policy sono cambiate nel corso del 2026, quindi controlla la versione attuale prima di una campagna importante invece di fidarti di un post di blog, compreso questo.
Inizia con Gemini Omni Flash a $0.10 al secondo, audio incluso: per una persona che parla in camera è il più economico e il meno capriccioso, ed è il modello più recente, con una fisica che Google pubblicizza esplicitamente. Non leggerlo come «Omni non sa fare il movimento»: versa, lascia cadere, porta pesi. Quello che perde sono le lunghe catene di manipolazioni precise in una sola ripresa: nel nostro test del contagocce con quattro azioni ha perso il flacone, mentre Veo 3.1 Fast lo ha tenuto. Quindi per un hook o una testimonianza, Omni. Per un'inquadratura costruita sulla coreografia, generala su entrambi e tieni la ripresa che funziona; quella venuta male costa centesimi.
Sì, fino a 10 secondi. Carica la tua clip e Omni Flash la modifica in modalità video-to-video – cambia la luce, lo sfondo, cosa tiene in mano la persona – mantenendo la ripresa. Le sorgenti più lunghe vengono tagliate al limite del modello prima della generazione.
Il saldo viene rimborsato automaticamente, sia su Omni Flash sia su Veo. I rifiuti si concentrano su abbigliamento, minori e persone reali riconoscibili; la regola sull'abbigliamento della sezione sulla scelta del modello qui sopra è quella che ti fa risparmiare più tentativi.
Leggi la risposta completaSì: gli stessi modelli sono disponibili tramite il nostro server MCP, compreso il modello vocale. Immagini di riferimento e primi fotogrammi si possono passare come job ID, URL pubblici o base64 inline, quindi un intero lotto di UGC si può automatizzare da un agente.
Conta le riprese, non le clip. Uno spot da 20–30 secondi di solito sono tre o quattro clip montate insieme, e ognuna richiede un paio di tentativi prima di essere usabile: una battuta piatta, una mano che fa qualcosa di strano, un rifiuto. A $0.80 per otto secondi di Omni Flash, un annuncio finito costa pochi dollari; girare i tagli pieni di movimento su Veo 3.1 completo a $3.00 l'uno lo porta sulle decine di dollari. Il montaggio non aggiunge nulla: ffmpeg unisce le riprese, le taglia e ci mette sopra la voce fuori campo da riga di comando, e un LLM può scriverti quei comandi.
Registrati gratis con $0.20 sul saldo, ricarica in crypto da $1 o con carta da $20. Primo fotogramma in circa un minuto, prima clip in cinque.