Caso d'uso · Video UGC AI

Annunci video UGC con l'AI partendo da due foto

Un annuncio UGC è una persona che parla alla fotocamera del telefono con il tuo prodotto in mano. Qui non si gira: si genera. Tu porti una foto del prodotto e una della persona, il modello costruisce il primo fotogramma e poi lo anima con la voce e il suono dell'ambiente nello stesso passaggio. Una clip costa da $0.09 a $1.00 con Gemini Omni Flash e fino a $3.00 con Veo 3.1 con audio, il fotogramma costa $0.11 e niente di tutto questo è un abbonamento.

Fatta apposta per questa pagina, dall'inizio alla fine: due foto di riferimento → un primo fotogramma con Nano Banana Pro → otto secondi di Gemini Omni Flash, con parlato e rumore d'ambiente generati insieme all'immagine. $1.13 per la ripresa che stai guardando. Guardala con l'audio acceso.
01Che cos'è

Che cos'è un video UGC fatto con l'AI?

Un video UGC con l'AI è un breve annuncio in formato user-generated content – una persona che parla alla fotocamera del telefono con un prodotto in mano, in cucina o in soggiorno invece che in studio – generato da un modello video invece che girato con un creator. La produzione si riduce a tre chiamate: foto di riferimento del prodotto e della persona, un fotogramma fisso che blocca chi c'è in scena e cosa tiene in mano, poi un modello video che anima quel fotogramma con il parlato sincronizzato. Qui bastano due modelli. Gemini Omni Flash è quello economico ed è anche il più recente: la model card di Google mette la simulazione della fisica reale tra le sue capacità e i movimenti complessi tra i punti deboli rimasti, e corrisponde a quello che vedo io – la manipolazione normale di solito regge, quella elaborata è un testa o croce. Veo 3.1 è quello da usare quando un'inquadratura dipende da come si comporta un oggetto. Una clip costa da $0.09 a $1.00 con Omni Flash, $1.00 con Veo 3.1 Fast e $3.00 con Veo 3.1 completo per otto secondi con audio, fino a $6.00 in 4K – e si genera in un paio di minuti, invece delle due-quattro settimane che di solito si mangia un brief a un creator.

Quanto costa davvero una clip nel 2026?

Il conto della clip qui sopra, senza arrotondamenti: $0.11 per il riferimento del prodotto, $0.11 per la persona, $0.11 per il primo fotogramma che li mette insieme, $0.80 per otto secondi di Omni Flash – $1.13 in tutto. Il montaggio verticale da sei secondi più in basso è costato $0.60. Registrare di nuovo la voce a parte costa $0.01 ogni 200 caratteri di copione, circa un centesimo a frase. I nuovi account ricevono $0.20 gratis, che coprono una foto di riferimento e un primo fotogramma: abbastanza per capire se il personaggio funziona prima di pagare il video.

Questo è il prezzo del primo ciak, e contare sul primo ciak non è un piano. Alcune clip escono buone al primo tentativo; molte ne richiedono due o tre, perché una battuta suona piatta, una mano fa qualcosa di strano o il modello rifiuta l'abbigliamento. E poi c'è l'altra cosa che nessuno mette nel prezzo: un annuncio raramente è una clip sola. Uno spot da 20–30 secondi di solito sono tre o quattro riprese montate insieme – hook, prodotto in mano, primo piano, chiusura – quindi il conto realistico per un annuncio finito è qualche dollaro, non qualche centesimo, e sale in fretta se giri le inquadrature piene di movimento su Veo 3.1 completo a $3.00 l'una. Montarle è la parte gratuita: ffmpeg taglia, unisce e mette l'audio sopra il video da riga di comando, senza nessun programma di montaggio.

02Il processo

Entrano due foto, esce un annuncio

  1. Parti da riferimenti veri

    Una foto pulita del prodotto e una della persona. Tutto quello che nell'input è sfocato, tagliato o illuminato male torna moltiplicato nel video.

  2. Costruisci il primo fotogramma

    Genera un'immagine fissa che contenga entrambi i riferimenti: la persona con il prodotto, inquadrata come deve aprirsi l'annuncio. $0.11 con Nano Banana Pro, e puoi rifarla finché non è giusta.

  3. Anima quel fotogramma

    Invia l'immagine come primo fotogramma e descrivi il movimento e la battuta che dice lei. Omni Flash costa $0.10 al secondo in 720p con audio; Veo 3.1 costa di più ed è quello da provare quando una sola ripresa deve contenere più azioni di fila.

Foto di riferimento del prodotto generata con l'AI: un flacone contagocce di siero in vetro ambrato, senza marchio, con tappo in ceramica color crema su lino chiaro
Riferimento 1 – il prodotto, un'unica angolazione pulita, luce uniforme. Nano Banana Pro, $0.11.
Ritratto di riferimento della creator generato con l'AI: una donna con un maglione in maglia color crema seduta in un soggiorno luminoso
Riferimento 2 – la persona. Stessa luce e stesso abbigliamento che vuoi nell'annuncio.
Primo fotogramma UGC generato con l'AI: la donna del ritratto di riferimento tiene il flacone di siero ambrato vicino alla spalla, inquadratura da fotocamera del telefono
Il primo fotogramma, generato da entrambi i riferimenti in una volta sola: è questa l'immagine che il modello video porta avanti.
03Riferimenti

Il risultato è buono quanto quello che gli dai

È la parte che tutti saltano, ed è quella che decide il risultato. Un modello a cui dai una foto sfocata di tre quarti di un flacone, scattata col telefono, non sbaglia in modo evidente: si inventa in silenzio il lato che non vede, e quel lato inventato è quello che finisce sullo schermo per otto secondi. Dagli una foto frontale, con luce uniforme e l'etichetta verso l'obiettivo, e lo stesso flacone sopravvive al passaggio del fotogramma, a quello del video e al montaggio successivo.

Per la persona vale lo stesso. La documentazione di Google su Veo lo dice senza giri di parole: scegli immagini nitide e ben illuminate che mostrino il soggetto dall'angolazione che vuoi, e mantieni identici obiettivo e luce tra un'inquadratura e l'altra. La mia regola dopo qualche decina di questi lavori: se il ritratto di riferimento e la scena che hai in mente non sono d'accordo su da dove arriva la luce, il volto finisce a metà strada e smette di sembrare la stessa persona.

Una sola buona angolazione del prodotto

Una foto frontale con luce uniforme vale più di cinque scatti al volo. Riflessi, mosso e una mano che copre metà etichetta vengono tutti ricostruiti di fantasia.

Stessa persona, stesso look

Taglio di capelli, abbigliamento e trucco devono essere uguali in tutte le foto di riferimento. Look diversi finiscono per fondersi in un volto che non somiglia a nessuno dei due.

Abbina la luce

Un ritratto col flash messo in una cucina con luce diurna morbida sembra un fotomontaggio. Scegli per il riferimento la luce che avrà davvero l'annuncio.

Occhio ai testi piccoli

Nano Banana Pro regge un testo breve sull'etichetta; un elenco fitto di ingredienti diventa una texture. Se la scritta conta, prevedi un primo piano con la confezione vera.

L'inquadratura viene dopo

I riferimenti non devono essere composti come un annuncio. La composizione è compito del primo fotogramma: è lì che discuti con il modello.

Non dargli un ritaglio

Un ritaglio da 300 pixel preso da un annuncio su un marketplace non lascia al modello quasi niente da conservare. Sempre gli originali a piena risoluzione.

04Primo fotogramma

Perché il primo fotogramma batte i riferimenti da soli

Funzionano entrambe le strade: puoi dare al modello video le tue foto di riferimento e lasciargli comporre la scena, oppure generare prima un'immagine fissa e animare quella. In pratica la seconda è migliore, e il motivo è banale: un modello video a cui chiedi di inventare la composizione la reinventa a ogni fotogramma, mentre uno a cui dai un'immagine deve solo portarla avanti. Su Gemini Omni Flash la differenza è così grande che per le inquadrature di prodotto ho smesso di usare solo i riferimenti.

Qui sotto due clip: stesso prompt, stessi riferimenti, sei secondi ciascuna, $0.60 l'una. L'unica differenza è se come primo fotogramma è entrata un'immagine approvata. Nient'altro è cambiato e nessuna delle due è stata rigenerata.

Solo riferimenti

Nessun primo fotogramma. Il tappo color crema sparisce entro il primo secondo, il flacone diventa un altro flacone scuro e alla fine è scivolato fuori dall'inquadratura. Il volto va bene, e la luce è forse migliore che nella ripresa accanto. È il prodotto che si rompe.

Da un primo fotogramma approvato

Stesso prompt, partendo da un'immagine che avevamo controllato prima. Tappo, vetro, inquadratura e distanza della camera reggono per tutti i sei secondi, perché il modello continuava un fotogramma invece di indovinarlo.

A essere onesti: la strada con i soli riferimenti non è rotta. Il volto ha retto bene, e per una scena senza prodotto in mano spesso basta. Anzi, in quella ripresa la luce è persino più bella: più morbida sul viso, meno contrasto dalla finestra, perché il modello componeva una stanza che piaceva a lui invece di continuare la nostra. Una precisazione che cambia la lettura: la nostra creator è generata, non è la foto di una persona reale, quindi il modello aveva margine per rifarle la luce. Un ritratto vero blocca luce e pelle molto di più, e la strada con i soli riferimenti ha meno libertà di abbellirlo. Quello che compri qui è controllo, non qualità. Su Veo 3.1 la scelta è già fatta: l'API di Google accetta o un primo fotogramma o fino a tre immagini di riferimento, mai entrambi nella stessa richiesta, e le immagini di riferimento richiedono la durata di otto secondi.

05Scelta del modello

Abbina l'inquadratura al modello

Omni Flash è bravissimo nel formato in cui l'UGC vive davvero: una persona che parla all'obiettivo. Interviste, pezzi in stile podcast, un founder che spiega un prodotto, qualcuno che tiene in mano un barattolo e lo descrive. E genera la bocca, i micromovimenti e il suono dell'ambiente in un solo passaggio, il che lo rende il modo più economico per ottenere una voce sincronizzata da un modello video. È anche il più recente dei due, e Google lo vende sulla fisica: l'annuncio parla di una comprensione intuitiva di gravità, energia cinetica e fluidodinamica, e la model card elenca la simulazione della fisica reale tra le capacità e i movimenti complessi tra i punti deboli noti. Nella pratica sono vere tutte e due le cose. Gli oggetti cadono, i liquidi si versano, il peso si percepisce correttamente – finché l'inquadratura non chiede una catena di azioni precise con un oggetto.

Quindi la divisione non è tra teste parlanti e movimento, ma tra quanta coreografia deve reggere una singola ripresa. Il test qui sotto è l'estremo difficile di questa scala, non un verdetto su nessuno dei due modelli: stesso primo fotogramma, stesso prompt, un modello per clip – togliere il tappo al flacone, premere la pipetta, due gocce nel palmo aperto, tutto in otto secondi.

Gemini Omni Flash · 8 s · $0.80

L'apertura è convincente, la pipetta esce pulita e le gocce cadono davvero nel palmo: la parte dei liquidi va bene. L'oggetto no: il flacone sparisce dalla mano in basso appena si apre il palmo, ricompare per la richiusura e la clip finisce con lei a mani vuote. Una delle quattro azioni è saltata.

Veo 3.1 Fast · 8 s con audio · $1.00

Prompt identico e primo fotogramma identico, e nota che questo è Veo 3.1 Fast – la versione economica, non il modello completo. Tiene il flacone per tutte e quattro le azioni. C'è mezzo secondo in cui una terza mano attraversa l'inquadratura come un fantasma, quindi non è nemmeno privo di artefatti; semplicemente ha tenuto insieme la sequenza.

Parlare in camera → Omni Flash

Labiale, suono dell'ambiente e parlato arrivano insieme, $0.10 al secondo. Per una recensione, una testimonianza o un dialogo tra due persone è la scelta ovvia.

Catene di azioni lunghe → prova anche Veo

Un movimento Omni lo gestisce; quattro di fila è il punto in cui le riprese iniziano a perdere azioni. Nel nostro confronto abbiamo usato Veo 3.1 Fast a $1.00 per otto secondi con audio, Veo 3.1 completo costa $3.00: genera entrambe le versioni e tieni quella che funziona.

L'abbigliamento cambia il verdetto

Il filtro di sicurezza di Omni è decisamente più severo sui vestiti: una fitness creator in reggiseno sportivo viene rifiutata lì molto più spesso che su Veo 3.1, a parità di prompt e riferimento. Pianifica l'abbigliamento o pianifica il modello.

Durata e risoluzione

Omni Flash fa da 3 a 10 secondi per clip, esattamente quanti ne paghi: 720p nella prima generazione del modello, da 360p a 4K su Omni 1.1, che può anche estendere una scena fino a 40 secondi. Veo 3.1 fa 4, 6 o 8 secondi fino al 4K nativo, e le sue clip si possono estendere oltre il primo taglio.

Audio: sempre o a scelta

Ogni clip di Omni ha l'audio, che tu l'abbia chiesto o no. Su Veo l'audio è un interruttore: i video senza audio costano meno, e conta quando la voce arriva comunque da un'altra parte.

I rifiuti non costano niente

Una generazione bloccata viene rimborsata automaticamente su entrambi i modelli. La parte costosa di un rifiuto sono i quattro minuti, non il dollaro.

06Voce e montaggio

Quando la voce ha bisogno di un secondo ciak

Omni Flash scrive il parlato nello stesso passaggio dell'immagine, e per l'inglese colloquiale di solito va bene. Il punto debole sono i nomi di marca: nomi di prodotto inventati, parole straniere, sigle di modelli, tutto ciò che anche un madrelingua dovrebbe farsi spiegare come si pronuncia. La versione più grande del problema sono le lingue diverse dall'inglese, e ce l'hanno tutti i modelli video: i recensori russofoni che hanno provato Seedance 2.5 descrivono una battuta che parte accettabile e si sfalda strada facendo – vocali atone ridotte male, accento sulla sillaba sbagliata e, alla fine di una scena da quindici secondi, una pronuncia più vicina a un ibrido slavo che al russo, perché russo, ucraino e bielorusso sono abbastanza vicini da farli mescolare al modello. Alcune parole escono pulite, la successiva tradisce l'intera ripresa. Se il tuo copione non è in inglese, ascoltalo tutto prima di approvarlo.

La soluzione è smettere di chiedere la voce al modello video e generarla a parte. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) funziona con lo stesso saldo tramite il nostro server MCP: $0.01 ogni 200 caratteri di copione, 30 voci, un solo speaker o un dialogo tra due persone, in uscita WAV a 24 kHz. Le indicazioni si danno in inglese semplice: personaggio, ritmo, accento e la trascrizione fonetica di ogni parola che deve essere pronunciata bene. Poi metti la traccia sopra la clip in qualsiasi editor. Se la battuta riscritta dura più o meno quanto la ripresa originale, la bocca resta grosso modo in sincrono; dove non lo è, stacca sul prodotto.

Voce fuori campo generata · $0.01

Un copione di 200 caratteri letto da Gemini 3.1 Flash TTS con una sola riga di indicazioni: ragazza giovane e simpatica, recensione col telefono nella sua cucina, ritmo un po' veloce, e il nome inventato del marchio pronunciato alla francese. Tredici secondi di audio, un centesimo, nessun modello video coinvolto.

Anche per montare l'annuncio non serve un editor. ffmpeg unisce le riprese una dopo l'altra, taglia il mezzo secondo in cui una mano fa qualcosa di strano, sostituisce l'audio generato con la tua traccia TTS, aggiunge una dissolvenza incrociata ed esporta la versione 9:16 – tutto da riga di comando, gratis, su qualsiasi computer. La sintassi è notoriamente ostica, ed è proprio per questo che si abbina bene a un modello: descrivi a Claude o a un altro LLM il montaggio che vuoi, ricevi il comando, lo esegui. Per uno spot UGC da tre clip questa è tutta la post-produzione, ed è il motivo per cui le cifre di questa pagina restano al costo di generazione invece di aggiungere un abbonamento sopra.

07Prezzi

Quanto costa un annuncio UGC con l'AI nel 2026?

Prezzi unitari dei modelli usati per creare un video UGC con l'AI
ModelloPrezzoUnitàAudio
Nano Banana Proriferimenti e primo fotogramma$0.11immagine 1K–2K—
Nano Banana 2bozze e varianti$0.03–$0.13immagine da 512px a 4K—
Gemini Omni Flash$0.10 al secondo$0.30–$1.003–10 s, 720psempre attivo
Veo 3.1 Fastcon audio$0.50–$1.004–8 s, 720p/1080pa scelta
Veo 3.1 Liteil video più economico$0.10–$0.364–8 s, 720pa scelta
Gemini 3.1 Flash TTSsolo via MCP$0.01ogni 200 caratterisolo voce

I prezzi di Veo sono per 720p e 1080p; il 4K costa di più. Omni Flash fattura $0.10 per ogni secondo generato, quindi la durata della clip è il prezzo. Le tabelle complete sono nella pagina dei prezzi.

Le ricariche si fanno in crypto da $1, oppure con carta, PayPal e SEPA da $20. Sui depositi da $50 in su si aggiunge il 5%, da $100 in su il 10%, e un codice promo attivo aggiunge un altro 10% dello stesso deposito: $100 con un codice diventano $120 sul saldo. A $1.13 per una clip da otto secondi sono circa cento riprese, cioè venticinque-trenta annunci finiti, contando i tentativi ripetuti e i montaggi da più clip. Il bonus sul volume +5% / +10% vale solo per le ricariche in crypto.

Tutti i modelli e le risoluzioni sono nella pagina completa dei prezzi, e la pagina di Gemini Omni Flash spiega cosa quel modello sa fare e cosa no.

08Approfondisci

Guide dal blog

09FAQ

Le domande che ci fanno davvero

Serve una persona vera per fare un video UGC con l'AI?

No. Anche la creator può essere generata: ogni persona che vedi in questa pagina è uscita da un prompt testuale e non è mai esistita. Se usi il volto di una persona reale, ti serve il suo consenso: le regole sull'immagine valgono per il video generato come per un servizio fotografico, e le policy delle piattaforme sui volti sintetici sono più severe di quanto si pensi.

Per il prossimo annuncio tornerà lo stesso volto?

Sì, se tieni le stesse foto di riferimento e riusi lo stesso primo fotogramma. Rigenerare il fotogramma dagli stessi riferimenti ti porta vicino, ma non identico al pixel: l'abitudine più sicura è conservare ogni primo fotogramma approvato e animarlo di nuovo invece di ricostruirlo.

TikTok o Meta richiedono un'etichetta AI su un annuncio UGC generato?

Su TikTok sì: la sua policy pubblicitaria sui media modificati e sui contenuti generati con l'AI richiede l'etichetta AIGC di Ads Manager oppure un tuo disclaimer visibile nella creatività. Meta applica automaticamente le proprie etichette AI agli annunci che riconosce come generati. Entrambe le policy sono cambiate nel corso del 2026, quindi controlla la versione attuale prima di una campagna importante invece di fidarti di un post di blog, compreso questo.

Quale modello usare per un annuncio UGC con una persona che parla in camera?

Inizia con Gemini Omni Flash a $0.10 al secondo, audio incluso: per una persona che parla in camera è il più economico e il meno capriccioso, ed è il modello più recente, con una fisica che Google pubblicizza esplicitamente. Non leggerlo come «Omni non sa fare il movimento»: versa, lascia cadere, porta pesi. Quello che perde sono le lunghe catene di manipolazioni precise in una sola ripresa: nel nostro test del contagocce con quattro azioni ha perso il flacone, mentre Veo 3.1 Fast lo ha tenuto. Quindi per un hook o una testimonianza, Omni. Per un'inquadratura costruita sulla coreografia, generala su entrambi e tieni la ripresa che funziona; quella venuta male costa centesimi.

Posso usare un video girato da me?

Sì, fino a 10 secondi. Carica la tua clip e Omni Flash la modifica in modalità video-to-video – cambia la luce, lo sfondo, cosa tiene in mano la persona – mantenendo la ripresa. Le sorgenti più lunghe vengono tagliate al limite del modello prima della generazione.

Cosa succede se una generazione viene rifiutata?

Il saldo viene rimborsato automaticamente, sia su Omni Flash sia su Veo. I rifiuti si concentrano su abbigliamento, minori e persone reali riconoscibili; la regola sull'abbigliamento della sezione sulla scelta del modello qui sopra è quella che ti fa risparmiare più tentativi.

Leggi la risposta completa
Posso usarlo da Claude, Cursor o da un mio script?

Sì: gli stessi modelli sono disponibili tramite il nostro server MCP, compreso il modello vocale. Immagini di riferimento e primi fotogrammi si possono passare come job ID, URL pubblici o base64 inline, quindi un intero lotto di UGC si può automatizzare da un agente.

Quanto costa un annuncio intero da 30 secondi, non una sola clip?

Conta le riprese, non le clip. Uno spot da 20–30 secondi di solito sono tre o quattro clip montate insieme, e ognuna richiede un paio di tentativi prima di essere usabile: una battuta piatta, una mano che fa qualcosa di strano, un rifiuto. A $0.80 per otto secondi di Omni Flash, un annuncio finito costa pochi dollari; girare i tagli pieni di movimento su Veo 3.1 completo a $3.00 l'uno lo porta sulle decine di dollari. Il montaggio non aggiunge nulla: ffmpeg unisce le riprese, le taglia e ci mette sopra la voce fuori campo da riga di comando, e un LLM può scriverti quei comandi.

Due foto e un paio di dollari

Registrati gratis con $0.20 sul saldo, ricarica in crypto da $1 o con carta da $20. Primo fotogramma in circa un minuto, prima clip in cinque.