Personaggi coerenti con l’AI: guida pratica
Lo stesso personaggio AI in immagini e video: limiti delle immagini di riferimento di Nano Banana 2 e Pro, scheda personaggio, storyboard, Veo 3.1.

La generazione di immagini con personaggi coerenti è un insieme di tecniche che spinge un modello AI a disegnare lo stesso personaggio, con lo stesso viso, gli stessi capelli e gli stessi vestiti, in tante immagini separate, invece di inventarsi una persona nuova a ogni richiesta. È la differenza tra «una donna dai capelli rossi in un caffè» che a ogni tentativo ti restituisce una sconosciuta e lo stesso prompt che ti restituisce la tua donna dai capelli rossi, quella della prima vignetta del fumetto, della campagna pubblicitaria o dello storyboard.
In breve: i metodi che funzionano sono due, e si sommano. Primo, carica immagini di riferimento del personaggio: è lo stesso meccanismo che sulla piattaforma alimenta i personaggi coerenti. Nano Banana 2 accetta fino a 4 riferimenti del personaggio, Nano Banana Pro fino a 5, e Veo 3.1 ne porta fino a 3 nel video. Secondo, scrivi una scheda personaggio, cioè una descrizione fissa ed esaustiva da incollare in ogni generazione. Su BananaBanana un personaggio coerente costa da $0.06 per immagine 1K con Nano Banana 2, e ogni demo di questo articolo è stata generata sulla piattaforma: i prompt che trovi qui si possono copiare e incollare così come sono.
Ti dico subito anche dove le cose si rompono. La coerenza nei modelli attuali è buona, non perfetta. Vedrai dove cede.
Perché lo stesso personaggio viene diverso ogni volta?
I modelli di immagini non hanno memoria tra una richiesta e l’altra. Ogni generazione parte dal rumore, e il prompt è l’unico ponte. Se il prompt dice «una giovane donna con i capelli rossi», il modello pesca una tra i milioni di giovani donne con i capelli rossi che è in grado di disegnare in modo plausibile. Lancialo cinque volte e avrai cinque persone. Magari con la stessa atmosfera. Non con lo stesso viso.
Si chiama character drift, deriva del personaggio, e peggiora con i prompt vaghi. «La stessa donna di prima» non serve a nulla, perché un «prima» non esiste. Il modello non ha mai visto la tua immagine precedente, a meno che tu non la alleghi esplicitamente.
La deriva si insinua anche dentro un unico flusso di lavoro. Cambi l’inquadratura e la linea della mascella si sposta. Cambi il vestito e all’improvviso le lentiggini spariscono. Per la mia esperienza, i tratti più fragili sono proprio quelli che usiamo noi per riconoscere le persone: forma degli occhi, naso, attaccatura dei capelli. Sfondi e vestiti reggono bene. I visi vagano.
Quindi tutto il gioco sta nel ridare l’identità al modello a ogni singola richiesta, come pixel (immagini di riferimento) o come testo (una descrizione bloccata). Meglio ancora, in entrambi i modi.

Quante immagini di riferimento accetta ogni modello?
Le immagini di riferimento sono il più forte dei due metodi: carichi le foto del personaggio e il modello le tratta come verità di base. Secondo la documentazione di Google sulle immagini nella Gemini API, i limiti cambiano parecchio da un modello all’altro, e conviene conoscerli prima di sceglierne uno.
| Modello | Riferimenti personaggio | Riferimenti oggetto | Riferimenti stile | Prezzo per immagine 1K |
|---|---|---|---|---|
| Nano Banana 2 Lite | nessuno | fino a 14 | nessuno | $0.03 |
| Nano Banana 2 | fino a 4 | fino a 10 | fino a 3 | $0.06 |
| Nano Banana Pro | fino a 5 | fino a 6 | nessuno | $0.11 |
La sorpresa della tabella è Lite. È quello che accetta più immagini in assoluto (14), ma la documentazione è esplicita: sono solo riferimenti di oggetti, nessun supporto alla coerenza del personaggio. L’abbiamo imparato sul campo: Lite accetta volentieri un viso in input e poi lo tratta come la foto di un prodotto, riproduce la giacca e perde la persona. Se il tuo lavoro ruota attorno a un personaggio, Lite è fuori, qualunque cosa dica il prezzo. (Per tutto il resto è un modello economico davvero valido: abbiamo scritto una guida a parte su quando Lite basta.)
Tra gli altri due: io partirei da Nano Banana 2 a $0.06. Il quinto slot per il personaggio di Pro e il suo blocco dell’identità più forte contano nelle scene con più personaggi e negli asset finali, e a $0.11 per immagine il sovrapprezzo è poca cosa quando l’immagine va davvero pubblicata da qualche parte.
L’angolazione delle foto caricate conta più del numero. Tre riferimenti dalla stessa angolazione insegnano al modello un’angolazione. Uno frontale, uno di profilo e uno di tre quarti gli insegnano una testa.

Cos’è il metodo della scheda personaggio?
Una scheda personaggio è un blocco di testo fisso che descrive il personaggio in modo esaustivo e che incolli parola per parola in ogni prompt. È il ripiego solo testuale quando non hai ancora foto di riferimento, ed è il modo in cui quelle foto di riferimento le crei la prima volta. È anche il metodo che funziona dagli agenti AI: se generi immagini in Claude Code tramite il nostro server MCP, la scheda personaggio viaggia dentro il prompt, senza bisogno di caricare nulla.
La regola: descrivi il personaggio come lo vorrebbe un disegnatore dell’identikit. Età, corporatura, pelle, colore e taglio dei capelli, colore degli occhi, segni particolari, uno o due accessori di riferimento. Gli aggettivi vaghi sbandano; i sostantivi concreti tengono.
Ecco il blocco esatto usato per le demo qui sotto:
a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt
Entrambe le immagini qui sotto sono state generate con Nano Banana Pro a partire da quello stesso blocco. È cambiato solo il testo della scena attorno. Nessuna immagine di riferimento allegata: è coerenza ancorata al solo testo.


È la stessa persona? Quasi. Il viso regge bene, giacca e orecchino sono bloccati, le lentiggini sono sopravvissute a entrambe le scene. Se guardi pixel per pixel, noterai che la lunghezza dei capelli varia leggermente. Questo è il limite onesto della coerenza solo testuale, ed è per questo che il flusso professionale combina i metodi: generi la migliore immagine del personaggio dalla scheda, poi ridai quella immagine al modello come riferimento del personaggio per tutto il resto. Il testo fissa l’identità, i pixel la fanno rispettare.
Due consigli più piccoli, da quando lo usiamo in produzione. Gli accessori di riferimento (l’orecchino, la giacca) fanno un sacco di lavoro di riconoscimento con pochissimi token: danne uno a ogni personaggio. E tieni la scheda sotto le 60 parole circa, perché oltre quella soglia la descrizione della scena comincia a contendersi l’attenzione del modello con quella del personaggio.
Scene con più personaggi e storyboard AI
Due personaggi coerenti nella stessa inquadratura: è qui che i trucchetti economici smettono di funzionare. Una scheda testuale unica per entrambi tende a contaminarsi: il personaggio A prende in prestito i capelli di B, B eredita la giacca di A. Probabilmente si risolve con abbastanza tentativi, ma i tentativi costano.
Le immagini di riferimento lo risolvono come si deve. Secondo la documentazione di Google, Nano Banana 2 accetta fino a 4 riferimenti del personaggio e Nano Banana Pro fino a 5, e quegli slot si possono dividere tra persone diverse. Carica due o tre foto di ciascun personaggio, poi scrivi la scena chiamandoli per ruolo («the red-haired woman hands a coffee to the gray-bearded man»). L’identità resta attaccata alla persona giusta in modo molto più affidabile, anche se le mani che si passano oggetti tra due persone, nel 2026, restano una lotteria.
Lo storyboard è il passo successivo naturale, e ci sono due modi per farlo. Fotogramma per fotogramma: una generazione per vignetta, con i riferimenti del personaggio allegati a ciascuna, $0.06 a vignetta su Nano Banana 2, quindi uno storyboard da sei vignette costa $0.36. Oppure in un’unica immagine: chiedi a Nano Banana Pro un layout a più vignette in una sola generazione. Quello qui sotto è stato fatto così, una sola richiesta da $0.11, stessa scheda personaggio di prima:

La coerenza dentro un’unica immagine è praticamente gratis, perché il modello disegna tutte le vignette in un solo passaggio e vede il proprio lavoro. Il prezzo da pagare è la risoluzione: ogni vignetta è un quarto del fotogramma. Per pitch deck e animatic va benissimo. Per vignette da pubblicare singolarmente, genera fotogramma per fotogramma e spendi i $0.36.
Puoi portare un personaggio nel video?
Sì, ed è qui che la pipeline si fa divertente. Veo 3.1 supporta quelle che la documentazione di Veo di Google chiama asset reference images: fino a 3 foto di una persona, di un personaggio o di un prodotto, e il modello conserva l’aspetto di quel soggetto nella clip generata. Nel nostro generatore è la sezione Riferimento soggetto. Gemini Omni Flash, che esce sempre con l’audio, è più generoso: fino a 10 immagini di riferimento per clip, combinabili con un fotogramma iniziale ($0.10 al secondo, recensione completa di Omni qui).
La scheda personaggio si guadagna il pane anche nei prompt video. La clip qui sotto è Veo 3.1 Fast, solo testo, stesso blocco descrittivo delle immagini sopra, più il linguaggio di movimento e di camera:
Il prompt: la scheda personaggio, poi «walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field». Sei secondi, 720p senza audio, $0.52. È riconoscibilmente lo stesso personaggio delle immagini fisse, e per un passaggio solo testuale tra due modelli diversi è sinceramente meglio di quanto mi aspettassi.
Un’avvertenza dai nostri log di generazione: i riferimenti degli asset a volte appiattiscono le espressioni. Il viso corrisponde ma risulta un po’ cereo, soprattutto nelle inquadrature larghe, dove occupa pochi pixel. Nei primi piani va meglio. Se una clip torna con una protagonista dallo sguardo spento, stringi l’inquadratura invece di rigenerare la stessa ripresa.
Ecco quindi lo stack completo: scheda personaggio → immagini principali su Nano Banana Pro → quelle immagini come riferimenti del personaggio per ogni immagine fissa e come riferimenti degli asset per il video. Un’identità, una pipeline, immagini da $0.06 e clip da $0.10 sulla pagina dei prezzi.
FAQ
Qual è il miglior modello AI per la coerenza del personaggio?
Nano Banana Pro, numeri alla mano: fino a 5 immagini di riferimento del personaggio e il blocco dell’identità più forte della famiglia, a $0.11 per immagine 1K o 2K. Nano Banana 2 è la scelta più conveniente a $0.06, con 4 slot per il personaggio più i riferimenti di stile, che Pro non ha. Evita Nano Banana 2 Lite per questo uso: non supporta affatto i riferimenti del personaggio.
Come mantengo lo stesso viso nelle immagini AI senza foto di riferimento?
Scrivi una scheda personaggio: una descrizione fissa di 40–60 parole che copra età, capelli, occhi, pelle, segni particolari e un accessorio di riferimento, e incollala identica in ogni prompt. Poi usa il tuo risultato migliore come immagine di riferimento da lì in avanti. Il solo testo ti porta più o meno lì; testo più immagini di riferimento ti ci tiene.
Posso usare la foto di una persona reale come riferimento del personaggio?
Tecnicamente l’API accetta qualsiasi foto. Sul piano legale ed etico, usa solo foto di cui hai i diritti e con il consenso della persona. Generare persone reali riconoscibili senza consenso viola i termini della maggior parte delle piattaforme, compresa la nostra.
Quante immagini di riferimento dovrei caricare?
Poche immagini varie battono tante immagini simili. Tre foto che coprono frontale, profilo e tre quarti di solito rendono più di cinque selfie quasi identici. I limiti massimi: 4 immagini del personaggio su Nano Banana 2, 5 su Nano Banana Pro, 3 nei video Veo 3.1.
La coerenza del personaggio funziona anche con personaggi non umani?
Quasi sempre sì. Mascotte, robot e animali stilizzati spesso reggono meglio degli umani, perché la loro identità sta in forme e colori decisi più che in una geometria facciale sottile. I metodi sono gli stessi: tratti distintivi fissi nella scheda, immagini di riferimento appena hai un design di riferimento.