Torna al blog
BananaBanana Teamtutorialvideoveoprompts

Guida ai prompt per Veo 3.1: prompt che funzionano davvero

Guida pratica ai prompt per Veo 3.1: la struttura in sette parti, i termini per i movimenti di camera, l'audio e clip reali prima/dopo da $0.10 a video.

Guida ai prompt per Veo 3.1: prompt che funzionano davvero

Un prompt per Veo 3.1 è una breve descrizione della scena che dice al modello video di Google cosa riprendere e come riprenderlo. I modelli trattano il tuo testo come il brief di un regista: ne ricavano soggetto, azione, stile, lavoro di camera, composizione, scelta dell'obiettivo e luce, poi riempiono tutto quello che non hai specificato con le loro ipotesi. Scrivere buoni prompt significa soprattutto lasciare meno cose da indovinare.

La versione rapida, se leggi un solo paragrafo: descrivi un soggetto che compie un'azione, poi aggiungi la camera. Un modello che funziona è «[shot type] of [subject] [doing action] in [setting], [camera movement], [lens or focus], [lighting and mood]». Questa sola abitudine, aggiungere camera e luce, colma gran parte della distanza tra una clip noiosa e una utilizzabile. Tutto il resto qui sotto sono dettagli e prove.

Uso Veo 3.1 ogni giorno su BananaBanana da quando abbiamo lanciato la generazione video, e la differenza tra un prompt pigro e uno strutturato qui è più grande che in qualsiasi modello di immagini che uso. Le immagini perdonano la vaghezza. Il video la punisce due volte, una nell'inquadratura e una nel movimento.

Cosa rende buono un prompt per Veo 3.1?

Secondo la documentazione di Veo di Google, un prompt solido copre sette elementi: soggetto, azione, stile, posizione della camera, composizione, messa a fuoco ed effetti dell'obiettivo, e atmosfera. Non ti servono tutti e sette ogni volta. Ti serve però sapere quali stai saltando, perché il resto il modello lo improvviserà.

ElementoCosa controllaFrase di esempio
SoggettoChi o cosa è in scena"an elderly potter with clay-stained hands"
AzioneCosa succede durante la clip"shaping a bowl on a spinning wheel"
StileEstetica generale"cinematic documentary style"
CameraPosizione e movimento"slow dolly-in at eye level"
ComposizioneInquadratura"close-up"
Obiettivo / fuocoCarattere ottico"shallow depth of field"
AtmosferaLuce e tono cromatico"warm window light, dust in the air"

L'ordine conta meno di quanto si pensi. Di solito metto in testa soggetto e azione, perché è lì che il modello si ancora, poi accodo camera e luce alla fine. Conta di più la precisione: «a horse» lascia al modello un testa o croce tra quaranta razze, mentre «a chestnut Arabian horse» no.

Un'avvertenza onesta. Veo 3.1 ha, lato Google, un riscrittore di prompt che espande i prompt brevi prima della generazione, e non puoi vedere per intero cosa ha aggiunto. I prompt brevi a volte tornano con dettagli che non hai mai chiesto. Scrivere i dettagli tu stesso è il modo per togliere quella decisione al riscrittore.

Anatomia di un prompt per Veo 3.1 scomposta in sette ingredienti etichettati: soggetto, azione, stile, camera, composizione, obiettivo e atmosfera

Come controlli la camera in Veo 3.1?

Il linguaggio di camera è la parte di un prompt per Veo 3.1 che rende di più, ed è quella che la maggior parte delle persone tralascia. Il modello capisce il lessico cinematografico standard, quindi usalo alla lettera.

Per la posizione: aerial view, eye-level, low-angle shot, top-down shot, over-the-shoulder. Per il movimento: dolly in o out, tracking shot, pan left o right, tilt up, slow zoom, POV shot. Per l'inquadratura: extreme close-up, close-up, medium shot, wide shot, establishing shot. Per l'ottica: shallow focus, deep focus, macro lens, wide-angle lens, soft focus.

Due regole pratiche dalle nostre generazioni. Primo, un solo movimento di camera per clip. Un prompt che chiede «a pan that becomes a dolly-in and then tilts up» di solito ti dà uno dei tre, scelto a caso, oppure un compromesso pastoso. Le clip durano da 4 a 8 secondi; c'è spazio per un movimento fatto bene. Secondo, quando sono in conflitto, i verbi di movimento battono i sostantivi di camera. Se il tuo soggetto «sprints» ma la camera è «static wide shot», aspettati che il modello dia priorità allo scatto e faccia comunque scivolare la camera. Mettili d'accordo.

Con la luce funziona allo stesso modo: chiamala come farebbe un direttore della fotografia. «Golden hour backlight», «cool blue moonlight», «harsh overhead fluorescent», «flickering torchlight» vengono letti in modo affidabile. Parole d'atmosfera vaghe come «beautiful lighting» per il modello non vogliono dire niente.

Lessico della camera cinematografica per i prompt di Veo 3.1 illustrato come uno storyboard di posizioni dolly, pan, low-angle e aerial attorno a un unico soggetto

Prima e dopo: la stessa idea, due prompt

Le chiacchiere stanno a zero, quindi ecco la stessa scena generata due volte con Veo 3.1 Fast su BananaBanana, senza audio, 6 secondi, 720p. Costo totale delle due demo: circa $1.

Prima il prompt che scrivono tutti il primo giorno. Solo «A horse running on a beach»:

Va bene. Nota che il tramonto il modello l'ha scelto da solo; è il riscrittore di prompt che prende decisioni al posto tuo. L'inquadratura resta un campo lungo distante, la camera non si impegna mai, e niente di tutto questo l'hai scelto tu. Ora la stessa idea riscritta con la struttura in sette elementi: «A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun»:

Stesso soggetto, stesso modello, stesso prezzo. La seconda clip ha una camera intenzionale, una direzione della luce coerente e gli spruzzi che catturano il controluce, e tutto questo erano parole nel prompt, non fortuna.

Una lezione da questa demo mi è costata due rigenerazioni: una versione precedente di quel prompt finiva con «cinematic 35mm look», e Veo ha preso il riferimento alla pellicola alla lettera, rendendo delle bande nere letterbox incise nell'inquadratura. Due volte. Parole di stile come «35mm», «anamorphic» o «cinematic film look» possono tirarsi dietro tutta la presentazione widescreen, bande comprese. Se vuoi l'atmosfera senza le bande, nomina direttamente la luce e il comportamento dell'obiettivo e salta il lessico da pellicola.

Se parti da una foto invece che da un testo, i meccanismi cambiano un po' (la tua immagine blocca il primo fotogramma e il prompt descrive solo il movimento). Abbiamo trattato quel flusso a parte nella guida da immagine a video.

Come si scrive il prompt per l'audio in Veo 3.1?

Veo 3.1 genera audio nativo e, secondo la documentazione di Google, nell'API è sempre attivo: dialoghi, effetti sonori e rumore ambientale, sincronizzati con l'immagine. Ognuno si controlla con una convenzione testuale diversa.

  • I dialoghi vanno tra virgolette, legati a chi parla: A man murmurs, "This must be it."
  • Gli effetti sonori si scrivono come eventi: "tires screeching", "waves crashing against rocks".
  • L'ambiente si descrive come atmosfera: "faint hum of fluorescent lights", "distant seagulls".

Il prompt di esempio di Google mostra lo schema: «A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'» La battuta tra virgolette produce parlato con lip-sync, e «flickering» più «torchlight» danno il tono all'ambiente sonoro della stanza.

Tieni corte le battute. Nei nostri test, oltre una dozzina di parole circa per battuta si rischia che la coda venga tagliata o accelerata dentro una clip da 8 secondi. E scrivi dialoghi per uno o due personaggi, non per una folla; le voci sovrapposte vengono fuori impastate.

Su BananaBanana l'audio è un interruttore, e ha un prezzo a parte perché Google lo fattura a parte: una clip Veo 3.1 Fast da 8 secondi costa $0.70 senza audio o $1.00 con audio, a 720p o 1080p. Le demo qui sopra sono senza audio di proposito, che è la scelta di budget più onesta quando una clip è comunque destinata all'autoplay muto. (Se vuoi l'audio su ogni clip di default, il modello Omni Flash fa l'opposto: audio sempre attivo, fatturato $0.10 al secondo.)

Onde sonore, un fumetto di dialogo e simboli di rumore ambientale che confluiscono in un fotogramma, a mostrare come sono strutturati i prompt audio di Veo 3.1

Prompt negativi, durate e quanto costa Veo 3.1

La questione dei prompt negativi è davvero confusa, quindi ecco cosa vediamo dal lato API. La documentazione dell'API Gemini per Veo 3.1 non documenta un parametro di prompt negativo. L'API di Veo di Google accetta invece negativePrompt, e nelle nostre generazioni orienta il risultato in modo misurabile. Quindi il campo esiste nel nostro generatore e funziona; solo, non aspettarti che si comporti come un filtro rigido.

Per scrivere i negativi c'è una regola controintuitiva dalle linee guida sui prompt di Google: non scrivere mai «no» o «don't» nel campo negativo. Elenca le cose indesiderate come semplici sostantivi. «Cartoon, low quality, text overlay, watermark» funziona; «no cartoons» può ritorcersi contro, perché la parola «cartoon» resta comunque in gioco.

Durate e formati, secondo la documentazione di Google e la nostra configurazione di produzione: le clip durano 4, 6, 7 o 8 secondi in 16:9 o 9:16, con uscita a 720p, 1080p e 4K. Le immagini di riferimento richiedono la durata piena di 8 secondi; 1080p e 4K si generano con tutte e quattro le durate, e lo stesso vale per l'estensione. L'estensione è la funzione sottovalutata di Veo: ogni richiesta aggiunge 7 secondi, fino a 20 volte, ed è così che superi i due minuti partendo da una sola catena di prompt.

Prezzi attuali di BananaBanana per una clip da 8 secondi a 720p:

ModelloSenza audioCon audio
Veo 3.1 Lite$0.20$0.36
Veo 3.1 Fast$0.70$1.00
Veo 3.1$1.40$3.00

Una clip Lite da 4 secondi senza audio costa $0.10, e il saldo di benvenuto gratuito che riceve ogni nuovo account ne copre due. Quindi il tuo primo video Veo non costa niente e, onestamente, Lite a 720p basta e avanza per imparare la struttura dei prompt prima di spendere soldi veri su Fast o sul modello completo. La griglia completa dei prezzi è nella pagina dei prezzi.

Il mio flusso predefinito: abbozzo il prompt su Lite, itero finché movimento e inquadratura reggono, poi rilancio il prompt finale una sola volta su Fast o Veo 3.1. La qualità del prompt si trasferisce tra i livelli quasi alla perfezione; quello che paghi è la qualità del render.

FAQ

Qual è la struttura migliore per un prompt di Veo 3.1?

Soggetto, azione, stile, camera, composizione, obiettivo, atmosfera, più o meno in quest'ordine. Un modello compatto: «[shot type] of [subject] [action] in [setting], [camera move], [lens], [lighting]». I sostantivi precisi battono gli aggettivi, e un movimento di camera per clip batte tre.

Veo 3.1 supporta i prompt negativi?

Sull'API di Veo vera e propria sì: il parametro negativePrompt viene accettato e funziona, anche se la documentazione dell'API Gemini non lo elenca per Veo 3.1. Scrivi i negativi come semplici sostantivi («cartoon, blurry, watermark»), mai come frasi del tipo «no X».

Come faccio a far parlare Veo 3.1?

Metti la battuta tra virgolette e legala a chi parla dentro il prompt: A woman whispers, "We're not alone." Veo gestisce bene il lip-sync delle battute brevi; tieni il dialogo sotto una dozzina di parole circa per clip.

Quanto può durare un video di Veo 3.1?

Le clip base durano da 4 a 8 secondi. Con l'estensione (7 secondi in più per richiesta, fino a 20 estensioni secondo la documentazione di Google) una singola catena può arrivare a 148 secondi a 720p.

Quanto costa un video di Veo 3.1?

Su BananaBanana, da $0.10 (Veo 3.1 Lite da 4 secondi senza audio a 720p) a $4.40 (Veo 3.1 da 8 secondi in 4K con audio). La scelta intermedia predefinita, una clip Fast da 8 secondi senza audio, costa $0.70.

tutorialvideoveoprompts