Guide de Prompt Veo 3.1 : Rédiger des Prompts qui Fonctionnent Vraiment
Un guide pratique pour les prompts Veo 3.1 : la structure en sept parties, les mouvements de caméra, le son et des exemples avant/après dès $0.10.

Un prompt pour Veo 3.1 est une courte description de scène qui indique au modèle vidéo de Google quoi filmer et comment le filmer. Les modèles traitent votre texte comme le cahier des charges d'un réalisateur : ils y décryptent le sujet, l'action, le style, les mouvements de caméra, la composition, le choix de l'objectif et l'éclairage, puis comblent tout ce que vous n'avez pas spécifié avec leurs propres suppositions. Un bon prompt consiste avant tout à laisser le moins de place possible au hasard.
Pour faire court, si vous ne deviez lire qu'un seul paragraphe : décrivez un sujet effectuant une action, puis ajoutez les indications de caméra. Un modèle efficace est le suivant : "[type de plan] de [sujet] [faisant une action] dans [décor], [mouvement de caméra], [objectif ou mise au point], [éclairage et ambiance]". Cette simple habitude d'ajouter la caméra et la lumière comble l'écart entre un clip fade et une séquence exploitable. Tout ce qui suit détaille cette approche avec des exemples concrets.
J'utilise Veo 3.1 quotidiennement sur BananaBanana depuis que nous avons lancé la génération vidéo, et l'écart entre un prompt rédigé à la va-vite et un prompt structuré est bien plus flagrant ici qu'avec n'importe quel modèle d'image. L'image pardonne l'imprécision. La vidéo, elle, la punit deux fois : une fois dans le cadrage et une fois dans le mouvement.
Qu'est-ce qu'un bon prompt Veo 3.1 ?
Selon la documentation officielle de Veo de Google, un prompt solide repose sur sept éléments : le sujet, l'action, le style, le positionnement de la caméra, la composition, l'objectif (ou la mise au point) et l'ambiance. Vous n'avez pas besoin d'inclure ces sept éléments à chaque fois. En revanche, vous devez avoir conscience de ceux que vous omettez, car le modèle improvisera pour le reste.
| Élément | Rôle | Exemple de phrase |
|---|---|---|
| Sujet | Qui ou quoi est à l'écran | "an elderly potter with clay-stained hands" |
| Action | Ce qui se passe pendant le clip | "shaping a bowl on a spinning wheel" |
| Style | Esthétique générale | "cinematic documentary style" |
| Caméra | Position et mouvement | "slow dolly-in at eye level" |
| Composition | Cadrage | "close-up" |
| Objectif / Mise au point | Caractère optique | "shallow depth of field" |
| Ambiance | Ambiance lumineuse et colorimétrique | "warm window light, dust in the air" |
L'ordre des mots importe moins qu'on ne le pense. Généralement, je place le sujet et l'action en premier car c'est ce sur quoi le modèle se focalise, puis j'ajoute les indications de caméra et de lumière à la fin. Ce qui compte vraiment, c'est la précision : "a horse" laisse au modèle le soin de choisir au hasard parmi quarante races, alors que "a chestnut Arabian horse" ne lui laisse aucun doute.
Un bémol toutefois. Veo 3.1 intègre un réécriveur de prompts côté Google qui enrichit les prompts courts avant la génération, sans que vous puissiez voir ce qui a été ajouté. Les prompts courts reviennent parfois avec des détails que vous n'avez jamais demandés. Décrire vous-même ces détails est le meilleur moyen de garder le contrôle.

Comment contrôler la caméra dans Veo 3.1 ?
Le vocabulaire cinématographique est le levier le plus puissant d'un prompt Veo 3.1, et c'est pourtant celui que la plupart des utilisateurs oublient. Le modèle comprend parfaitement le jargon technique standard du cinéma, utilisez-le donc au pied de la lettre.
Pour la position : aerial view (vue aérienne), eye-level (à hauteur d'yeux), low-angle shot (contre-plongée), top-down shot (vue du dessus/zénithale), over-the-shoulder (plan par-dessus l'épaule). Pour le mouvement : dolly in ou out (travelling avant ou arrière), tracking shot (plan de suivi), pan left ou right (panoramique gauche ou droite), tilt up (panoramique vertical vers le haut), slow zoom (zoom lent), POV shot (caméra subjective). Pour le cadrage : extreme close-up (très gros plan), close-up (gros plan), medium shot (plan moyen), wide shot (plan large), establishing shot (plan d'ensemble). Pour l'optique : shallow focus (faible profondeur de champ), deep focus (grande profondeur de champ), macro lens (objectif macro), wide-angle lens (grand angle), soft focus (flou artistique).
Deux règles pratiques tirées de nos essais. Premièrement, un seul mouvement de caméra par clip. Un prompt demandant "a pan that becomes a dolly-in and then tilts up" n'aboutira généralement qu'à l'un de ces trois mouvements choisi au hasard, ou à un compromis bancal. Les clips durent de 4 à 8 secondes : il y a juste la place pour un mouvement bien exécuté. Deuxièmement, en cas de conflit, les verbes de mouvement du sujet l'emportent sur les indications statiques de la caméra. Si votre sujet court ("sprints") mais que la caméra est censée être fixe ("static wide shot"), attendez-vous à ce que le modèle privilégie la course et déplace la caméra malgré tout. Veillez à ce que vos indications soient cohérentes.
Pour l'éclairage, c'est la même chose : décrivez-le comme le ferait un chef opérateur. Des expressions comme "golden hour backlight", "cool blue moonlight", "harsh overhead fluorescent" ou "flickering torchlight" fonctionnent à tous coups. Les mots flous comme "beautiful lighting" n'ont aucun effet.

Avant / après : la même idée, deux prompts
Rien ne vaut la pratique. Voici la même scène générée deux fois avec Veo 3.1 Fast sur BananaBanana, sans son, de 6 secondes, en 720p. Coût total pour les deux essais : environ $1.
D'abord, le prompt que tout le monde écrit au début. Simplement "A horse running on a beach" :
Le résultat est correct. Notez que le modèle a choisi de lui-même un coucher de soleil ; c'est le réécriveur de prompts qui a décidé à votre place. Le cadrage reste un plan large lointain, la caméra ne s'engage sur aucun mouvement précis, et rien de tout cela n'a été votre choix. Voici maintenant la même idée réécrite en suivant notre structure en sept éléments : "A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun" :
Même sujet, même modèle, même prix. Le second clip propose un mouvement de caméra précis, une direction de lumière cohérente et des éclaboussures d'eau qui capturent le contre-jour : autant d'éléments dictés par le prompt, et non par la chance.
Une leçon apprise à mes dépens lors de cet essai (qui m'a coûté deux relances) : une version précédente de ce prompt se terminait par "cinematic 35mm look", et Veo a pris la référence cinématographique au pied de la lettre, en incrustant des bandes noires (letterbox) en haut et en bas de l'image. Deux fois de suite. Les termes de style comme "35mm", "anamorphic" ou "cinematic film look" peuvent imposer le format d'image cinéma complet, bandes noires comprises. Si vous souhaitez l'ambiance sans les bandes noires, décrivez directement la lumière et le comportement de l'objectif, et évitez le vocabulaire lié aux pellicules de film.
Si vous partez d'une photo plutôt que d'un texte, la méthode change légèrement (votre image fige la première image et le prompt ne décrit que le mouvement). Nous avons détaillé cette méthode dans notre guide de l'image en vidéo.
Comment gérer le son dans Veo 3.1 ?
Veo 3.1 génère du son de manière native, et selon la documentation de Google, cette fonction est toujours active dans l'API : dialogues, effets sonores et bruits d'ambiance sont synchronisés avec l'image. Vous pouvez contrôler chaque aspect à l'aide de conventions textuelles simples.
- Le dialogue s'écrit entre guillemets, associé à un personnage : A man murmurs, "This must be it."
- Les effets sonores sont indiqués comme des événements : "tires screeching", "waves crashing against rocks".
- L'ambiance est décrite comme une atmosphère générale : "faint hum of fluorescent lights", "distant seagulls".
Le prompt d'exemple de Google montre bien cette structure : "A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'" Les guillemets du dialogue déclenchent des paroles synchronisées sur le mouvement des lèvres, tandis que les mots "flickering" et "torchlight" créent l'ambiance sonore de la pièce.
Gardez les dialogues courts. Lors de nos tests, au-delà d'une douzaine de mots par réplique, la fin de la phrase risque d'être coupée ou accélérée dans un clip de 8 secondes. Limitez les dialogues à une ou deux personnes maximum, plutôt qu'à un groupe, pour éviter que les voix qui se chevauchent ne deviennent inaudibles.
Sur BananaBanana, l'audio est une option activable, facturée à part car Google la facture séparément : un clip de 8 secondes en Veo 3.1 Fast coûte $0.70 sans le son et $1.00 avec l'audio en 720p ou 1080p. Les exemples présentés ci-dessus sont volontairement muets, ce qui reste le choix budgétaire le plus judicieux si votre vidéo est destinée à être diffusée en lecture automatique muette sur un site. (Si vous souhaitez du son par défaut sur chaque séquence, le modèle Omni Flash adopte l'approche inverse : le son est toujours activé, facturé $0.10 par seconde.)

Prompts négatifs, durées et tarifs de Veo 3.1
Le fonctionnement des prompts négatifs est assez flou, voici donc notre retour d'expérience côté API. La documentation de l'API Gemini pour Veo 3.1 ne mentionne pas de paramètre de prompt négatif. En revanche, le point de terminaison de Vertex AI (sur lequel repose BananaBanana) accepte le paramètre negativePrompt, et nous constatons une réelle influence sur le résultat généré. Ce champ est donc disponible et fonctionnel sur notre générateur, mais ne vous attendez pas à ce qu'il agisse comme un filtre absolu.
La rédaction des prompts négatifs obéit à une règle surprenante tirée du guide de rédaction de Google : n'écrivez jamais "pas de" ou "sans" dans le champ négatif. Listez simplement les éléments indésirables sous forme de noms communs. Par exemple, "Cartoon, low quality, text overlay, watermark" fonctionne très bien, alors que "no cartoons" peut avoir l'effet inverse, car le mot "cartoon" reste présent dans la requête.
Concernant la durée et les formats, d'après la documentation de Google et nos réglages système : les clips durent 4, 6, 7 ou 8 secondes au format 16:9 ou 9:16, avec des résolutions de 720p, 1080p et 4K. La durée de 8 secondes est requise pour le 1080p, le 4K, les images de référence et l'extension de vidéo. L'extension est d'ailleurs la fonction secrète de Veo : chaque demande ajoute 7 secondes supplémentaires à la vidéo, et ce jusqu'à 20 fois de suite, ce qui vous permet de dépasser les deux minutes de film à partir d'une seule série de prompts.
Tarifs actuels sur BananaBanana pour un clip de 8 secondes en 720p :
| Modèle | Sans son | Avec audio |
|---|---|---|
| Veo 3.1 Lite | $0.20 | $0.36 |
| Veo 3.1 Fast | $0.70 | $1.00 |
| Veo 3.1 | $1.40 | $3.00 |
Un clip muet de 4 secondes avec Lite coûte $0.10, et le crédit gratuit offert à l'ouverture de chaque nouveau compte en couvre deux. Votre première vidéo avec Veo ne vous coûte donc rien, et en toute franchise, Lite en 720p est largement suffisant pour se faire la main sur la structure des prompts avant de dépenser votre crédit sur Fast ou sur le modèle complet. La grille tarifaire complète est consultable sur notre page des tarifs.
Ma méthode de travail habituelle : je prépare mon prompt sur Lite, j'ajuste jusqu'à ce que le mouvement et le cadrage me conviennent, puis je lance la génération finale sur Fast ou Veo 3.1. La structure du prompt est interprétée de façon identique d'un modèle à l'autre ; la différence de prix réside uniquement dans la qualité du rendu final.
FAQ
Quelle est la meilleure structure de prompt pour Veo 3.1 ?
Sujet, action, style, caméra, composition, objectif, ambiance, à peu près dans cet ordre. Un modèle condensé : "[type de plan] de [sujet] [action] dans [décor], [mouvement de caméra], [objectif], [éclairage]". Les noms précis l'emportent sur les adjectifs, et il est préférable de se limiter à un seul mouvement de caméra par clip plutôt que d'en cumuler trois.
Veo 3.1 prend-il en charge les prompts négatifs ?
Sur Vertex AI, oui : le paramètre negativePrompt est accepté et fonctionne, même s'il n'est pas mentionné dans la documentation de l'API Gemini pour Veo 3.1. Écrivez les éléments négatifs sous forme de noms communs simples ("cartoon, blurry, watermark"), et jamais sous forme de phrases négatives ("pas de X").
Comment faire générer des dialogues par Veo 3.1 ?
Placez la réplique entre guillemets et attribuez-la à un personnage dans le prompt : A woman whispers, "We're not alone." Veo gère très bien la synchronisation labiale sur des répliques courtes ; limitez le dialogue à une douzaine de mots par clip.
Quelle peut être la durée maximale d'une vidéo Veo 3.1 ?
Les clips de base durent de 4 à 8 secondes. En utilisant l'extension de vidéo (7 secondes supplémentaires par demande, jusqu'à 20 extensions d'après la documentation de Google), une seule session de génération peut atteindre 148 secondes en 720p.
Combien coûte la génération d'une vidéo Veo 3.1 ?
Sur BananaBanana, les tarifs vont de $0.10 (un clip muet de 4 secondes avec Veo 3.1 Lite en 720p) à $4.40 (un clip de 8 secondes en 4K avec Veo 3.1 et son). L'option intermédiaire recommandée, à savoir un clip de 8 secondes sans le son sur Fast, s'élève à $0.70.