Retour au blog
BananaBanana Teamtutorialvideoimage-to-video

AI Image to Video : transformez vos photos en vidéos

Fonctionnement de l'image en vidéo par IA, choix du modèle (Veo 3.1 vs Omni Flash), tarifs dès $0.10, prompts de mouvement, boucles et séquences de 148s.

AI Image to Video : transformez vos photos en vidéos

L'image en vidéo par IA est une technique de génération dans laquelle un modèle prend une image fixe, la traite comme la première image d'un clip et invente tout ce qui se passe ensuite : mouvement, déplacement de la caméra, variations de lumière et parfois du son. Vous fournissez une photo et une description textuelle de ce qui doit bouger. Le modèle génère une courte vidéo, généralement de 4 à 10 secondes, donnant vie à votre image exacte.

Pour faire simple, si vous manquez de temps : importez une photo dans le générateur BananaBanana, décrivez le mouvement et attendez 2 à 5 minutes. Un clip silencieux de 4 secondes créé à partir de votre photo commence à $0.10 avec Veo 3.1 Lite, l'ajout de l'audio monte le prix à $0.18, et Gemini Omni Flash anime une photo avec une bande-son complète à partir de $0.30 (facturé $0.10 par seconde). Les nouveaux comptes reçoivent $0.20 gratuits, ce qui couvre deux essais silencieux.

Nous exploitons quatre modèles vidéo en production, ce guide s'appuie donc sur de véritables logs de génération plutôt que sur des fiches marketing. Y compris nos échecs. Certains d'entre eux se révèlent d'ailleurs bien plus instructifs que nos réussites.

Comment fonctionne la technologie image en vidéo par IA ?

Sous le capot, l'image fixe est transmise au modèle comme image de conditionnement. La documentation de l'API vidéo de Gemini indique que Veo 3.1 prend en charge l'« image-based direction » et la « frame-specific generation » (le guidage par l'image et la génération par image clé), ce qui signifie simplement que votre image oriente l'ensemble du clip et que vous pouvez figer des images exactes là où vous le souhaitez. Le modèle analyse la scène, estime les lois physiques (la façon dont l'eau de votre photo devrait onduler ou le mouvement des cheveux au vent) et génère les images les unes après les autres à partir de votre point de départ.

En pratique : la première image de la vidéo finale correspond à votre photo, presque au pixel près. Tout ce qui suit est purement inventé. Les bons prompts se concentrent donc sur cette création, plutôt que de redécrire ce que le modèle a déjà sous les yeux.

Cette approche fonctionne étonnamment bien pour les scènes contenant un mouvement latent évident. Un portrait respire et cligne des yeux. De la vapeur s'échappe d'une tasse de café. Une voiture garée démarre. En revanche, le résultat est moins convaincant lorsque la photo n'évoque aucun mouvement plausible : si vous envoyez un rendu de produit à plat sur fond blanc sans donner d'indications de mouvement dans le prompt, vous obtiendrez généralement un zoom lent et légèrement saccadé. Rien de cassé, mais c'est tout simplement ennuyeux.

Une photographie vintage tenue à deux mains dont la scène intérieure commence à onduler et à s'animer, illustrant l'animation d'une image en vidéo par IA

Quel modèle transforme le mieux une photo en vidéo ?

Les quatre modèles vidéo disponibles sur la plateforme acceptent une image comme point de départ. Ils se distinguent par leurs performances maximales et leurs tarifs.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Prix (4s, silencieux)$0.70$0.35$0.10
Prix (4s, avec audio)$1.50$0.50$0.18$0.40 ($0.10 par seconde)
Résolution max4K4K1080p720p uniquement
Duréeexactement 4/6/7/8 sexactement 4/6/7/8 sexactement 4/6/7/8 sexactement 3–10 s
Audiooptionnel (on/off)optionnel (on/off)optionnel (on/off)toujours actif
Image finale + bouclesouiouiouinon
Prolongation à 148 souiouinonnon, édition conversationnelle à la place

Mon option par défaut est Veo 3.1 Fast. Ce modèle conserve les fonctionnalités indispensables (durée exacte, image finale optionnelle, prolongation) à la moitié du prix du modèle phare, et pour des formats adaptés aux réseaux sociaux, la différence de qualité avec le modèle complet Veo 3.1 est rarement perceptible. Avec Lite à $0.10, je teste si une idée de mouvement fonctionne avant d'investir un budget plus conséquent. Veo 3.1 complet justifie son prix pour les scènes contenant de l'eau, du tissu ou des collisions, ou lorsque le cahier des charges impose de la 4K. Omni Flash s'impose lorsque le son compte autant que l'image ; nous l'avons analysé en détail dans une évaluation de l'API Omni Flash, notamment sa limite à 720p qui s'avère un peu juste pour un affichage en plein écran.

Le clip ci-dessus est une génération Veo 3.1 Fast issue de nos pipelines de production, réalisée spécifiquement pour cet article : un voilier photographié dans un cadre posé sur un bureau. Le prompt demande à la mer dans le cadre de se mettre en mouvement pendant que la caméra s'approche lentement. Une seule prise, sans montage, silencieux par choix (nous utilisons l'option silencieuse de Fast pour nos brouillons). Cet effet d'« image qui s'éveille » correspond exactement à ce que le modèle applique à vos propres fichiers importés.

Comment générer une vidéo à partir d'une photo, étape par étape

L'ensemble du processus sur le générateur prend environ une minute de votre temps, plus le temps de rendu.

  1. Passez le générateur en mode vidéo et choisissez un modèle. Pour un premier essai, Veo 3.1 Lite à $0.10 est l'option la plus économique pour apprendre.
  2. Importez votre photo comme première image (au format JPG ou PNG). Elle sera recadrée au format de la vidéo, pensez donc à vérifier les bordures avant de lancer la génération.
  3. Choisissez le format 16:9 ou 9:16. Le format vertical fonctionne parfaitement pour TikTok et Reels ; le modèle gère le cadrage portrait sans aucune difficulté.
  4. Rédigez le prompt de mouvement (voir section suivante) et, si besoin, un prompt négatif allant jusqu'à 1 000 caractères pour spécifier les éléments à exclure.
  5. Choisissez la durée et l'activation de l'audio. Ce sont des paramètres précis sur Veo ; sur Omni Flash, vous choisissez la durée de votre choix entre 3 et 10 secondes, et l'audio est toujours activé.
  6. Générez. La création de la vidéo prend environ 2 à 5 minutes. Vous pouvez fermer l'onglet ; vos résultats resteront disponibles dans votre historique pendant 30 jours.

Votre solde n'est débité que si la génération réussit. Les échecs de rendu sont remboursés automatiquement, ce qui est particulièrement important pour la vidéo où l'on procède souvent par essais successifs.

Un storyboard en trois volets montrant une main important une photo, un panneau de configuration et un lecteur vidéo finalisé, illustrant le processus de création d'une image en vidéo

Comment rédiger des prompts de mouvement pour l'image en vidéo ?

Règle numéro un : décrivez le mouvement, pas la scène. La scène figure déjà sur la photo. Écrire « A woman in a red coat stands on a bridge » (Une femme en manteau rouge se tient sur un pont) revient à gaspiller le prompt avec des informations que le modèle possède déjà. « She turns toward the camera and smiles as wind lifts her hair, slow dolly-in » (Elle se tourne vers la caméra et sourit tandis que le vent soulève ses cheveux, zoom avant lent) fait la même longueur mais n'apporte que des instructions utiles.

Les termes techniques de cadrage fonctionnent extrêmement bien avec Veo. Des instructions telles que « dolly in », « orbit », « handheld », « static tripod shot » ou « slow pan left » sont idéales. Les modèles ont clairement été entraînés sur des descriptions de rushes vidéo et réagissent bien plus fidèlement au vocabulaire cinématographique qu'à des formulations floues comme « make it dynamic ». Évitez d'ailleurs d'utiliser le mot « dynamic » : personne ne s'accorde sur sa signification, y compris le modèle.

Une leçon que nous avons apprise à nos dépens en produisant des clips de démonstration pour ce blog : ces modèles conservent l'état initial de la première image et ignorent discrètement les actions censées démarrer plus tard. Nous avons demandé un jour à Omni Flash de faire sauter une crêpe (« around the middle of the clip » – vers le milieu du clip) et nous avons obtenu dix secondes d'une crêpe totalement immobile. Et ce, trois fois de suite, à un dollar l'essai. En réécrivant l'action comme étant déjà en cours, le problème a été résolu dès la première tentative. Ainsi, « syrup is pouring onto the stack » (du sirop coule sur la pile) fonctionne bien mieux que « syrup starts pouring after two seconds » (le sirop commence à couler après deux secondes). Pour l'image en vidéo, choisissez de préférence une photo de départ où l'action souhaitée est déjà plausible à mi-parcours.

Voici quelques structures qui s'avèrent toujours efficaces :

  • Portraits : « subtle breathing, a slow blink, then a small smile; camera locked » (respiration subtile, léger clignement d'yeux, puis léger sourire ; caméra fixe) donne une impression de vie sans les déformations étranges que provoquent les grands mouvements.
  • Produits : « slow 180-degree orbit around the object, studio lighting stays constant » (rotation lente à 180 degrés autour de l'objet, l'éclairage studio reste constant) est une formule incontournable. Veillez à garder un arrière-plan simple sur la photo d'origine.
  • Paysages : nommez explicitement les éléments en mouvement (« clouds drift right, grass sways, light shifts warmer » – les nuages dérivent vers la droite, l'herbe ondule, la lumière s'adoucit) sous peine de vous retrouver avec le zoom saccadé par défaut.

Un clap de cinéma à côté de notes de prompts manuscrites avec des flèches esquissant des mouvements de caméra sur une photographie, illustrant la rédaction de prompts de mouvement

Boucles, images finales et vidéos de 148 secondes

Les modèles Veo 3.1 acceptent une image finale optionnelle en plus de l'image de départ. Donnez-leur deux photos différentes et ils généreront une transition fluide entre elles, ce qui permet de transformer une photo de jour en une scène de nuit, ou un croquis en un produit fini. Si vous utilisez la même photo pour le début et la fin, vous obtiendrez un clip qui se termine exactement là où il a commencé : une boucle parfaite, idéale pour un fond de site web ou une publication de type cinémagraphe. C'est ma fonctionnalité méconnue préférée sur la plateforme.

La prolongation est l'autre atout de Veo. Un clip généré peut être prolongé de 7 secondes supplémentaires avec un nouveau prompt, et cette séquence peut s'étendre jusqu'à 148 secondes au total en conservant une parfaite continuité visuelle (disponible uniquement sur Veo 3.1 et Fast ; Lite et Omni Flash n'offrent pas cette option). Commencer une longue séquence à partir d'une photo existante est ce qui se rapproche le plus d'une réalisation sans storyboard dans les API actuelles. Les coûts s'accumulent également vite, pensez donc à prévoir votre budget avant de vous lancer.

Omni Flash remplace la prolongation par de l'édition conversationnelle : décrivez une modification à apporter au clip finalisé (« make it dusk, keep everything else the same » – passez au crépuscule en gardant tout le reste identique) et Omni Flash remplace la prolongation par de l'édition conversationnelle : décrivez une modification à apporter au clip finalisé (« make it dusk, keep everything else the same » – passez au crépuscule en gardant tout le reste identique) et payez à nouveau pour ses secondes — il accepte également les vidéos qu'il n'a pas générées, y compris vos propres importations, et les retourne à la même longueur. C'est une philosophie différente. L'édition peaufine un instant précis, tandis que la prolongation développe une chronologie.. C'est une philosophie différente. L'édition peaufine un instant précis, tandis que la prolongation développe une chronologie.

Une bande de pellicule de film courbée en un cercle parfait sur un fond pastel, illustrant une boucle vidéo IA qui se termine là où elle a commencé

FAQ

Est-il possible de transformer une photo en vidéo gratuitement ?

Presque. La création d'un nouveau compte BananaBanana vous offre $0.20 de crédit gratuit sans avoir à saisir de carte bancaire, de quoi générer deux clips silencieux de 4 secondes avec Veo 3.1 Lite à partir de votre photo. Par la suite, la facturation se fait par clip, à partir de $0.10.

Quelle est l'option d'API image en vidéo la moins chère ?

Sur BananaBanana, il s'agit de Veo 3.1 Lite : $0.10 pour un clip silencieux de 4 secondes en 720p, et $0.18 avec audio. Ce tarif s'entend par génération réussie, avec un remboursement automatique en cas d'échec et sans abonnement ni configuration Google Cloud complexe.

La vidéo générée peut-elle inclure du son ?

Oui. Les modèles Veo 3.1 disposent d'une option d'activation audio (dialogues, effets sonores et ambiance décrits dans votre prompt), et Gemini Omni Flash génère systématiquement une bande-son, incluse dans son prix de $0.10 par seconde.

Puis-je animer une photo verticale pour TikTok ou Reels ?

Oui, les quatre modèles prennent en charge le format 9:16. Importez votre photo, sélectionnez 9:16, et gardez à l'esprit que l'image source sera recadrée à ce format, prévoyez donc de l'espace dans la prise de vue d'origine.

Quelle est la durée maximale d'une vidéo IA créée à partir d'une photo ?

Chaque clip dure de 4 à 8 secondes sur les modèles Veo (3–10 secondes, à votre choix, sur Omni Flash), mais les clips Veo 3.1 et Veo 3.1 Fast peuvent être prolongés par étapes de 7 secondes jusqu'à 148 secondes tout en conservant la continuité visuelle de votre photo d'origine.

tutorialvideoimage-to-video