AI Image to Video : transformez vos photos en vidéos
Fonctionnement de l'image en vidéo par IA, choix du modèle (Veo 3.1, Omni Flash, Wan 3.0, Grok), tarifs dès $0.10, prompts de mouvement, boucles, séquences de 148s.

L'image en vidéo par IA est une technique de génération dans laquelle un modèle prend une image fixe, la traite comme la première image d'un clip et invente tout ce qui se passe ensuite : mouvement, déplacement de la caméra, variations de lumière et parfois du son. Vous fournissez une photo et une description textuelle de ce qui doit bouger. Le modèle génère une courte vidéo, généralement de 4 à 10 secondes, donnant vie à votre image exacte.
Pour faire simple, si vous manquez de temps : importez une photo dans le générateur BananaBanana, décrivez le mouvement et attendez 2 à 5 minutes. Un clip silencieux de 4 secondes créé à partir de votre photo commence à $0.10 avec Veo 3.1 Lite, l'ajout de l'audio monte le prix à $0.18, Gemini Omni Flash anime une photo avec une bande-son complète à partir de $0.09 (facturé à la seconde, de $0.03 en 360p à $0.30 en 4K), et Wan 3.0 le fait avec un son gratuit dès $0.20 pour 4 secondes en 480p. Les nouveaux comptes reçoivent $0.20 gratuits, ce qui couvre deux essais silencieux.
Nous exploitons sept modèles vidéo en production et chacun d'eux accepte une photo comme première image : ce guide les couvre donc tous les sept, en s'appuyant sur de véritables logs de génération plutôt que sur des fiches marketing. Y compris nos échecs. Certains d'entre eux se révèlent d'ailleurs bien plus instructifs que nos réussites.
Comment fonctionne la technologie image en vidéo par IA ?
Sous le capot, l'image fixe est transmise au modèle comme image de conditionnement. La documentation de l'API vidéo de Gemini indique que Veo 3.1 prend en charge l'« image-based direction » et la « frame-specific generation » (le guidage par l'image et la génération par image clé), ce qui signifie simplement que votre image oriente l'ensemble du clip et que vous pouvez figer des images exactes là où vous le souhaitez. Le modèle analyse la scène, estime les lois physiques (la façon dont l'eau de votre photo devrait onduler ou le mouvement des cheveux au vent) et génère les images les unes après les autres à partir de votre point de départ.
En pratique : la première image de la vidéo finale correspond à votre photo, presque au pixel près. Tout ce qui suit est purement inventé. Les bons prompts se concentrent donc sur cette création, plutôt que de redécrire ce que le modèle a déjà sous les yeux.
Cette approche fonctionne étonnamment bien pour les scènes contenant un mouvement latent évident. Un portrait respire et cligne des yeux. De la vapeur s'échappe d'une tasse de café. Une voiture garée démarre. En revanche, le résultat est moins convaincant lorsque la photo n'évoque aucun mouvement plausible : si vous envoyez un rendu de produit à plat sur fond blanc sans donner d'indications de mouvement dans le prompt, vous obtiendrez généralement un zoom lent et légèrement saccadé. Rien de cassé, mais c'est tout simplement ennuyeux.

Quel modèle transforme le mieux une photo en vidéo ?
Les sept modèles vidéo disponibles sur la plateforme acceptent une image comme point de départ. Ils se distinguent par leurs performances maximales et leurs tarifs. D'abord les modèles Google :
| Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite | Gemini Omni Flash | |
|---|---|---|---|---|
| Prix (4s, silencieux) | $0.70 | $0.35 | $0.10 | — |
| Prix (4s, avec audio) | $1.50 | $0.50 | $0.18 | $0.12 en 360p, $0.40 en 720p |
| Résolution max | 4K | 4K | 1080p | 4K (upscalée) |
| Durée | exactement 4/6/7/8 s | exactement 4/6/7/8 s | exactement 4/6/7/8 s | exactement 3–10 s |
| Audio | optionnel (on/off) | optionnel (on/off) | optionnel (on/off) | toujours actif |
| Image finale + boucles | oui | oui | oui | oui (Omni 1.1) |
| Prolongation | jusqu'à 148 s | jusqu'à 148 s | non | jusqu'à 40 s, plus l'édition vidéo |
Mon option par défaut est Veo 3.1 Fast. Ce modèle conserve les fonctionnalités indispensables (durée exacte, image finale optionnelle, prolongation) à la moitié du prix du modèle phare, et pour des formats adaptés aux réseaux sociaux, la différence de qualité avec le modèle complet Veo 3.1 est rarement perceptible. Avec Lite à $0.10, je teste si une idée de mouvement fonctionne avant d'investir un budget plus conséquent. Veo 3.1 complet justifie son prix pour les scènes contenant de l'eau, du tissu ou des collisions, ou lorsque le cahier des charges impose de la 4K. Omni Flash s'impose lorsque le son compte autant que l'image ; nous l'avons analysé en détail dans une évaluation de l'API Omni Flash, notamment la façon dont son tarif à la seconde évolue du 360p jusqu'à la 4K. La génération précédente, Omni Flash 1.0, reste disponible de 4 à 10 secondes et n'accepte qu'une image de départ.
Le clip ci-dessus est une génération Veo 3.1 Fast issue de nos pipelines de production, réalisée spécifiquement pour cet article : un voilier photographié dans un cadre posé sur un bureau. Le prompt demande à la mer dans le cadre de se mettre en mouvement pendant que la caméra s'approche lentement. Une seule prise, sans montage, silencieux par choix (nous utilisons l'option silencieuse de Fast pour nos brouillons). Cet effet d'« image qui s'éveille » correspond exactement à ce que le modèle applique à vos propres fichiers importés.
Ensuite, les deux modèles arrivés en septembre, signés Alibaba et xAI :
| Wan 3.0 | Grok Imagine Video 1.5 | |
|---|---|---|
| Prix (4s, avec audio) | $0.20 en 480p, $0.40 en 720p, $0.80 en 1080p | $0.56 en 720p |
| Résolution max | 1080p | 1080p (images de référence en 720p uniquement) |
| Durée | 4, 6, 8, 10, 15, 20 ou 30 s | n'importe quel nombre entier de 4 à 15 s |
| Audio | activé par défaut et gratuit, désactivable | toujours actif, dialogue synchronisé sur les lèvres |
| Image finale + boucles | oui | non |
| Prolongation | non, mais 30 s d'une seule prise | non |
Wan 3.0, c'est celui vers lequel j'oriente une photo quand le clip doit durer plus de dix secondes ou avoir du son sans le payer en plus. Grok, c'est pour la photo d'une personne qui doit ensuite dire quelque chose : écrivez la réplique entre guillemets et la bouche suit. Même photo de montgolfière (un rendu Nano Banana Pro, donc aucun visage réel n'est en jeu) passée dans les deux, même prompt demandant au ballon captif de s'élever un peu pendant que le brûleur s'embrase et que la brume dérive :
Wan 3.0, six secondes en 720p, $0.60. Il a gardé la photo presque au pixel près, a soulevé le ballon de quelques mètres, a fait apparaître une corde d'amarrage absente de l'image fixe, et a mis sur la piste de courtes rafales de brûleur et des chants d'oiseaux sans qu'on ait à le lui redemander.
Grok Imagine Video 1.5, six secondes en 720p, $0.84. Un mouvement plus subtil, la même fidélité à la source, et un détail des logs bon à savoir : le fichier est revenu en 1280×704, pas en 720 lignes pile. Aucun souci pour un fil d'actualité, gênant si vous faites du compositing.
Comment générer une vidéo à partir d'une photo, étape par étape
L'ensemble du processus sur le générateur prend environ une minute de votre temps, plus le temps de rendu.
- Passez le générateur en mode vidéo et choisissez un modèle. Pour un premier essai, Veo 3.1 Lite à $0.10 est l'option la plus économique pour apprendre.
- Importez votre photo comme première image (au format JPG ou PNG). Elle sera recadrée au format de la vidéo, pensez donc à vérifier les bordures avant de lancer la génération.
- Choisissez le format 16:9 ou 9:16. Le format vertical fonctionne parfaitement pour TikTok et Reels ; le modèle gère le cadrage portrait sans aucune difficulté.
- Rédigez le prompt de mouvement (voir section suivante) et, si besoin, un prompt négatif allant jusqu'à 1 000 caractères pour spécifier les éléments à exclure.
- Choisissez la durée et l'activation de l'audio. Ce sont des paramètres précis sur Veo ; sur Omni Flash, vous choisissez la durée de votre choix entre 3 et 10 secondes, et l'audio est toujours activé. Wan 3.0 monte jusqu'à 30 secondes avec une bande-son gratuite que vous pouvez couper, et Grok accepte n'importe quelle durée de 4 à 15 secondes et parle toujours.
- Générez. La création de la vidéo prend environ 2 à 5 minutes. Vous pouvez fermer l'onglet ; vos résultats resteront disponibles dans votre historique pendant 30 jours.
Votre solde n'est débité que si la génération réussit. Les échecs de rendu sont remboursés automatiquement, ce qui est particulièrement important pour la vidéo où l'on procède souvent par essais successifs.

Comment rédiger des prompts de mouvement pour l'image en vidéo ?
Règle numéro un : décrivez le mouvement, pas la scène. La scène figure déjà sur la photo. Écrire « A woman in a red coat stands on a bridge » (Une femme en manteau rouge se tient sur un pont) revient à gaspiller le prompt avec des informations que le modèle possède déjà. « She turns toward the camera and smiles as wind lifts her hair, slow dolly-in » (Elle se tourne vers la caméra et sourit tandis que le vent soulève ses cheveux, zoom avant lent) fait la même longueur mais n'apporte que des instructions utiles.
Les termes techniques de cadrage fonctionnent extrêmement bien avec Veo. Des instructions telles que « dolly in », « orbit », « handheld », « static tripod shot » ou « slow pan left » sont idéales. Les modèles ont clairement été entraînés sur des descriptions de rushes vidéo et réagissent bien plus fidèlement au vocabulaire cinématographique qu'à des formulations floues comme « make it dynamic ». Évitez d'ailleurs d'utiliser le mot « dynamic » : personne ne s'accorde sur sa signification, y compris le modèle.
Une leçon que nous avons apprise à nos dépens en produisant des clips de démonstration pour ce blog : ces modèles conservent l'état initial de la première image et ignorent discrètement les actions censées démarrer plus tard. Nous avons demandé un jour à Omni Flash de faire sauter une crêpe (« around the middle of the clip » – vers le milieu du clip) et nous avons obtenu dix secondes d'une crêpe totalement immobile. Et ce, trois fois de suite, à un dollar l'essai. En réécrivant l'action comme étant déjà en cours, le problème a été résolu dès la première tentative. Ainsi, « syrup is pouring onto the stack » (du sirop coule sur la pile) fonctionne bien mieux que « syrup starts pouring after two seconds » (le sirop commence à couler après deux secondes). Pour l'image en vidéo, choisissez de préférence une photo de départ où l'action souhaitée est déjà plausible à mi-parcours.
Voici quelques structures qui s'avèrent toujours efficaces :
- Portraits : « subtle breathing, a slow blink, then a small smile; camera locked » (respiration subtile, léger clignement d'yeux, puis léger sourire ; caméra fixe) donne une impression de vie sans les déformations étranges que provoquent les grands mouvements.
- Produits : « slow 180-degree orbit around the object, studio lighting stays constant » (rotation lente à 180 degrés autour de l'objet, l'éclairage studio reste constant) est une formule incontournable. Veillez à garder un arrière-plan simple sur la photo d'origine.
- Paysages : nommez explicitement les éléments en mouvement (« clouds drift right, grass sways, light shifts warmer » – les nuages dérivent vers la droite, l'herbe ondule, la lumière s'adoucit) sous peine de vous retrouver avec le zoom saccadé par défaut.

Boucles, images finales et vidéos de 148 secondes
Les modèles Veo 3.1 acceptent une image finale optionnelle en plus de l'image de départ, tout comme Omni 1.1 et Wan 3.0. Donnez à un modèle deux photos différentes et il générera une transition fluide entre elles, ce qui permet de transformer une photo de jour en une scène de nuit, ou un croquis en un produit fini. Si vous utilisez la même photo pour le début et la fin, vous obtiendrez un clip qui se termine exactement là où il a commencé : une boucle parfaite, idéale pour un fond de site web ou une publication de type cinémagraphe. C'est ma fonctionnalité méconnue préférée sur la plateforme.
La prolongation est l'autre atout de Veo. Un clip généré peut être prolongé de 7 secondes supplémentaires avec un nouveau prompt, et cette séquence peut s'étendre jusqu'à 148 secondes au total en conservant une parfaite continuité visuelle (disponible uniquement sur Veo 3.1 et Fast ; Lite n'offre pas cette option). Commencer une longue séquence à partir d'une photo existante est ce qui se rapproche le plus d'une réalisation sans storyboard dans les API actuelles. Les coûts s'accumulent également vite, pensez donc à prévoir votre budget avant de vous lancer. Si 30 secondes suffisent, Wan 3.0 les rend d'une seule prise à partir de votre photo, sans raccords ni dérive de continuité, pour $1.50 en 480p ou $3.00 en 720p.
Omni Flash a désormais sa propre prolongation : chaque étape ajoute 3 à 10 secondes au dernier clip, enchaînables jusqu'à environ 40 secondes au total, un plafond plus bas que les 148 secondes de Veo. Il conserve aussi, en parallèle, l'édition conversationnelle : décrivez une modification à apporter au clip finalisé (« make it dusk, keep everything else the same » – passez au crépuscule en gardant tout le reste identique) et payez à nouveau pour ses secondes — il accepte également les vidéos qu'il n'a pas générées, y compris vos propres importations, et les retourne à la même longueur. C'est une philosophie différente. L'édition peaufine un instant précis, tandis que la prolongation développe une chronologie.

FAQ
Est-il possible de transformer une photo en vidéo gratuitement ?
Presque. La création d'un nouveau compte BananaBanana vous offre $0.20 de crédit gratuit sans avoir à saisir de carte bancaire, de quoi générer deux clips silencieux de 4 secondes avec Veo 3.1 Lite à partir de votre photo. Par la suite, la facturation se fait par clip, à partir de $0.10.
Quelle est l'option d'API image en vidéo la moins chère ?
Sur BananaBanana, il s'agit de Veo 3.1 Lite : $0.10 pour un clip silencieux de 4 secondes en 720p, et $0.18 avec audio. Ce tarif s'entend par génération réussie, avec un remboursement automatique en cas d'échec et sans abonnement ni configuration Google Cloud complexe.
La vidéo générée peut-elle inclure du son ?
Oui. Les modèles Veo 3.1 disposent d'une option d'activation audio (dialogues, effets sonores et ambiance décrits dans votre prompt), Gemini Omni Flash génère systématiquement une bande-son, incluse dans son prix à la seconde (de $0.03 en 360p à $0.30 en 4K), Wan 3.0 ajoute une bande-son gratuitement, et Grok Imagine Video 1.5 prononce le dialogue que vous écrivez.
Puis-je animer une photo verticale pour TikTok ou Reels ?
Oui, les sept modèles prennent en charge le format 9:16, et Grok Imagine Video 1.5 ajoute le 1:1, le 3:2 et le 2:3. Importez votre photo, sélectionnez 9:16, et gardez à l'esprit que l'image source sera recadrée à ce format, prévoyez donc de l'espace dans la prise de vue d'origine.
Quelle est la durée maximale d'une vidéo IA créée à partir d'une photo ?
Chaque clip dure de 4 à 8 secondes sur les modèles Veo, de 3 à 10 secondes sur Omni Flash, de 4 à 15 sur Grok, et jusqu'à 30 secondes d'une seule prise sur Wan 3.0. Les clips Veo 3.1 et Veo 3.1 Fast peuvent en plus être prolongés par étapes de 7 secondes jusqu'à 148 secondes tout en conservant la continuité visuelle de votre photo d'origine, et Omni 1.1 se prolonge jusqu'à environ 40.