Audio synchronisé permanent
Chaque clip est livré avec un son généré — ambiance, effets, discours. Orientez-le via une ligne « Audio: » dans l'invite.
Modèle · Google Gemini Omni Flash
Le modèle mondial de Google pour les vidéos courtes : chaque clip est livré avec un audio synchronisé, un mouvement conscient des lois de la physique, et une édition conversationnelle — décrivez un changement et la scène se régénère. 3 à 10 secondes, 720p, au format 16:9 ou vertical 9:16 pour les Shorts et Reels. Forfaitaire $1.00 par génération, payé en crypto. Sans abonnement.
Gemini Omni Flash est le premier modèle de la famille Gemini Omni de Google — un modèle mondial qui analyse une scène à la manière d'un moteur physique, puis la restitue en vidéo. Vous envoyez du texte, une image ou un résultat précédent ; il renvoie un clip de 3 à 10 secondes en 720p à 24 ips avec un audio natif synchronisé — ambiance, effets, voire discours — généré en même temps que les pixels, et non ajouté après. Google l'a déployé sur l'application Gemini, Flow et YouTube Shorts en mai 2026 et a ouvert l'API (gemini-omni-flash-preview) le 30 juin 2026. Sur BananaBanana, il fonctionne en production aux côtés de la famille Veo 3.1 : même équilibre, $1.00 forfaitaire par génération, payé en crypto.
La vidéo courte exige trois choses : un son activé par défaut, un mouvement crédible et une itération rapide. Omni Flash les offre toutes trois. L'audio est toujours activé — le modèle décide du son que la scène doit avoir en fonction de ce qu'elle montre. Le mouvement provient d'un modèle mondial qui raisonne sur la scène : le sirop coule, le papier dérive, la vapeur monte là où elle devrait — généralement sans gymnastique d'invite (pour les prises les plus critiques sur le plan physique, Veo 3.1 reste le rendu le plus sûr). Et au lieu de relancer une invite à partir de zéro, vous affinez par conversation — « mettez le crépuscule », « ajoutez de la pluie sur la fenêtre » — tandis que le modèle maintient la cohérence du personnage, de l'éclairage et de la caméra. Générez au format vertical 9:16 et le clip s'insère directement dans les Shorts, Reels ou TikTok sans recadrage.
Chaque clip est livré avec un son généré — ambiance, effets, discours. Orientez-le via une ligne « Audio: » dans l'invite.
Décrivez un changement et la scène se régénère en conservant le personnage, l'éclairage et la caméra intacts. Les modifications s'enchaînent itération après itération.
Le modèle analyse la scène comme un moteur physique — les liquides, la fumée et les tissus se comportent généralement de manière plausible dès la première tentative.
Toute photo devient l'image d'ouverture ; l'invite décrit le mouvement et l'ambiance sonore.
Jusqu'à 3 images de référence permettent de maintenir la cohérence d'un personnage ou d'un produit au sein d'une scène entièrement nouvelle.
Choisissez le rapport hauteur/largeur par génération — le rendu vertical est optimisé pour les Shorts, Reels et TikTok.
Ces limites proviennent de l'API de Google elle-même, et non de notre intégration — et elles sont à prendre en compte avant toute dépense. 720p uniquement : il n'existe pas d'option 1080p ou 4K ; si vous avez besoin d'une résolution supérieure, utilisez Veo 3.1. Le modèle détermine la durée : il n'y a pas de paramètre de longueur, un clip monté sur de la musique pourrait donc nécessiter plusieurs tentatives. Pas d'extension : contrairement à Veo, vous ne pouvez pas enchaîner un clip au-delà de 10 secondes — l'édition conversationnelle modifie une scène, elle ne l'allonge pas.
Manquent également de l'API de prévisualisation : les seeds, les paramètres d'invite négative, l'amélioration d'invite, plusieurs échantillons par requête, et la désactivation de l'audio. Si l'une de ces fonctionnalités est essentielle, la famille Veo 3.1 les propose — même équilibre, même générateur.
E-mail et mot de passe — aucune carte de crédit, aucun compte Google, 0.10 $ de solde de départ offert.
À partir de 1 $ en USDT, USDC, BTC, ETH, SOL, TON et bien plus. +5 % de bonus à partir de 50 $, +10 % à partir de 100 $.
Rédigez l'invite (ajoutez une ligne « Audio: »), choisissez le format 16:9 ou 9:16, générez pour $1.00 — puis affinez en décrivant les modifications.
| Modèle | Prix par clip | Durée | Résolution | Audio |
|---|---|---|---|---|
| Gemini Omni Flashtarif forfaitaire | $1.00 | 3–10 s (choisi par le modèle) | 720p | toujours activé |
| Veo 3.1 Fastavec audio | $0.50–$1.00 | 4–8 s (au choix) | jusqu'à 4K | optionnel |
| Veo 3.1avec audio | $1.50–$3.00 | 4–8 s (au choix) | jusqu'à 4K | optionnel |
Les prix Veo affichés concernent le 720p/1080p ; la 4K est plus chère. Les modifications conversationnelles avec Omni Flash sont considérées comme de nouvelles générations au même tarif forfaitaire $1.00. Tableaux complets sur la page des tarifs.
landings.geminiOmni.section5.compareLinks
Évaluation pratique : ce que l'API prend réellement en charge, les fonctionnalités exclusives à Flow, les coûts réels par clip.
Lire le guideLa structure d'invite en sept parties, les termes de mouvement de caméra et les repères audio.
Lire le guidePremières images, images de fin, boucles et vidéos étendues.
Lire le guideGemini Omni Flash est le premier modèle de la famille Gemini Omni de Google — un modèle mondial qui transforme le texte, les images ou un clip précédent en une courte vidéo 720p avec un son synchronisé généré en un seul passage. Il a été lancé aux consommateurs en mai 2026 et a atteint l'API sous le nom de gemini-omni-flash-preview le 30 juin 2026. Sur BananaBanana, il fonctionne en production aux côtés de la famille Veo 3.1.
Forfaitaire $1.00 par génération sur BananaBanana, quelle que soit la durée choisie par le modèle (3–10 secondes) — audio inclus, sans abonnement. Une édition conversationnelle d'un clip existant est considérée comme une nouvelle génération, au même tarif forfaitaire $1.00. Vous rechargez en crypto à partir de 1 $ et payez par clip.
Oui — toujours. Chaque clip est livré avec un audio natif synchronisé : ambiance, effets, voire discours si vous le demandez. Vous ne pouvez pas le désactiver ; le seul contrôle est le texte, décrivez donc le paysage sonore via une ligne « Audio: » au sein de l'invite.
Non. L'API ne dispose pas de paramètre de durée — le modèle choisit entre 3 et 10 secondes en fonction de l'invite — et le rendu est uniquement en 720p à 24 ips. Vous pouvez cependant choisir le rapport hauteur/largeur : 16:9 pour le grand écran ou 9:16 vertical pour les Shorts, Reels et TikTok.
Générez un clip, puis décrivez le changement — « faites neiger », « échangez la tasse contre un verre » — et Omni Flash régénère la scène en maintenant la cohérence du personnage, de l'éclairage et de la caméra. Les modifications s'enchaînent. Chaque modification coûte le même tarif forfaitaire $1.00. Cela remplace la fonction d'extension de style Veo, que Omni ne prend pas en charge.
Optez pour Omni Flash lorsque le son est primordial et que le format est une vidéo courte verticale ou sociale : l'audio est toujours activé, la physique est réaliste, et l'itération se fait par conversation pour un tarif forfaitaire $1.00. Choisissez Veo 3.1 lorsque vous avez besoin d'un contrôle précis — durées exactes de 4/6/7/8 secondes, résolutions jusqu'à 4K, audio optionnel, premières/dernières images et extensions jusqu'à 148 secondes.
Non. BananaBanana accepte uniquement les cryptomonnaies — USDT, USDC, BTC, ETH, SOL, TON et d'autres devises majeures, avec un rechargement minimum de 1 $. Inscrivez-vous avec un e-mail, rechargez, générez ; le solde inutilisé n'expire jamais.
Gemini Omni Flash — $1.00 forfaitaire par clip avec audio permanent ; Veo 3.1 à partir de $0.10. Payez à l'utilisation en crypto, sans abonnement, 0.10 $ offerts pour commencer.