Gemini Omni Flash API im Test: Was die Preview wirklich kann
Gemini Omni Flash API im Praxistest: was gemini-omni-flash-preview tatsächlich unterstützt, was exklusiv in Flow bleibt und echte Kosten pro Clip.

Gemini Omni Flash ist Googles erstes multimodales „Any-to-Any“-Modell, das Video ausgibt: Du schickst Text, Bilder oder ein vorheriges Ergebnis, und es liefert einen kurzen Clip mit Ton zurück, inzwischen wählbar bis 4K, den du weiter bearbeiten kannst, indem du Änderungen in normaler Sprache beschreibst. Google hat es am 30. Juni 2026 als Public Preview veröffentlicht, zusammen mit Nano Banana 2 Lite, und die Modell-ID in der API lautet gemini-omni-flash-preview.
Kurze Antwort, falls du nur wegen einer Sache hier bist: Die Gemini Omni Flash API unterstützt Text-zu-Video, Bild-zu-Video, Referenz-zu-Video mit bis zu zehn Motivbildern (kombinierbar mit einem Startbild), dialogbasierte Bearbeitung und Video-zu-Video-Bearbeitung eines Clips, den du ihr gibst. Nicht unterstützt werden Seeds, Parameter für Negativprompts und das Abschalten des Tons – die Auflösung reicht inzwischen bis 4K, und die Szenenverlängerung ist seitdem dazugekommen, beides weiter unten. Eine Steuerung der Dauer steht ebenfalls nicht in der Dokumentation, das Feld existiert aber und funktioniert – mehr dazu unten. Wer die Omni-Flash-Demos in Google Flow gesehen hat und von der API denselben Werkzeugkasten erwartet, wird enttäuscht sein. Wir haben das Modell in der Launch-Woche in unseren Generator integriert, dieser Test beruht also darauf, was der Endpunkt tatsächlich zurückgibt, nicht auf der Marketingseite.
Was die Gemini Omni Flash API dir tatsächlich bietet
Die API stellt Omni Flash über die Interactions API (interactions.create) bereit, nicht über den Endpunkt generateVideos, den Veo nutzt. Dieses Detail zählt, denn Interactions sind zustandsbehaftet. Jede Antwort trägt eine ID, auf die du dich später beziehen kannst.
Laut Googles Omni-Dokumentation und einer Woche Herumprobieren am Endpunkt funktionieren heute fünf Aufgaben:
- Text-zu-Video. Ein Prompt rein, ein Clip bis 4K raus, Soundtrack inklusive.
- Bild-zu-Video. Dein Bild wird zum Eröffnungsframe, und der Prompt beschreibt die Bewegung.
- Referenz-zu-Video. Motivbilder halten eine Figur oder ein Produkt in einer neuen Szene konsistent – die Anfrage nimmt bis zu zehn davon, und anders als bei Veo lassen sie sich mit einem Startbild kombinieren.
- Dialogbasierte Bearbeitung. Übergib
previous_interaction_idplus eine kurze Anweisung, und das Modell ändert den Clip, während der Rest erhalten bleibt. - Video-zu-Video-Bearbeitung. Schick ein echtes Video als Inhalt mit
task: "edit", und es kommt umgestylt zurück – ohne Interaction-ID, es funktioniert also auch mit Clips, die das Modell nie erzeugt hat, einschließlich Veo-Renderings und Handyaufnahmen. Der Haken: Die Ausgabe ist immer exakt so lang wie die Eingabe, und die Eingabe ist auf 10 Sekunden begrenzt.
Der Clip oben kam direkt aus gemini-omni-flash-preview durch unsere eigene Pipeline, du siehst also ein echtes Sample und kein Pressematerial. Ein einziger Text-Prompt: ein Papierschiffchen, das durch verschüttete Tinte treibt, „single continuous scene“, damit das Modell nicht schneidet, und eine „Audio:“-Zeile, die Papierrascheln und kleine Wellen verlangt. Wir haben die vollen 10 Sekunden angefragt. Mach den Ton an; das Audio ist ebenfalls generiert.
Jeder Clip läuft 3 bis 10 Sekunden bei 24 fps. Die Dokumentation nennt keinen Parameter für die Dauer, und zum Launch gingen wir davon aus, dass das Modell einfach selbst entscheidet – frag nach „a slow pan across a foggy harbor at dawn“, und du bekommst 9 Sekunden oder 4, such's dir aus. Es stellte sich heraus, dass das Anfrageformat stillschweigend trotzdem eine Dauer akzeptiert, und zwar exakt: Frag nach 3 Sekunden, und du bekommst 3.008 davon, abgerechnet als drei. Genau das bieten wir im Generator an – wer auf Musik schneidet, spielt also nicht mehr Lotto.
Der Prompt dient zugleich als Bedienfeld für alles, was die API nicht anbietet. Sich selbst überlassen, schneidet das Modell gern zwischen mehreren Einstellungen, deshalb gehört „single unbroken shot, no cuts“ in die meisten Prompts; Timecode-Bereiche wie [0-3s] ... [3-6s] ... werden tatsächlich befolgt; Text in Anführungszeichen wird erstaunlich genau als Schrift im Bild gerendert. Unser Generator bietet diese Bausteine per Klick an, weil wir sie ständig von Hand getippt haben.
Audio ist die zweite Überraschung, und eine angenehme. Jede Generierung kommt mit Ton: Umgebungsgeräusche, Effekte, manchmal Sprache, wenn du danach fragst. Abschalten lässt er sich allerdings nicht. Die einzige Steuerung, die du hast, ist Text, also hängen wir inzwischen eine Zeile „Audio: ...“ an die Prompts an, und das funktioniert ziemlich gut.
Was hat Flow, das die API nicht hat?
Google Flow ist ein vollständiges Produktionswerkzeug rund um mehrere Modelle, und genau diese Hülle fehlt der rohen API. Flow bietet dir einen Scene Builder für Sequenzen aus mehreren Einstellungen und voreingestellte Kamerasteuerungen (Einstellungsgröße, Winkel, Bewegung). Eine Nuance, die viele bei der Auflösung falsch verstehen: Auch Flow rendert standardmäßig in 720p. Die Versionen in 1080p und 4K tauchen erst beim Download auf, als Exportoption auf dem Veo-Rendering, nicht als eigener Generierungsmodus. Nichts von diesen Werkzeugen gibt es in gemini-omni-flash-preview.
Hier der ehrliche Vergleich nach einer Woche mit beiden:
| Funktion | Flow / Gemini-App | Gemini Omni Flash API |
|---|---|---|
| Auflösung | 720p-Rendering; 1080p / 4K beim Download | 360p–4K, 24 fps (1080p/4K hochskaliert) |
| Cliplänge | Scene Builder verkettet Einstellungen | 3–10 s, exakt |
| Kamerasteuerung | Voreingestellte Einstellungsgrößen, Winkel, Bewegung | Nur Text-Prompt |
| Video verlängern | Ja (über Veo) | Ja, verkettet in Schritten von 3–10 s bis insgesamt 40 s |
| Bestehendes Video bearbeiten | Remix in der App | Dialogbasiert oder Video-zu-Video mit jedem Clip |
| Audio | An, mit UI-Steuerung | Immer an, Steuerung nur per Prompt |
| Seed / Negativprompt | Für Nutzer ohnehin verborgen | Nicht unterstützt |
| Clips pro Anfrage | Einer nach dem anderen | Einer pro Interaction, kein sampleCount |
Manches davon räumt die Dokumentation offen ein. Googles Docs halten fest, dass Videoverlängerung und Interpolation „are not supported“, und dasselbe gilt für System-Instructions, Temperature und Parameter für Negativprompts (sie empfehlen, Negatives in den normalen Prompt zu schreiben, was nach meiner Erfahrung vielleicht in der Hälfte der Fälle klappt). Videoreferenzen stehen mit einer Grenze von 3 Sekunden im API-Schema, aber die Docs räumen ein, dass das Modell sie noch nicht korrekt verarbeitet.
Die Preview-API ist also ein schmaler Ausschnitt dessen, was das Modell auf Googles eigenen Oberflächen kann. Für eine Preview ist das normal. Es schmerzt trotzdem, wenn ein Kunde einen 1080p-Export verlangt und die Obergrenze bei 720p liegt.

Die dialogbasierte Bearbeitung hält wirklich, was sie verspricht
Bei der Bearbeitung spielt Omni Flash seine Stärke aus. Du generierst einen Clip, schaust ihn dir an und schickst dann eine Folgeanweisung wie „make the jacket red and slow down the camera“ mit der previous_interaction_id des ersten Ergebnisses. Das Modell baut das Video mit deiner Änderung neu auf und bewahrt den Großteil des Originals. Kein erneutes Hochladen, keine Masken, keine Zeitleiste.
Laut Googles Dokumentation zu Gemini Enterprise lassen sich bis zu drei Bearbeitungen hintereinander stapeln, während die Session den Kontext hält. In der Praxis ist jede Bearbeitung ein frisches 720p-Rendering, die Konsistenz driftet also mit jedem Durchgang ein wenig. Gesichter überstehen das besser als Text auf Schildern. Komplexe Bewegung ändert sich manchmal, obwohl du nur um eine Farbkorrektur gebeten hast.
Ein Vorbehalt, auf den wir im Produktivbetrieb gestoßen sind: Eltern-Interactions verfallen auf Googles Seite. Versuchst du, einen vor einiger Zeit generierten Clip zu bearbeiten, kann die API für die referenzierte Interaction einen 404-Fehler zurückgeben. Bei BananaBanana zeigen wir das als abgelaufenes Video an und erstatten den Versuch, aber wenn du direkt auf der rohen API aufbaust, plan es ein.

Was kostet Gemini Omni Flash?
Googles Launch-Ankündigung bepreist Omni Flash mit $0.10 pro Sekunde ausgegebenem Video: Ein 3-Sekunden-Ergebnis kostet $0.30, eines mit 10 Sekunden $1.00. Solange die Dauer nach einer Entscheidung des Modells aussah, galt das auch für deine Rechnung – gleicher Prompt, gleiche Einstellungen, anderer Betrag.
Auf BananaBanana ist dieser Pauschalsatz inzwischen nach Auflösung aufgeteilt: $0.03/s bei 360p, $0.10/s bei 720p, $0.15/s bei 1080p, $0.30/s bei 4K – wähl 3 Sekunden in 720p für $0.30 oder die vollen zehn für $1.00, und eine Bearbeitung kostet denselben Sekundenpreis, weil sie ein komplettes Neu-Rendering ist (sie kommt auch exakt so lang zurück wie ihre Vorlage – das Modell kann weder strecken noch kürzen). Nano Banana 2 Lite, am selben Tag gestartet, kostet hier $0.03 pro Bild (Googles API-Preis liegt bei $0.034 für ein 1K-Bild). Die vollständige Preisliste steht im Preisbereich.
Sind zehn Cent pro Sekunde – der Preis für 720p – ein guter Deal? Für einen Entwurf mit Ton, der sonst einen Videodurchgang plus separate Audioarbeit bräuchte, wahrscheinlich ja – und ein 3-Sekunden-Test kostet weniger als ein Veo-Clip. Für stummes B-Roll nein. Veo 3.1 Fast macht günstigere Clips ohne Ton in höherer Auflösung.
Omni Flash oder Veo 3.1 – was solltest du nehmen?
Kurzfassung: Sie teilen sich die Arbeit, aber nicht entlang der Linie „Entwurf gegen Endfassung“, die du vielleicht erwartest.
Eines solltest du vor der Wahl wissen: Der Qualitätsabstand zwischen ihnen hat eigentlich nichts mit Auflösung zu tun. Veo 3.1 rendert Bewegung und Physik überzeugender. Wasser verhält sich wie Wasser, Stoff faltet sich dort, wo er soll, Objekte stoßen zusammen, statt geisterhaft durcheinander hindurchzugleiten. Omni Flash kriegt das oft hin, aber nicht verlässlich, und bei manchen Clips fällt es dir auf, ohne dass du danach suchst.
Nimm Veo 3.1, wenn du eine exakte Cliplänge brauchst (du stellst ganze Sekunden ein, 4 bis 8; Bruchteile gibt es nicht), Ausgabe ohne Ton oder stabilere Physik – bei 4K-Export, Szenenverlängerung und Steuerung über Start- und Endbild hat Omni Flash inzwischen aufgeholt, siehe oben. Letzteres funktioniert inzwischen mit beiden Modellen: Gib dasselbe Bild als Start- und Endbild, und du bekommst einen nahtlosen Loop, das ist der ganze Trick hinter Hintergrundvideos in Endlosschleife. Veo bleibt das Produktionswerkzeug für alles im Breitbild oder mit viel Physik.
Nimm Omni Flash, wenn das Ziel ein Handybildschirm ist. Für TikTok, Shorts oder Reels ist 720p ehrlich gesagt alles, was die Plattform nach ihrer eigenen Kompression übrig lässt, der Ton kommt im selben Durchgang mit, und dialogbasierte Bearbeitung schlägt komplettes Neu-Prompten, während du der Idee hinterherjagst. Hier ist es nicht das Skizzenwerkzeug. Es ist schlicht die bessere Wahl.
Mein persönlicher Workflow nach zwei Tagen: Für Kundenarbeit im Breitbild skizziere ich das Konzept weiterhin in Omni Flash – 3-Sekunden-Takes für $0.30 – und mache den Favoriten dann in Veo in Endqualität neu. Bei einem Hochformatclip, der direkt auf Social Media geht, geht der Omni-Take oft so raus, wie er ist.

Beide Modelle laufen live im BananaBanana-Generator, du kannst sie also mit demselben Prompt vergleichen, ohne eine Zeile Code zu schreiben oder ein Google-Cloud-Projekt einzurichten. Und wenn du die Kurzfassung dieses Tests willst – Funktionen, Grenzen und Preis auf einer Seite –, findest du sie auf der Gemini-Omni-Seite.
FAQ
Was ist gemini-omni-flash-preview?
Das ist die API-Modell-ID von Gemini Omni Flash, Googles dialogbasiertem Modell zur Videogenerierung, das am 30. Juni 2026 als Public Preview erschienen ist. Es generiert und bearbeitet Clips von 3–10 Sekunden mit Audio über die Interactions API und deckt inzwischen Auflösungen von 360p bis 4K ab.
Kann Gemini Omni Flash Video in 1080p oder 4K generieren?
Ja, inzwischen schon. Die API kam ursprünglich nur mit 720p; Omni Flash auf BananaBanana bietet jetzt 360p, 720p, 1080p und 4K, wobei 1080p und 4K als Hochskalierung geliefert werden, nicht als natives Rendering in höherer Auflösung. Google Flow rendert standardmäßig weiterhin in 720p; die Versionen in 1080p und 4K werden dort beim Download von Veo-Renderings angeboten.
Kann ich in der Omni Flash API die Videodauer festlegen?
Ja, auch wenn du es in den Docs nicht findest. Das Anfrageformat akzeptiert eine Dauer, und das Ergebnis trifft sie auf den Frame genau: 3 Sekunden rein, 3.008 Sekunden raus, abgerechnet als drei. Im Generator bieten wir das als Auswahl von 3–10 Sekunden an. Die Ausnahme ist die Bearbeitung – ein bearbeiteter Clip übernimmt immer die Länge des Videos, aus dem er entstanden ist.
Generiert Omni Flash immer Audio?
Ja, jeder Clip enthält einen generierten Soundtrack, und es gibt keinen Schalter, um ihn abzustellen. Beschreib den gewünschten Ton (oder bitte um „quiet ambient room tone“) direkt im Prompt.
Kann Omni Flash bestehende Videos verlängern oder interpolieren?
Inzwischen ja: Die aktuelle Omni-Flash-Generation unterstützt Szenenverlängerung und hängt Fortsetzungen von 3–10 Sekunden an einen Clip, bis insgesamt 40 Sekunden (die ursprüngliche Version beantwortete eine extend-Aufgabe mit „this model does not support video extension“). Dialogbasierte Bearbeitung und Video-zu-Video-Bearbeitung funktionieren wie bisher, mit einem selbst generierten Clip oder mit jedem fertigen Video, das du übergibst, auch einem Veo-Rendering oder deinem eigenen Upload; dabei bleibt die Länge der Eingabe erhalten.