Ein guter Produktwinkel
Ein einziges flaches, gleichmäßig ausgeleuchtetes Foto schlägt fünf beiläufige Schnappschüsse. Spiegelungen, Bewegungsunschärfe und eine Hand, die das halbe Etikett verdeckt, werden allesamt durch Erfindung ersetzt.
Anwendungsfall · KI-UGC-Video
Eine UGC-Anzeige ist jemand, der in eine Handykamera spricht, dein Produkt in der Hand. Hier wird sie generiert statt gedreht: Du bringst ein Produktfoto und eine Person mit, das Modell baut das Startbild und animiert es dann – Stimme und Raumklang im selben Durchgang. Ein Clip kostet $0.09–$1.00 mit Gemini Omni Flash und bis zu $3.00 mit Veo 3.1 inklusive Ton, das Startbild $0.11, und nichts davon ist ein Abo.
Ein KI-UGC-Video ist eine kurze Anzeige im Format von User-generated Content – eine Person spricht in eine Handykamera, hält ein Produkt, sitzt in Küche oder Wohnzimmer statt im Studio –, die von einem Videomodell generiert statt mit einem Creator gedreht wird. Die Produktion besteht aus drei Aufrufen: Referenzfotos von Produkt und Person, ein Standbild, das festlegt, wer im Bild ist und was er hält, dann ein Videomodell, das dieses Bild mit synchroner Sprache animiert. Zwei Modelle decken das hier ab. Gemini Omni Flash ist das günstige und das neuere – Googles Model Card zählt die Simulation realer Physik zu seinen Fähigkeiten und komplexe Bewegung zu den verbleibenden Schwächen, und das deckt sich mit dem, was ich sehe: Normales Hantieren übersteht es meistens, aufwendiges Hantieren ist ein Münzwurf. Veo 3.1 ist das, wozu du greifst, wenn eine Einstellung davon abhängt, dass sich ein Gegenstand richtig verhält. Ein Clip kostet $0.09–$1.00 mit Omni Flash, $1.00 mit Veo 3.1 Fast und $3.00 mit dem vollen Veo 3.1 für acht Sekunden mit Ton, bis zu $6.00 in 4K – und er ist in ein paar Minuten gerendert statt in den zwei bis vier Wochen, die ein Creator-Briefing normalerweise frisst.
Die Rechnung für den Clip oben, ungerundet: $0.11 für die Produktreferenz, $0.11 für die Person, $0.11 für das Startbild, das beide zusammenbringt, $0.80 für acht Sekunden Omni Flash – $1.13 insgesamt. Die sechs Sekunden lange Hochkant-Version weiter unten hat $0.60 gekostet. Die Stimme separat neu aufzunehmen kostet $0.01 pro 200 Zeichen Skript, etwa einen Cent pro Satz. Neue Konten bekommen $0.20 geschenkt – das reicht für ein Referenzfoto und ein Startbild, genug, um zu sehen, ob die Figur funktioniert, bevor du für Video zahlst.
Das ist der Preis für den ersten Versuch, und erste Versuche sind kein Plan. Manche Clips sitzen auf Anhieb; viele brauchen zwei oder drei, weil ein Satz flach klingt, eine Hand etwas Seltsames macht oder das Modell die Kleidung ablehnt. Und dann ist da noch das, was niemand in den Preis schreibt: Eine Anzeige ist selten ein einzelner Clip. Ein Spot von 20–30 Sekunden besteht meist aus drei oder vier zusammengeschnittenen Aufnahmen – Hook, Produkt in der Hand, Nahaufnahme, Abschluss –, die realistische Rechnung für eine fertige Anzeige liegt also bei ein paar Dollar, nicht ein paar Cent, und sie steigt schnell, wenn du die bewegungsintensiven Einstellungen mit dem vollen Veo 3.1 zu je $3.00 drehst. Der Schnitt ist der kostenlose Teil: ffmpeg kürzt, verbindet und legt Ton über Video, direkt in der Kommandozeile, ganz ohne Schnittprogramm.
Ein sauberes Produktfoto und ein Foto der Person. Alles, was im Input unscharf, abgeschnitten oder seltsam beleuchtet ist, kommt im Video vervielfacht zurück.
Generiere ein Standbild mit beiden Referenzen – die Person mit dem Produkt, so gerahmt, wie die Anzeige anfangen soll. $0.11 mit Nano Banana Pro, und du kannst es wiederholen, bis es passt.
Schick das Standbild als Startbild rein und beschreib die Bewegung und den Satz, den sie sagt. Omni Flash berechnet $0.10 pro Sekunde 720p mit Ton; Veo 3.1 kostet mehr und ist das Modell, das du probieren solltest, wenn eine einzige Aufnahme mehrere Aktionen hintereinander tragen muss.



Das ist der Teil, den alle überspringen, und genau der entscheidet über das Ergebnis. Ein Modell, das einen unscharfen Handy-Schnappschuss einer Flasche im Dreiviertelprofil bekommt, scheitert nicht laut – es erfindet still die Seite, die es nicht sieht, und genau diese erfundene Seite ist dann acht Sekunden lang im Bild. Gib ihm ein flaches, gleichmäßig ausgeleuchtetes Produktfoto mit dem Etikett zur Kamera, und dieselbe Flasche übersteht den Bildschritt, den Videoschritt und die Bearbeitung danach.
Bei der Person ist es genauso. Googles Veo-Dokumentation sagt es ganz direkt: Wähle klare, gut ausgeleuchtete Bilder, die das Motiv aus dem gewünschten Winkel zeigen, und halte Objektiv- und Lichtbeschreibung zwischen den Einstellungen identisch. Meine Faustregel nach ein paar Dutzend solcher Clips: Wenn Referenzporträt und geplante Szene sich nicht einig sind, woher das Licht kommt, driftet das Gesicht irgendwo in die Mitte und sieht nicht mehr wie dieselbe Person aus.
Ein einziges flaches, gleichmäßig ausgeleuchtetes Foto schlägt fünf beiläufige Schnappschüsse. Spiegelungen, Bewegungsunschärfe und eine Hand, die das halbe Etikett verdeckt, werden allesamt durch Erfindung ersetzt.
Halte Frisur, Kleidung und Make-up über alle Referenzfotos gleich. Gemischte Looks mitteln sich zu einem Gesicht, das zu keinem passt.
Ein mit Blitz aufgenommenes Porträt in einer Küche mit weichem Tageslicht wirkt wie eine Montage. Nimm in der Referenz das Licht, das die Anzeige tatsächlich haben wird.
Nano Banana Pro gibt kurze Etikettentexte sauber wieder; eine dichte Inhaltsstoffliste wird zu Textur. Wenn die Schrift wichtig ist, plan lieber eine Nahaufnahme mit echter Verpackung.
Referenzen müssen nicht wie eine Anzeige komponiert sein. Die Komposition ist Aufgabe des Startbilds – das ist der Schritt, in dem du mit dem Modell diskutierst.
Ein 300-Pixel-Ausschnitt aus einem Marktplatz-Angebot gibt dem Modell fast nichts, woran es sich halten kann. Originale in voller Auflösung, jedes Mal.
Beide Wege funktionieren: Du kannst dem Videomodell deine Referenzfotos geben und es die Szene komponieren lassen, oder du generierst erst ein Standbild und animierst das. In der Praxis ist der zweite Weg besser, und der Grund ist banal – ein Videomodell, das die Komposition erfinden soll, erfindet sie in jedem Frame neu, während ein Modell mit einem Standbild sie nur fortsetzen muss. Bei Gemini Omni Flash ist der Unterschied so groß, dass ich für Produktaufnahmen keine reinen Referenzen mehr verwende.
Unten zwei Clips, gleicher Prompt, gleiche Referenzen, je sechs Sekunden, je $0.60. Der einzige Unterschied: ob ein freigegebenes Standbild als Startbild reinging. Sonst wurde nichts verändert, und keiner der Clips wurde neu gewürfelt.
Nur Referenzen
Aus einem freigegebenen Startbild
Ehrlich gesagt: Der Weg nur über Referenzen ist nicht kaputt – das Gesicht hat gut gehalten, und für eine Szene ohne Produkt in der Hand reicht das oft. Das Licht ist in dieser Aufnahme sogar schöner: weicher im Gesicht, weniger Fensterkontrast, weil das Modell einen Raum komponiert hat, der ihm gefiel, statt unseren fortzusetzen. Ein Vorbehalt, der die Lesart ändert: Unsere Creatorin ist generiert, kein Foto einer echten Person, also hatte das Modell Spielraum, sie neu auszuleuchten. Ein echtes Porträt legt Licht und Haut viel stärker fest, und der Weg nur über Referenzen hat weniger Freiheit, ihm zu schmeicheln. Was du hier kaufst, ist Kontrolle, nicht Qualität. Bei Veo 3.1 ist die Wahl schon getroffen: Die API von Google nimmt entweder ein Startbild oder bis zu drei Referenzbilder, nie beides in derselben Anfrage, und Referenzbilder setzen die Länge von acht Sekunden voraus.
Omni Flash ist sehr gut in dem Format, in dem UGC tatsächlich lebt: eine Person, die in die Linse spricht. Interviews, Podcast-artige Stücke, eine Gründerin, die ein Produkt erklärt, jemand, der ein Glas hält und es beschreibt – und es rendert Mund, Mikrobewegungen und Raumklang in einem Durchgang. Damit ist es der günstigste Weg, eine synchrone Stimme aus einem Videomodell zu bekommen. Es ist außerdem das neuere der beiden Modelle, und Google verkauft es über Physik: Die Ankündigung spricht von einem intuitiven Verständnis für Schwerkraft, kinetische Energie und Strömungsdynamik, und die Model Card führt die Simulation realer Physik als Fähigkeit auf, nennt aber komplexe Bewegung als bekannte Schwachstelle. Beide Hälften stimmen in der Praxis. Dinge fallen, Flüssigkeiten fließen, Gewicht wirkt richtig – bis die Einstellung eine Kette präziser Handgriffe mit einem Gegenstand verlangt.
Die Grenze verläuft also nicht zwischen sprechenden Köpfen und Bewegung, sondern bei der Frage, wie viel Choreografie eine einzige Aufnahme tragen muss. Der Test unten ist das harte Ende dieser Skala, kein Urteil über eines der Modelle: gleiches Startbild, gleicher Prompt, je ein Modell – Flasche aufschrauben, Pipette drücken, zwei Tropfen in die offene Handfläche, alles in acht Sekunden.
Gemini Omni Flash · 8 s · $0.80
Veo 3.1 Fast · 8 s mit Ton · $1.00
Lippenbewegung, Raumklang und Sprache kommen zusammen, $0.10 pro Sekunde. Für ein Review, ein Testimonial oder einen Dialog zu zweit ist es die naheliegende Wahl.
Eine Bewegung schafft Omni; bei vier hintereinander fangen Aufnahmen an, Aktionen zu verlieren. Unser Vergleich lief mit Veo 3.1 Fast: $1.00 für acht Sekunden mit Ton, das volle Veo 3.1 kostet $3.00 – generiere beide und behalte die, die funktioniert.
Der Sicherheitsfilter von Omni ist bei Kleidung spürbar strenger: Eine Fitness-Creatorin im Sport-BH wird dort viel öfter abgelehnt als bei Veo 3.1, gleicher Prompt, gleiche Referenz. Plan die Kleidung oder plan das Modell.
Omni Flash macht 3–10 Sekunden pro Clip, genau so viele, wie du bezahlst – 720p in der ersten Generation, 360p bis 4K bei Omni 1.1, das eine Szene außerdem auf 40 Sekunden verlängern kann. Veo 3.1 macht 4, 6 oder 8 Sekunden bis zu nativem 4K, und seine Clips lassen sich über den ersten Schnitt hinaus verlängern.
Jeder Omni-Clip hat Ton, ob du willst oder nicht. Bei Veo ist Ton ein Schalter – stumme Renderings sind günstiger, und das zählt, wenn die Stimme sowieso von woanders kommt.
Eine blockierte Generierung wird bei beiden Modellen automatisch erstattet. Teuer an einer Ablehnung sind die vier Minuten, nicht der Dollar.
Omni Flash schreibt die Sprache in denselben Durchgang wie das Bild, und bei umgangssprachlichem Englisch passt das meistens. Wackelig wird es bei Markennamen – erfundene Produktnamen, Fremdwörter, Modellnummern, alles, wobei man auch einem Muttersprachler sagen müsste, wie es ausgesprochen wird. Die größere Version dieses Problems sind andere Sprachen als Englisch, und das hat jedes Videomodell: Russischsprachige Reviewer, die Seedance 2.5 testen, beschreiben einen Satz, der akzeptabel beginnt und unterwegs zerfällt – unbetonte Vokale falsch reduziert, Betonung auf der falschen Silbe, und am Ende einer fünfzehnsekündigen Szene ein Akzent, der eher nach slawischem Mischmasch klingt als nach Russisch, weil Russisch, Ukrainisch und Belarussisch so nah beieinander liegen, dass das Modell sie vermengt. Manche Wörter kommen sauber, das nächste verrät die ganze Aufnahme. Wenn dein Skript nicht auf Englisch ist, hör dir das Ganze an, bevor du es freigibst.
Die Lösung: Die Stimme nicht vom Videomodell verlangen, sondern separat generieren. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) läuft über dasselbe Guthaben auf unserem MCP-Server: $0.01 pro 200 Zeichen Skript, 30 Stimmen, ein Sprecher oder ein Dialog zu zweit, Ausgabe als WAV mit 24 kHz. Die Regieanweisung ist einfaches Englisch – Persona, Tempo, Akzent und die Lautschrift jedes Wortes, das richtig ausgesprochen werden muss. Dann legst du die Spur in einem beliebigen Editor über den Clip. Halte den neu geschriebenen Satz etwa so lang wie die Originalaufnahme, dann passt der Mund noch ungefähr; wo nicht, schneid aufs Produkt.
Generiertes Voice-over · $0.01
Auch zum Zusammenbauen der Anzeige brauchst du kein Schnittprogramm. ffmpeg hängt Aufnahmen aneinander, schneidet die halbe Sekunde heraus, in der eine Hand etwas Seltsames macht, tauscht den generierten Ton gegen deine TTS-Spur, setzt eine Überblendung und exportiert die 9:16-Version – alles in einer Kommandozeile, kostenlos, auf jedem Rechner. Die Syntax ist berüchtigt unfreundlich, und genau deshalb passt sie gut zu einem Modell: Beschreib Claude oder einem anderen LLM den Schnitt, den du willst, nimm den Befehl, führ ihn aus. Für einen UGC-Spot aus drei Clips ist das die komplette Postproduktion – und der Grund, warum die Zahlen auf dieser Seite bei den Generierungskosten bleiben, statt noch ein Abo obendrauf zu packen.
| Modell | Preis | Einheit | Ton |
|---|---|---|---|
| Nano Banana ProReferenzen & Startbild | $0.11 | Bild 1K–2K | — |
| Nano Banana 2Entwürfe und Varianten | $0.03–$0.13 | Bild 512px–4K | — |
| Gemini Omni Flash$0.10 pro Sekunde | $0.30–$1.00 | 3–10 s, 720p | immer an |
| Veo 3.1 Fastmit Ton | $0.50–$1.00 | 4–8 s, 720p/1080p | optional |
| Veo 3.1 Litegünstigstes Video | $0.10–$0.36 | 4–8 s, 720p | optional |
| Gemini 3.1 Flash TTSnur über MCP | $0.01 | pro 200 Zeichen | nur Stimme |
Veo-Preise gelten für 720p und 1080p; 4K kostet mehr. Omni Flash berechnet $0.10 für jede Sekunde Ausgabe, die Cliplänge ist also der Preis. Vollständige Tabellen auf der Preisseite.
Alle Modelle und Auflösungen stehen auf der vollständigen Preisseite, und die Seite zu Gemini Omni Flash zeigt, was dieses Modell kann und was nicht.
Wie Startbild-Animation funktioniert, was in den Bewegungs-Prompt gehört und wo es auseinanderfällt.
Zum GuideWie ein Produkt vom Referenzfoto bis zum fertigen Bild heil bleibt – mit echten Prompts.
Zum GuidePraxistest der Preview-API: was sie unterstützt, was sie ablehnt, was jeder Clip wirklich kostet.
Zum GuideNein. Auch der Creator kann generiert sein – jede Person, die du auf dieser Seite siehst, stammt aus einem Text-Prompt und hat nie existiert. Wenn du das Gesicht einer echten Person verwendest, brauchst du ihre Einwilligung: Das Recht am eigenen Bild gilt für generierte Videos genauso wie für ein Fotoshooting, und die Plattformregeln zu synthetischen Abbildern sind strenger, als die meisten denken.
Ja, solange du dieselben Referenzfotos behältst und dasselbe Startbild wiederverwendest. Das Startbild aus denselben Referenzen neu zu generieren bringt dich nah ran, aber nicht pixelgenau – die sicherste Gewohnheit ist, jedes freigegebene Startbild aufzubewahren und erneut zu animieren, statt es neu zu bauen.
Bei TikTok ja: Die Werberichtlinie zu bearbeiteten Medien und KI-generierten Inhalten verlangt entweder das AIGC-Label aus dem Ads Manager oder einen eigenen sichtbaren Hinweis im Creative. Meta versieht Anzeigen, die es als generiert erkennt, automatisch mit eigenen KI-Labels. Beide Richtlinien haben sich 2026 geändert – prüf also vor einer großen Kampagne die aktuelle Fassung, statt einem Blogpost zu vertrauen. Diesem hier eingeschlossen.
Fang mit Gemini Omni Flash an, $0.10 pro Sekunde, Ton inklusive – für eine Person, die in die Kamera spricht, ist es das günstigste und unkomplizierteste, und es ist das neuere Modell, mit Physik, die Google ausdrücklich bewirbt. Versteh das nicht als „Omni kann keine Bewegung“: Es gießt, es lässt fallen, es trägt Gewicht. Was es verliert, sind lange Ketten präziser Handgriffe in einer Aufnahme – in unserem Pipetten-Test mit vier Aktionen hat es die Flasche verloren, Veo 3.1 Fast hat sie behalten. Für einen Hook oder ein Testimonial also Omni. Für eine Einstellung, die auf Choreografie aufbaut, generierst du auf beiden und behältst die Aufnahme, die funktioniert; die misslungene kostet Cents.
Ja, bis zu 10 Sekunden davon. Lad deinen Clip hoch, und Omni Flash bearbeitet ihn als Video-zu-Video – Licht, Hintergrund, was die Person in der Hand hält –, während die Aufnahme erhalten bleibt. Längere Quellen werden vor der Generierung auf das Limit des Modells gekürzt.
Das Guthaben wird automatisch erstattet, sowohl bei Omni Flash als auch bei Veo. Ablehnungen häufen sich bei Kleidung, Minderjährigen und erkennbaren realen Personen; die Kleidungsregel aus dem Abschnitt zur Modellwahl oben spart die meisten Wiederholungen.
Ganze Antwort lesenJa – dieselben Modelle sind über unseren MCP-Server verfügbar, einschließlich des Sprachmodells. Referenzbilder und Startbilder lassen sich als Job-IDs, öffentliche URLs oder inline als base64 übergeben, sodass ein ganzer UGC-Batch aus einem Agenten heraus geskriptet werden kann.
Zähl Aufnahmen, nicht Clips. Ein Spot von 20–30 Sekunden besteht normalerweise aus drei oder vier zusammengeschnittenen Clips, und jeder braucht ein paar Anläufe, bis er brauchbar ist – ein flach gesprochener Satz, eine Hand, die etwas Seltsames macht, eine Ablehnung. Bei $0.80 für acht Sekunden Omni Flash landet eine fertige Anzeige im niedrigen einstelligen Dollarbereich; drehst du die bewegungsintensiven Einstellungen mit dem vollen Veo 3.1 zu je $3.00, bist du im zweistelligen Bereich. Der Schnitt kostet nichts extra: ffmpeg verbindet die Aufnahmen, kürzt sie und legt das Voice-over drüber, direkt in der Kommandozeile – und die Befehle kann dir ein LLM schreiben.
Kostenlos registrieren mit $0.20 Startguthaben, aufladen mit Krypto ab $1 oder Karte ab $20. Das erste Startbild in etwa einer Minute, der erste Clip in fünf.