Anwendungsfall · KI-UGC-Video

KI-UGC-Werbung aus zwei Fotos

Eine UGC-Anzeige ist jemand, der in eine Handykamera spricht, dein Produkt in der Hand. Hier wird sie generiert statt gedreht: Du bringst ein Produktfoto und eine Person mit, das Modell baut das Startbild und animiert es dann – Stimme und Raumklang im selben Durchgang. Ein Clip kostet $0.09–$1.00 mit Gemini Omni Flash und bis zu $3.00 mit Veo 3.1 inklusive Ton, das Startbild $0.11, und nichts davon ist ein Abo.

Komplett für diese Seite produziert: zwei Referenzfotos → ein Startbild mit Nano Banana Pro → acht Sekunden Gemini Omni Flash, Sprache und Raumklang zusammen mit dem Bild generiert. $1.13 für genau diese Aufnahme. Mit Ton abspielen.
01Was es ist

Was ist ein KI-UGC-Video?

Ein KI-UGC-Video ist eine kurze Anzeige im Format von User-generated Content – eine Person spricht in eine Handykamera, hält ein Produkt, sitzt in Küche oder Wohnzimmer statt im Studio –, die von einem Videomodell generiert statt mit einem Creator gedreht wird. Die Produktion besteht aus drei Aufrufen: Referenzfotos von Produkt und Person, ein Standbild, das festlegt, wer im Bild ist und was er hält, dann ein Videomodell, das dieses Bild mit synchroner Sprache animiert. Zwei Modelle decken das hier ab. Gemini Omni Flash ist das günstige und das neuere – Googles Model Card zählt die Simulation realer Physik zu seinen Fähigkeiten und komplexe Bewegung zu den verbleibenden Schwächen, und das deckt sich mit dem, was ich sehe: Normales Hantieren übersteht es meistens, aufwendiges Hantieren ist ein Münzwurf. Veo 3.1 ist das, wozu du greifst, wenn eine Einstellung davon abhängt, dass sich ein Gegenstand richtig verhält. Ein Clip kostet $0.09–$1.00 mit Omni Flash, $1.00 mit Veo 3.1 Fast und $3.00 mit dem vollen Veo 3.1 für acht Sekunden mit Ton, bis zu $6.00 in 4K – und er ist in ein paar Minuten gerendert statt in den zwei bis vier Wochen, die ein Creator-Briefing normalerweise frisst.

Was kostet ein Clip 2026 wirklich?

Die Rechnung für den Clip oben, ungerundet: $0.11 für die Produktreferenz, $0.11 für die Person, $0.11 für das Startbild, das beide zusammenbringt, $0.80 für acht Sekunden Omni Flash – $1.13 insgesamt. Die sechs Sekunden lange Hochkant-Version weiter unten hat $0.60 gekostet. Die Stimme separat neu aufzunehmen kostet $0.01 pro 200 Zeichen Skript, etwa einen Cent pro Satz. Neue Konten bekommen $0.20 geschenkt – das reicht für ein Referenzfoto und ein Startbild, genug, um zu sehen, ob die Figur funktioniert, bevor du für Video zahlst.

Das ist der Preis für den ersten Versuch, und erste Versuche sind kein Plan. Manche Clips sitzen auf Anhieb; viele brauchen zwei oder drei, weil ein Satz flach klingt, eine Hand etwas Seltsames macht oder das Modell die Kleidung ablehnt. Und dann ist da noch das, was niemand in den Preis schreibt: Eine Anzeige ist selten ein einzelner Clip. Ein Spot von 20–30 Sekunden besteht meist aus drei oder vier zusammengeschnittenen Aufnahmen – Hook, Produkt in der Hand, Nahaufnahme, Abschluss –, die realistische Rechnung für eine fertige Anzeige liegt also bei ein paar Dollar, nicht ein paar Cent, und sie steigt schnell, wenn du die bewegungsintensiven Einstellungen mit dem vollen Veo 3.1 zu je $3.00 drehst. Der Schnitt ist der kostenlose Teil: ffmpeg kürzt, verbindet und legt Ton über Video, direkt in der Kommandozeile, ganz ohne Schnittprogramm.

02Der Ablauf

Zwei Fotos rein, eine Anzeige raus

  1. Echte Referenzen mitbringen

    Ein sauberes Produktfoto und ein Foto der Person. Alles, was im Input unscharf, abgeschnitten oder seltsam beleuchtet ist, kommt im Video vervielfacht zurück.

  2. Das Startbild bauen

    Generiere ein Standbild mit beiden Referenzen – die Person mit dem Produkt, so gerahmt, wie die Anzeige anfangen soll. $0.11 mit Nano Banana Pro, und du kannst es wiederholen, bis es passt.

  3. Dieses Bild animieren

    Schick das Standbild als Startbild rein und beschreib die Bewegung und den Satz, den sie sagt. Omni Flash berechnet $0.10 pro Sekunde 720p mit Ton; Veo 3.1 kostet mehr und ist das Modell, das du probieren solltest, wenn eine einzige Aufnahme mehrere Aktionen hintereinander tragen muss.

KI-generiertes Produkt-Referenzfoto: eine markenlose Serum-Pipettenflasche aus Braunglas mit cremefarbener Keramikkappe auf hellem Leinen
Referenz 1 – das Produkt, ein sauberer Winkel, gleichmäßiges Licht. Nano Banana Pro, $0.11.
KI-generiertes Creator-Referenzporträt: eine Frau in cremefarbenem Strickpullover in einem hellen Wohnzimmer
Referenz 2 – die Person. Dasselbe Licht und dieselbe Kleidung, die du in der Anzeige haben willst.
KI-generiertes UGC-Startbild: die Frau aus dem Referenzporträt hält die Serumflasche aus Braunglas neben ihrer Schulter, Handykamera-Ausschnitt
Das Startbild, aus beiden Referenzen gleichzeitig generiert – dieses Standbild ist es, was das Videomodell fortsetzt.
03Referenzen

Alles danach ist nur so gut wie das, was du reingibst

Das ist der Teil, den alle überspringen, und genau der entscheidet über das Ergebnis. Ein Modell, das einen unscharfen Handy-Schnappschuss einer Flasche im Dreiviertelprofil bekommt, scheitert nicht laut – es erfindet still die Seite, die es nicht sieht, und genau diese erfundene Seite ist dann acht Sekunden lang im Bild. Gib ihm ein flaches, gleichmäßig ausgeleuchtetes Produktfoto mit dem Etikett zur Kamera, und dieselbe Flasche übersteht den Bildschritt, den Videoschritt und die Bearbeitung danach.

Bei der Person ist es genauso. Googles Veo-Dokumentation sagt es ganz direkt: Wähle klare, gut ausgeleuchtete Bilder, die das Motiv aus dem gewünschten Winkel zeigen, und halte Objektiv- und Lichtbeschreibung zwischen den Einstellungen identisch. Meine Faustregel nach ein paar Dutzend solcher Clips: Wenn Referenzporträt und geplante Szene sich nicht einig sind, woher das Licht kommt, driftet das Gesicht irgendwo in die Mitte und sieht nicht mehr wie dieselbe Person aus.

Ein guter Produktwinkel

Ein einziges flaches, gleichmäßig ausgeleuchtetes Foto schlägt fünf beiläufige Schnappschüsse. Spiegelungen, Bewegungsunschärfe und eine Hand, die das halbe Etikett verdeckt, werden allesamt durch Erfindung ersetzt.

Gleiche Person, gleicher Look

Halte Frisur, Kleidung und Make-up über alle Referenzfotos gleich. Gemischte Looks mitteln sich zu einem Gesicht, das zu keinem passt.

Licht angleichen

Ein mit Blitz aufgenommenes Porträt in einer Küche mit weichem Tageslicht wirkt wie eine Montage. Nimm in der Referenz das Licht, das die Anzeige tatsächlich haben wird.

Vorsicht bei kleiner Schrift

Nano Banana Pro gibt kurze Etikettentexte sauber wieder; eine dichte Inhaltsstoffliste wird zu Textur. Wenn die Schrift wichtig ist, plan lieber eine Nahaufnahme mit echter Verpackung.

Die Bildgestaltung kommt später

Referenzen müssen nicht wie eine Anzeige komponiert sein. Die Komposition ist Aufgabe des Startbilds – das ist der Schritt, in dem du mit dem Modell diskutierst.

Gib ihm keinen Ausschnitt

Ein 300-Pixel-Ausschnitt aus einem Marktplatz-Angebot gibt dem Modell fast nichts, woran es sich halten kann. Originale in voller Auflösung, jedes Mal.

04Startbild

Warum das Startbild reine Referenzen schlägt

Beide Wege funktionieren: Du kannst dem Videomodell deine Referenzfotos geben und es die Szene komponieren lassen, oder du generierst erst ein Standbild und animierst das. In der Praxis ist der zweite Weg besser, und der Grund ist banal – ein Videomodell, das die Komposition erfinden soll, erfindet sie in jedem Frame neu, während ein Modell mit einem Standbild sie nur fortsetzen muss. Bei Gemini Omni Flash ist der Unterschied so groß, dass ich für Produktaufnahmen keine reinen Referenzen mehr verwende.

Unten zwei Clips, gleicher Prompt, gleiche Referenzen, je sechs Sekunden, je $0.60. Der einzige Unterschied: ob ein freigegebenes Standbild als Startbild reinging. Sonst wurde nichts verändert, und keiner der Clips wurde neu gewürfelt.

Nur Referenzen

Kein Startbild. Die cremefarbene Kappe verschwindet in der ersten Sekunde, die Flasche wird zu einer anderen dunklen Flasche, und am Ende ist sie aus dem Bild gedriftet. Ihr Gesicht ist in Ordnung – das Licht darauf ist wohl sogar besser als in der Aufnahme daneben. Was kaputtgeht, ist das Produkt.

Aus einem freigegebenen Startbild

Gleicher Prompt, gestartet von einem Standbild, das wir uns vorher angesehen haben. Kappe, Glas, Bildausschnitt und Kameraabstand halten die vollen sechs Sekunden, weil das Modell ein Bild fortgesetzt hat, statt eins zu raten.

Ehrlich gesagt: Der Weg nur über Referenzen ist nicht kaputt – das Gesicht hat gut gehalten, und für eine Szene ohne Produkt in der Hand reicht das oft. Das Licht ist in dieser Aufnahme sogar schöner: weicher im Gesicht, weniger Fensterkontrast, weil das Modell einen Raum komponiert hat, der ihm gefiel, statt unseren fortzusetzen. Ein Vorbehalt, der die Lesart ändert: Unsere Creatorin ist generiert, kein Foto einer echten Person, also hatte das Modell Spielraum, sie neu auszuleuchten. Ein echtes Porträt legt Licht und Haut viel stärker fest, und der Weg nur über Referenzen hat weniger Freiheit, ihm zu schmeicheln. Was du hier kaufst, ist Kontrolle, nicht Qualität. Bei Veo 3.1 ist die Wahl schon getroffen: Die API von Google nimmt entweder ein Startbild oder bis zu drei Referenzbilder, nie beides in derselben Anfrage, und Referenzbilder setzen die Länge von acht Sekunden voraus.

05Modellwahl

Die Einstellung zum Modell passend wählen

Omni Flash ist sehr gut in dem Format, in dem UGC tatsächlich lebt: eine Person, die in die Linse spricht. Interviews, Podcast-artige Stücke, eine Gründerin, die ein Produkt erklärt, jemand, der ein Glas hält und es beschreibt – und es rendert Mund, Mikrobewegungen und Raumklang in einem Durchgang. Damit ist es der günstigste Weg, eine synchrone Stimme aus einem Videomodell zu bekommen. Es ist außerdem das neuere der beiden Modelle, und Google verkauft es über Physik: Die Ankündigung spricht von einem intuitiven Verständnis für Schwerkraft, kinetische Energie und Strömungsdynamik, und die Model Card führt die Simulation realer Physik als Fähigkeit auf, nennt aber komplexe Bewegung als bekannte Schwachstelle. Beide Hälften stimmen in der Praxis. Dinge fallen, Flüssigkeiten fließen, Gewicht wirkt richtig – bis die Einstellung eine Kette präziser Handgriffe mit einem Gegenstand verlangt.

Die Grenze verläuft also nicht zwischen sprechenden Köpfen und Bewegung, sondern bei der Frage, wie viel Choreografie eine einzige Aufnahme tragen muss. Der Test unten ist das harte Ende dieser Skala, kein Urteil über eines der Modelle: gleiches Startbild, gleicher Prompt, je ein Modell – Flasche aufschrauben, Pipette drücken, zwei Tropfen in die offene Handfläche, alles in acht Sekunden.

Gemini Omni Flash · 8 s · $0.80

Das Aufschrauben ist überzeugend, die Pipette kommt sauber heraus, und die Tropfen landen tatsächlich in der Handfläche – der Flüssigkeitsteil passt. Das Objekt nicht: Die Flasche verschwindet aus ihrer unteren Hand, sobald sich die Handfläche öffnet, taucht zum Zuschrauben wieder auf, und am Ende hat sie leere Hände. Eine der vier Aktionen ist weggefallen.

Veo 3.1 Fast · 8 s mit Ton · $1.00

Identischer Prompt, identisches Startbild – und wohlgemerkt Veo 3.1 Fast, die günstige Stufe, nicht das volle Modell. Es behält die Flasche durch alle vier Aktionen. Eine halbe Sekunde lang geistert eine dritte Hand durchs Bild, artefaktfrei ist es also auch nicht; es hat die Abfolge einfach zusammengehalten.

In die Kamera sprechen → Omni Flash

Lippenbewegung, Raumklang und Sprache kommen zusammen, $0.10 pro Sekunde. Für ein Review, ein Testimonial oder einen Dialog zu zweit ist es die naheliegende Wahl.

Lange Handlungsketten → auch Veo testen

Eine Bewegung schafft Omni; bei vier hintereinander fangen Aufnahmen an, Aktionen zu verlieren. Unser Vergleich lief mit Veo 3.1 Fast: $1.00 für acht Sekunden mit Ton, das volle Veo 3.1 kostet $3.00 – generiere beide und behalte die, die funktioniert.

Kleidung ändert das Urteil

Der Sicherheitsfilter von Omni ist bei Kleidung spürbar strenger: Eine Fitness-Creatorin im Sport-BH wird dort viel öfter abgelehnt als bei Veo 3.1, gleicher Prompt, gleiche Referenz. Plan die Kleidung oder plan das Modell.

Länge und Auflösung

Omni Flash macht 3–10 Sekunden pro Clip, genau so viele, wie du bezahlst – 720p in der ersten Generation, 360p bis 4K bei Omni 1.1, das eine Szene außerdem auf 40 Sekunden verlängern kann. Veo 3.1 macht 4, 6 oder 8 Sekunden bis zu nativem 4K, und seine Clips lassen sich über den ersten Schnitt hinaus verlängern.

Ton: immer oder optional

Jeder Omni-Clip hat Ton, ob du willst oder nicht. Bei Veo ist Ton ein Schalter – stumme Renderings sind günstiger, und das zählt, wenn die Stimme sowieso von woanders kommt.

Ablehnungen kosten nichts

Eine blockierte Generierung wird bei beiden Modellen automatisch erstattet. Teuer an einer Ablehnung sind die vier Minuten, nicht der Dollar.

06Stimme & Schnitt

Wenn die Stimme einen zweiten Take braucht

Omni Flash schreibt die Sprache in denselben Durchgang wie das Bild, und bei umgangssprachlichem Englisch passt das meistens. Wackelig wird es bei Markennamen – erfundene Produktnamen, Fremdwörter, Modellnummern, alles, wobei man auch einem Muttersprachler sagen müsste, wie es ausgesprochen wird. Die größere Version dieses Problems sind andere Sprachen als Englisch, und das hat jedes Videomodell: Russischsprachige Reviewer, die Seedance 2.5 testen, beschreiben einen Satz, der akzeptabel beginnt und unterwegs zerfällt – unbetonte Vokale falsch reduziert, Betonung auf der falschen Silbe, und am Ende einer fünfzehnsekündigen Szene ein Akzent, der eher nach slawischem Mischmasch klingt als nach Russisch, weil Russisch, Ukrainisch und Belarussisch so nah beieinander liegen, dass das Modell sie vermengt. Manche Wörter kommen sauber, das nächste verrät die ganze Aufnahme. Wenn dein Skript nicht auf Englisch ist, hör dir das Ganze an, bevor du es freigibst.

Die Lösung: Die Stimme nicht vom Videomodell verlangen, sondern separat generieren. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) läuft über dasselbe Guthaben auf unserem MCP-Server: $0.01 pro 200 Zeichen Skript, 30 Stimmen, ein Sprecher oder ein Dialog zu zweit, Ausgabe als WAV mit 24 kHz. Die Regieanweisung ist einfaches Englisch – Persona, Tempo, Akzent und die Lautschrift jedes Wortes, das richtig ausgesprochen werden muss. Dann legst du die Spur in einem beliebigen Editor über den Clip. Halte den neu geschriebenen Satz etwa so lang wie die Originalaufnahme, dann passt der Mund noch ungefähr; wo nicht, schneid aufs Produkt.

Generiertes Voice-over · $0.01

Ein Skript mit 200 Zeichen, gelesen von Gemini 3.1 Flash TTS mit einer einzigen Regiezeile: freundliche junge Frau, Handy-Review in ihrer Küche, etwas schnell, und den erfundenen Markennamen französisch aussprechen. Dreizehn Sekunden Audio, ein Cent, ganz ohne Videomodell.

Auch zum Zusammenbauen der Anzeige brauchst du kein Schnittprogramm. ffmpeg hängt Aufnahmen aneinander, schneidet die halbe Sekunde heraus, in der eine Hand etwas Seltsames macht, tauscht den generierten Ton gegen deine TTS-Spur, setzt eine Überblendung und exportiert die 9:16-Version – alles in einer Kommandozeile, kostenlos, auf jedem Rechner. Die Syntax ist berüchtigt unfreundlich, und genau deshalb passt sie gut zu einem Modell: Beschreib Claude oder einem anderen LLM den Schnitt, den du willst, nimm den Befehl, führ ihn aus. Für einen UGC-Spot aus drei Clips ist das die komplette Postproduktion – und der Grund, warum die Zahlen auf dieser Seite bei den Generierungskosten bleiben, statt noch ein Abo obendrauf zu packen.

07Preise

Was kostet eine KI-UGC-Anzeige 2026?

Stückpreise der Modelle in einem KI-UGC-Video-Workflow
ModellPreisEinheitTon
Nano Banana ProReferenzen & Startbild$0.11Bild 1K–2K—
Nano Banana 2Entwürfe und Varianten$0.03–$0.13Bild 512px–4K—
Gemini Omni Flash$0.10 pro Sekunde$0.30–$1.003–10 s, 720pimmer an
Veo 3.1 Fastmit Ton$0.50–$1.004–8 s, 720p/1080poptional
Veo 3.1 Litegünstigstes Video$0.10–$0.364–8 s, 720poptional
Gemini 3.1 Flash TTSnur über MCP$0.01pro 200 Zeichennur Stimme

Veo-Preise gelten für 720p und 1080p; 4K kostet mehr. Omni Flash berechnet $0.10 für jede Sekunde Ausgabe, die Cliplänge ist also der Preis. Vollständige Tabellen auf der Preisseite.

Aufladen geht mit Krypto ab $1 oder mit Karte, PayPal und SEPA ab $20. Einzahlungen ab $50 bringen 5 % mehr, ab $100 10 %, und ein aktiver Promo-Code legt noch einmal 10 % derselben Einzahlung drauf – aus $100 mit Code werden so $120 Guthaben. Bei $1.13 für einen Acht-Sekunden-Clip sind das rund hundert Aufnahmen – sagen wir fünfundzwanzig bis dreißig fertige Anzeigen, wenn man Wiederholungen und Schnitte aus mehreren Clips mitrechnet. Der Mengenbonus von +5 % / +10 % gilt nur für Aufladungen mit Krypto.

Alle Modelle und Auflösungen stehen auf der vollständigen Preisseite, und die Seite zu Gemini Omni Flash zeigt, was dieses Modell kann und was nicht.

08Mehr erfahren

Guides aus dem Blog

09FAQ

Fragen, die wirklich gestellt werden

Brauche ich eine echte Person für ein KI-UGC-Video?

Nein. Auch der Creator kann generiert sein – jede Person, die du auf dieser Seite siehst, stammt aus einem Text-Prompt und hat nie existiert. Wenn du das Gesicht einer echten Person verwendest, brauchst du ihre Einwilligung: Das Recht am eigenen Bild gilt für generierte Videos genauso wie für ein Fotoshooting, und die Plattformregeln zu synthetischen Abbildern sind strenger, als die meisten denken.

Kommt bei der nächsten Anzeige dasselbe Gesicht wieder?

Ja, solange du dieselben Referenzfotos behältst und dasselbe Startbild wiederverwendest. Das Startbild aus denselben Referenzen neu zu generieren bringt dich nah ran, aber nicht pixelgenau – die sicherste Gewohnheit ist, jedes freigegebene Startbild aufzubewahren und erneut zu animieren, statt es neu zu bauen.

Verlangen TikTok oder Meta eine KI-Kennzeichnung für generierte UGC-Werbung?

Bei TikTok ja: Die Werberichtlinie zu bearbeiteten Medien und KI-generierten Inhalten verlangt entweder das AIGC-Label aus dem Ads Manager oder einen eigenen sichtbaren Hinweis im Creative. Meta versieht Anzeigen, die es als generiert erkennt, automatisch mit eigenen KI-Labels. Beide Richtlinien haben sich 2026 geändert – prüf also vor einer großen Kampagne die aktuelle Fassung, statt einem Blogpost zu vertrauen. Diesem hier eingeschlossen.

Welches Modell nehme ich für eine UGC-Anzeige mit sprechender Person?

Fang mit Gemini Omni Flash an, $0.10 pro Sekunde, Ton inklusive – für eine Person, die in die Kamera spricht, ist es das günstigste und unkomplizierteste, und es ist das neuere Modell, mit Physik, die Google ausdrücklich bewirbt. Versteh das nicht als „Omni kann keine Bewegung“: Es gießt, es lässt fallen, es trägt Gewicht. Was es verliert, sind lange Ketten präziser Handgriffe in einer Aufnahme – in unserem Pipetten-Test mit vier Aktionen hat es die Flasche verloren, Veo 3.1 Fast hat sie behalten. Für einen Hook oder ein Testimonial also Omni. Für eine Einstellung, die auf Choreografie aufbaut, generierst du auf beiden und behältst die Aufnahme, die funktioniert; die misslungene kostet Cents.

Kann ich selbst gedrehtes Material verwenden?

Ja, bis zu 10 Sekunden davon. Lad deinen Clip hoch, und Omni Flash bearbeitet ihn als Video-zu-Video – Licht, Hintergrund, was die Person in der Hand hält –, während die Aufnahme erhalten bleibt. Längere Quellen werden vor der Generierung auf das Limit des Modells gekürzt.

Was passiert, wenn eine Generierung abgelehnt wird?

Das Guthaben wird automatisch erstattet, sowohl bei Omni Flash als auch bei Veo. Ablehnungen häufen sich bei Kleidung, Minderjährigen und erkennbaren realen Personen; die Kleidungsregel aus dem Abschnitt zur Modellwahl oben spart die meisten Wiederholungen.

Ganze Antwort lesen
Kann ich das aus Claude, Cursor oder meinem eigenen Skript steuern?

Ja – dieselben Modelle sind über unseren MCP-Server verfügbar, einschließlich des Sprachmodells. Referenzbilder und Startbilder lassen sich als Job-IDs, öffentliche URLs oder inline als base64 übergeben, sodass ein ganzer UGC-Batch aus einem Agenten heraus geskriptet werden kann.

Was kostet eine komplette 30-Sekunden-Anzeige, nicht nur ein Clip?

Zähl Aufnahmen, nicht Clips. Ein Spot von 20–30 Sekunden besteht normalerweise aus drei oder vier zusammengeschnittenen Clips, und jeder braucht ein paar Anläufe, bis er brauchbar ist – ein flach gesprochener Satz, eine Hand, die etwas Seltsames macht, eine Ablehnung. Bei $0.80 für acht Sekunden Omni Flash landet eine fertige Anzeige im niedrigen einstelligen Dollarbereich; drehst du die bewegungsintensiven Einstellungen mit dem vollen Veo 3.1 zu je $3.00, bist du im zweistelligen Bereich. Der Schnitt kostet nichts extra: ffmpeg verbindet die Aufnahmen, kürzt sie und legt das Voice-over drüber, direkt in der Kommandozeile – und die Befehle kann dir ein LLM schreiben.

Zwei Fotos und ein paar Dollar

Kostenlos registrieren mit $0.20 Startguthaben, aufladen mit Krypto ab $1 oder Karte ab $20. Das erste Startbild in etwa einer Minute, der erste Clip in fünf.