Zurück zum Blog
BananaBanana Teamtutorialvideoimage-to-video

KI Bild zu Video: So wird aus jedem Foto ein Clip

Wie KI Bild zu Video funktioniert, welches Modell passt (Veo 3.1, Omni Flash, Wan 3.0, Grok), echte Preise ab $0.10 pro Clip, Bewegungsprompts, Loops, 148-Sekunden-Ketten.

KI Bild zu Video: So wird aus jedem Foto ein Clip

KI Bild zu Video ist eine Generierungstechnik, bei der ein Modell ein einzelnes Standbild nimmt, es als erstes Bild eines Clips behandelt und alles erfindet, was danach passiert: Bewegung, Kamerafahrt, Lichtwechsel, manchmal Ton. Du lieferst ein Foto und eine Textbeschreibung dessen, was sich bewegen soll. Das Modell gibt ein kurzes Video zurück, meist 4 bis 10 Sekunden lang, in dem genau dein Bild lebendig wird.

Die Kurzfassung, falls dir das reicht: Lade im BananaBanana-Generator ein Foto hoch, beschreib die Bewegung, warte 2–5 Minuten. Ein 4-Sekunden-Clip ohne Ton aus deinem Foto kostet mit Veo 3.1 Lite ab $0.10, mit Ton werden daraus $0.18. Gemini Omni Flash animiert ein Foto mit komplettem Soundtrack ab $0.09 (abgerechnet wird pro Sekunde, von $0.03 bei 360p bis $0.30 bei 4K), und Wan 3.0 schafft das mit kostenlosem Ton ab $0.20 für 4 Sekunden in 480p. Neue Konten bekommen $0.20 Startguthaben geschenkt, das reicht für zwei Testclips ohne Ton.

Wir betreiben sieben Videomodelle im Produktivbetrieb, und jedes davon nimmt ein Foto als Startbild an. Dieser Guide behandelt deshalb alle sieben, geschrieben aus echten Generierungslogs statt aus Marketingseiten. Samt Fehlschlägen. Manche davon sind lehrreicher als die Erfolge.

Wie funktioniert KI Bild zu Video?

Technisch wird das Standbild dem Modell als Konditionierungs-Frame übergeben. Googles Video-Dokumentation zur Gemini API beschreibt Veo 3.1 so, dass es „image-based direction“ und „frame-specific generation“ unterstützt. Auf gut Deutsch: Dein Bild steuert den ganzen Clip, und du kannst bestimmte Frames genau dort festnageln, wo du sie haben willst. Das Modell liest die Szene, schätzt die Physik (wie das Wasser auf deinem Foto kräuseln, wie sich Haare im Wind bewegen würden) und rendert von deinem Ausgangspunkt aus Frame für Frame nach vorn.

Die praktische Folge: Das erste Bild des Ergebnisses ist dein Foto, fast pixelgenau. Alles danach ist erfunden. Gute Prompts verwenden ihre Wörter auf das Erfundene, nicht darauf, noch einmal zu beschreiben, was das Modell ohnehin sieht.

Bei Szenen mit offensichtlicher, schlummernder Bewegung klappt das verblüffend gut. Ein Porträt atmet und blinzelt. Dampf steigt vom Kaffee auf. Ein geparktes Auto fährt los. Weniger gut klappt es, wenn das Foto überhaupt keine plausible Bewegung enthält: Gib ihm ein flaches Produktrendering auf weißem Hintergrund ohne Bewegungshinweis im Prompt, und du bekommst meist einen langsamen, leicht nervösen Zoom. Nicht kaputt, nur langweilig.

Ein altes Foto in zwei Händen, die Szene darin beginnt sich zu kräuseln und zu bewegen – Illustration für KI Bild zu Video

Welches Modell macht aus einem Foto das beste Video?

Alle sieben Videomodelle auf der Plattform nehmen ein Bild als Startbild an. Sie unterscheiden sich in ihren Obergrenzen und im Preis. Zuerst die Google-Modelle:

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Preis (4 s, ohne Ton)$0.70$0.35$0.10—
Preis (4 s, mit Audio)$1.50$0.50$0.18$0.12 bei 360p, $0.40 bei 720p
Max. Auflösung4K4K1080p4K (hochskaliert)
Dauergenau 4/6/7/8 sgenau 4/6/7/8 sgenau 4/6/7/8 sgenau 3–10 s
Audiooptional zuschaltbaroptional zuschaltbaroptional zuschaltbarimmer an
Endbild + Loopsjajajaja (Omni 1.1)
Verlängernbis 148 sbis 148 sneinbis 40 s, plus Videobearbeitung

Mein Standard ist Veo 3.1 Fast. Es behält die nützlichen Stellschrauben (exakte Dauer, optionales Endbild, Verlängerung) zum halben Preis des Flaggschiffs, und bei Social-Media-Formaten fällt der Qualitätsabstand zum vollen Veo 3.1 selten auf. Lite für $0.10 ist mein Testfeld, um zu sehen, ob eine Idee sich überhaupt bewegt, bevor ich echtes Geld ausgebe. Das volle Veo 3.1 ist seinen Preis wert, wenn im Clip Wasser, Stoff oder Zusammenstöße vorkommen oder die Vorgabe 4K lautet. Omni Flash ist die Wahl, wenn der Ton genauso zählt wie das Bild; wir haben es in einem eigenen Test der Omni Flash API auseinandergenommen, falls du Details willst, inklusive der Frage, wie der Sekundenpreis von 360p bis 4K skaliert. Die vorige Omni-Generation, Omni Flash 1.0, lässt sich mit 4 bis 10 Sekunden weiterhin auswählen und nimmt nur ein Startbild an.

Der Clip oben ist eine Veo-3.1-Fast-Generierung aus unserer Produktionspipeline, eigens für diesen Artikel gemacht: ein gerahmtes Foto eines Segelboots auf einem Schreibtisch, und der Prompt verlangt, dass das Meer im Rahmen in Bewegung gerät, während die Kamera langsam heranfährt. Ein Take, kein Schnitt, bewusst ohne Ton (die stumme Stufe von Fast nutzen wir für Entwürfe). Dieses „Foto wacht auf“ ist im Kern genau das, was das Modell mit deinen eigenen Uploads macht.

Dann die beiden Modelle, die im September dazugekommen sind, von Alibaba und xAI:

Wan 3.0Grok Imagine Video 1.5
Preis (4 s, mit Audio)$0.20 bei 480p, $0.40 bei 720p, $0.80 bei 1080p$0.56 bei 720p
Max. Auflösung1080p1080p (Referenzbilder nur bei 720p)
Dauer4, 6, 8, 10, 15, 20 oder 30 sjede ganze Zahl von 4 bis 15 s
Audiostandardmäßig an und kostenlos, abschaltbarimmer an, lippensynchroner Dialog
Endbild + Loopsjanein
Verlängernnein, dafür 30 s in einem Takenein

Wan 3.0 ist das Modell, auf das ich ein Foto richten würde, wenn der Clip länger als zehn Sekunden laufen oder Ton haben muss, ohne dafür extra zu zahlen. Grok ist für das Foto einer Person, die danach etwas sagen soll: Schreib den Satz in Anführungszeichen, und der Mund folgt. Dasselbe Ballonfoto (ein Rendering mit Nano Banana Pro, also ist niemandes Aussehen im Spiel) durch beide, derselbe Prompt: Der gefesselte Ballon soll ein Stück aufsteigen, während der Brenner aufflammt und der Nebel zieht.

Wan 3.0, sechs Sekunden in 720p, $0.60. Es hat das Foto fast pixelgenau übernommen, den Ballon ein paar Meter angehoben, ein Halteseil sichtbar gemacht, das im Standbild nicht zu sehen war, und kurze Brennerstöße samt Vogelgezwitscher auf die Tonspur gelegt, ohne dass man zweimal fragen musste.

Grok Imagine Video 1.5, sechs Sekunden in 720p, $0.84. Dezentere Bewegung, dieselbe Treue zur Vorlage, und ein Detail aus den Logs, das du kennen solltest: Die Datei kam mit 1280×704 zurück, nicht mit echten 720 Zeilen. Für einen Feed egal, beim Compositing lästig.

Video aus einem Foto generieren, Schritt für Schritt

Der ganze Ablauf im Generator kostet dich etwa eine Minute plus Renderzeit.

  1. Stell den Generator auf Video um und wähl ein Modell. Für den ersten Versuch ist Veo 3.1 Lite für $0.10 der günstige Weg, es zu lernen.
  2. Lade dein Foto als Startbild hoch. JPG oder PNG; es wird auf das Seitenverhältnis des Videos zugeschnitten, also prüf die Ränder, bevor du generierst.
  3. Wähl 16:9 oder 9:16. Hochformat funktioniert gut für TikTok und Reels; das Modell kommt mit Porträtformat klaglos zurecht.
  4. Schreib den Bewegungsprompt (nächster Abschnitt) und optional einen Negativprompt mit bis zu 1.000 Zeichen für Dinge, die du nicht willst.
  5. Wähl Dauer und ob du Audio willst. Bei Veo sind beides feste Einstellungen; bei Omni Flash wählst du eine beliebige Länge von 3 bis 10 Sekunden, und Audio ist immer an. Wan 3.0 geht bis 30 Sekunden mit kostenlosem, abschaltbarem Soundtrack, und Grok nimmt jede Länge von 4 bis 15 und spricht immer.
  6. Generieren. Videos brauchen grob 2–5 Minuten. Du kannst den Tab schließen; die Ergebnisse warten 30 Tage in deinem Verlauf.

Das Guthaben wird nur belastet, wenn eine Generierung gelingt. Fehlgeschlagene Renderings werden automatisch erstattet, und das zählt bei Video mehr als bei Bildern, weil du iterieren wirst.

Storyboard aus drei Feldern: eine Hand lädt ein Foto hoch, ein Einstellungsfeld, ein fertiger Videoplayer – Illustration des Bild-zu-Video-Ablaufs

Wie schreibt man Bewegungsprompts für Bild zu Video?

Regel eins: Beschreib die Bewegung, nicht die Szene. Die Szene steckt schon im Foto. „A woman in a red coat stands on a bridge“ verschwendet den Prompt auf Fakten, die das Modell schon hat. „She turns toward the camera and smiles as wind lifts her hair, slow dolly-in“ ist genauso lang und reines Signal.

Kamerabegriffe leisten bei Veo viel. Dolly-in, Orbit, Handkamera, statische Stativeinstellung, langsamer Schwenk nach links. Die Modelle wurden offensichtlich mit Filmmaterialbeschreibungen trainiert und reagieren auf Filmvokabular zuverlässiger als auf vage Formulierungen wie „make it dynamic“. „Dynamic“ würde ich wohl ganz weglassen. Niemand ist sich einig, was es bedeutet, auch das Modell nicht.

Eine Lektion, die wir beim Produzieren von Demo-Clips für diesen Blog teuer gelernt haben: Diese Modelle behalten bei, was im Startbild bereits passiert, und lassen Aktionen, die erst später beginnen sollen, stillschweigend fallen. Wir haben Omni Flash einmal um ein Pfannkuchen-Wenden „etwa in der Mitte des Clips“ gebeten und zehn Sekunden lang einen Pfannkuchen bekommen, der einfach nur dalag. Dreimal hintereinander, einen Dollar pro Zehn-Sekunden-Take. Die Aktion als bereits laufend umzuschreiben, hat es beim ersten Versuch gelöst. Also: „syrup is pouring onto the stack“ schlägt „syrup starts pouring after two seconds“, und speziell für Bild zu Video gilt: Wähl ein Ausgangsfoto, in dem die gewünschte Aktion zumindest plausibel mitten im Ablauf sein kann.

Ein paar Muster, die sich immer wieder bezahlt machen:

  • Porträts: „subtle breathing, a slow blink, then a small smile; camera locked“ wirkt lebendig, ohne das unheimliche Verziehen, das große Bewegungen auslösen.
  • Produkte: „slow 180-degree orbit around the object, studio lighting stays constant“ ist das Arbeitspferd. Halte den Hintergrund im Ausgangsfoto schlicht.
  • Landschaften: Nenn die bewegten Elemente („clouds drift right, grass sways, light shifts warmer“), sonst bekommst du den nervösen Notfall-Zoom.

Eine Regieklappe neben handschriftlichen Prompt-Notizen mit Pfeilen, die Kamerabewegungen über ein Foto skizzieren – Illustration zum Schreiben von Bewegungsprompts

Loops, Endbilder und 148-Sekunden-Videos

Die Modelle von Veo 3.1 nehmen neben dem Startbild optional auch ein Endbild an, genauso Omni 1.1 und Wan 3.0. Gib einem Modell zwei verschiedene Fotos, und es rendert einen Übergang dazwischen. So verwandelst du eine Tagesaufnahme in eine Nachtaufnahme oder eine Skizze in ein fertiges Produkt. Gib ihm zweimal dasselbe Foto, und du bekommst einen Clip, der dort endet, wo er begann: ein sauberer Loop, fertig als Website-Hintergrund oder als Post im Cinemagraph-Stil. Das ist meine liebste unterschätzte Funktion auf der Plattform.

Die Verlängerung ist der andere Veo-Trick. Ein fertiger Clip lässt sich mit einem neuen Prompt um 7 Sekunden fortsetzen, und die Kette kann insgesamt bis zu 148 Sekunden laufen, mit voller visueller Kontinuität (nur Veo 3.1 und Fast; Lite setzt hier aus). Eine lange Kette mit einem eigenen Foto zu beginnen, ist das, was die heutigen APIs dem Filmemachen ohne Storyboard am nächsten bringen. Die Kosten summieren sich allerdings auch, also rechne, bevor du dich in die Idee verliebst. Reichen dir 30 Sekunden, rendert Wan 3.0 das in einem Take aus deinem Foto, ohne Zusammenstückeln und ohne Kontinuitätsdrift, für $1.50 in 480p oder $3.00 in 720p.

Omni Flash hat inzwischen eine eigene Verlängerung: Jeder Schritt hängt 3 bis 10 Sekunden an den letzten Clip, verkettbar bis insgesamt etwa 40 Sekunden, also eine niedrigere Obergrenze als die 148 von Veo. Außerdem gibt es nebenher die dialogbasierte Bearbeitung: Beschreib eine Änderung am fertigen Clip („make it dusk, keep everything else the same“) und bezahl seine Sekunden noch einmal – es nimmt auch Videos an, die es nicht selbst generiert hat, einschließlich deiner eigenen Uploads, und gibt sie in derselben Länge zurück. Eine andere Philosophie. Bearbeiten verfeinert einen Moment; Verlängern lässt eine Zeitleiste wachsen.

Ein Filmstreifen, zu einem perfekten Kreis gebogen, auf pastellfarbenem Hintergrund – Illustration eines KI-Videos im Loop, das dort endet, wo es begann

FAQ

Kann ich ein Foto kostenlos in ein Video verwandeln?

Fast. Ein neues BananaBanana-Konto kommt mit $0.20 Startguthaben und ohne Kartenpflicht, genug für zwei 4-Sekunden-Clips ohne Ton mit Veo 3.1 Lite aus deinem Foto. Danach zahlst du pro Clip, ab $0.10.

Was ist die günstigste API für Bild zu Video?

Auf BananaBanana ist es Veo 3.1 Lite: $0.10 für einen 4-Sekunden-Clip ohne Ton in 720p, $0.18 mit Audio. Das gilt pro erfolgreicher Generierung, mit automatischer Rückerstattung bei Fehlschlägen und ohne Abo oder Google-Cloud-Einrichtung.

Kann das generierte Video Ton haben?

Ja. Die Modelle von Veo 3.1 haben einen Audio-Schalter (Dialog, Effekte und Atmosphäre, die du im Prompt beschreibst), Gemini Omni Flash generiert immer Audio, im Sekundenpreis enthalten ($0.03 bei 360p bis $0.30 bei 4K), Wan 3.0 legt kostenlos einen Soundtrack dazu, und Grok Imagine Video 1.5 spricht den Dialog, den du schreibst.

Kann ich ein Hochformatfoto für TikTok oder Reels animieren?

Ja, alle sieben Modelle unterstützen 9:16, und Grok Imagine Video 1.5 bietet zusätzlich 1:1, 3:2 und 2:3. Lade das Foto hoch, wähl 9:16 und denk daran, dass die Vorlage auf dieses Verhältnis zugeschnitten wird. Lass also im Original etwas Luft nach oben.

Wie lang kann ein KI-Video aus einem Foto sein?

Jeder Clip dauert bei den Veo-Modellen 4–8 Sekunden, bei Omni Flash 3–10 Sekunden, bei Grok 4–15 und bei Wan 3.0 bis zu 30 Sekunden in einem Take. Clips von Veo 3.1 und Veo 3.1 Fast lassen sich außerdem in 7-Sekunden-Schritten auf bis zu 148 Sekunden verlängern, mit visueller Kontinuität ab deinem Originalfoto, und Omni 1.1 verlängert auf etwa 40.

tutorialvideoimage-to-video