Ohne Abo · Preise in Dollar · Guthaben verfällt nie
UGC-Werbung, Kurzserien, KI-Influencer – gerendert ab $0.03. Ohne Abo.
Erstelle Bilder, Videos und Sprache mit einem einzigen Guthaben in Dollar, das nie verfällt, ganz ohne Abo. Videos gibt es ab $0.10; ein 10-Sekunden-Clip mit sprechender Person und Ton kostet $1.00.
UGC-VideowerbungGemini Omni 1.1 Flash9:16 · 10 s · 720p · $1.00
KI-Influencer & virtuelles ModelGrok Imagine Video 1.59:16 · 6 s · 720p · $0.84
Modelle
Nano Banana 2 Lite
Nano Banana 2
Nano Banana Pro
Qwen Image 3.0 Pro
GPT Image 2.5 Flare
GPT Image 2.5 Sunburst
Veo 3.1 Lite
Veo 3.1 Fast
Veo 3.1
Gemini Omni 1.1 Flash
Gemini Omni Flash
Wan 3.0
Grok Imagine Video 1.5
Gemini 3.1 Flash TTS
Nano Banana 2 Lite
Nano Banana 2
Nano Banana Pro
Qwen Image 3.0 Pro
GPT Image 2.5 Flare
GPT Image 2.5 Sunburst
Veo 3.1 Lite
Veo 3.1 Fast
Veo 3.1
Gemini Omni 1.1 Flash
Gemini Omni Flash
Wan 3.0
Grok Imagine Video 1.5
Gemini 3.1 Flash TTS
Funktioniert mit
Claude Code
Claude Desktop
claude.ai
Cursor
VS Code
Gemini CLI
Codex
n8n
Claude Code
Claude Desktop
claude.ai
Cursor
VS Code
Gemini CLI
Codex
n8n
01Was hier entsteht
Fünf Arten von Projekten – und was jedes kostet.
Beispiele und Generierungskosten für jede Projektart. Die Preise basieren auf den aktuellen Tarifen für die angegebenen Einstellungen.
01UGC-Videowerbung
Straßeninterviews und Clips mit dem Produkt in der Hand. Stimme inklusive.
Vertikale 9:16-Clips, in denen eine Person in die Kamera spricht und dein Produkt in der Hand hält. Gemini Omni 1.1 Flash rechnet pro Sekunde ab, Sprache und Straßengeräusche kommen im selben Rendering. Ein 360p-Entwurf kostet etwa ein Drittel des 720p-Preises, und per Verlängerung wird ein Clip bis zu 40 Sekunden lang.
Mit Wan 3.0 bekommt eine Szene bis zu 30 Sekunden in einem Durchgang, Ton ohne Aufpreis. Probier zuerst einen 480p-Entwurf, häng bis zu 10 Referenzen an oder erzähl die Geschichte von einem Eingabevideo aus weiter.
Ein Feed-Influencer, ein virtuelles Model oder ein Markengesicht, SFW. Häng bis zu 14 Referenzfotos an, bekomm bis zu 8 Bilder pro Prompt, ohne sichtbares Wasserzeichen und mit SMO für saubere Veröffentlichung.
Für Shops und Marktplätze. Lade das Foto als Startbild hoch und beschreib die Kamerabewegung. Mit deinem eigenen Foto zu starten ist der zuverlässigste Weg, die Form des Produkts zu erhalten.
Generiere B-Roll mit Wan 3.0 aus einem n8n-Flow oder deinem eigenen Agenten. Probier 480p-Entwürfe, mach Takes von bis zu 30 Sekunden oder setz ein Eingabevideo fort. Schnitt und Kanal bleiben bei dir.
Die Belege zeigen die Generierungskosten bei den angegebenen Einstellungen. Eine weitere Version oder eine Bearbeitung durch das Modell ist eine eigene, bezahlte Generierung.
02.1UGC-Videowerbung
Ein Straßeninterview-Werbeclip, gemacht mit Gemini Omni.
Ein Text-Prompt, ein Rendering: Bild, Stimme und Straßenlärm kommen in derselben Datei, für $0.10 pro Sekunde. Leg die genaue Länge fest und probier einen 360p-Entwurf für etwa ein Drittel des 720p-Preises, bevor du für die finale Version zahlst.
Modell
Gemini Omni 1.1 Flash
Format
9:16 · 10 s · 720p
Dieses Rendering
$1.00
Renderzeit
2–5 Min.
Genauer Prompt
Gemini Omni 1.1 Flash · 9:16 · 10 s · 720p · $1.00
Vertical street interview, handheld phone footage. A friendly interviewer's hand holds a small microphone toward a woman in her thirties on a sunny city sidewalk. She holds up a plain white tube of hand cream with no label and says, smiling: "Honestly? I bought it because of the smell, and now I carry it everywhere." Natural street ambience, light traffic, shallow depth of field.
Schreib, was passiert, zitier den Dialogsatz, bekomm den Take. Diese Wan-3.0-Szene startet mit einem einzigen Bild. Braucht eine Szene mehr Luft, liefert Wan bis zu 30 Sekunden in einem Durchgang, Ton ohne Aufpreis, 480p-Entwürfe und die Fortsetzung eines Eingabevideos.
Modell
Wan 3.0
Format
9:16 · 10 s · 720p
Dieses Rendering
$1.00
Renderzeit
2–5 Min.
Genauer Prompt
Wan 3.0 · 9:16 · 10 s · 720p · $1.00
Locked-off vertical close-up. The woman in the magenta wool coat stands still in the dim windowless apartment hallway, the warm wall lamp is already on and stays at constant brightness. She holds the small folded paper note in both hands at chest height, reads it for two seconds, slowly lowers her hands to her waist, looks up past the camera, startled, and whispers clearly: "He knew." She holds the look, breathing quietly. Nothing in the background moves or changes: the lamp, the plain wall and the closed door stay exactly as they are. Quiet room tone, faint distant thunder. No text visible on the note, no other people, no camera movement.
Referenzfoto rein. Dasselbe Gesicht in jedem Post.
01Referenz
02Neue Szene
03Clip mit Sprache
Diese drei Bilder zeigen denselben Charakter: ein Referenzporträt, eine daraus gebaute neue Szene und ein Clip mit sprechender Person, der diese Szene als Startbild nutzt – Grok Imagine Video 1.5, 720p. Bis zu 14 Referenzen pro Generierung, bis zu 8 Bilder pro Prompt. Nur SFW-Feed-Content.
Genauer Prompt
Nano Banana Pro · 4:5 · 2K · $0.11
The same woman as in the reference image, identical face, green eyes and long wavy honey-blonde hair now tied in a high ponytail, an adult of 24, athletic hourglass figure: fitness influencer photo in a bright modern gym. She wears a matching dusty-rose sports set — a supportive sports top and high-waisted leggings made of smooth matte solid-colour fabric with no ribs, no stripes, no mesh and no knit texture — standing relaxed next to a rack of dumbbells, a plain smooth white towel over one shoulder, friendly confident smile at the camera, morning light from large windows. Three-quarter framing, natural phone-camera look, tasteful, no text.
Sieh dir an, was jedes Modell erzeugt hat – und was es kostet.
Jede Datei unten wurde auf BananaBanana generiert. Wo der Prompt gespeichert wurde, öffne das Beispiel, um ihn zu lesen.
Die Preise basieren auf den aktuellen Tarifen für Modell und Einstellungen der jeweiligen Datei. Manche Vorschauen sind gekürzt oder laufen als Loop; die angegebenen Einstellungen beschreiben die vollständige Generierung.
Straßeninterview, Produkt in der Hand
Gemini Omni 1.1 Flash 9:16 · 10 s · 720p · mit Ton
$1.00
Genauer Prompt
Gemini Omni 1.1 Flash · 9:16 · 10 s · 720p · mit Ton · $1.00
Vertical street interview, handheld phone footage. A friendly interviewer's hand holds a small microphone toward a woman in her thirties on a sunny city sidewalk. She holds up a plain white tube of hand cream with no label and says, smiling: "Honestly? I bought it because of the smell, and now I carry it everywhere." Natural street ambience, light traffic, shallow depth of field.
Straßeninterview Nr. 2: andere Person, anderes Produkt
Gemini Omni 1.1 Flash 9:16 · 10 s · 720p · mit Ton
$1.00
Genauer Prompt
Gemini Omni 1.1 Flash · 9:16 · 10 s · 720p · mit Ton · $1.00
Vertical street interview, handheld phone footage. A friendly interviewer's hand holds a small microphone toward a man in his thirties with a short beard on a busy pedestrian street on an overcast afternoon. He holds up a plain matte black reusable water bottle with no logo and says, laughing: "My wife bought it for me as a joke. Now I refill it four times a day." Natural street ambience, passing footsteps, shallow depth of field.
Selfie-Review: Produkt neben dem Gesicht, ein klarer Satz
Wan 3.0 9:16 · 8 s · 720p · mit Ton
$0.80
Genauer Prompt
Wan 3.0 · 9:16 · 8 s · 720p · mit Ton · $0.80
Vertical selfie-style UGC review, handheld phone front-camera look, starting exactly from the first frame. The woman in the bright bathroom keeps holding the plain white pump bottle with no label next to her face with one hand, keeps it still and upright, and says to the camera clearly, with a warm smile: "I was skeptical, but two pumps in the morning and my skin stays soft all day." She says this one sentence only once, finishing by the sixth second, then stops talking, closes her lips and keeps smiling at the camera in the same pose as the first frame until the end of the shot. Her appearance, age, hair and grey t-shirt stay exactly as in the first frame. Only slight natural handheld sway, framing unchanged, the bottle keeps the same shape, her fingers stay natural. Natural room tone, soft daylight, shallow depth of field. No music. No text on screen.
Unboxing am Schreibtisch mit gesprochener Reaktion
Grok Imagine Video 1.5 9:16 · 6 s · 720p · mit Ton
$0.84
Genauer Prompt
Grok Imagine Video 1.5 · 9:16 · 6 s · 720p · mit Ton · $0.84
Vertical UGC unboxing, phone camera on a small desk tripod, slightly high angle. A man in his twenties sits at a wooden desk, lifts the lid off a plain kraft cardboard box, takes out a matte black wireless earbuds case with no logo, holds it up to the camera and says happily: "Okay, this feels way more expensive than it was." Natural room sound, soft cardboard rustle. Both hands move naturally. Plain wall behind him, nothing in the background moves. No text, no logos.
Die Preise basieren auf den aktuellen Tarifen für Modell und Einstellungen der jeweiligen Datei. Manche Vorschauen sind gekürzt oder laufen als Loop; die angegebenen Einstellungen beschreiben die vollständige Generierung.
04So entsteht ein Clip
Prompt Referenzen Startbild Clip Verlängern.
So kannst du im Web-Studio zum Beispiel einen Clip machen. Welche Referenzen und Verlängerungen möglich sind, hängt vom Modell ab.
Beschreib die Einstellung und zitier den Satz, der gesprochen werden soll. Das Panel zeigt den Preis genau dieses Durchgangs, bevor du auf Generieren drückst.
2
Referenzen
Häng bis zu 14 Fotos deines Charakters oder Produkts an. Das Modell behält Gesicht, Verpackung und Stil über alle Szenen bei.
3
Startbild
Generiere zuerst das Anfangsbild, bis zu 8 Varianten pro Prompt, und gib das frei, das dir gefällt. Prüf das Standbild, bevor du ein Video daraus machst.
4
Clip
Animiere das ausgewählte Bild. Wähl Modell, Länge, Auflösung und ob du Ton brauchst – jede Entscheidung ändert den Preis, den du direkt vor dir siehst.
5
Verlängern
Setz den Clip mit einem neuen Prompt fort: bis zu 40 s mit Omni 1.1, bis zu 148 s als Veo-3.1-Kette oder 30 s in einem einzigen Durchgang mit Wan 3.0.
05MCP · BananaBanana über deinen Agenten nutzen
Der komplette Generator, über deinen Agenten.
Verbinde Claude Code, Cursor, Gemini CLI oder einen n8n-Workflow per MCP mit BananaBanana. Dein Agent bekommt dieselben Modelle und Einstellungen wie das Web-Studio.
Ein Endpunkt für diese Aufgaben – und alles, was du sonst baust
dein Agent / Skill / n8n-Flow
UGC-Videowerbung
Micro-Dramen & Kurzserien
KI-Influencer & virtuelles Model
Produktfoto → Produktvideo
Faceless-Kanäle & automatisierte Shorts
Alles andere, was du baust
generate_image
ab $0.03
generate_video
ab $0.09
generate_speech
ab $0.01
get_account
Guthaben & Ausgabenlimit
Remote-MCP-Server
https://bananabanana.pro/api/mcp
# Claude Code – OAuth, kein Schlüssel zum Einfügen
claude mcp add --transport http bananabanana https://bananabanana.pro/api/mcp
Gib den Zugriff per OAuth frei oder erstelle in deinem Profil einen API-Schlüssel und leg ein Tageslimit für die Ausgaben fest.
Alle Generierungs-Tools. Bilder und Videos generieren oder bearbeiten, Sprache erzeugen. Nutze Referenzbilder, Start- und Endbilder, Referenzvideos für Wan und die Omni-Verlängerung bis 40 Sekunden. Batch-Bilder, Seeds und Negativ-Prompts funktionieren, wo das Modell sie unterstützt.
Lass deinen Agenten den Clip zusammenbauen. Dein Agent kann hier Bilder, Videos und ein Voice-over mit Gemini 3.1 Flash TTS generieren und dann mit ffmpeg auf deinem Rechner das Video schneiden und den Ton anlegen. BananaBanana übernimmt die Generierung, dein Agent den lokalen Schnitt.
Dieselben Preise wie in der Web-App. Dein Guthaben verfällt nie, und jeder Aufruf kostet genauso viel wie im Web-Studio.
Du willst Content machen, ohne noch ein Abo abzuschließen.
Du arbeitest in Schüben. Dein Guthaben wartet und verfällt nie.
Du willst mit Krypto zahlen oder einen Agenten per x402 pro Aufruf zahlen lassen.
Du willst, dass ein Agent die wiederkehrenden Generierungsschritte übernimmt.
Du hast Referenzfotos für ein virtuelles SFW-Model oder ein Produkt.
Du testest Werbeideen mit günstigen Entwürfen, bevor du für den finalen Clip zahlst.
Der Teil deines Agenten · über MCP
Hier generieren. Auf deinem Rechner zusammenbauen.
Deine eigene Pipeline. Dein Agent holt sich Bilder, Clips und Stimme per MCP von BananaBanana, schneidet dann, legt Ton und Untertitel an und exportiert mit ffmpeg auf deinem Rechner.
Ein generiertes Voice-over. Erzeuge Sprache mit Gemini 3.1 Flash TTS, per MCP oder im Web-Studio.
Ton unter dem Video. Dein Agent legt das Voice-over mit ffmpeg auf deinem Rechner unter deine Clips.
Du zahlst für die Generierung und sonst nichts. Vorlagen, Avatare, Posting und Planung sind nicht eingebaut: Leg sie als eigene Prompts und Skills an.
Ein pixelgenaues Gesicht oder Produktetikett beim ersten Versuch. Referenzbilder und ein Startbild helfen, aber manchmal brauchst du trotzdem einen weiteren Versuch.
Aufrufe, Verkäufe oder Einnahmen.
Eine Agentur, die alles für dich erledigt. Was du machst und was du veröffentlichst, entscheidest weiterhin du.
Keine Analytics. Weder in der App noch über MCP – Aufrufe und Verkäufe stehen in deinen Werbe- und Social-Media-Dashboards.
Verantwortungsvoll veröffentlichen
Was bei dir liegt
KI kennzeichnen, wo es Pflicht ist
Die Endorsement-Regeln der FTC und der EU AI Act gelten für KI-generierte Werbung und realistische synthetische Personen. Die Kennzeichnung liegt bei dir – und gib eine generierte Person nie als echte Kundin oder echten Kunden aus.
Was wir tun
SynthID bleibt in der Datei
Googles unsichtbare SynthID-Markierung bleibt erhalten, wo Google-Modelle sie einbetten.
Was wir tun
Saubere Veröffentlichung
Kein sichtbares Wasserzeichen, und SMO bereitet die Datei für Social-Media-Plattformen vor.
Was wir tun
Kommerzielle Nutzung
Nutze, was du generierst, in Werbung, Shops und Kanälen – im Rahmen der Bedingungen der Modellanbieter.
Was bei dir liegt
Keine Klone echter Menschen
Bilde Gesicht oder Stimme einer echten Person nicht ohne deren Einwilligung nach.
08Preise
Preise in Dollar. Die meisten Google-Modelle unter Googles Listenpreis.
Wan, Grok und GPT Image kosten den Listenpreis ihrer Hersteller. Bezahl Bilder, Videos und Sprache pro Nutzung von einem Guthaben in US-Dollar, das nie verfällt, ohne Abo.
Bilder
Preis pro Bild nach Auflösungsstufe. 4K heißt bis zu 3840–4096 px an der längeren Seite, je nach Modell und Seitenverhältnis.
Google
Google: Preis pro Bild nach Auflösung
Auflösung
Nano Banana 2 Lite
Nano Banana 2
Nano Banana Pro
512px
—
$0.03
—
1K
$0.03
$0.06
$0.11
2K
—
$0.09
$0.11
4K
—
$0.13
$0.20
Alibaba
Alibaba: Preis pro Bild nach Auflösung
Auflösung
Qwen Image 3.0 Pro
1K
$0.04
2K
$0.08
OpenAI
OpenAI: Preis pro Bild nach Auflösung
Auflösung
GPT Image 2.5 Flare
GPT Image 2.5 Sunburst
1K
$0.05
$0.05
2K
$0.11
$0.11
4K
$0.18
$0.18
Video
Jede Tabelle hat dieselben Spalten: den Preis pro Sekunde, dann den kürzesten und den längsten Clip bei dieser Auflösung.
Gemini Omni 1.1 Flash
Ton ist immer inklusive.
Cliplänge in Sekunden: 3–10.
Gemini Omni 1.1 Flash: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
3 s
10 s
360p
$0.03
$0.09
$0.30
720p
$0.10
$0.30
$1.00
1080p
$0.15
$0.45
$1.50
4K
$0.30
$0.90
$3.00
Gemini Omni Flash 1.0
Ton ist immer inklusive.
Cliplänge in Sekunden: 4, 6, 8, 10.
Gemini Omni Flash 1.0: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
4 s
10 s
720p
$0.10
$0.40
$1.00
1080p*
$0.12
—
$1.20
* Geliefert als hochskalierte Version des 720p-Renderings.
Wan 3.0
Ton lässt sich zum selben Preis ein- oder ausschalten.
Cliplänge in Sekunden: 4, 6, 8, 10, 15, 20, 30.
Wan 3.0: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
4 s
30 s
480p
$0.05
$0.20
$1.50
720p
$0.10
$0.40
$3.00
1080p
$0.20
$0.80
$6.00
Die Beispiele nutzen kein Eingabevideo. Wenn du eine Videoreferenz hinzufügst, wird ihre Dauer zusammen mit dem generierten Ergebnis abgerechnet.
Grok Imagine Video 1.5
Ton ist immer inklusive.
Cliplänge in Sekunden: 4–15.
Grok Imagine Video 1.5: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
4 s
15 s
720p
$0.14
$0.56
$2.10
1080p
$0.25
$1.00
$3.75
Veo 3.1
Mit und ohne Ton gelten eigene Preise.
Cliplänge in Sekunden: 4, 6, 8.
Veo 3.1: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
4 s
8 s
720p / 1080pMit Ton
$0.375
$1.50
$3.00
4KMit Ton
$0.55
$2.20
$4.40
720p / 1080pOhne Ton
$0.175
$0.70
$1.40
4KOhne Ton
$0.375
$1.50
$3.00
Preis pro Clip; der Sekundenpreis ist aus dem Clippreis abgeleitet.
Veo 3.1 Fast
Mit und ohne Ton gelten eigene Preise.
Cliplänge in Sekunden: 4, 6, 8.
Veo 3.1 Fast: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
4 s
8 s
720p / 1080pMit Ton
$0.125
$0.50
$1.00
4KMit Ton
$0.325
$1.30
$2.60
720p / 1080pOhne Ton
$0.0875
$0.35
$0.70
4KOhne Ton
$0.275
$1.10
$2.20
Preis pro Clip; der Sekundenpreis ist aus dem Clippreis abgeleitet.
Veo 3.1 Lite
Mit und ohne Ton gelten eigene Preise.
Cliplänge in Sekunden: 4, 6, 8.
Veo 3.1 Lite: Preis pro Sekunde und pro Clip nach Auflösung
Auflösung
Pro Sek.
4 s
8 s
720pMit Ton
$0.045
$0.18
$0.36
1080pMit Ton
$0.07
$0.28
$0.56
720pOhne Ton
$0.025
$0.10
$0.20
1080pOhne Ton
$0.0425
$0.17
$0.34
Preis pro Clip; der Sekundenpreis ist aus dem Clippreis abgeleitet.
Sprache
Voice-overs und Dialoge werden nach Textlänge berechnet. Verfügbar im Web-Studio, per MCP und über x402.
Gemini 3.1 Flash TTS
Pro angefangene 200 Zeichen: $0.01
Gemini 3.1 Flash TTS: Preis nach Textlänge
Zeichen
Länge
Preis
200
≈ 15 s
$0.01
450
≈ 30 s
$0.03
1,000
≈ 65 s
$0.05
3,000
≈ 200 s
$0.15
Du zahlst pro Zeichen; die Länge in Sekunden ist eine Schätzung bei normalem Sprechtempo. Ein 30-Sekunden-Text hat etwa 450 Zeichen: 3 × $0.01 = $0.03.
Was du bekommst
30 Stimmen, mit Stil-Prompt für Tonfall und Tempo
Ein Erzähler oder ein Dialog mit zwei Sprechern in einer Datei
WAV, 24 kHz mono, fertig, um es unter ein Video zu legen
Bonus auf Krypto-Aufladungen: +5 % ab $50, +10 % ab $100.
+5 %
Ab $50 in Krypto aufladen
$50 aufladen → $52.50 erhalten
+10 %
Ab $100 in Krypto aufladen
$100 aufladen → $110 erhalten
Der Bonus kommt zu dem dazu, was du in Krypto zahlst. Krypto-Aufladungen beginnen bei $1, je nach Coin und Netzwerk.
USDT
USDC
BTC
ETH
SOL
TON
DAI
TUSD
BNB
LTC
TRX
XRP
BCH
DOGE
Karte, PayPal, SEPA
Zahl per Karte, PayPal oder SEPA ab $20.
Der gezahlte Betrag wird deinem Guthaben gutgeschrieben. Aufladungen per Karte, PayPal und SEPA bekommen keinen Mengenbonus. Jede Aufladung ist eine Einmalzahlung. Ungenutztes Guthaben wird auf Anfrage erstattet, abzüglich Bonusguthaben.
x402 · für Agenten
Lass deinen Agenten per x402 pro Aufruf zahlen.
Dein Agent zahlt jeden Aufruf in USDC auf Base – ohne Konto, ohne API-Schlüssel, ohne Aufladung. Er fordert eine Generierung an, bekommt den genauen Preis zurück, signiert die Zahlung und erhält die Datei.
USDC im Base-Netzwerk
Keine Mindestaufladung: Ein Aufruf kostet, was die Generierung kostet, ab $0.01
Funktioniert für generate_image, generate_speech, generate_video
Schlägt ein Video fehl, bekommt der Zahlende einen Gutschrift-Token über denselben Betrag, 90 Tage gültig. Zahlungen werden nicht on-chain erstattet.
$0.20 Startguthaben · keine Karte für die Registrierung
09FAQ
Fragen zum Erstellen und Bezahlen
UGC-Videowerbung
3 Antworten
Was kostet eine KI-UGC-Videoanzeige bei BananaBanana?
Ein vertikaler 10-Sekunden-Clip mit Sprache und Umgebungsgeräuschen kostet mit Gemini Omni 1.1 Flash $1.00 in 720p, und ein 360p-Entwurf desselben Clips wird mit $0.03 pro Sekunde abgerechnet. Du legst die genaue Länge fest und zahlst pro Sekunde, ein kurzer Hook kostet also weniger als ein komplettes Review. Grok Imagine Video 1.5 ($0.14 pro Sekunde in 720p) und Wan 3.0 ($0.10 pro Sekunde) rendern ebenfalls Sprache, und Veo-3.1-Clips ohne Ton gibt es ab $0.10. Es gibt kein Abo: Du lädst ein Guthaben auf, und jedes Rendering wird davon abgebucht.
Kann die Person im Clip mein Skript sprechen und mein Produkt halten?
Ja – die Person in einem BananaBanana-Clip kann dein Skript sprechen und dein Produkt halten. Zitier den Text im Prompt, und das Modell rendert die Stimme im selben Durchgang wie das Bild. Für dein echtes Produkt häng Referenzfotos an oder generiere zuerst ein Anfangsbild mit dem Produkt und animiere dieses Bild – so behält die Verpackung ihre Form.
Muss ich angeben, dass eine UGC-Anzeige KI-generiert ist?
Das hängt vom Inhalt, der Rechtsordnung und der Plattform ab. Die FTC wendet ihre Regeln zu Endorsements und Fake-Bewertungen auf KI-generierte Testimonials an, der EU AI Act legt Transparenzpflichten für Deepfakes fest, und Werbeplattformen haben eigene Kennzeichnungen für synthetische Medien. BananaBanana setzt kein sichtbares Wasserzeichen, die Kennzeichnung liegt also bei dir. Gib eine generierte Person nie als echte Kundin oder echten Kunden aus.
Micro-Dramen & Kurzserien
3 Antworten
Wie lang kann eine einzelne Szene sein?
Wan 3.0 rendert bis zu 30 Sekunden in einem Durchgang. Gemini Omni 1.1 verlängert einen fertigen Clip auf insgesamt bis zu 40 Sekunden. Veo 3.1 hängt pro Verlängerung 7 Sekunden an, und verkettete Verlängerungen erreichen 148 Sekunden mit visueller Kontinuität.
Wie bleiben dieselben Darsteller über Szenen und Folgen hinweg gleich?
Generiere für jeden Charakter einmal ein Referenzbild und häng diese Bilder dann an jede Szene als Referenzen an. Du kannst einen Clip auch mit einem abgesegneten Startbild beginnen lassen, dann startet die Szene genau so, wie du es festgelegt hast.
Schreibt, schneidet oder veröffentlicht BananaBanana meine Serie?
Nein – BananaBanana schreibt, schneidet und veröffentlicht keine Serie; es rendert die Einstellungen und das Voice-over, die du beschreibst, und dein Agent kann sie lokal mit ffmpeg zusammensetzen. Drehbücher, Schnitt, Veröffentlichung und Publikum liegen bei dir, und nichts hier ist ein Versprechen von Aufrufen oder Einnahmen. Es ist ein Produktionstool für Leute, die schon Kurzserien machen.
KI-Influencer & virtuelles Model
3 Antworten
Wie bleibt ein KI-Influencer über alle Posts hinweg konsistent?
Häng bei Nano Banana pro Generierung bis zu 14 Referenzfotos des Charakters an und beschreib die neue Szene. Du kannst bis zu 8 Bilder pro Prompt rendern und die besten behalten. Auch Videomodelle akzeptieren Referenzen, jeweils mit eigenen Limits, sodass Standbilder und Clips dasselbe Gesicht zeigen.
Darf eine Marke einen KI-Influencer oder ein virtuelles Model kommerziell nutzen?
Ja – eine Marke darf einen KI-Influencer oder ein virtuelles Model, das auf BananaBanana entstanden ist, kommerziell nutzen, im Rahmen der Bedingungen der Modellanbieter. Das KI-Model muss eine erfundene Figur sein: Bilde Gesicht oder Stimme einer echten Person nicht ohne Einwilligung nach, und kennzeichne synthetische Medien dort, wo Gesetz oder Plattform es verlangen.
Sind Inhalte für Erwachsene bei KI-Influencer-Accounts erlaubt?
Nein – Inhalte für Erwachsene sind nicht erlaubt: KI-Influencer-Content auf BananaBanana ist SFW-Feed-Content. Der „Lockere Filter“ gibt mehr Spielraum für Mode, Bademode und Kunst, aber explizite Inhalte werden von den Modellanbietern blockiert, und dafür ist die Plattform auch nicht gedacht.
Produktfoto → Produktvideo
3 Antworten
Kann ich aus einem Produktfoto ein Video machen?
Ja – BananaBanana macht aus einem Produktfoto ein Video. Lade das Foto als Startbild hoch, beschreib die Kamerabewegung, und der Clip beginnt genau mit deinem Bild. Manche Modelle akzeptieren auch ein Endbild, so bestimmst du, wo die Einstellung endet. Clips gibt es ab $0.10.
Behält das Produkt Form, Farbe und Etikett?
Mit deinem Foto als Startbild zu beginnen ist der zuverlässigste Weg, die Geometrie zu erhalten. Kleine Schrift auf Etiketten kann in Bewegung trotzdem verrutschen, also prüf das Ergebnis und render bei Bedarf neu. Kurze, langsame Kamerafahrten halten Details am besten.
Welches Modell eignet sich für Marktplatz-Angebote?
Grok Imagine Video 1.5 hält sich sehr genau an ein Startbild – ein Startbild funktioniert in 720p und 1080p, Referenzbilder in 720p, Clips dauern 4–15 Sekunden, Ton ist inklusive. Gemini Omni 1.1 Flash und Wan 3.0 akzeptieren zusätzlich ein Endbild und gehen über 720p hinaus, Wan 3.0 liefert Takes bis zu 30 Sekunden, und Veo 3.1 ist die Top-Stufe für natives 4K. Für das Standbild selbst ist Nano Banana Pro die übliche Wahl – oder GPT Image 2.5 und Qwen Image 3.0 Pro, wenn auf dem Packshot lesbarer Text steht.
Faceless-Kanäle & automatisierte Shorts
3 Antworten
Kann ich Material automatisch aus n8n oder meinem eigenen Agenten generieren?
Ja – Material lässt sich automatisch aus n8n oder deinem eigenen Agenten generieren. Der Remote-MCP-Server von BananaBanana stellt Tools für Bild, Video und Sprache für jeden MCP-Client bereit, darunter n8n, Claude Code, Cursor und Gemini CLI. Aufrufe werden vom selben Guthaben abgebucht wie in der Web-App, und fehlgeschlagene Generierungen werden erstattet.
Was kostet eine Serie von Bildern?
Bilder kosten ab $0.03 pro Stück, und ein Prompt kann bis zu 8 Bilder liefern. Vertikale Videoclips gibt es ab $0.10. Die Summe hängt von Modell, Einstellungen, Anzahl der Ergebnisse und Wiederholungen ab.
Werden automatisierte Videos auf YouTube monetarisiert?
Über die Monetarisierung automatisierter Videos entscheidet YouTube, nicht BananaBanana. YouTube monetarisiert keine massenhaft produzierten, sich wiederholenden Inhalte. BananaBanana liefert das Rohmaterial: Bilder, B-Roll, Clips und Voice-over. Bewertet werden von den Plattformen der Schnitt und die Originalität des Kanals.
Erste Schritte
6 Antworten
Was ist BananaBanana und wie funktioniert es?
BananaBanana ist ein KI-Generator für Bilder, Videos und Sprache mit Bezahlung pro Nutzung und 14 Modellen von Google, OpenAI, Alibaba und xAI. Bilder gibt es ab $0.03, Videoclips ab $0.10. Du schreibst einen Prompt, hängst bei Bedarf Referenzfotos oder ein Startbild an, siehst den Preis vor dem Rendern und bekommst bis zu 8 Bilder pro Prompt. Aufladen per Krypto ab $1, je nach Coin und Netzwerk, oder per Karte, PayPal oder SEPA ab $20 – ohne Abo, und für die Registrierung brauchst du keine Karte. Jedes neue Konto bekommt $0.20 Startguthaben.
Welche KI-Modelle gibt es bei BananaBanana?
14 Modelle: 6 für Bilder, 7 für Video und eines für Sprache. Bilder – Nano Banana 2 Lite (pauschal $0.03 in 1K, der günstigste Weg zum Iterieren), Nano Banana 2 (ab $0.03, bis 4K), Nano Banana Pro (ab $0.11, die detailreichsten Porträts und Produktaufnahmen, bis 4K), GPT Image 2.5 Flare und Sunburst von OpenAI (ab $0.05, die Wahl, wenn lesbarer Text ins Bild muss; Flare ist die schnelle, Sunburst die präzise Stufe) und Qwen Image 3.0 Pro von Alibaba (ab $0.04, dichte Layouts und kleine Schrift, 1K und 2K). Video – Veo 3.1 (ab $0.70), Veo 3.1 Fast (ab $0.35) und Veo 3.1 Lite (ab $0.10): Clips mit 4, 6 oder 8 Sekunden, Ton optional, bis 4K bei Veo 3.1 und Fast; Gemini Omni 1.1 Flash (ab $0.09): 3–10 Sekunden mit immer aktivem Ton und Sprache, 360p-Entwürfe bis 4K, Bearbeitung und Szenenverlängerung bis 40 Sekunden; Gemini Omni Flash 1.0 (ab $0.40), die vorherige Generation, bleibt für Projekte, die damit begonnen haben; Wan 3.0 von Alibaba (ab $0.20): bis zu 30 Sekunden in einem Durchgang, Start- und Endbild, abschaltbarer Ton; Grok Imagine Video 1.5 von xAI (ab $0.56): Clips mit 4–15 Sekunden und nativem Ton, fünf Seitenverhältnisse. Sprache – Gemini 3.1 Flash TTS von Google ($0.01 pro angefangene 200 Zeichen): 30 Stimmen, ein oder zwei Sprecher, im Web-Studio und per MCP.
Was kostet die Generierung? Gibt es eine kostenlose Option?
Jedes neue Konto bekommt $0.20 Startguthaben ohne Karte – genug für mehrere Bilder oder einen kurzen Entwurfsclip. Danach zahlst du pro Rendering. Bilder: Nano Banana 2 Lite kostet pauschal $0.03; Nano Banana 2 liegt zwischen $0.03 und $0.13 (512 px bis 4K); Nano Banana Pro zwischen $0.11 und $0.20; GPT Image 2.5 Flare und Sunburst zwischen $0.05 und $0.18 (1K bis 4K); Qwen Image 3.0 Pro $0.04 in 1K und $0.08 in 2K. Video: Veo 3.1 Lite ab $0.10, Veo 3.1 Fast ab $0.35, Veo 3.1 ab $0.70. Gemini Omni 1.1 Flash wird pro Sekunde nach Auflösung abgerechnet – $0.03 in 360p, $0.10 in 720p –, ein 10-Sekunden-Clip in 720p mit Ton kostet also $1.00. Wan 3.0 kostet je nach Auflösung $0.05–$0.20 pro Sekunde, Grok Imagine Video 1.5 $0.14 pro Sekunde in 720p und $0.25 in 1080p. Die kompletten Tabellen stehen oben im Abschnitt Preise. Ab $50 in Krypto gibt es 5 % Bonus, ab $100 10 %; Zahlungen per Karte, PayPal und SEPA werden ohne Bonus gutgeschrieben. Sprache mit Gemini 3.1 Flash TTS kostet $0.01 pro angefangene 200 Zeichen. Ungenutztes Guthaben verfällt nie, und fehlgeschlagene Renderings werden erstattet.
Welche Zahlungsmethoden akzeptiert BananaBanana? Kann ich mit Krypto oder Karte zahlen?
BananaBanana akzeptiert Krypto und Karte. Krypto: USDT (ERC-20, BEP-20, SOL, TON), USDC (SOL, BASE, ERC-20, BEP-20), DAI, Bitcoin (BTC), Ethereum (ETH), Solana (SOL), BNB, Litecoin (LTC), Tron (TRX), TON, XRP, Dogecoin (DOGE) und weitere – klick auf „Aufladen“, wähl einen Betrag (Minimum ab $1, je nach Coin und Netzwerk), Kryptowährung und Netzwerk, und du bekommst eine feste Wallet-Adresse, die für alle künftigen Einzahlungen gilt; das Guthaben wird nach der Bestätigung in der Blockchain automatisch gutgeschrieben. Karte: Visa und Mastercard, PayPal-Guthaben oder SEPA-Überweisung in der EU, von $20 bis $2000 pro Zahlung, abgewickelt im PayPal-Fenster, sodass deine Kartendaten nie auf unserer Seite landen, und gutgeschrieben, sobald die Zahlung durch ist. Egal wie du zahlst, es ist eine einmalige Aufladung: kein Abo, keine gespeicherte Karte, keine automatische Verlängerung – das Guthaben bleibt, bis du es ausgibst. Krypto haben wir zuerst gebaut, und es ist immer noch der einfachere Weg: ab $1 statt $20, keine Bank dazwischen und Gebühren von ein paar Cent in Netzwerken wie TON oder Solana. Mengenboni gibt es nur bei Krypto-Aufladungen: +5 % ab $50, +10 % ab $100; Zahlungen per Karte, PayPal und SEPA werden zum Nennwert gutgeschrieben.
BananaBanana ist weltweit ohne geografische Einschränkungen verfügbar. Krypto-Aufladungen funktionieren aus jedem Land, auch ohne lokales Bankkonto, und Zahlungen per Karte, PayPal und SEPA laufen über PayPal überall dort, wo PayPal verfügbar ist. Die Oberfläche gibt es auf Englisch, Arabisch, Deutsch, Spanisch, Französisch, Hindi, Indonesisch, Italienisch, Japanisch, Portugiesisch, Russisch, Thai, Türkisch, Ukrainisch, Urdu, Vietnamesisch und Chinesisch. Alle KI-Modelle und Funktionen stehen jedem Nutzer zur Verfügung, egal wo.
Wie lange dauert eine Generierung?
Bilder brauchen 1–2 Minuten, Videos 2–5 Minuten, je nach Modell und Einstellungen. Veo 3.1 Fast und Veo 3.1 Lite sind meist schneller. Du kannst die Seite während der Generierung schließen und später zurückkommen – die Ergebnisse warten in deinem Konto.
Bildgenerierung
6 Antworten
Wie funktionieren konsistente Charaktere bei BananaBanana?
Charakterkonsistenz ist bei BananaBanana eingebaut: Lade ein Porträtfoto als Charakterreferenz hoch, beschreib deine Szene, und die KI behält die Gesichtszüge bei, während sie die Person in einem neuen Umfeld, Outfit oder Kunststil zeigt. Pro Generierung kannst du bis zu 14 Referenzfotos (Charaktere und Objekte) anhängen, damit derselbe Charakter über viele Bilder hinweg gleich aussieht. Ideal für KI-Influencer-Content, Social-Media-Visuals, Marketingmaterial oder jedes Projekt, in dem dieselbe Figur in verschiedenen Szenen auftaucht.
Kann ich mit BananaBanana KI-Influencer- oder Social-Media-Content erstellen?
Ja – BananaBanana ist für die Workflows von KI-Influencern und Content-Creatorn gebaut: Referenzmodus, konsistente Charaktere und bis zu 8 Bilder pro Prompt. Erstelle einen konsistenten KI-Charakter und generiere ihn in verschiedenen Szenen, Outfits und Locations – ideal für Instagram, TikTok und andere Plattformen. Nano Banana Pro liefert sehr realistische Porträts und Lifestyle-Fotos in Profiqualität. Anders als die Webversion von Googles Gemini generiert BananaBanana ohne sichtbares Wasserzeichen. Hinweis: Bilder und Videos von Google-Modellen (Nano Banana, Veo, Gemini Omni) tragen Googles unsichtbares SynthID-Wasserzeichen – es beeinträchtigt die Qualität nicht, kann aber von den KI-Erkennungssystemen mancher Plattformen erkannt werden. Aktiviere Social Media Optimization, um deine Bilder ohne Qualitätsverlust für die Veröffentlichung auf Social-Media-Plattformen vorzubereiten. Bezahlung pro Nutzung, aufgeladen per Krypto oder Karte – das passt für Solo-Creator genauso wie für Agenturen.
Kann ich Bilder in großen Mengen für E-Commerce oder Content-Marketing generieren?
Ja – generiere bis zu 8 Bilder pro Prompt und bekomm mehrere Varianten auf einmal, ideal für Produktbilder im E-Commerce, Print-on-Demand-Designs, Social-Media-Content und Marketingkampagnen. Der Referenzmodus sorgt für einen einheitlichen Look, wenn derselbe Charakter, dasselbe Produkt oder derselbe Stil in verschiedenen Szenen gebraucht wird.
Welche Auflösungen, Seitenverhältnisse und Längen werden unterstützt?
Bilder: Nano Banana 2 und Pro rendern 512 px bis 4K (Pro ab 1K) in zehn Seitenverhältnissen von 1:1 bis 21:9; Nano Banana 2 Lite nur in 1K; GPT Image 2.5 bietet 1K, 2K und 4K; Qwen Image 3.0 Pro 1K und 2K. Bis zu 8 Bilder pro Prompt. Video: Veo 3.1 und Veo 3.1 Fast – 4, 6 oder 8 Sekunden in 720p, 1080p oder 4K; Veo 3.1 Lite – dieselben Längen bis 1080p. Gemini Omni 1.1 Flash – jede Länge von 3 bis 10 Sekunden in Ein-Sekunden-Schritten, 360p, 720p, 1080p oder 4K, verlängerbar auf 40 Sekunden. Gemini Omni Flash 1.0 – 4, 6, 8 oder 10 Sekunden in nativem 720p oder 6, 8 oder 10 Sekunden als hochskaliertes 1080p. Wan 3.0 – 4, 6, 8, 10, 15, 20 oder 30 Sekunden in 480p, 720p oder 1080p. Grok Imagine Video 1.5 – 4 bis 15 Sekunden in 720p oder 1080p. Jedes Videomodell rendert 16:9 und 9:16; Grok kann zusätzlich 1:1, 3:2 und 2:3.
Kann ich generierte Bilder mit KI bearbeiten?
Ja – BananaBanana unterstützt KI-Bildbearbeitung im Dialog. Wähl ein generiertes Bild aus und beschreib die Änderungen in normaler Sprache; die KI passt das Bild an und behält die ursprüngliche Komposition bei. Reih mehrere Bearbeitungen wie in einem Chat aneinander und verfeinere das Ergebnis Schritt für Schritt – so wie im Gespräch mit einem KI-Assistenten, nur eben für Bilder.
Was ist Social Media Optimization (SMO)?
Social Media Optimization ist eine Option per Klick, die deine generierten Bilder für die Veröffentlichung auf Social-Media-Plattformen aufbereitet – so sinkt die Wahrscheinlichkeit automatischer KI-Kennzeichnungen, ohne Qualitätsverlust. Schalte sie vor der Generierung einfach in den Generator-Einstellungen ein. Funktioniert mit jeder Auflösung und jedem Modell. Googles unsichtbares SynthID-Wasserzeichen bleibt erhalten, deine Inhalte entsprechen also weiter den Transparenzstandards für KI.
Videogenerierung
5 Antworten
Welches Videomodell soll ich nehmen: Veo 3.1, Gemini Omni, Wan 3.0 oder Grok Imagine Video?
Wähl das Videomodell danach, was der Clip leisten muss: Veo 3.1 für ausgefeilte finale Renderings, Gemini Omni 1.1 Flash für Clips mit Sprache und Abrechnung pro Sekunde, Wan 3.0 für lange Einzel-Takes, Grok Imagine Video 1.5 für Clips, die sich eng an ein Startbild halten. Veo 3.1 (ab $0.70) ist die Top-Stufe von Veo für finale Renderings, Veo 3.1 Fast (ab $0.35) der praktische Standard und Veo 3.1 Lite (ab $0.10) die günstigste Veo-Stufe, um eine Idee zu testen; alle drei rendern Clips von exakt 4, 6 oder 8 Sekunden, Ton ist optional, und Veo 3.1 und Fast gehen bis zu nativem 4K und lassen sich per Verlängerung verketten. Gemini Omni 1.1 Flash ($0.10 pro Sekunde in 720p, $0.03 in 360p) ist die Wahl für Clips mit Sprache: Ton ist immer an, zitierte Zeilen im Prompt spricht die Figur, du zahlst genau die 3–10 Sekunden, die du brauchst, es akzeptiert Start- und Endbild sowie Referenzbilder, bearbeitet einen fertigen Clip per Textanweisung und verlängert eine Szene auf 40 Sekunden. Gemini Omni Flash 1.0 ist die vorherige Generation mit nativem 720p und hochskaliertem 1080p, die wir für laufende Projekte behalten. Wan 3.0 ($0.10 pro Sekunde in 720p) ist das einzige Modell, das bis zu 30 Sekunden in einem Durchgang rendert, mit Start- und Endbild, Seeds und abschaltbarem Ton. Grok Imagine Video 1.5 ($0.14 pro Sekunde in 720p, $0.25 in 1080p) rendert Clips von 4–15 Sekunden mit nativem Ton, hält sich sehr genau an ein Startbild und unterstützt quadratische und 3:2-Formate.
Kann BananaBanana Videos mit Ton, Musik und Dialog generieren?
Ja – jedes Videomodell hier kann Ton im selben Durchgang wie das Bild rendern. Bei Gemini Omni 1.1 Flash und Omni Flash 1.0 ist Ton immer an und im Sekundenpreis enthalten; zitier eine Zeile im Prompt, und die Figur spricht sie (prüf den Take auf Genauigkeit) – deshalb ist Omni die übliche Wahl für Talking-Head- und UGC-Clips. Die drei Veo-3.1-Modelle erzeugen Umgebungsgeräusche, Musik, Effekte und Dialog, wenn du Ton einschaltest, mit optionalem Audio-Prompt für das Sounddesign; Veo-Clips ohne Ton kosten weniger. Wan 3.0 hat Ton zum selben Preis inklusive, und du kannst ihn kostenlos abschalten. Grok Imagine Video 1.5 rendert immer eine Tonspur und spricht Dialogzeilen ein. Für ein separates Voice-over bietet Gemini 3.1 Flash TTS 30 Stimmen und einen oder zwei Sprecher, im Web-Studio und per MCP.
Kann ich aus einem Foto ein Video machen oder ein Standbild animieren?
Ja – jedes Videomodell auf der Plattform akzeptiert ein Startbild: Lade ein Foto hoch, beschreib die Bewegung, und der Clip beginnt genau mit deinem Bild. Veo 3.1, Gemini Omni 1.1 Flash und Wan 3.0 akzeptieren auch ein Endbild, so bestimmst du, wo die Einstellung endet, oder baust einen nahtlosen Loop. Grok Imagine Video 1.5 hält sich besonders genau an das Startbild (Bildeingaben funktionieren dort in 720p). Statt eines festen Startbilds akzeptieren die meisten Videomodelle Referenzbilder eines Charakters oder Produkts und inszenieren die Szene selbst; die Limits unterscheiden sich je nach Modell und werden im Generator angezeigt. Veo 3.1 und Veo 3.1 Fast gehen bis 4K, Omni 1.1 bis 4K, Wan 3.0 und Grok bis 1080p.
Kann ich KI-generierte Videos verlängern oder fortsetzen?
Ja – BananaBanana verlängert fertige KI-Videos auf drei Arten. Veo 3.1 und Veo 3.1 Fast: Klick bei einem fertigen Clip auf „Szene verlängern“ und setz ihn mit einem neuen Prompt fort; das Modell hält die visuelle Kontinuität, und verkettete Verlängerungen erreichen 148 Sekunden. Gemini Omni 1.1 Flash: Häng jeweils 3–10 Sekunden an einen fertigen Clip an, insgesamt bis zu 40 Sekunden (jede Verlängerung wird nach der gesamten resultierenden Länge berechnet, der Preis steht vor dem Rendern fest), oder bearbeite den Clip per Textanweisung, wobei Szene und Figuren erhalten bleiben; du kannst auch die ersten 10 Sekunden eines beliebigen fertigen Videos – eines Veo-Clips oder eines eigenen Uploads – für ein Video-zu-Video-Restyling in 720p einschicken. Wan 3.0 braucht selten eine Verlängerung, weil ein einzelner Durchgang schon bis zu 30 Sekunden läuft; per MCP kann es außerdem einen Quellclip einlesen und die nächste Szene mit denselben Figuren und demselben Setting drehen – eine Fortsetzung der Geschichte, nicht bildgenau. Grok Imagine Video 1.5 rendert eigenständige Clips von 4–15 Sekunden.
Wie lang darf ein Video bei BananaBanana maximal sein?
In einem Durchgang: 30 Sekunden mit Wan 3.0, 15 Sekunden mit Grok Imagine Video 1.5, 10 Sekunden mit Gemini Omni, 8 Sekunden mit Veo 3.1. Mit Verlängerung: bis zu 40 Sekunden mit Gemini Omni 1.1 Flash, jeweils 3–10 Sekunden mehr, und bis zu 148 Sekunden mit Veo 3.1 und Veo 3.1 Fast durch verkettete Verlängerungen. Jeder Durchgang und jede Verlängerung wird einzeln berechnet und vor dem Rendern angezeigt.
Wie schlägt sich BananaBanana im Vergleich zu Midjourney, Sora, Higgsfield und anderen KI-Generatoren?
Der Hauptunterschied sind Abrechnungsmodell und Auswahl. Viele Generatoren verkaufen ein Monatsabo mit Credits, die verfallen; hier gibt es überhaupt kein Abo – Bilder ab $0.03, Video ab $0.10, abgebucht pro Rendering von einem Guthaben, das nie verfällt. Statt des Modells eines einzigen Anbieters bekommst du 14 von vier: Nano Banana, Veo 3.1 und Gemini Omni von Google, GPT Image 2.5 von OpenAI, Wan 3.0 und Qwen Image 3.0 Pro von Alibaba sowie Grok Imagine Video 1.5 von xAI. Damit hast du natives 4K-Video, Clips mit Sprache, Einzel-Takes bis zu 30 Sekunden, Szenenverlängerung bis zu 148 Sekunden und Bilder mit lesbarem Text. Es gibt keine sichtbaren Wasserzeichen, Fair-Use-Limits ersetzen Monatskontingente, und dasselbe Guthaben funktioniert in der Web-App und für KI-Agenten per MCP.
Was bringt BananaBanana im Vergleich zur direkten Nutzung von Gemini?
Mit BananaBanana kommst du bequemer und günstiger an die Gemini-Bildmodelle und die Veo-3.1-Videomodelle von Google. Die wichtigsten Vorteile gegenüber Gemini: keine sichtbaren Wasserzeichen auf generierten Inhalten, „Lockerer Filter“ für weniger blockierte Inhalte, bis zu 8 Bilder pro Prompt, 4K-Video mit Tongenerierung, Videoverlängerung, die Clips auf bis zu 148 Sekunden verkettet, konsistente Charaktere über Referenzfotos und Zahlung per Krypto oder Karte ohne Google-Konto. Die Preise beginnen bei $0.03 pro Bild – vergleichbar mit API-Preisen oder günstiger, ohne dass du Billing einrichten oder API-Schlüssel verwalten musst.
Welche erweiterten Einstellungen bietet BananaBanana?
BananaBanana bietet Negativ-Prompts (bis zu 1000 Zeichen), um Unerwünschtes auszuschließen, Seed-Werte für reproduzierbare Ergebnisse, Social Media Optimization (SMO) für die Veröffentlichung auf Social Media, bis zu 4 Videovarianten pro Prompt und Bildausgabe als PNG, JPEG oder WebP. Ein fester Seed hält die Ergebnisse zwischen Durchläufen desselben Prompts nah beieinander – praktisch für Konsistenztests und A/B-Vergleiche –, eine pixelgenaue Wiederholung garantieren die Modelle aber nicht. Diese Profi-Einstellungen geben Creatorn und Entwicklern genaue Kontrolle über KI-generierte Inhalte.
Was ist der „Lockere Filter“? Kann ich uneingeschränkte oder erwachsene kreative Inhalte generieren?
BananaBanana hat in den Generator-Einstellungen einen Schalter „Lockerer Filter“, der deutlich mehr kreative Freiheit bietet als Midjourney, GPT Image, Grok Imagine oder die Webversion von Gemini. Ist er aktiv, sendet BananaBanana den API-Parameter safetySettings von Gemini mit dem Schwellenwert OFF – das schaltet die Moderation nicht komplett ab, sondern deaktiviert nur den Sicherheitsfilter auf Prompt-Ebene, den die API freigibt. Gemini hat zusätzlich einen zweiten, internen Filter, der sich über die API nicht steuern lässt, deshalb werden extreme Inhalte weiterhin blockiert. Trotzdem gibt der Schalter spürbar mehr Spielraum für legitime kreative Arbeit wie Kunst, Modefotografie oder Geschichten für Erwachsene – ohne dass du gegen Regeln verstoßen musst. Der Schalter lässt sich für jede Generierung einzeln ein- oder ausschalten.
Darf ich mit BananaBanana generierte Inhalte kommerziell nutzen?
Ja – generierte Bilder und Videos darfst du privat und kommerziell nutzen, etwa für Werbung, Social Media, Produktbilder, KI-Influencer-Accounts, E-Commerce-Angebote und Print-on-Demand. Für die Inhalte gelten die Nutzungsrichtlinien des Modellanbieters, der sie gerendert hat (Google, OpenAI, Alibaba oder xAI), und die Kennzeichnung synthetischer Medien, wo Gesetz oder Plattform sie verlangen, liegt bei dir.
Für ein Konto brauchst du nur eine E-Mail-Adresse – keinen Namen, keine Telefonnummer, keine Postadresse und bei uns keine Kartendaten: Krypto-Aufladungen gehen an eine Wallet-Adresse, Zahlungen per Karte, PayPal und SEPA laufen im eigenen Fenster von PayPal, Kartennummern erreichen uns also nie; wir speichern nur die Transaktionsdaten. Wie jeder gehostete Dienst protokollieren wir auch technische Daten: IP-Adresse, Browser und Nutzungsverlauf; die Datenschutzerklärung listet alles auf. Prompts und Referenzbilder gehen an den Anbieter des gewählten Modells – Google, OpenAI, Alibaba oder xAI, direkt oder über ein API-Gateway –, ohne Kontokennung, und wir verkaufen sie nie und nutzen sie nicht zum Training von Modellen. Generierte Bilder und Videos bleiben 30 Tage in deinem privaten Konto und werden dann automatisch gelöscht; du kannst sie auch jederzeit selbst löschen.
Hat BananaBanana ein Empfehlungs- oder Partnerprogramm?
Ja – BananaBanana hat ein dreistufiges Partnerprogramm ohne Obergrenze bei den Einnahmen. Erstelle bis zu 3 persönliche Promo-Codes – wer deinen Code nutzt, bekommt 10 % Bonus auf die Aufladung, und du erhältst eine Provision: 5 % zu Beginn, 10 % ab $1000 Empfehlungsumsatz, 15 % ab $2000. Deine Einnahmen siehst du im Dashboard deines Profils. Auszahlungen werden direkt deinem BananaBanana-Guthaben gutgeschrieben.
Hat BananaBanana eine API für Entwickler?
Ja – BananaBanana hat einen öffentlichen Remote-MCP-Server unter bananabanana.pro/mcp. KI-Agenten und MCP-Clients wie Claude Code, Claude Desktop und Gemini CLI können darüber programmatisch Bilder und Videos generieren: Erstelle in deinem Profil einen API-Schlüssel, verbinde den Server, und jede Generierung wird pro Nutzung vom selben Guthaben abgebucht wie auf der Website, zu denselben Preisen pro Generierung. Eine klassische REST-API kann später folgen.
Kann mein Agent Bilder, Videos und Sprache generieren?
Ja – Claude und andere KI-Agenten können über den öffentlichen Remote-MCP-Server (Model Context Protocol) von BananaBanana Bilder, Videos und Sprache generieren. Claude Code, Claude Desktop, claude.ai, Cursor, Gemini CLI, Codex, n8n und jeder andere MCP-kompatible Client können sich verbinden. Der Agent bekommt dieselben Modelle und Einstellungen wie das Web-Studio: Referenzbilder, Start- und Endbilder, Referenzvideos für Wan, Omni-Verlängerung bis 40 Sekunden, Bild- und Videobearbeitung sowie Gemini 3.1 Flash TTS. Jeder Aufruf wird vom selben Guthaben zu denselben Preisen abgebucht, und bei Videos wird der Preis vor der Abbuchung zur Bestätigung angezeigt. Anschließend kann der Agent die generierten Dateien mit ffmpeg auf deinem Rechner zusammensetzen: BananaBanana übernimmt die Generierung, der Agent den lokalen Schnitt. Melde dich per OAuth aus dem Client an oder erstelle unter Profil → MCP-API-Schlüssel einen API-Schlüssel. Einrichtungsanleitung: bananabanana.pro/mcp.
Welches Sprachmodell nutzt BananaBanana, und was kostet es?
BananaBanana bietet Gemini 3.1 Flash TTS von Google, im Web-Studio und per MCP. Es kostet $0.01 pro angefangene 200 Zeichen, ein 30-Sekunden-Text mit etwa 450 Zeichen kostet also $0.03. Es gibt 30 Stimmen, einen Stil-Prompt für Tonfall und Tempo und einen Erzähler oder einen Dialog mit zwei Sprechern in einer Datei. Der Ton kommt als WAV-Datei mit 24 kHz, die du oder dein Agent mit ffmpeg unter ein Video legen kann.
Kann mein Agent per x402 ohne Konto bezahlen?
Ja – mit x402 zahlt ein Agent jeden Aufruf in USDC im Base-Netzwerk, ohne BananaBanana-Konto, API-Schlüssel oder Aufladung. Der Agent fordert eine Generierung an, bekommt den genauen Preis, signiert die Zahlung und erhält das Ergebnis. Das funktioniert für Bild-, Video- und Sprachgenerierung, und ein Aufruf kostet, was die Generierung kostet, ab $0.01. Schlägt ein x402-Video fehl, bekommt der Zahlende einen Gutschrift-Token über denselben Betrag, 90 Tage gültig; Zahlungen werden nicht on-chain erstattet. Details: bananabanana.pro/mcp.
Kann ich per Karte oder PayPal zahlen?
Ja – BananaBanana akzeptiert Aufladungen per Karte, PayPal und SEPA ab $20. Der gezahlte Betrag wird deinem Guthaben in US-Dollar ohne Bonus gutgeschrieben; Mengenboni von 5 % ab $50 und 10 % ab $100 gelten nur für Krypto-Aufladungen. Kartenzahlungen laufen im PayPal-Fenster, jede Aufladung ist eine Einmalzahlung ohne Abo, und dein Guthaben verfällt nie.
Fehlgeschlagene Renderings werden auf dein Guthaben erstattet
Wenn du mehr willst: Krypto ab $1 · Karte, PayPal, SEPA ab $20
Was du mit dem Startguthaben bekommst
$0.20
1 KI-Influencer-Foto in Top-Qualität
Nano Banana Pro · 4K · $0.20
1K–2K ab $0.11
4 Storyboard-Bilder
GPT Image 2.5 Flare · 1K
4 × $0.05 = $0.20
2 Poster mit lesbarem Text
Qwen Image 3.0 Pro · 2K
2 × $0.08 = $0.16
Ein 6-Sekunden-Test für einen gesprochenen Hook, mit Ton
Gemini Omni 1.1 Flash · 360p · $0.18
Jedes Beispiel ist eine eigene Möglichkeit, $0.20 auszugeben. Die Mengen basieren auf aktuellen Preisen; die Vorschauen sind echte Renderings mit den angegebenen Einstellungen.