Torna al blog
BananaBanana Teamguidemodelspricing

Guida a BananaBanana: 13 modelli AI, prezzi, funzioni

Tour completo di BananaBanana: tredici modelli AI per immagini e video più sintesi vocale, prezzi da $0.03, senza abbonamento, crypto o carta, referral.

Guida a BananaBanana: 13 modelli AI, prezzi, funzioni

BananaBanana è una piattaforma di generazione di immagini, video e voce con AI a pagamento a consumo: tredici modelli di quattro fornitori dietro un unico saldo in USD. Sei modelli per immagini (tre livelli di Nano Banana, due di GPT Image 2.5 e Qwen Image 3.0 Pro), sette modelli video (tre livelli di Veo 3.1, due generazioni di Gemini Omni Flash, Wan 3.0 e Grok Imagine Video 1.5), più Gemini 3.1 Flash TTS per la voce. Niente abbonamento, nessuna carta salvata. Ricarichi con crypto o carta e paghi per ogni risultato.

In breve, se stai confrontando le opzioni:

  • Immagini: da $0.03 a $0.20 l'una, a seconda del modello e della risoluzione (da 512px a 4K).
  • Video senza audio: da $0.10 per una clip di 4 secondi a 720p su Veo 3.1 Lite.
  • Video con audio: da $0.18 su Veo Lite, oppure $0.20 per una clip di 4 secondi a 480p su Wan 3.0, dove la colonna sonora è gratis. Gemini Omni Flash si paga al secondo, da $0.03 a 360p fino a $0.30 in 4K.
  • Voce: $0.01 ogni 200 caratteri, 30 voci, uno o due speaker.
  • Ricariche: oltre 20 criptovalute e stablecoin da $1, oppure carta, PayPal e SEPA da $20. Senza abbonamento, niente da disdire.
  • Controlli: seed, prompt negativo, immagini e clip di riferimento, primo e ultimo fotogramma, estensione delle clip. Quasi tutta la superficie delle API grezze, in un'interfaccia web, e gli stessi modelli via MCP per gli agenti.
  • I nuovi account ricevono un saldo di benvenuto di $0.20, e le generazioni fallite vengono rimborsate in automatico.

La prima versione di questo post l'abbiamo pubblicata il giorno del lancio, quando la piattaforma aveva sette modelli Google e l'articolo era sei punti elenco e una promessa. Questa è l'edizione di settembre 2026: tredici modelli, quattro fornitori, e ogni esempio qui sotto è stato generato con la nostra pipeline apposta per questo articolo.

Cosa puoi creare con BananaBanana?

Immagini, brevi clip video e audio parlato, nella maggior parte delle varianti che servono davvero.

Le immagini vanno da bozze veloci a 512px fino a export in 4K, in dieci formati: dal quadrato 1:1 al cinematografico 21:9. Puoi allegare immagini di riferimento quando un prodotto o un personaggio deve restare coerente in tutta una serie (fino a 14 su Nano Banana 2 e GPT Image 2.5, tre su Qwen). Un'immagine economica arriva in pochi secondi; i modelli di punta si avvicinano al mezzo minuto.

Il video oggi segue tre filosofie. La famiglia Veo 3.1 ti dà il controllo: durata esatta di 4, 6, 7 o 8 secondi, risoluzione fino a 4K e una colonna sonora che puoi spegnere. Omni Flash è quello conversazionale: sempre con audio, da 3 a 10 secondi pagati al secondo, e lo perfezioni descrivendo le modifiche a parole. La coppia più recente punta sulla durata o sul parlato: Wan 3.0 genera fino a 30 secondi in un'unica ripresa, e Grok Imagine Video 1.5 sincronizza il labiale su una battuta di dialogo scritta da te.

Una differenza meno vistosa rispetto alla maggior parte dei siti «wrapper»: esponiamo quasi tutti i parametri di ogni API invece di un'unica casella per il prompt. Seed, prompt negativo, un interruttore per il miglioramento del prompt, dieci formati, riferimenti del soggetto, primo e ultimo fotogramma, estensione delle clip, l'interruttore dell'audio. Se ti è mai capitato di abbandonare uno strumento perché nascondeva proprio l'impostazione che ti serviva, è successo anche a noi: ecco perché il generatore non lo fa.

Attorno ai modelli c'è la parte noiosa ma importante: la cronologia delle generazioni nel profilo, i rimborsi automatici quando un provider fallisce, un'interfaccia tradotta in 15 lingue e un server MCP, così Claude, Cursor o il tuo agente possono chiamare gli stessi modelli dallo stesso saldo.

Cassetta degli attrezzi aperta con tredici strumenti luminosi che proiettano immagini, fotogrammi e un'onda sonora: i tredici modelli AI di BananaBanana

Modelli di immagini Nano Banana: Lite, standard e Pro

I tre modelli di immagini di Google sono della stessa famiglia e si dividono i compiti in modo netto. Lite è per i volumi, Nano Banana 2 per avere margine sulla risoluzione, Pro per le immagini che la gente guarderà davvero da vicino.

Nano Banana 2 LiteNano Banana 2Nano Banana Pro
Prezzo per immagine$0.03 (solo 1K)$0.03 a 512px, $0.06 a 1K, $0.09 a 2K, $0.13 a 4K$0.11 a 1K e 2K, $0.20 a 4K
Velocità nella nostra pipelinecirca 4 secondicirca 2–4 volte più lento20–40 secondi
Punto di forzabozze, asset in serierisoluzione, testo affidabile, fino a 8 immagini per prompttipografia, scene complesse

Invece di descrivere la differenza, ecco lo stesso prompt con tutti e tre i modelli: una bottiglia fotorealistica di soda alla banana sul bancone di un mercato bagnato dalla pioggia al tramonto, con un'etichetta di carta che dice "BANANA SODA".

Bottiglia di soda alla banana generata da Nano Banana 2 Lite: scritta principale corretta, testo piccolo illeggibile

Lite ($0.03) centra l'atmosfera e le lettere del titolo, poi lascia perdere il testo piccolo: la riga sotto il logo è un'accozzaglia decorativa. Per un'illustrazione su cui nessuno zooma, di solito va benissimo.

Bottiglia di soda alla banana generata da Nano Banana 2 con un'etichetta retrò completamente leggibile

Nano Banana 2 ($0.06 a 1K) rende un'etichetta tutta leggibile, fino a un inventato "EST. 1974" e all'indicazione del volume, e inquadra una scena di strada più ampia. La lavagna del menu che ha aggiunto sullo sfondo, però, è un pasticcio.

Bottiglia di soda alla banana generata da Nano Banana Pro con tipografia retrò nitida e scritta in corsivo

Pro ($0.11) vince su tipografia e luce: lettere retrò nitide con ombra, corsivo leggibile sotto. Dettaglio divertente: perfino Pro ha sbagliato a scrivere il suo stesso slogan inventato, "Small Balch". I modelli di immagini hanno fatto passi enormi con il testo; la correzione di bozze resta compito tuo.

Abbiamo anche usato Lite in produzione per una settimana e raccontato quando il modello economico basta, se vuoi approfondire il lato del budget.

GPT Image 2.5 e Qwen Image 3.0 Pro: gli altri modelli di immagini

Tre modelli di immagini ora arrivano da fuori Google, e ci sono perché gli utenti continuavano a chiedere un secondo parere sullo stesso prompt.

GPT Image 2.5 FlareGPT Image 2.5 SunburstQwen Image 3.0 Pro
Prezzo per immagine$0.05 a 1K, $0.11 a 2K, $0.18 a 4Kcome Flare$0.04 a 1K, $0.08 a 2K
Carattereil livello veloce di 2.5 di OpenAIil livello preciso, più lentolo specialista del testo di Alibaba
Extrafino a 14 immagini di riferimentofino a 14 immagini di riferimentoseed, prompt negativo, 3 riferimenti, testo nell'immagine in 12 lingue
Mancaseed, Filtro permissivoseed, Filtro permissivo4K

Stesso prompt della soda alla banana, altre due versioni.

Bottiglia di soda alla banana generata da GPT Image 2.5 Flare con etichetta leggibile anche nel testo piccolo

Flare ($0.05) è l'unico modello di tutta la rassegna che ha scritto giusta ogni parola, testo piccolo compreso: "Real Banana Flavor, Since 1932", più un caschetto di banane che nessuno aveva chiesto e un bokeh da mercato bagnato che sembra una foto vera. Ci ha messo 36 secondi, ed è il prezzo di quella precisione. Sunburst è la stessa famiglia di modelli tarata per un'aderenza al prompt ancora più stretta; lo uso quando un layout deve rispettare un brief, non per una prima bozza.

Bottiglia di soda alla banana generata da Qwen Image 3.0 Pro con titolo marcato e leggibile e testo piccolo illeggibile

Qwen ($0.04) è tornato in nove secondi con il titolo più deciso dei cinque e la bottiglia più pulita, poi ha fatto come Lite sul testo piccolo: due righe di nonsense convincente. Il suo vero punto di forza è il testo in cinese, giapponese, coreano e altri sistemi di scrittura dove i modelli Google inciampano ancora, ed è il modello più economico qui con seed e prompt negativo. Niente 4K, però.

Video Veo 3.1: Standard, Fast e Lite

I tre livelli di Veo condividono gli stessi controlli nel nostro generatore; la differenza di prezzo compra qualità, visibile soprattutto nella fisica e nei movimenti fini. Secondo la documentazione di Veo di Google, la famiglia supporta audio nativo, video da immagine e risoluzioni fino a 4K, e coincide con quello che vediamo tramite API, con una nota sulla piattaforma: Veo 3.1 Lite si ferma a 1080p.

I prezzi qui sotto vanno da una clip di 4 secondi a una di 8:

ModelloSenza audio, 720p/1080pCon audio, 720p/1080p4K
Veo 3.1$0.70–1.40$1.50–3.00$1.50–3.00 senza audio, $2.20–4.40 con audio
Veo 3.1 Fast$0.35–0.70$0.50–1.00$1.10–2.20 senza audio, $1.30–2.60 con audio
Veo 3.1 Lite$0.10–0.20 a 720p, $0.17–0.34 a 1080p$0.18–0.36 a 720p, $0.28–0.56 a 1080pnon disponibile

La clip qui sopra è Veo 3.1 Fast: un dolly-in di 6 secondi senza audio su una tavola apparecchiata per la colazione all'ora dorata, generato per questo post. È costata $0.52 a 720p. Guarda il vapore e la tenda: è quel tipo di movimento credibile che separa Veo dai modelli video più economici, e Fast ne conserva quasi tutto a un terzo del prezzo di Standard.

Di solito una clip arriva in pochi minuti. Quando la capacità è sotto pressione, la piattaforma riavvia l'operazione da sola e mostra il contatore dei tentativi mentre aspetti. Se nemmeno così riesce a consegnare, ti restituisce i soldi. Stessa regola quando il filtro di sicurezza si mangia i risultati: un blocco totale rimborsa tutto, uno parziale rimborsa in proporzione.

La mia regola pratica dopo mesi di utilizzo: Lite per storyboard e bozze social, Fast per tutti i giorni, Standard quando acqua, tessuti o urti devono sembrare veri, o quando le specifiche di consegna chiedono il 4K. Veo ha anche la portata più lunga: una clip finita si estende di 7 secondi alla volta, fino a 148 secondi con piena continuità.

Omni Flash: video con audio che modifichi chattando

Gemini Omni Flash è quello fuori dal coro. Google ha rilasciato la prima generazione a giugno 2026 e Omni 1.1 ad agosto; qui girano entrambe, con 1.1 come predefinita. Genera sempre una colonna sonora, dura da 3 a 10 secondi a una lunghezza che scegli tu in secondi interi e si paga al secondo: $0.03 a 360p, $0.10 a 720p, $0.15 a 1080p e $0.30 in 4K, quindi una bozza di tre secondi costa $0.09 e dieci secondi pieni a 720p costano $1.00. Accetta immagini in input: un fotogramma iniziale, un ultimo fotogramma opzionale e fino a tre clip di riferimento per un personaggio o un prodotto. La generazione 1.0 resta disponibile a 4, 6, 8 o 10 secondi, 720p o 1080p, se preferisci il suo look.

Qui accendi l'audio. La clip dei pancake è una singola generazione di Omni Flash: un solo prompt testuale che descrive lo sciroppo d'acero versato su una pila di pancake, un'istruzione esplicita "single continuous shot, no scene cuts" (Omni adora montare inquadrature in più se non glielo dici), più una riga "Audio:" che chiede il leggero colare dello sciroppo sul sottofondo di una cucina silenziosa. Nessun lavoro audio a parte. Ho chiesto tutti e 10 i secondi.

Una lezione di prompting da questa clip: Omni mantiene quello che sta già succedendo nel primo fotogramma e lascia cadere in silenzio le azioni previste più avanti. Le mie prime bozze chiedevano di girare un pancake «verso metà clip» e per tre volte di fila ho ottenuto dieci secondi di niente. La versione che ha funzionato descrive lo sciroppo che scende già dal primissimo fotogramma e continua per tutta la clip. Scrivi l'azione al presente progressivo, non come una timeline.

La funzione che giustifica il prezzo è la modifica. Ogni video finito ha un pulsante di modifica, non solo quelli di Omni: descrivi un cambiamento («fai che sia notte, lascia tutto il resto uguale»), paghi di nuovo i secondi e il modello rigenera la clip con la tua correzione mantenendo gran parte dell'originale. Funziona anche con i tuoi upload, quindi una clip Veo o un video del telefono si possono ristilizzare con Omni; il risultato ha sempre la stessa durata della sorgente. Omni 1.1 sa anche estendere: ogni passaggio aggiunge da 3 a 10 secondi all'ultima clip, fino a circa 40 secondi in totale. Abbiamo smontato il modello in una recensione dell'API di Omni Flash a parte, e c'è una pagina dedicata a cosa è cambiato con 1.1.

Wan 3.0 e Grok Imagine Video 1.5: riprese lunghe e clip parlate

Questi due sono arrivati a settembre e coprono i buchi che lasciano i modelli Google.

Wan 3.0Grok Imagine Video 1.5
Durata4, 6, 8, 10, 15, 20 o 30 squalsiasi numero intero da 4 a 15 s
Prezzo$0.05/s a 480p, $0.10/s a 720p, $0.20/s a 1080p$0.14/s a 720p, $0.25/s a 1080p
Clip più economica$0.20 (4 s, 480p, audio incluso)$0.56 (4 s, 720p)
Audioattivo di default, gratis, si può spegneresempre attivo, con dialoghi in lip-sync
Inputprimo e ultimo fotogramma, fino a 10 immagini di riferimento, fino a 5 clip di riferimentoprimo fotogramma o fino a 7 riferimenti (riferimenti solo a 720p)
Formati16:9, 9:1616:9, 9:16, 1:1, 3:2, 2:3

Wan 3.0 è l'unico modello della piattaforma che genera mezzo minuto in un solo passaggio, e la sua colonna sonora non costa nulla in più: è il modo più economico per avere video con audio qui. Il rovescio della medaglia è nella fascia alta: 30 secondi a 1080p costano $6.00, la singola generazione più cara che vendiamo. Anche le clip di riferimento si pagano, quindi un riferimento di 15 secondi più un output di 15 secondi costa come 30 secondi.

La barca con la lanterna è una generazione di Wan 3.0 per questo post: dieci secondi a 720p, $1.00, un solo prompt che chiede un'unica carrellata continua lungo un torrente nel bosco al crepuscolo con le lucciole, e una riga "Audio:" per acqua e grilli. Ha consegnato tutta la ripresa senza un taglio, cioè proprio quello che a Omni devi strappare con le istruzioni. La fiamma della candela è un filo troppo ferma per i miei gusti. Audio acceso: il ruscello è generato, non di repertorio.

Grok è quello che parla. La clip della barista dura sei secondi a 720p ($0.84): ho scritto la sua battuta tra virgolette nel prompt e il modello ha restituito un volto che parla con il labiale allineato alle parole. È la funzione su cui si costruiscono gli annunci in stile UGC, e ci abbiamo scritto attorno una guida ai video UGC con AI. Due note oneste dai log: le immagini di riferimento funzionano solo a 720p (un primo fotogramma funziona anche a 1080p), e questa clip è tornata a 1280×704 invece che a 720 righe piene. Sul telefono non se ne accorgerà nessuno. Un cliente che conta i pixel, forse sì.

Sintesi vocale: 30 voci, un centesimo ogni 200 caratteri

Gemini 3.1 Flash TTS trasforma il testo in un WAV a 24 kHz per $0.01 ogni 200 caratteri iniziati, quindi una lettura di 60 secondi da circa 900 caratteri costa cinque centesimi. Scegli una delle 30 voci o imposti un dialogo tra esattamente due, e dirigi l'interpretazione a parole: «calda, senza fretta, un leggero sorriso», più tag in linea come [whispers] o [laughs] dove servono. Gira nello stesso generatore di immagini e video, e via MCP come generate_speech.

È una sola generazione: circa 150 caratteri, la voce Kore, una nota di stile di una riga che chiede un narratore rilassato e non uno spot pubblicitario. Costo: un centesimo. Non la userei per un audiolibro, ma per la voce fuori campo di una clip di prodotto batte l'attesa che un freelance apra la posta.

Come funzionano pagamenti e rimborsi?

Il saldo è in USD e scende solo quando una generazione va a buon fine. Le ricariche in crypto sul web passano da 0xProcessing: BTC, ETH, SOL, TON, BNB, LTC, TRX, XRP, DOGE e BCH, più le stablecoin USDT, USDC, DAI e TUSD sulle reti ERC-20, BEP-20, Solana, TON e Base. Sono più di 20 opzioni, e in pratica la maggior parte dei nostri utenti sceglie stablecoin su reti economiche come TON o Solana. Se stai per fare il tuo primo trasferimento c'è una guida completa alla ricarica in crypto. Carte, saldo PayPal e bonifici SEPA passano invece da PayPal Checkout, da $20 per pagamento.

Per registrarti basta un'email e ricevi $0.20 di credito, abbastanza per sei immagini Lite prima di decidere qualsiasi cosa. Se qualcuno ti ha passato un codice promo, attivalo una volta e ogni ricarica che fai riceve un bonus del +10%. Anche l'importo della ricarica dà un bonus, sulle ricariche in crypto: 5% da $50 e 10% da $100, e i due si sommano: $100 in crypto con un codice attivo accreditano $120.

Nessun dato salvato

Pagare con carta si può, ma la carta non tocca mai la nostra piattaforma: premi il pulsante PayPal e i dati si inseriscono nella finestra di PayPal. Dopo non resta salvato nulla, e nulla si rinnova. Se ti è mai capitato di abbonarti a uno strumento AI per un solo progetto e poi pagare quattro mesi a vuoto perché la disdetta era sepolta tre menu più in fondo, sai esattamente perché conta. Un saldo ricaricato resta tuo finché non lo spendi; quando finisce, niente continua ad addebitarti soldi solo perché esisti. Il compromesso, detto chiaro: con la carta si parte da $20 per pagamento, con le crypto da circa $1. Un trasferimento di $10 in stablecoin su TON costa pochi centesimi di commissioni e la prima volta richiede circa cinque minuti, poi pochi secondi.

In post separati abbiamo spiegato perché non ti serve mai una carta salvata e come il pagamento per immagine si confronta con gli abbonamenti. La logica dei rimborsi merita di essere spiegata qui, perché le API generative falliscono più spesso di quanto chiunque ammetta. Una generazione che finisce in stato di errore rimborsa il prezzo pieno in automatico. Nessun ticket all'assistenza. I listini completi sono nella pagina dei prezzi.

Monete crypto che scivolano lungo uno scivolo in un barattolo di vetro a forma di banana: le ricariche in crypto su BananaBanana

Programma referral: dal 5% al 15% di ogni ricarica

Nel tuo profilo puoi creare fino a tre codici promo. Chi attiva il tuo codice riceve +10% su ogni ricarica, e tu guadagni una commissione su quelle ricariche: 5% all'inizio, 10% quando i tuoi referral superano $1,000 di ricariche totali, 15% oltre $2,000. Il codice resta legato all'account dell'acquirente, quindi il bonus e la tua commissione si applicano a ogni ricarica in automatico, non solo alla prima.

Due avvertenze oneste. Non puoi attivare il tuo stesso codice, e le registrazioni dalla tua stessa rete non contano per le commissioni; i controlli antifrode sono severi di proposito.

Figurine di carta che salgono tre gradini di un podio con pacchi regalo: i tre livelli del programma referral di BananaBanana

FAQ

Quanto costa generare immagini con AI su BananaBanana?

Da $0.03 a immagine (Nano Banana 2 Lite a 1K, o Nano Banana 2 a 512px) fino a $0.20 per un'immagine 4K su Nano Banana Pro. GPT Image 2.5 va da $0.05 a $0.18, Qwen Image 3.0 Pro da $0.04 a $0.08. Senza abbonamento: paghi a immagine da un saldo prepagato.

C'è una prova gratis?

Ogni nuovo account parte con $0.20 di credito, che coprono sei immagini sul modello più economico o una clip Wan 3.0 di 4 secondi con audio. Per registrarti non servono dati della carta, solo un'email.

Mi servono una carta di credito o un abbonamento?

Per iniziare non serve nessuna carta: ti registri con un'email e ricevi $0.20 di saldo. Poi ricarichi un saldo in USD quando vuoi, con crypto da circa $1 oppure con carta, PayPal o SEPA da $20, e paghi a generazione. Non esiste un piano in abbonamento, il saldo non usato non scade e nessuno può addebitarti nulla in automatico.

Quali criptovalute accetta BananaBanana?

BTC, ETH, SOL, TON, BNB, LTC, TRX, XRP, DOGE, BCH e le stablecoin USDT, USDC, DAI e TUSD sulle reti ERC-20, BEP-20, Solana, TON e Base.

Posso generare video AI con audio?

Sì, in quattro modi. I modelli Veo 3.1 hanno un interruttore per l'audio (una clip di 4 secondi con audio parte da $0.18 su Veo Lite), Wan 3.0 include la colonna sonora gratis da $0.20, Gemini Omni Flash genera sempre l'audio da $0.03 al secondo, e Grok Imagine Video 1.5 sincronizza il labiale sul dialogo che scrivi tu, da $0.56 a clip.

Cosa succede se una generazione fallisce?

Il prezzo pieno ti viene rimborsato sul saldo in automatico. Per i video, la piattaforma prima riprova da sola in caso di errori di capacità; se un filtro di sicurezza blocca una parte dell'output, la parte non consegnata viene rimborsata in proporzione.

guidemodelspricing