Modello · Alibaba Wan 3.0

Wan 3.0 – 30 secondi di video in una sola generazione

Il modello video di Alibaba, e l'unica cosa che fa e che i modelli di Google qui non fanno: la durata. Una sola generazione ti dà da 4 a 30 secondi con l'audio già dentro, in 480p, 720p o 1080p, orizzontale o verticale. Paghi al secondo – $0.05, $0.10 o $0.20 a seconda della risoluzione – quindi una bozza breve costa $0.20 e la clip più lunga e nitida della piattaforma costa $6.00. Crypto o carta, senza abbonamento.

Una vera generazione di Wan 3.0 su BananaBanana: un prompt, dieci secondi in 720p, audio creato nello stesso passaggio. Questa clip è costata $1.00. Se disattivi l'audio il prezzo non cambia.
01Che cos'è

Che cos'è Wan 3.0?

Wan 3.0 è il modello di generazione video di Alibaba, uscito su Alibaba Cloud Model Studio ad agosto 2026, e genera clip da 4 a 30 secondi con l<strong>audio creato nello stesso passaggio</strong> dellimmagine. Qui legge un prompt, un primo e un ultimo fotogramma opzionali oppure fino a 10 immagini di riferimento, e restituisce una clip finita in 480p, 720p o 1080p. Facciamo pagare esattamente il listino di Alibaba per il modello – $0.05, $0.10 e $0.20 al secondo a seconda della risoluzione – senza ricarichi, la stessa politica che applichiamo ai modelli di Google.

A chi servono davvero 30 secondi?

A chiunque sia stanco di cucire spezzoni. La maggior parte dei modelli video si ferma intorno agli otto o dieci secondi, quindi una sequenza da mezzo minuto significa tre o quattro generazioni, raccordarle a mano e convivere con le giunture dove il modello ha cambiato idea sulla luce. Wan genera tutto come un'unica ripresa. Per loop di prodotto, sfondi d'atmosfera, riprese di processo e qualsiasi scena in cui la camera continua semplicemente a muoversi, il passaggio di montaggio sparisce del tutto. In verticale funziona allo stesso modo: 9:16 in tutte e tre le risoluzioni, che è quello che vogliono Shorts e Reels.

Verticale 9:16 in 480p, sei secondi, audio incluso. A $0.05 al secondo, questa è costata trenta centesimi.
02Cosa fa bene

Sei cose da sapere prima di spendere

Fino a 30 secondi, una sola ripresa

4, 6, 8, 10, 15, 20 o 30 secondi. Niente spezzoni da cucire, nessuna deriva tra un segmento e l'altro. Il secondo modello più lungo qui arriva a quindici; quelli di Google si fermano a otto o dieci.

Un audio che non costa niente

L'audio viene generato insieme all'immagine ed è attivo di default. Per spegnerlo basta un interruttore, e il prezzo resta lo stesso in entrambi i casi – a differenza di Veo, dove l'audio nativo si paga a parte.

Primo e ultimo fotogramma

Dagli un'immagine di partenza da animare e, se vuoi, un'immagine finale su cui atterrare. La stessa immagine in entrambi gli slot ti dà un loop pulito.

Fino a 10 immagini di riferimento

I riferimenti mantengono coerenti un soggetto o uno stile tra una generazione e l'altra. Sono un'alternativa ai fotogrammi, non un'aggiunta: il modello accetta o gli uni o gli altri.

Seed

Fissa il seed e lo stesso prompt produce un'inquadratura molto simile. Utile quando ritocchi una parola alla volta e vuoi vedere cosa ha cambiato quella parola.

Tre fasce di prezzo

480p per le bozze a $0.05 al secondo, 720p per pubblicare a $0.10, 1080p a $0.20. Fai le bozze spendendo poco, e genera una volta sola la versione buona.

Venti secondi senza interruzioni da una sola generazione in 480p: argilla centrata, parete tirata su, bordo aperto, nessun taglio. È costata un dollaro. Le mani restano coerenti dall'inizio alla fine, cosa che da una ripresa di venti secondi non mi aspettavo.
03Limiti onesti

Cosa Wan 3.0 non fa

Qui la modifica non è una conversazione. Con Gemini Omni Flash puoi dire «rendi la luce più calda» e il modello sistema la scena che ricorda. Wan può rigirare una clip che gli passi – fino a 15 secondi di sorgente, con sorgente e risultato insieme entro 30 secondi – ma ogni richiesta riparte da zero, e i secondi della sorgente si pagano insieme a quelli del risultato. Inoltre genera una clip per generazione: niente griglie di quattro varianti tra cui scegliere. Non c'è il prompt negativo, quindi tutto ciò che non vuoi va tolto dalla descrizione della scena, non vietato. I formati sono solo 16:9 e 9:16, e il tetto è 1080p. E primi fotogrammi e immagini di riferimento si escludono a vicenda: o i fotogrammi o i riferimenti, non entrambi.

Alibaba è franca su dove il modello deve ancora crescere: le sue note di lancio dicono che la texture dell'audio e il rendering del testo a schermo non sono ancora dove li vorrebbero, e grosso modo corrisponde a quello che vediamo noi: l'atmosfera sonora arriva, le battute parlate sono uscite meglio del previsto, ma non è una traccia che puoi modellare nei dettagli. Le riprese lunghe hanno i loro rischi. La nostra clip di ceramica da venti secondi qui sopra ha retto meglio di quanto mi aspettassi, ma trenta secondi sono tanti fotogrammi da tenere coerenti, quindi metti in conto un nuovo tentativo per tutto ciò che supera i quindici. Una cosa che il modello fa a monte e che noi non abbiamo collegato: accetta documenti (PPT, PDF, fogli di calcolo) come input. E la sua «estensione» è una scena successiva con lo stesso cast e lo stesso set, non una continuazione precisa al fotogramma. Se vuoi un audio da guidare frase per frase, Gemini Omni Flash è lo strumento migliore; se ti serve il 4K, che Wan non raggiunge, l'alternativa è Veo 3.1.

04Note dal campo

Cosa ci ha insegnato la produzione

Queste note vengono da una vera produzione pubblicitaria su Wan 3.0 a settembre 2026: clip di prodotto, pulizia di riprese girate dal vero, rifacimenti a partire da un primo fotogramma. Niente di tutto questo è nella documentazione, e scoprirlo è costato soldi veri.

L'ordine dei blocchi decide il risultato

Quello che viene per primo nel prompt si prende l'attenzione, e una lunga descrizione del prodotto se la prende tutta. Nelle nostre prove un'istruzione di pulizia messa al settimo posto nel prompt è stata ignorata; le stesse parole spostate in cima come «TASK 1» sono state eseguite. Metti per prima la cosa che ti serve di più.

I negativi funzionano come una lista di cose da disegnare

«No ring, no watch, no ink» ci ha dato un anello d'oro nuovo e un tatuaggio più marcato. Nelle nostre prove, nominare una cosa equivaleva a chiederla. Descrivi invece cosa deve esserci: «each finger is plain skin from base to tip» ha fatto quello che tre negativi non erano riusciti a fare.

Riempie le mani vuote

Nelle nostre inquadrature in cui il prodotto non doveva comparire, Wan ha sostituito con il prodotto qualunque cosa la mano tenesse: un pettine è diventato un rasoio regolabarba. Nomina ogni strumento, scrivi chiaramente che un'inquadratura senza prodotto va bene, e scrivi «never more than one» invece di «exactly one». Ancora più sicuro: genera quelle inquadrature come segmento separato, con un prompt che non descrive mai il prodotto.

Un primo fotogramma tiene fermo l'oggetto

Da un'unica immagine di partenza e senza riferimenti, Wan ha mantenuto un prodotto intatto per dieci secondi: pulsanti al loro posto, niente di estraneo nella scena. Nei nostri test sullo stesso fotogramma, altri modelli hanno fatto spuntare un cavo di troppo e oggetti estranei. Se conta il prodotto esatto, crea prima il fotogramma e lascia che Wan lo animi in una sola generazione.

La pulizia torna fotogramma per fotogramma

Modificare una clip girata dal vero per togliere tatuaggi, un orologio e dei braccialetti ha restituito un girato che corrispondeva all'originale inquadratura per inquadratura, con la pelle pulita. Per noi la misura affidabile sono stati pezzi fino a circa otto secondi; le sorgenti più lunghe conviene tagliarle in parti.

Una generazione lunga batte una catena

Estendere su Wan significa «la scena successiva», non una continuazione precisa al fotogramma. Quando ti servono quindici, venti o trenta secondi, ordinali come un'unica generazione invece di concatenarne di brevi.

Le durate sono in secondi interi

Il risultato viene tagliato al numero intero di secondi che hai ordinato, a 30 fps: 94 fotogrammi in ingresso sono tornati come 90. Tagliare esattamente sul confine di un'inquadratura quindi per noi non ha funzionato: pianifica i segmenti in modo che i raccordi cadano su secondi interi.

Una foto di riferimento si porta dietro il guardaroba

Nelle nostre prove Wan ha copiato vestiti e gioielli dalla foto di una persona anche quando il prompt diceva «face and hair only». Ritaglia il riferimento su quello che vuoi davvero trasferire.

Spazio per un brief inquadratura per inquadratura

Il prompt accetta fino a 20.000 caratteri, quindi c'è spazio per task numerati, un vincolo su ogni strumento e la descrizione di ogni inquadratura. Wan premia questa struttura: più un blocco dice con precisione cosa c'è nell'inquadratura, meno il modello improvvisa.

Difetti da mettere in conto. Di norma l'audio c'è, e il modello rende bene le battute parlate, non solo in inglese. Un progetto è andato al contrario: nei passaggi di modifica e in una generazione da testo a video con un prompt complesso, il rumore del motore di un rasoio regolabarba è tornato basso, intorno a −45 dB – udibile, ma debole. Nelle nostre altre prove la traccia era al livello giusto, quindi è una situazione specifica e non una caratteristica del modello; se una traccia debole è un problema, controlla il volume e, quando serve, prendi l'audio dalla sorgente. Le cifre piccole sul display di un dispositivo vengono disegnate meglio che dalla concorrenza, ma non in modo affidabile: abbiamo ottenuto 89 dove il fotogramma diceva 84, e con una presa orizzontale le cifre sono uscite ruotate. La forma di un prodotto può ammorbidirsi nei piani medi. E quando modifica un girato, a volte il modello dipinge un dettaglio che nella sorgente compare più avanti: in un montaggio, una riga rasata in un taglio di capelli è comparsa un'inquadratura prima ed è sparita in quella dopo. Rigenerare non l'ha risolto, quindi quel pezzo l'abbiamo tagliato.

05Come usarlo

Dal prompt alla clip in tre passi

  1. Descrivi l'inquadratura, non l'argomento

    Soggetto, cosa sta facendo, la camera, la luce. Vale la pena scrivere esplicitamente «Single continuous shot». Poi aggiungi una breve riga «Audio/sound:» con quello che si deve sentire: Wan coglie il suggerimento.

  2. Prima una bozza in 480p

    Quattro secondi in 480p costano $0.20. Sistema lì la composizione, poi rigenera la versione migliore in 720p o 1080p con la durata che ti serve davvero.

  3. Paghi i secondi che ottieni

    Il saldo viene addebitato all'avvio del job e rimborsato automaticamente se fallisce o se il filtro lo blocca. Ricarichi in crypto o con carta; e nessun canone mensile ad attenderti.

06Prezzi

Quanto costa Wan 3.0 rispetto a Veo 3.1 e Omni nel 2026?

Wan 3.0 per risoluzione e durata, accanto ai modelli con cui compete
Modello4 s10 s30 sAudio
Wan 3.0 · 480p$0.05/s – bozze e social$0.20$0.50$1.50Incluso, gratis
Wan 3.0 · 720p$0.10/s – la scelta abituale$0.40$1.00$3.00Incluso, gratis
Wan 3.0 · 1080p$0.20/s – la più nitida$0.80$2.00$6.00Incluso, gratis
Veo 3.1 Fast · 720pModello di Google, solo 4–8 s$0.35——Costa a parte
Gemini Omni 1.1 Flash · 720pModello di Google, al secondo, 3–10 s a generazione$0.40$1.00—Sempre attivo
Gemini Omni 1.1 Flash · 1080pLo stesso modello in 1080p, $0.15 al secondo$0.60$1.50—Sempre attivo

I prezzi sono per clip finita e includono la traccia audio. Il trattino indica che il modello non arriva a quella durata in una sola generazione: Veo si ferma a otto secondi, e Omni arriva a 40 secondi solo estendendo una clip finita scena dopo scena. I depositi da $50 aggiungono il 5% al saldo e quelli da $100 il 10%; un codice promo attivo aggiunge un altro 10% sullo stesso deposito. Il bonus sul volume +5% / +10% vale solo per le ricariche in crypto.

La tabella completa di tutti i modelli è nella pagina dei prezzi.

07Da leggere

Guide per approfondire

08FAQ

Le domande che ci fanno davvero

Quanto può durare un video di Wan 3.0?

Fino a 30 secondi in una sola generazione. Le durate disponibili sono 4, 6, 8, 10, 15, 20 e 30 secondi, e la clip arriva come un'unica ripresa continua, non come quattro clip brevi incollate. I modelli Veo e Omni di Google si fermano a otto e dieci secondi per clip.

Quanto costa una clip di Wan 3.0?

Paghi al secondo: $0.05 in 480p, $0.10 in 720p, $0.20 in 1080p. Quindi quattro secondi di bozza costano $0.20, dieci secondi in 720p $1.00, e il massimo – trenta secondi in 1080p – $6.00. La traccia audio è inclusa nel prezzo.

Leggi la risposta completa
Wan 3.0 genera anche l'audio?

Sì, ed è attivo di default. L'audio viene generato insieme all'immagine invece di essere aggiunto dopo, quindi i passi cadono sull'appoggio del piede. Puoi disattivarlo per avere una clip senza audio, e il prezzo non cambia. Descrivi quello che vuoi sentire in una breve riga «Audio/sound:» alla fine del prompt. Da sapere: le note di lancio di Alibaba indicano la texture dell'audio come un aspetto ancora da rifinire. Nelle nostre prove la traccia è arrivata utilizzabile così com'era e le battute parlate suonavano bene, ma su una clip importante conviene controllare il volume.

Posso animare una mia foto?

Sì. Metti un'immagine nello slot del primo fotogramma e nel prompt descrivi cosa deve succederle. Puoi aggiungere un ultimo fotogramma per decidere dove finisce l'inquadratura, e la stessa immagine in entrambi gli slot ti dà un loop. Un limite: fotogrammi e immagini di riferimento non si possono usare insieme.

Wan 3.0 o Veo 3.1: quale conviene?

Wan 3.0 è il più recente e il più capace dei due: riprese fino a 30 secondi contro otto, audio incluso nel prezzo, clip di riferimento in input e un prodotto che resta se stesso quando lo animi da un primo fotogramma. Veo 3.1 è l'alternativa per quello che Wan non copre – l'output in 4K – e per clip brevi con il look di Google. La mia regola: parti da Wan e passa a Veo quando il brief chiede il 4K.

Posso modificare una clip dopo averla generata?

Sì, con una riserva. Passa a Wan una clip fino a 15 secondi – generata da lui o girata da te – descrivi la modifica e ti restituisce una clip nuova. Sorgente e risultato insieme devono stare entro 30 secondi, e i secondi della sorgente si pagano alla stessa tariffa al secondo del risultato. Non è una conversazione: ogni modifica è una richiesta nuova senza memoria della precedente, e l'«estensione» ti dà la scena successiva, non una continuazione precisa al fotogramma. Il modello che ricorda la clip che ha fatto è Gemini Omni Flash.

Posso usare i video di Wan 3.0 a fini commerciali?

Sì. Quello che generi puoi usarlo come vuoi, anche per clienti e progetti commerciali, nel rispetto delle regole sui contenuti dei nostri termini. Sull'output non c'è filigrana e non c'è una licenza separata da comprare.

Trenta secondi, un prompt

I nuovi account partono con $0.20 sul saldo: abbastanza per una bozza in 480p e capire se Wan è il modello giusto per te. Clip da $0.20, senza abbonamento, senza vincoli.