El primer fotograma es tu foto
Enviamos los pedidos con primer fotograma al endpoint nativo de imagen a vídeo de xAI y comprobamos el resultado fotograma a fotograma: el fotograma inicial es la imagen de entrada, no una reinterpretación.
Modelo · xAI Grok Imagine Video 1.5
El modelo de vídeo de xAI, y lo que hace mejor que ningún otro aquí: abre con tu foto y dice tu frase. Dale un retrato y una frase entre comillas, y el primer fotograma del clip es ese retrato, con la frase dicha en voz alta y sincronizada con los labios. Los clips duran de 4 a 15 segundos con cualquier duración entera, a 720p o 1080p, en cinco relaciones de aspecto. Pagas por segundo — $0.14 a 720p, $0.25 a 1080p —, las mismas tarifas que xAI publica para su propia API. Cripto o tarjeta, sin suscripción.
Grok Imagine Video 1.5 es el modelo de generación de vídeo de xAI — el que está detrás de la parte de vídeo de Grok Imagine — y convierte un prompt, o una imagen fija más un prompt, en un clip de hasta 15 segundos con el sonido generado en la misma pasada. Está en la API de xAI desde junio de 2026 y en BananaBanana desde el 16 de septiembre de 2026, y se paga del mismo saldo que cualquier otro modelo. Cobramos las tarifas por segundo de la propia xAI, $0.14 a 720p y $0.25 a 1080p, y no trasladamos el recargo que xAI añade por cada imagen de entrada.
En el diálogo y en los primeros fotogramas. Una frase escrita entre comillas se dice en voz alta, con sincronía labial y mezclada a volumen de conversación, que es lo que necesita un anuncio con estilo de creador. Y cuando le das una foto como primer fotograma, el clip abre con esa foto — la misma persona, la misma habitación, el mismo dibujo del jersey — y no con un doble vuelto a escenificar. Los prompts solo de texto también funcionan, y el vertical es honesto: un pedido 9:16 a 1080p llegó como un archivo de 1088×1920, no como un render horizontal recortado.
Enviamos los pedidos con primer fotograma al endpoint nativo de imagen a vídeo de xAI y comprobamos el resultado fotograma a fotograma: el fotograma inicial es la imagen de entrada, no una reinterpretación.
Pon la frase entre comillas y el modelo la dice. El audio está siempre activo y siempre incluido en el precio; no hay tarifa sin sonido ni nada extra que pagar por él.
No es un menú de tres duraciones: cada segundo entero del rango. Siete segundos para una línea de diálogo, once para dos, y pagas exactamente eso.
16:9, 9:16, 1:1, 3:2 y 2:3. El cuadrado y el 3:2 son formatos que los demás modelos de vídeo de aquí no generan.
Las referencias guían el sujeto y el entorno mientras el modelo monta la escena por su cuenta. Son una alternativa al primer fotograma, no un añadido: envía una cosa o la otra.
$0.14 por segundo a 720p, $0.25 a 1080p. Afina el prompt a 720p y luego genera una sola vez a 1080p el texto a vídeo que te quedas.
Aquí los clips que parten de una imagen se generan a 720p. xAI limita el vídeo guiado por referencias a 720p, y la ruta de primer fotograma que tenemos disponible todavía no acepta 1080p, así que 1080p queda para texto a vídeo. En lugar de cobrarte la tarifa de 1080p y entregarte un archivo más pequeño, rechazamos esa combinación antes de cobrar nada; en el estudio, las ranuras de imagen simplemente se desactivan con una nota cuando eliges 1080p. Un primer fotograma y las imágenes de referencia no se pueden combinar. No hay último fotograma, ni seed, ni prompt negativo, ni entrada de vídeo.
15 segundos es el render único más largo, y después no hay extensión ni edición: un anuncio de cuarenta segundos son tres clips y un corte. El audio es fuerte en el habla y en sonidos nombrados, y flojo en ambientes vagos: «soft ambient kitchen sounds» volvió a unos −50 dB, que es silencio. Nombra un sonido («a kettle starting to whistle off-screen») o añade ambiente en el montaje. El prompt llega hasta 2048 caracteres. Si necesitas medio minuto en una sola toma, clips de referencia o seeds, eso lo cubre Wan 3.0; si quieres cambiar un clip terminado describiendo el cambio, es Gemini Omni Flash.
Un retrato, un producto en la mano, la habitación de fondo. Genéralo aquí o sube el tuyo. Lo que haya en esa imagen es con lo que empieza el clip, así que deja bien el fotograma antes de pagar por el movimiento.
Describe quién está en el encuadre, pon la línea hablada entre comillas y di cómo se comporta la cámara. «Natural handheld motion, quiet room tone» es suficiente. No pases de 2048 caracteres.
Cuatro segundos a 720p son $0.56. El saldo se carga cuando empieza el trabajo y se reembolsa automáticamente si falla o si el filtro lo rechaza. Recarga con cripto o tarjeta; no hay cuota mensual.
| Modelo | 4 s | 8 s | 15 s | Sonido |
|---|---|---|---|---|
| Grok Imagine Video 1.5 · 720p$0.14/s — primer fotograma, referencias, borradores | $0.56 | $1.12 | $2.10 | Siempre activo, incluido |
| Grok Imagine Video 1.5 · 1080p$0.25/s — solo texto a vídeo | $1.00 | $2.00 | $3.75 | Siempre activo, incluido |
| Wan 3.0 · 720pModelo de Alibaba, hasta 30 s | $0.40 | $0.80 | $1.50 | Incluido, gratis |
| Veo 3.1 Fast · 720pModelo de Google, solo 4–8 s | $0.35 | $0.70 | — | Cuesta aparte |
| Gemini Omni Flash · 720pModelo de Google, por segundo, 3–10 s | $0.40 | $0.80 | — | Siempre activo |
Los precios son por clip terminado e incluyen la pista de audio. Las imágenes de entrada son gratis. Una raya significa que el modelo no puede generar esa duración en una sola ejecución. Los depósitos de $50 añaden un 5% a tu saldo y los de $100 un 10%; un código promocional activo suma otro 10% sobre el mismo depósito.
La tabla completa de todos los modelos está en la página de precios.
Cómo se comportan de verdad los fotogramas iniciales, los finales y los bucles, con los prompts que los hicieron.
Leer la guíaLenguaje de cámara, luz, movimiento. Está escrito para Veo, pero la estructura se traslada a Wan casi sin cambios.
Leer la guíaEl modelo al que recurrir cuando necesitas editar un clip hablándole en vez de volver a escribir el prompt.
Leer la guíaSí, siempre. El diálogo escrito entre comillas se dice con sincronía labial, y los efectos de sonido nombrados se generan. Las peticiones de ambiente vagas suelen volver casi en silencio, así que nombra un sonido concreto si lo necesitas. El sonido está incluido en el precio.
Pagas por segundo: $0.14 a 720p y $0.25 a 1080p, las mismas tarifas que xAI cobra en su propia API. Así, cuatro segundos a 720p son $0.56, ocho segundos son $1.12 o $2.00 según la resolución, y el máximo — 15 segundos a 1080p — son $3.75. Aquí las imágenes de entrada no cuestan nada extra.
Leer la respuesta completaHoy no. Los clips que parten de un primer fotograma o usan imágenes de referencia son 720p: xAI limita el vídeo guiado por referencias a 720p, y la ruta nativa de primer fotograma a la que tenemos acceso todavía no acepta 1080p. Rechazamos un pedido de 1080p con imagen antes de cobrar en vez de entregar un archivo más pequeño al precio más alto. 1080p funciona para texto a vídeo.
Con este modelo no. Genera hasta 15 segundos por clip y monta las piezas más largas, o usa Wan 3.0 para una sola toma de hasta 30 segundos, o Gemini Omni Flash, que extiende sus propios clips hasta 40.
No. Acepta un primer fotograma o hasta 7 imágenes de referencia, y nada más. Para controlar primer y último fotograma usa Veo 3.1, Omni o Wan 3.0; para seeds, Veo o Wan.
El importe completo vuelve a tu saldo automáticamente, incluidos los rechazos del filtro de contenido. Es la misma regla para todos los modelos de la plataforma.
Leer la respuesta completaSí. Lo que generas es tuyo, también para trabajos de cliente y usos comerciales, sujeto a las normas de contenido de nuestros términos. No hay marca de agua en el resultado ni una licencia aparte que comprar.
Las cuentas nuevas empiezan con $0.20 de saldo, suficiente para hacer el primer fotograma. Clips desde $0.56, sin suscripción, sin compromiso.