Imagen a video con IA: convierte fotos en clips animados
Imagen a video con IA: cómo funciona, qué modelo elegir (Veo 3.1, Omni Flash, Wan 3.0, Grok), precios desde $0.10, prompts de movimiento, bucles, cadenas de 148 s.

La imagen a video con IA es una técnica de generación donde un modelo toma una imagen estática, la trata como el primer fotograma de un clip e inventa todo lo que sucede a continuación: movimiento, dinámica de cámara, cambios de iluminación y, a veces, sonido. Solo tienes que subir una foto y describir con texto qué debe moverse. El modelo devuelve un video corto, de 4 a 10 segundos, donde tu propia imagen cobra vida.
La versión corta por si tienes prisa: sube una foto en el generador de BananaBanana, describe el movimiento y espera de 2–5 minutos. Un clip mudo de 4 segundos a partir de tu foto cuesta desde $0.10 en Veo 3.1 Lite, con sonido sube a $0.18, Gemini Omni Flash anima una foto con banda sonora completa desde $0.09 (cobra por segundo, de $0.03 a 360p a $0.30 en 4K), y Wan 3.0 lo hace con sonido gratis desde $0.20 por 4 segundos a 480p. Las cuentas nuevas reciben $0.20 gratis, lo que cubre dos clips de prueba mudos.
En producción operamos siete modelos de video y todos aceptan una foto como primer fotograma, así que esta guía cubre los siete, y está basada en registros reales de generación y no en páginas de marketing. Incluyendo los fallos. De hecho, algunos errores enseñan mucho más que los aciertos.
¿Cómo funciona la imagen a video con IA?
Por dentro, la imagen estática se envía al modelo como un fotograma de condicionamiento (conditioning frame). La documentación de video de la API de Gemini explica que Veo 3.1 admite "dirección basada en imágenes" y "generación de fotogramas específicos". Para que nos entendamos: tu imagen guía todo el clip y puedes fijar fotogramas exactos donde tú quieras. El modelo analiza la escena, deduce la física (cómo ondularía el agua de la foto, cómo se movería el pelo con el viento) y renderiza fotograma a fotograma a partir de tu punto de partida.
La consecuencia práctica: el primer fotograma del resultado es tu foto, casi píxel por píxel. Todo lo que viene después es pura invención. Los buenos prompts se enfocan en describir lo que se inventa, no en repetir lo que el modelo ya puede ver.
Esto funciona sorprendentemente bien en escenas con un movimiento implícito claro. Un retrato respira y parpadea. El vapor sube de una taza de café. Un coche aparcado arranca y se va. Pero no va tan bien si la foto no sugiere ningún movimiento lógico: si subes un render plano de un producto sobre fondo blanco sin pistas de movimiento en el prompt, lo más probable es que acabes con un zoom lento y un poco tembloroso. No es que falle, es que es aburrido.

¿Qué modelo convierte mejor una foto en video?
Los siete modelos de video de la plataforma aceptan una imagen como primer fotograma. Se diferencian en sus límites de calidad y en lo que pagas por ellos. Primero, los modelos de Google:
| Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite | Gemini Omni Flash | |
|---|---|---|---|---|
| Precio (4 s, mudo) | $0.70 | $0.35 | $0.10 | — |
| Precio (4 s, con audio) | $1.50 | $0.50 | $0.18 | $0.12 a 360p, $0.40 a 720p |
| Resolución máxima | 4K | 4K | 1080p | 4K (con aumento de escala) |
| Duración | 4/6/7/8 s exactos | 4/6/7/8 s exactos | 4/6/7/8 s exactos | 3–10 s exactos |
| Audio | activación opcional | activación opcional | activación opcional | siempre activo |
| Último fotograma y bucles | sí | sí | sí | sí (Omni 1.1) |
| Extensión | hasta 148 s | hasta 148 s | no | hasta 40 s, más edición de video |
Mi opción por defecto es Veo 3.1 Fast. Mantiene los controles útiles (duración exacta, último fotograma opcional, extensión) a la mitad de precio del modelo estrella y, para formatos de redes sociales, la diferencia de calidad frente al Veo 3.1 completo casi ni se nota. El modelo Lite a $0.10 es el que uso para probar si una idea tiene sentido antes de gastar dinero real. El Veo 3.1 completo vale lo que cuesta cuando el clip incluye agua, telas o colisiones, o si el formato de entrega exige 4K. Omni Flash es la elección si el sonido importa tanto como la imagen; analizamos a fondo este modelo en nuestra reseña de la API de Omni Flash por si quieres ver los detalles, incluido cómo su precio por segundo escala desde 360p hasta 4K. La generación anterior de Omni, Omni Flash 1.0, sigue disponible con 4 a 10 segundos y solo acepta primer fotograma.
El clip de arriba es una generación de Veo 3.1 Fast de nuestro flujo de producción, creada para este artículo: una fotografía enmarcada de un velero sobre un escritorio, donde el prompt pide que el mar dentro del marco empiece a moverse mientras la cámara se acerca lentamente. Una sola toma, sin edición, mudo por elección (la tarifa sin sonido de Fast es la que usamos para borradores). Ese efecto de "foto que despierta" es básicamente lo que el modelo le hace a tus propias imágenes.
Luego, los dos modelos que llegaron en septiembre, de Alibaba y xAI:
| Wan 3.0 | Grok Imagine Video 1.5 | |
|---|---|---|
| Precio (4 s, con audio) | $0.20 a 480p, $0.40 a 720p, $0.80 a 1080p | $0.56 a 720p |
| Resolución máxima | 1080p | 1080p (imágenes de referencia solo a 720p) |
| Duración | 4, 6, 8, 10, 15, 20 o 30 s | cualquier número entero de 4 a 15 s |
| Audio | activado por defecto y gratis, se puede desactivar | siempre activo, diálogo con sincronización labial |
| Último fotograma y bucles | sí | no |
| Extensión | no, pero 30 s en una sola toma | no |
Wan 3.0 es el que usaría con una foto cuando el clip tiene que durar más de diez segundos o necesita sonido sin pagar extra por él. Grok es para la foto de una persona que luego tiene que decir algo: escribe la frase entre comillas y la boca la sigue. La misma foto de un globo aerostático (un render de Nano Banana Pro, así que no aparece el parecido de nadie) en ambos, con el mismo prompt: que el globo amarrado se eleve un poco mientras el quemador se enciende y la neblina se desplaza:
Wan 3.0, seis segundos a 720p, $0.60. Conservó la foto casi píxel por píxel, elevó el globo unos metros, dejó ver una cuerda de amarre que no estaba en la imagen fija y puso en la pista breves ráfagas del quemador y cantos de pájaros sin tener que pedirlo dos veces.
Grok Imagine Video 1.5, seis segundos a 720p, $0.84. Movimiento más sutil, la misma fidelidad a la fuente y un detalle de los registros que conviene saber: el archivo salió a 1280×704, no a 720 filas reales. Sin problema para un feed, una molestia si vas a hacer composición.
Cómo generar video a partir de una foto, paso a paso
Todo el proceso en el generador te llevará apenas un minuto, más el tiempo de renderizado.
- Cambia el generador al modo de video y elige un modelo. Para empezar, Veo 3.1 Lite a $0.10 es la forma más barata de aprender.
- Sube tu foto como primer fotograma. Admite JPG o PNG, y se recortará a la relación de aspecto del video, así que vigila los bordes antes de generar.
- Elige 16:9 o 9:16. El formato vertical va genial para TikTok y Reels; el modelo maneja el encuadre de retrato sin rechistar.
- Escribe el prompt de movimiento (ver siguiente sección) y, opcionalmente, un prompt negativo de hasta 1,000 caracteres con lo que no quieras que aparezca.
- Elige la duración y si quieres audio. Ambos son ajustes exactos en Veo; en Omni Flash puedes elegir cualquier duración de 3 a 10 segundos y el audio siempre está activado. Wan 3.0 llega hasta 30 segundos con una banda sonora gratis que puedes desactivar, y Grok acepta cualquier duración de 4 a 15 segundos y siempre habla.
- Genera. Los videos tardan entre 2–5 minutos. Puedes cerrar la pestaña; tus resultados te esperarán en el historial durante 30 días.
El saldo solo se descuenta cuando la generación tiene éxito. Los renders fallidos se reembolsan automáticamente, algo muy importante en video ya que vas a necesitar varias iteraciones.

¿Cómo se escriben los prompts de movimiento para imagen a video?
Regla número uno: describe el movimiento, no la escena. La escena ya está en la foto. Poner "A woman in a red coat stands on a bridge" es desperdiciar el prompt con detalles que el modelo ya ve. En cambio, "She turns toward the camera and smiles as wind lifts her hair, slow dolly-in" ocupa el mismo espacio y es pura información útil.
Los términos de cámara funcionan de maravilla con Veo: dolly in, orbit, handheld, static tripod shot, slow pan left. Está claro que estos modelos se entrenaron con descripciones de metraje real, por lo que responden mejor al vocabulario técnico de cine que a frases vagas como "hazlo dinámico". Yo evitaría la palabra "dinámico" por completo. Nadie se pone de acuerdo sobre qué significa, y el modelo tampoco.
Una lección que aprendimos por las malas (y pagando) mientras creábamos clips de demostración para este blog: estos modelos mantienen lo que ya está ocurriendo en el primer fotograma e ignoran las acciones programadas para empezar más tarde. Una vez le pedimos a Omni Flash que diera la vuelta a una tortita "hacia la mitad del clip" y obtuvimos diez segundos de una tortita completamente inmóvil. Tres veces seguidas, un dólar por intento. Escribir la acción como si ya estuviera ocurriendo lo solucionó a la primera. Así que: "syrup is pouring onto the stack" funciona mucho mejor que "syrup starts pouring after two seconds". Y para imagen a video en particular, elige una foto de inicio donde la acción deseada sea creíble a mitad de movimiento.
Algunos patrones que siempre dan buen resultado:
- Retratos: "subtle breathing, a slow blink, then a small smile; camera locked" se percibe natural sin las deformaciones raras que provocan los movimientos bruscos.
- Productos: "slow 180-degree orbit around the object, studio lighting stays constant" es la fórmula infalible. Mantén el fondo simple en la foto de origen.
- Paisajes: detalla los elementos que se mueven (por ejemplo, "clouds drift right, grass sways, light shifts warmer") o acabarás con el zoom nervioso de siempre por defecto.

Bucles, últimos fotogramas y videos de 148 segundos
Los modelos de Veo 3.1 admiten un último fotograma opcional además del primero, y lo mismo Omni 1.1 y Wan 3.0. Si le das a un modelo dos fotos distintas, renderiza una transición entre ambas; así es como puedes transformar una toma diurna en nocturna o un boceto en un producto terminado. Si usas la misma foto para ambos, obtendrás un clip que termina exactamente donde empezó: un bucle perfecto, ideal para fondos de web o publicaciones estilo cinemagraph. Esta es mi función infravalorada favorita de la plataforma.
La extensión es el otro gran truco de Veo. Un clip ya terminado se puede prolongar otros 7 segundos con un nuevo prompt, y esta cadena de continuidad visual puede llegar hasta un total de 148 segundos (solo disponible en Veo 3.1 y Fast; Lite se queda fuera de esto). Crear una cadena larga a partir de tu propia foto es lo más parecido a hacer cine sin necesidad de storyboard que ofrecen las API actuales. Pero ojo, los costes se acumulan rápido, así que calcula tu presupuesto antes de enamorarte de la idea. Si te bastan 30 segundos, Wan 3.0 los renderiza en una sola toma a partir de tu foto, sin empalmes ni pérdida de continuidad, por $1.50 a 480p o $3.00 a 720p.
Omni Flash ahora tiene su propia extensión: cada paso añade de 3 a 10 segundos al último clip, encadenables hasta unos 40 segundos en total, un límite más corto que los 148 de Veo. Además, mantiene la edición conversacional como opción adicional: describes un cambio en el clip terminado ("haz que sea el atardecer, mantén todo lo demás igual") y vuelves a pagar por sus segundos — también acepta videos que no ha generado, incluyendo tus propias subidas, y los devuelve con la misma duración. Es otra filosofía. La edición refina un momento; la extensión amplía la línea de tiempo.

Preguntas frecuentes
¿Puedo convertir una foto en video gratis?
Casi. Una cuenta nueva de BananaBanana viene con un saldo de $0.20 sin necesidad de tarjeta, suficiente para dos clips mudos de 4 segundos con Veo 3.1 Lite a partir de tu foto. Después de eso, pagas por clip, desde $0.10.
¿Cuál es la opción de API más barata para imagen a video?
En BananaBanana es Veo 3.1 Lite: $0.10 por un clip mudo de 4 segundos a 720p, o $0.18 con audio. El cobro es por generación exitosa, con reembolso automático si falla, y sin suscripciones ni configuraciones complicadas en Google Cloud.
¿El video generado puede tener sonido?
Sí. Los modelos Veo 3.1 tienen un interruptor de audio (diálogos, efectos y ambiente descritos en tu prompt), Gemini Omni Flash siempre genera audio, incluido en su precio por segundo (de $0.03 a 360p a $0.30 en 4K), Wan 3.0 añade la banda sonora gratis y Grok Imagine Video 1.5 pronuncia el diálogo que escribes.
¿Puedo animar una foto vertical para TikTok o Reels?
Sí, los siete modelos admiten 9:16, y Grok Imagine Video 1.5 añade 1:1, 3:2 y 2:3. Solo sube la foto, selecciona 9:16 y ten en cuenta que la imagen original se recortará a esa proporción; deja algo de aire por arriba en la toma original.
¿Qué duración máxima puede tener un video generado por IA a partir de una foto?
Cada clip dura entre 4–8 segundos en los modelos Veo, 3–10 segundos en Omni Flash, 4–15 en Grok y hasta 30 segundos en una sola toma en Wan 3.0. Además, los clips de Veo 3.1 y Veo 3.1 Fast se pueden prolongar en pasos de 7 segundos hasta alcanzar los 148 segundos, manteniendo la continuidad visual de tu foto original, y Omni 1.1 extiende hasta unos 40.