Imagen a video con IA: convierte fotos en clips animados
Imagen a video con IA: cómo funciona, qué modelo elegir (Veo 3.1 vs Omni Flash), precios reales desde $0.10, prompts de movimiento, bucles y más.

La imagen a video con IA es una técnica de generación donde un modelo toma una imagen estática, la trata como el primer fotograma de un clip e inventa todo lo que sucede a continuación: movimiento, dinámica de cámara, cambios de iluminación y, a veces, sonido. Solo tienes que subir una foto y describir con texto qué debe moverse. El modelo devuelve un video corto, de 4 a 10 segundos, donde tu propia imagen cobra vida.
La versión corta por si tienes prisa: sube una foto en el generador de BananaBanana, describe el movimiento y espera de 2–5 minutos. Un clip mudo de 4 segundos a partir de tu foto cuesta desde $0.10 en Veo 3.1 Lite, con sonido sube a $0.18, y Gemini Omni Flash anima una foto con banda sonora completa desde $0.30 (factura $0.10 por segundo). Las cuentas nuevas reciben $0.20 gratis, lo que cubre dos clips de prueba mudos.
En producción operamos cuatro modelos de video, así que esta guía está basada en registros reales de generación y no en páginas de marketing. Incluyendo los fallos. De hecho, algunos errores enseñan mucho más que los aciertos.
¿Cómo funciona la imagen a video con IA?
Por dentro, la imagen estática se envía al modelo como un fotograma de condicionamiento (conditioning frame). La documentación de video de la API de Gemini explica que Veo 3.1 admite "dirección basada en imágenes" y "generación de fotogramas específicos". Para que nos entendamos: tu imagen guía todo el clip y puedes fijar fotogramas exactos donde tú quieras. El modelo analiza la escena, deduce la física (cómo ondularía el agua de la foto, cómo se movería el pelo con el viento) y renderiza fotograma a fotograma a partir de tu punto de partida.
La consecuencia práctica: el primer fotograma del resultado es tu foto, casi píxel por píxel. Todo lo que viene después es pura invención. Los buenos prompts se enfocan en describir lo que se inventa, no en repetir lo que el modelo ya puede ver.
Esto funciona sorprendentemente bien en escenas con un movimiento implícito claro. Un retrato respira y parpadea. El vapor sube de una taza de café. Un coche aparcado arranca y se va. Pero no va tan bien si la foto no sugiere ningún movimiento lógico: si subes un render plano de un producto sobre fondo blanco sin pistas de movimiento en el prompt, lo más probable es que acabes con un zoom lento y un poco tembloroso. No es que falle, es que es aburrido.

¿Qué modelo convierte mejor una foto en video?
Los cuatro modelos de video de la plataforma aceptan una imagen como primer fotograma. Se diferencian en sus límites de calidad y en lo que pagas por ellos.
| Veo 3.1 | Veo 3.1 Fast | Veo 3.1 Lite | Gemini Omni Flash | |
|---|---|---|---|---|
| Precio (4 s, mudo) | $0.70 | $0.35 | $0.10 | — |
| Precio (4 s, con audio) | $1.50 | $0.50 | $0.18 | $0.40 ($0.10 por segundo) |
| Resolución máxima | 4K | 4K | 1080p | Solo 720p |
| Duración | 4/6/7/8 s exactos | 4/6/7/8 s exactos | 4/6/7/8 s exactos | 3–10 s exactos |
| Audio | activación opcional | activación opcional | activación opcional | siempre activo |
| Último fotograma y bucles | sí | sí | sí | no |
| Extender hasta 148 s | sí | sí | no | no, solo edición conversacional |
Mi opción por defecto es Veo 3.1 Fast. Mantiene los controles útiles (duración exacta, último fotograma opcional, extensión) a la mitad de precio del modelo estrella y, para formatos de redes sociales, la diferencia de calidad frente al Veo 3.1 completo casi ni se nota. El modelo Lite a $0.10 es el que uso para probar si una idea tiene sentido antes de gastar dinero real. El Veo 3.1 completo vale lo que cuesta cuando el clip incluye agua, telas o colisiones, o si el formato de entrega exige 4K. Omni Flash es la elección si el sonido importa tanto como la imagen; analizamos a fondo este modelo en nuestra reseña de la API de Omni Flash por si quieres ver los detalles, incluido ese límite de 720p que, sinceramente, duele un poco si lo vas a ver a pantalla completa.
El clip de arriba es una generación de Veo 3.1 Fast de nuestro flujo de producción, creada para este artículo: una fotografía enmarcada de un velero sobre un escritorio, donde el prompt pide que el mar dentro del marco empiece a moverse mientras la cámara se acerca lentamente. Una sola toma, sin edición, mudo por elección (la tarifa sin sonido de Fast es la que usamos para borradores). Ese efecto de "foto que despierta" es básicamente lo que el modelo le hace a tus propias imágenes.
Cómo generar video a partir de una foto, paso a paso
Todo el proceso en el generador te llevará apenas un minuto, más el tiempo de renderizado.
- Cambia el generador al modo de video y elige un modelo. Para empezar, Veo 3.1 Lite a $0.10 es la forma más barata de aprender.
- Sube tu foto como primer fotograma. Admite JPG o PNG, y se recortará a la relación de aspecto del video, así que vigila los bordes antes de generar.
- Elige 16:9 o 9:16. El formato vertical va genial para TikTok y Reels; el modelo maneja el encuadre de retrato sin rechistar.
- Escribe el prompt de movimiento (ver siguiente sección) y, opcionalmente, un prompt negativo de hasta 1,000 caracteres con lo que no quieras que aparezca.
- Elige la duración y si quieres audio. Ambos son ajustes exactos en Veo; en Omni Flash puedes elegir cualquier duración de 3 a 10 segundos y el audio siempre está activado.
- Genera. Los videos tardan entre 2–5 minutos. Puedes cerrar la pestaña; tus resultados te esperarán en el historial durante 30 días.
El saldo solo se descuenta cuando la generación tiene éxito. Los renders fallidos se reembolsan automáticamente, algo muy importante en video ya que vas a necesitar varias iteraciones.

¿Cómo se escriben los prompts de movimiento para imagen a video?
Regla número uno: describe el movimiento, no la escena. La escena ya está en la foto. Poner "A woman in a red coat stands on a bridge" es desperdiciar el prompt con detalles que el modelo ya ve. En cambio, "She turns toward the camera and smiles as wind lifts her hair, slow dolly-in" ocupa el mismo espacio y es pura información útil.
Los términos de cámara funcionan de maravilla con Veo: dolly in, orbit, handheld, static tripod shot, slow pan left. Está claro que estos modelos se entrenaron con descripciones de metraje real, por lo que responden mejor al vocabulario técnico de cine que a frases vagas como "hazlo dinámico". Yo evitaría la palabra "dinámico" por completo. Nadie se pone de acuerdo sobre qué significa, y el modelo tampoco.
Una lección que aprendimos por las malas (y pagando) mientras creábamos clips de demostración para este blog: estos modelos mantienen lo que ya está ocurriendo en el primer fotograma e ignoran las acciones programadas para empezar más tarde. Una vez le pedimos a Omni Flash que diera la vuelta a una tortita "hacia la mitad del clip" y obtuvimos diez segundos de una tortita completamente inmóvil. Tres veces seguidas, un dólar por intento. Escribir la acción como si ya estuviera ocurriendo lo solucionó a la primera. Así que: "syrup is pouring onto the stack" funciona mucho mejor que "syrup starts pouring after two seconds". Y para imagen a video en particular, elige una foto de inicio donde la acción deseada sea creíble a mitad de movimiento.
Algunos patrones que siempre dan buen resultado:
- Retratos: "subtle breathing, a slow blink, then a small smile; camera locked" se percibe natural sin las deformaciones raras que provocan los movimientos bruscos.
- Productos: "slow 180-degree orbit around the object, studio lighting stays constant" es la fórmula infalible. Mantén el fondo simple en la foto de origen.
- Paisajes: detalla los elementos que se mueven (por ejemplo, "clouds drift right, grass sways, light shifts warmer") o acabarás con el zoom nervioso de siempre por defecto.

Bucles, últimos fotogramas y videos de 148 segundos
Los modelos de Veo 3.1 admiten un último fotograma opcional además del primero. Si le das dos fotos distintas, renderiza una transición entre ambas; así es como puedes transformar una toma diurna en nocturna o un boceto en un producto terminado. Si usas la misma foto para ambos, obtendrás un clip que termina exactamente donde empezó: un bucle perfecto, ideal para fondos de web o publicaciones estilo cinemagraph. Esta es mi función infravalorada favorita de la plataforma.
La extensión es el otro gran truco de Veo. Un clip ya terminado se puede prolongar otros 7 segundos con un nuevo prompt, y esta cadena de continuidad visual puede llegar hasta un total de 148 segundos (solo disponible en Veo 3.1 y Fast; Lite y Omni Flash se quedan fuera de esto). Crear una cadena larga a partir de tu propia foto es lo más parecido a hacer cine sin necesidad de storyboard que ofrecen las API actuales. Pero ojo, los costes se acumulan rápido, así que calcula tu presupuesto antes de enamorarte de la idea.
Omni Flash sustituye la extensión por la edición: describes un cambio en el clip terminado ("haz que sea el atardecer, mantén todo lo demás igual") y vuelves a pagar por sus segundos — también acepta videos que no ha generado, incluyendo tus propias subidas, y los devuelve con la misma duración. Es otra filosofía. La edición refina un momento; la extensión amplía la línea de tiempo.

Preguntas frecuentes
¿Puedo convertir una foto en video gratis?
Casi. Una cuenta nueva de BananaBanana viene con un saldo de $0.20 sin necesidad de tarjeta, suficiente para dos clips mudos de 4 segundos con Veo 3.1 Lite a partir de tu foto. Después de eso, pagas por clip, desde $0.10.
¿Cuál es la opción de API más barata para imagen a video?
En BananaBanana es Veo 3.1 Lite: $0.10 por un clip mudo de 4 segundos a 720p, o $0.18 con audio. El cobro es por generación exitosa, con reembolso automático si falla, y sin suscripciones ni configuraciones complicadas en Google Cloud.
¿El video generado puede tener sonido?
Sí. Los modelos Veo 3.1 tienen un interruptor de audio (diálogos, efectos y ambiente descritos en tu prompt), y Gemini Omni Flash siempre genera audio, incluido en su precio de $0.10 por segundo.
¿Puedo animar una foto vertical para TikTok o Reels?
Sí, los cuatro modelos admiten 9:16. Solo sube la foto, selecciona 9:16 y ten en cuenta que la imagen original se recortará a esa proporción; deja algo de aire por arriba en la toma original.
¿Qué duración máxima puede tener un video generado por IA a partir de una foto?
Cada clip dura entre 4–8 segundos en los modelos Veo (3–10 segundos, a tu elección, en Omni Flash), pero los clips de Veo 3.1 y Veo 3.1 Fast se pueden prolongar en pasos de 7 segundos hasta alcanzar los 148 segundos, manteniendo siempre la continuidad visual de tu foto original.