Guía de Prompts para Veo 3.1: Cómo Escribir Prompts que Realmente Funcionen
Una guía práctica de prompts para Veo 3.1: estructura en siete partes, términos de movimiento de cámara, pistas de audio y clips antes/después desde $0.10.

Un prompt de Veo 3.1 es una breve descripción de escena que le indica al modelo de video de Google qué filmar y cómo hacerlo. Los modelos tratan el texto como el informe de un director: identifican el sujeto, la acción, el estilo, el movimiento de cámara, la composición, la elección del lente y la iluminación, y luego rellenan todo lo que no especificaste con sus propias suposiciones. Hacer un buen prompt consiste principalmente en dejar el menor margen posible a la improvisación.
La versión rápida, si solo lees un párrafo: describe un sujeto que realiza una acción y luego añade la cámara. Una plantilla útil es "[tipo de plano] de [sujeto] [haciendo una acción] en [entorno], [movimiento de cámara], [lente o enfoque], [iluminación y atmósfera]". Este simple hábito de especificar la cámara y la luz marca la diferencia entre un video aburrido y uno profesional. A continuación, te mostramos los detalles y las pruebas.
He estado usando Veo 3.1 a diario en BananaBanana desde que lanzamos la generación de video, y la diferencia entre un prompt impreciso y uno estructurado es mucho mayor aquí que en cualquier modelo de imagen que utilice. Las imágenes perdonan la vaguedad. El video la castiga por partida doble: una vez en el encuadre y otra en el movimiento.
¿Qué hace que un prompt de Veo 3.1 sea bueno?
Según la documentación oficial de Veo de Google, un prompt sólido incluye siete elementos: sujeto, acción, estilo, posición de la cámara, composición, enfoque y efectos de lente, y atmósfera. No necesitas usar los siete cada vez, pero sí debes saber cuáles estás omitiendo, porque el modelo improvisará el resto.
| Elemento | Qué controla | Frase de ejemplo |
|---|---|---|
| Sujeto | Quién o qué aparece en pantalla | "an elderly potter with clay-stained hands" |
| Acción | Qué sucede durante el clip | "shaping a bowl on a spinning wheel" |
| Estilo | Estética general | "cinematic documentary style" |
| Cámara | Posición y movimiento | "slow dolly-in at eye level" |
| Composición | Encuadre | "close-up" |
| Lente / Enfoque | Carácter óptico | "shallow depth of field" |
| Atmósfera | Tono de luz y color | "warm window light, dust in the air" |
El orden de los factores importa menos de lo que se piensa. Suelo colocar el sujeto y la acción al principio porque es en lo que se apoya el modelo, y dejo la cámara y la luz para el final. Lo realmente importante es la especificidad: escribir "a horse" le da al modelo la oportunidad de elegir al azar entre cuarenta razas, mientras que "a chestnut Arabian horse" no deja lugar a dudas.
Un detalle importante. Veo 3.1 cuenta con un optimizador de prompts por parte de Google que amplía las descripciones cortas antes de la generación, y no puedes ver exactamente qué ha añadido. Por eso, los prompts cortos a veces devuelven detalles que nunca pediste. Escribir tú mismo los detalles es la mejor manera de evitar que el optimizador decida por ti.

¿Cómo se controla la cámara en Veo 3.1?
El lenguaje cinematográfico es la herramienta más potente en un prompt de Veo 3.1, y es la que la mayoría de la gente olvida. El modelo entiende el vocabulario técnico estándar del cine, así que utilízalo de forma literal.
Para la posición: aerial view (vista aérea), eye-level (a la altura de los ojos), low-angle shot (contrapicado), top-down shot (cenital), over-the-shoulder (sobre el hombro). Para el movimiento: dolly in o out (acercamiento o alejamiento), tracking shot (plano de seguimiento), pan left o right (paneo a la izquierda o derecha), tilt up (inclinación hacia arriba), slow zoom (zoom lento), POV shot (punto de vista). Para el encuadre: extreme close-up (primerísimo primer plano), close-up (primer plano), medium shot (plano medio), wide shot (plano abierto), establishing shot (plano general de situación). Para la óptica: shallow focus (enfoque superficial), deep focus (gran profundidad de campo), macro lens (lente macro), wide-angle lens (gran angular), soft focus (enfoque suave).
Dos reglas prácticas basadas en nuestras pruebas. Primero, un solo movimiento de cámara por clip. Un prompt que pida "a pan that becomes a dolly-in and then tilts up" normalmente generará solo uno de los tres movimientos al azar, o una mezcla confusa. Los clips duran de 4 a 8 segundos; hay tiempo suficiente para un solo movimiento bien ejecutado. Segundo, los verbos de movimiento tienen prioridad sobre las indicaciones estáticas de cámara en caso de conflicto. Si el sujeto corre ("sprints") pero la cámara es un plano abierto estático ("static wide shot"), el modelo priorizará la carrera y moverá la cámara de todos modos. Haz que coincidan.
La iluminación funciona igual: descríbela como lo haría un director de fotografía. Términos como "golden hour backlight", "cool blue moonlight", "harsh overhead fluorescent" o "flickering torchlight" funcionan a la perfección. Las palabras vagas como "beautiful lighting" no aportan nada.

Antes y después: la misma idea, dos prompts
La teoría está bien, pero veamos la práctica. Aquí tienes la misma escena generada dos veces con Veo 3.1 Fast en BananaBanana, sin sonido, de 6 segundos y a 720p. El costo total de ambas pruebas: alrededor de $1.
Primero, el prompt básico que todos escriben al principio. Simplemente "A horse running on a beach":
No está mal. Observa que el modelo eligió el atardecer por su cuenta; ese es el optimizador de prompts tomando decisiones por ti. El encuadre sigue siendo un plano general lejano, la cámara no define su movimiento y nada de esto fue tu elección. Ahora, veamos la misma idea estructurada con los siete elementos: "A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun":
Mismo sujeto, mismo modelo, mismo precio. El segundo video tiene un movimiento de cámara intencionado, una dirección de luz coherente y el agua salpicada capturando el contraluz; todo definido por las palabras del prompt y no por el azar.
Una lección que aprendí al hacer esta prueba (y que me costó dos intentos fallidos): una versión anterior de ese prompt terminaba con "cinematic 35mm look", y Veo interpretó la referencia cinematográfica de forma literal, añadiendo franjas negras (letterbox) arriba y abajo de la pantalla. Dos veces. Palabras de estilo como "35mm", "anamorphic" o "cinematic film look" pueden aplicar todo el formato de cine clásico, franjas incluidas. Si quieres lograr esa atmósfera sin las franjas negras, describe directamente la luz y el comportamiento del lente, y evita el vocabulario técnico de celuloide.
Si empiezas a partir de una foto en lugar de texto, la dinámica cambia un poco (la imagen fija el primer fotograma y el prompt describe solo el movimiento). Explicamos este proceso detalladamente en nuestra guía de imagen a video.
¿Cómo estructurar el audio en Veo 3.1?
Veo 3.1 genera audio de forma nativa, y según los documentos de Google, esta función siempre está activa en la API: incluye diálogos, efectos de sonido y ruido ambiental sincronizados con la imagen. Puedes controlar cada uno con diferentes formatos de texto.
- El diálogo se escribe entre comillas, asociado a un narrador o personaje: A man murmurs, "This must be it."
- Los efectos de sonido se describen como sucesos: "tires screeching", "waves crashing against rocks".
- El ambiente se describe como atmósfera: "faint hum of fluorescent lights", "distant seagulls".
El propio prompt de ejemplo de Google ilustra este patrón: "A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'" Las comillas del diálogo producen una voz sincronizada con los labios, mientras que palabras como "flickering" and "torchlight" definen el sonido de fondo del entorno.
Mantén las líneas de diálogo cortas. En nuestras pruebas, cualquier frase que supere las doce palabras corre el riesgo de cortarse al final o de sonar demasiado rápida en un clip de 8 segundos. Además, escribe diálogos para uno o dos personajes como máximo, no para multitudes; las voces superpuestas suelen sonar confusas.
En BananaBanana el audio es opcional, y tiene una tarifa distinta porque Google lo cobra por separado: un clip de 8 segundos en Veo 3.1 Fast cuesta $0.70 en silencio o $1.00 con audio a 720p o 1080p. Las demostraciones anteriores son silenciosas a propósito, lo cual es una opción inteligente si el clip está destinado a reproducirse en bucle y en silencio en una web. (Si prefieres tener sonido en todos los clips de forma predeterminada, el modelo Omni Flash hace lo contrario: audio siempre activo, cobrado a $0.10 por segundo.)

Prompts negativos, duraciones y precios de Veo 3.1
El tema del prompt negativo suele ser confuso, así que te explicamos cómo funciona a nivel de API. La documentación de la API de Gemini para Veo 3.1 no menciona un parámetro de prompt negativo. Sin embargo, el punto de enlace de Vertex AI (que es el que utiliza BananaBanana) sí acepta negativePrompt, y en nuestras pruebas afecta significativamente al resultado final. Por lo tanto, esta opción está disponible y funciona en nuestro generador, aunque no debes esperar que actúe como un filtro absoluto.
Escribir prompts negativos tiene una regla poco intuitiva según la guía de prompts de Google: nunca utilices palabras como "no" o "sin". En su lugar, enumera lo que quieres evitar como sustantivos sencillos. Por ejemplo, "Cartoon, low quality, text overlay, watermark" funciona muy bien; sin embargo, "no cartoons" puede fallar porque la palabra "cartoon" sigue apareciendo en el texto.
Duraciones y formatos, según la documentación de Google y nuestra configuración de producción: los clips duran 4, 6, 7 u 8 segundos en formato 16:9 o 9:16, con resoluciones de 720p, 1080p y 4K. La duración de 8 segundos es obligatoria para resoluciones de 1080p, 4K, imágenes de referencia y extensiones de video. La extensión es una de las funciones estrella de Veo: cada solicitud añade 7 segundos de video, hasta un máximo de 20 veces, lo que te permite superar los dos minutos de video a partir de un único hilo de prompts.
Precios actuales en BananaBanana para un clip de 8 segundos a 720p:
| Modelo | Sin sonido | Con audio |
|---|---|---|
| Veo 3.1 Lite | $0.20 | $0.36 |
| Veo 3.1 Fast | $0.70 | $1.00 |
| Veo 3.1 | $1.40 | $3.00 |
Un clip silencioso de 4 segundos con Lite cuesta $0.10, y el saldo gratuito que recibe cada cuenta nueva alcanza para dos. Así que tu primer video con Veo no te costará nada y, para ser sinceros, Lite a 720p es ideal para experimentar con la estructura de tus prompts antes de dar el salto a Fast o al modelo completo. Puedes consultar la tabla de tarifas completa en la página de precios.
Mi flujo de trabajo recomendado: diseña el prompt en Lite, realiza ajustes hasta que el movimiento y el encuadre queden como deseas, y luego genera la versión definitiva en Fast o Veo 3.1. La estructura del prompt se adapta de manera idéntica entre las distintas opciones; la diferencia de precio se refleja únicamente en la calidad del renderizado.
Preguntas frecuentes
¿Cuál es la mejor estructura de prompt para Veo 3.1?
Sujeto, acción, estilo, cámara, composición, lente y atmósfera, en ese orden aproximado. Una plantilla simplificada: "[tipo de plano] de [sujeto] [acción] en [entorno], [movimiento de cámara], [lente], [iluminación]". Los sustantivos concretos funcionan mejor que los adjetivos, y es recomendable elegir un solo movimiento de cámara por clip en lugar de varios.
¿Soporta Veo 3.1 prompts negativos?
En Vertex AI, sí: el parámetro negativePrompt está disponible y funciona, aunque la documentación oficial de la API de Gemini no lo mencione expresamente para Veo 3.1. Escribe los elementos negativos como términos individuales ("cartoon, blurry, watermark"), evitando redactar frases completas como "no X".
¿Cómo puedo hacer que Veo 3.1 genere diálogos?
Escribe el diálogo entre comillas y asócialo a un hablante dentro del prompt: A woman whispers, "We're not alone." Veo sincroniza muy bien los labios con frases cortas; procura mantener los diálogos por debajo de las doce palabras por clip.
¿Qué duración máxima puede tener un video en Veo 3.1?
Los clips base duran de 4 a 8 segundos. Gracias a las extensiones (7 segundos adicionales por solicitud, hasta un máximo de 20 veces según la documentación de Google), un único hilo de generación puede alcanzar los 148 segundos a 720p.
¿Cuánto cuesta generar un video con Veo 3.1?
En BananaBanana, las tarifas van desde los $0.10 (un clip de 4 segundos sin sonido con Veo 3.1 Lite a 720p) hasta los $4.40 (un clip de 8 segundos en resolución 4K con Veo 3.1 y audio). La opción estándar recomendada, un clip de 8 segundos sin sonido con Fast, tiene un costo de $0.70.