Un buen ángulo del producto
Una sola foto plana y bien iluminada gana a cinco fotos casuales. Los brillos, el movimiento y una mano tapando media etiqueta se reconstruyen como invención.
Caso de uso · Vídeo UGC con IA
Un anuncio UGC es alguien hablándole a la cámara del móvil con tu producto en la mano. Aquí no se graba: se genera. Traes una foto del producto y otra de la persona, el modelo arma el primer fotograma y luego lo anima con la voz y el sonido de la habitación en la misma pasada. Un clip cuesta entre $0.30 y $1.00 en Gemini Omni Flash, y hasta $3.00 en Veo 3.1 con sonido; el fotograma sale por $0.11, y nada de esto es una suscripción.
Un vídeo UGC con IA es un anuncio corto en formato de contenido de usuario — alguien hablándole a la cámara del móvil, con un producto en la mano, en una cocina o un salón en lugar de un plató — pero generado por un modelo de vídeo en vez de rodado con un creador. La producción son tres llamadas: fotos de referencia del producto y de la persona, un fotograma fijo que fija quién aparece y qué sostiene, y un modelo de vídeo que anima ese fotograma con voz sincronizada. Aquí hay dos modelos. Gemini Omni Flash es el barato y el más reciente: la ficha del modelo de Google incluye la simulación de física real entre sus capacidades y el movimiento complejo entre sus puntos débiles, algo que coincide con lo que veo — la manipulación normal suele salir bien, la elaborada es cara o cruz. A Veo 3.1 se recurre cuando el plano depende de que un objeto se comporte. Un clip cuesta $0.30–$1.00 en Omni Flash, $1.00 en Veo 3.1 Fast y $3.00 en el Veo 3.1 completo por ocho segundos con sonido, hasta $4.40 en 4K. Y se renderiza en un par de minutos en vez de las dos a cuatro semanas que suele comerse un brief con un creador.
La factura del clip de arriba, sin redondear: $0.11 por la referencia del producto, $0.11 por la persona, $0.11 por el fotograma inicial que los junta y $0.80 por ocho segundos de Omni Flash — $1.13 en total. La versión vertical de seis segundos que verás más abajo costó $0.60. Regrabar la voz aparte sale por $0.01 cada 200 caracteres de guion, más o menos un céntimo por frase. Las cuentas nuevas reciben $0.20 gratis, que dan para una foto de referencia y un primer fotograma: suficiente para ver si el personaje funciona antes de pagar vídeo.
Ese es el precio de la primera toma, y la primera toma no es un plan. Algunos clips salen al primer intento; muchos necesitan dos o tres, porque la frase suena plana, una mano hace algo raro o el modelo rechaza la ropa. Y luego está lo otro que nadie mete en el precio: un anuncio casi nunca es un solo clip. Un spot de 20–30 segundos suele ser tres o cuatro tomas montadas — gancho, producto en mano, primer plano, cierre —, así que la factura realista de un anuncio terminado son unos pocos dólares, no unos pocos centavos, y sube rápido si los planos con movimiento los ruedas en el Veo 3.1 completo a $3.00 cada uno. El montaje, en cambio, es gratis: ffmpeg recorta, une y superpone audio sobre vídeo desde la línea de comandos, sin ningún editor de por medio.
Una foto limpia del producto y una foto de la persona. Todo lo que entre borroso, recortado o mal iluminado vuelve multiplicado en el vídeo.
Genera una imagen fija con las dos referencias dentro — la persona con el producto, encuadrada como debe abrir el anuncio. $0.11 con Nano Banana Pro, y puedes repetirlo hasta que quede bien.
Envía el fotograma como primer frame y describe el movimiento y la frase que dice. Omni Flash cobra $0.10 por segundo de 720p con audio; Veo 3.1 cuesta más y es la que conviene probar cuando una sola toma tiene que sostener varias acciones seguidas.



Esta es la parte que la gente se salta y es la que decide el resultado. Un modelo al que le das una foto movida de un frasco en tres cuartos no falla en voz alta: inventa en silencio el lado que no ve, y ese lado inventado es el que acaba ocho segundos en pantalla. Dale una foto plana y bien iluminada con la etiqueta hacia cámara y ese mismo frasco sobrevive al fotograma, al vídeo y a la edición posterior.
Con la persona pasa igual. La documentación de Veo de Google lo dice sin rodeos: elige imágenes nítidas y bien iluminadas que muestren al sujeto desde el ángulo que quieres, y mantén el mismo lenguaje de óptica e iluminación entre planos. Mi regla después de unas cuantas decenas de estos: si el retrato de referencia y la escena prevista no se ponen de acuerdo en de dónde viene la luz, la cara se va a un punto intermedio y deja de parecer la misma persona.
Una sola foto plana y bien iluminada gana a cinco fotos casuales. Los brillos, el movimiento y una mano tapando media etiqueta se reconstruyen como invención.
Mantén el mismo peinado, la misma ropa y el mismo maquillaje en todas las referencias. Los looks mezclados se promedian en una cara que no se parece a ninguno.
Un retrato con flash metido en una cocina de luz suave se lee como un montaje. Elige en la referencia la luz que el anuncio va a tener de verdad.
Nano Banana Pro aguanta textos cortos de etiqueta; una lista densa de ingredientes se convierte en textura. Si la tipografía importa, planifica un primer plano con el envase real.
Las referencias no necesitan estar compuestas como un anuncio. La composición es trabajo del fotograma inicial: ahí es donde discutes con el modelo.
Un recorte de 300 píxeles sacado de una ficha de marketplace no le deja casi nada al modelo. Originales a resolución completa, siempre.
Los dos caminos funcionan: puedes darle al modelo de vídeo tus fotos de referencia y dejar que componga la escena, o generar primero una imagen fija y animar esa. En la práctica lo segundo es mejor, y la razón es prosaica: un modelo al que le pides que invente la composición la inventa en cada fotograma, mientras que un modelo con una imagen fija solo tiene que continuarla. En Gemini Omni Flash la diferencia es tan grande que dejé de usar solo referencias para planos con producto.
Abajo hay dos clips: el mismo prompt, las mismas referencias, seis segundos cada uno, $0.60 por clip. La única diferencia es si entró o no un fotograma aprobado. No se cambió nada más y ninguno se volvió a generar.
Solo referencias
Desde un primer fotograma aprobado
La versión honesta: usar solo referencias no está roto — la cara aguanta bien y, para una escena sin producto en la mano, suele bastar. Es más, la luz de esa toma es incluso más bonita: más suave en el rostro, con menos contraste de ventana, porque el modelo compuso la habitación que le apetecía en lugar de continuar la nuestra. Un matiz que cambia la lectura: nuestra creadora está generada, no es la foto de una persona real, así que el modelo tenía margen para reiluminarla. Un retrato real fija la luz y la piel con mucha más dureza, y la vía de solo referencias tiene menos libertad para favorecerlo. Lo que compras aquí es control, no calidad. En Veo 3.1 la decisión ya está tomada: la API de Google acepta o un primer fotograma o hasta tres imágenes de referencia, nunca ambos en la misma petición, y las referencias exigen la duración de ocho segundos.
Omni Flash es muy bueno justo en el formato en el que vive el UGC: una persona hablándole al objetivo. Entrevistas, piezas tipo pódcast, un fundador explicando un producto, alguien sosteniendo un bote y describiéndolo. Dibuja la boca, el micromovimiento y el ambiente de la sala en una sola pasada, y es la forma más barata de sacar una voz sincronizada de un modelo de vídeo. Además es el más nuevo de los dos, y Google lo vende precisamente por la física: el anuncio habla de una comprensión intuitiva de la gravedad, la energía cinética y la dinámica de fluidos, y la ficha del modelo lista la simulación de física real entre sus capacidades mientras señala el movimiento complejo como debilidad conocida. Las dos mitades se cumplen en la práctica. Las cosas caen, los líquidos se vierten, el peso se lee bien — hasta que el plano pide una cadena de acciones precisas con un objeto.
Así que la división no es cabezas parlantes contra movimiento: es cuánta coreografía tiene que sostener una sola toma. La prueba de abajo es el extremo duro de esa escala, no un veredicto sobre ninguno de los dos modelos: mismo primer fotograma, mismo prompt, un clip por modelo — destapar el frasco, apretar el cuentagotas, dos gotas en la palma abierta, todo en ocho segundos.
Gemini Omni Flash · 8 s · $0.80
Veo 3.1 Fast · 8 s con audio · $1.00
El movimiento de labios, el ambiente y la voz llegan juntos, $0.10 por segundo. Para una reseña, un testimonio o un diálogo a dos es la elección obvia.
Un movimiento lo lleva bien Omni; cuatro seguidos es donde las tomas empiezan a perder acciones. Nuestra comparación usó Veo 3.1 Fast a $1.00 por ocho segundos con audio; el Veo 3.1 completo son $3.00. Genera en ambos y quédate con la toma que funcione.
El filtro de seguridad de Omni es bastante más estricto con la ropa: a una creadora de fitness en top deportivo la rechaza mucho más a menudo que Veo 3.1, con el mismo prompt y la misma referencia. Planifica el vestuario o planifica el modelo.
Omni Flash es 720p y de 3 a 10 segundos, exactamente los que pagues. Veo 3.1 hace 4, 6 u 8 segundos hasta 4K, y sus clips se pueden extender más allá del primer corte.
Todo clip de Omni lleva audio, lo pidieras o no. En Veo el audio es un interruptor, y los renders mudos salen más baratos, algo que importa cuando la voz va a venir de otro sitio.
Una generación bloqueada se reembolsa automáticamente en ambos modelos. Lo caro de un rechazo son los cuatro minutos, no el dólar.
Omni Flash escribe el habla en la misma pasada que la imagen y, con inglés conversacional, suele bastar. Donde tropieza es en los nombres: marcas inventadas, palabras extranjeras, números de modelo, cualquier cosa que a un hablante nativo habría que explicarle. Pero la versión grande de este problema son los idiomas distintos del inglés, y la tienen todos los modelos de vídeo: quienes probaron Seedance 2.5 en ruso describen una frase que empieza aceptable y se deshace por el camino — vocales átonas mal reducidas, acentos en la sílaba equivocada y, al final de una escena de quince segundos, un acento más cercano a un híbrido eslavo que al ruso, porque el ruso, el ucraniano y el bielorruso están lo bastante cerca como para que el modelo los mezcle. Algunas palabras salen limpias y la siguiente delata toda la toma. Si tu guion no está en inglés, escúchalo entero antes de darlo por bueno.
La solución es dejar de pedirle la voz al modelo de vídeo y generarla aparte. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) funciona con el mismo saldo a través de nuestro servidor MCP: $0.01 cada 200 caracteres de guion, 30 voces, un locutor o un diálogo a dos, WAV a 24 kHz de salida. La dirección se escribe en lenguaje normal — persona, ritmo, acento y la grafía fonética de cualquier palabra que necesites bien pronunciada. Luego montas la pista sobre el clip en cualquier editor. Mantén tu frase reescrita más o menos igual de larga que la toma original y la boca seguirá cuadrando a grandes rasgos; donde no cuadre, corta al producto.
Voz generada · $0.01
Montar el anuncio tampoco necesita editor. ffmpeg pega tomas una detrás de otra, recorta el medio segundo en que una mano hace algo raro, cambia el audio generado por tu pista de TTS, mete un fundido encadenado y exporta la versión 9:16 — todo desde una línea de comandos, gratis, en cualquier máquina. Su sintaxis es célebre por lo áspera, y justo por eso encaja bien con un modelo: describe el corte que quieres a Claude o a cualquier LLM, recibe el comando y ejecútalo. Para un spot UGC de tres clips, eso es toda la posproducción — y es la razón por la que las cifras de esta página se quedan en el coste de generación en vez de sumar otra suscripción.
| Modelo | Precio | Unidad | Audio |
|---|---|---|---|
| Nano Banana Proreferencias y primer fotograma | $0.11 | imagen 1K–2K | — |
| Nano Banana 2borradores y variantes | $0.03–$0.13 | imagen 512px–4K | — |
| Gemini Omni Flash$0.10 por segundo | $0.30–$1.00 | 3–10 s, 720p | siempre activo |
| Veo 3.1 Fastcon audio | $0.50–$1.00 | 4–8 s, 720p/1080p | opcional |
| Veo 3.1 Liteel vídeo más barato | $0.10–$0.36 | 4–8 s, 720p | opcional |
| Gemini 3.1 Flash TTSsolo por MCP | $0.01 | cada 200 caracteres | solo voz |
Los precios de Veo son para 720p y 1080p; el 4K cuesta más. Omni Flash factura $0.10 por cada segundo de salida, así que la duración del clip es el precio. Tablas completas en la página de precios.
Todos los modelos y resoluciones están en la página de precios completa, y la página de Gemini Omni Flash explica qué puede y qué no puede hacer ese modelo.
Cómo funciona la animación desde el primer fotograma, qué escribir en el prompt de movimiento y dónde se rompe.
Leer la guíaCómo conseguir que un producto sobreviva de la foto de referencia al fotograma final, con prompts reales.
Leer la guíaPráctica con la API en preview: qué admite, qué rechaza y cuánto cuesta de verdad cada clip.
Leer la guíaNo. El creador también se puede generar: todas las personas que ves en esta página salieron de un prompt de texto y nunca existieron. Si usas la cara de una persona real, necesitas su permiso: las normas sobre la imagen de una persona se aplican al vídeo generado igual que a un rodaje, y las políticas de las plataformas sobre dobles sintéticos son más estrictas de lo que la mayoría supone.
Sí, mientras conserves las mismas fotos de referencia y reutilices el mismo fotograma inicial. Regenerar el fotograma con las mismas referencias se acerca mucho, pero no es idéntico píxel a píxel: la costumbre más segura es guardar cada primer fotograma aprobado y volver a animarlo en vez de reconstruirlo.
En TikTok, sí: su política publicitaria sobre contenido editado y generado con IA exige o la etiqueta AIGC del Ads Manager o tu propio aviso visible en el creativo. Meta pone su propia etiqueta de IA de forma automática en los anuncios que detecta como generados. Ambas políticas cambiaron durante 2026, así que revisa la versión vigente antes de una campaña grande en lugar de fiarte de un artículo de blog, incluido este.
Empieza por Gemini Omni Flash, a $0.10 por segundo con audio incluido: para una persona hablando a cámara es lo más barato y lo menos quisquilloso, y además es el modelo más nuevo, con una física que Google promociona explícitamente. No lo leas como «Omni no sabe hacer movimiento»: vierte, deja caer, transmite peso. Lo que se le escapa son las cadenas largas de manipulación precisa en una sola toma — en nuestra prueba del cuentagotas, con cuatro acciones, perdió el frasco mientras Veo 3.1 Fast lo mantuvo. Así que para un gancho o un testimonio, Omni. Para un plano construido sobre coreografía, genera en los dos y quédate con la toma que salga; la fallida cuesta céntimos.
Sí, hasta 10 segundos. Sube tu clip y Omni Flash lo editará como vídeo a vídeo — cambiar la luz, el fondo, lo que sostiene la persona — conservando la toma. Las fuentes más largas se recortan al límite del modelo antes de generar.
El saldo se devuelve automáticamente, tanto en Omni Flash como en Veo. Los rechazos se concentran en la ropa, los menores y las personas reales reconocibles; la regla del vestuario de la sección de elección de modelo es la que más reintentos ahorra.
Sí: los mismos modelos están expuestos por nuestro servidor MCP, incluido el de voz, que no tiene interfaz web. Las imágenes de referencia y los primeros fotogramas se pasan como job ID, URL públicas o base64 en línea, así que un lote entero de UGC se puede automatizar desde un agente.
Cuenta tomas, no clips. Un spot de 20–30 segundos son normalmente tres o cuatro clips montados, y cada uno se lleva un par de intentos antes de ser usable: una lectura plana, una mano rara, un rechazo. A $0.80 los ocho segundos de Omni Flash, un anuncio terminado se queda en unos pocos dólares; rodar los planos con más movimiento en el Veo 3.1 completo a $3.00 cada uno lo lleva a las decenas. El montaje no suma nada: ffmpeg une las tomas, las recorta y superpone la locución desde la línea de comandos, y un LLM puede escribirte esos comandos.
Regístrate gratis con $0.20 en el saldo y recarga con cripto desde $1. Primer fotograma en cosa de un minuto, primer clip en cinco.