Generación de personajes consistentes: Guía de campo
Mantén el mismo personaje de IA en imágenes y video: límites de imágenes de referencia para Nano Banana 2 y Pro, método de hoja de personaje, storyboards, Veo 3.1.

La generación de imágenes con personajes consistentes es un conjunto de técnicas que logran que un modelo de IA dibuje al mismo personaje —con la misma cara, cabello y ropa— en múltiples imágenes independientes, en lugar de inventar a una persona nueva cada vez. Es la diferencia entre que la instrucción "una mujer pelirroja en una cafetería" te devuelva a una desconocida en cada intento, o que te devuelva a tu mujer pelirroja: la del primer recuadro de tu cómic, tu campaña publicitaria o tu storyboard.
Para ir al grano: hay dos métodos que funcionan, y se pueden combinar. Primero, sube imágenes de referencia de tu personaje, usando el mismo mecanismo de referencia que alimenta el intercambio de caras con IA en nuestra plataforma. Nano Banana 2 acepta hasta 4 referencias de personaje, Nano Banana Pro hasta 5, y Veo 3.1 traslada hasta 3 al formato de video. Segundo, escribe un prompt de hoja de personaje: una descripción fija y detallada que pegarás en cada generación. En BananaBanana, generar un personaje consistente cuesta desde $0.06 por cada 1K imágenes en Nano Banana 2, y todos los ejemplos de este post fueron generados en la plataforma, por lo que puedes copiar y pegar los prompts tal cual.
También seré honesto desde el principio sobre los puntos de fallo. La consistencia en los modelos actuales es buena, pero no perfecta. Ya verás dónde empieza a flaquear.
¿Por qué el mismo personaje se ve diferente cada vez?
Los modelos de imagen no tienen memoria entre peticiones. Cada generación parte desde cero (ruido), y tu prompt es el único puente. Si el prompt dice "una mujer joven con cabello pelirrojo", el modelo elige al azar una de los millones de pelirrojas que es capaz de dibujar. Pruébalo cinco veces y obtendrás cinco personas distintas. Quizás compartan cierto aire, pero no la misma cara.
A esto se le llama desviación del personaje (character drift), y empeora con prompts vagos. Escribir "la misma mujer de antes" no sirve para nada, porque no existe un "antes". El modelo nunca vio tu imagen anterior a menos que la adjuntes explícitamente.
La desviación también se cuela dentro de un mismo flujo de trabajo. Cambias el ángulo de la cámara y la línea de la mandíbula varía. Cambias la ropa y de repente desaparecen las pecas. En mi experiencia, las características más frágiles son precisamente las que los humanos usamos para reconocer a alguien: la forma de los ojos, la nariz y el nacimiento del cabello. Los fondos y la ropa se mantienen bien; las caras tienden a divagar.
Así que todo el juego consiste en volver a introducir la identidad en el modelo en cada petición, ya sea mediante píxeles (imágenes de referencia) o texto (una descripción fija). De preferencia, ambos.

¿Cuántas imágenes de referencia acepta cada modelo?
Las imágenes de referencia son el método más potente de los dos: subes fotos del personaje y el modelo las toma como base indiscutible. Según la documentación de imágenes de la API de Gemini de Google, los límites varían bastante según el modelo, y vale la pena conocer estas diferencias antes de elegir uno.
| Modelo | Referencias de personaje | Referencias de objeto | Referencias de estilo | Precio por 1K imágenes |
|---|---|---|---|---|
| Nano Banana 2 Lite | ninguno | hasta 14 | ninguno | $0.03 |
| Nano Banana 2 | hasta 4 | hasta 10 | hasta 3 | $0.06 |
| Nano Banana Pro | hasta 5 | hasta 6 | ninguno | $0.11 |
La sorpresa en esa tabla es Lite. Es el que acepta más imágenes en total (14), pero la documentación deja claro que son solo referencias de objeto, sin soporte para consistencia de personajes. Nosotros lo aprendimos por las malas: Lite acepta de buena gana una cara como entrada y luego la trata como la foto de un producto, replicando la chaqueta pero cambiando a la persona. Si tu flujo de trabajo se centra en personajes, Lite queda descartado, diga lo que diga el precio. (Para todo lo demás es un modelo económico realmente bueno; escribimos una guía aparte sobre cuándo es suficiente usar Lite.)
Entre las otras dos opciones: yo empezaría con Nano Banana 2 a $0.06. El quinto espacio para personajes de Pro y su mayor control de identidad son muy útiles para escenas con varios personajes y piezas finales; y a $0.11 por imagen, la diferencia no es tan grande cuando el resultado final va a ser publicado en algún sitio.
El ángulo de las imágenes que subas importa más que la cantidad. Tres referencias desde el mismo ángulo solo le enseñan al modelo ese único ángulo. Una foto de frente, otra de perfil y una en tres cuartos le enseñan cómo es la cabeza completa.

¿Qué es el método de la hoja de personaje?
Una hoja de personaje (character sheet) es un bloque de texto fijo que describe detalladamente a tu personaje y que pegas tal cual en cada prompt. Es la alternativa puramente de texto cuando aún no tienes fotos de referencia, y de hecho es el método que usas para crear esas fotos de referencia en primer lugar. También es el método que funciona con agentes de IA: si generas imágenes en Claude Code a través de nuestro servidor MCP, la hoja de personaje viaja dentro del prompt sin necesidad de subir archivos.
La regla: describe al personaje como lo querría un retratista de la policía. Edad, complexión, piel, color y corte de cabello, color de ojos, marcas distintivas y uno o dos accesorios clave. Los adjetivos vagos fluctúan; los sustantivos concretos se mantienen firmes.
Este es el bloque exacto que usamos para los siguientes ejemplos:
a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt
Ambas imágenes de abajo se generaron con Nano Banana Pro usando exactamente ese bloque. Solo cambió el texto de la escena que lo rodeaba. No se adjuntó ninguna imagen de referencia; esto es consistencia pura basada en texto:


¿Es la misma persona? Está muy cerca. La cara se mantiene bien, la chaqueta y el arete coinciden y las pecas sobrevivieron en ambas escenas. Si te pones a analizar pixel por pixel, notarás que la longitud del cabello varía un poco. Ese es el límite real de la consistencia basada solo en texto, y por eso el flujo de trabajo profesional combina ambos métodos: generas la mejor imagen de tu personaje con la hoja de descripción y luego usas esa misma imagen como referencia para todo lo que viene después. El texto establece la identidad y los píxeles la imponen.
Dos consejos extra tras usar esto en producción. Los accesorios clave (el arete, la chaqueta) ayudan muchísimo al reconocimiento visual por muy pocos tokens; ponle uno a cada personaje. Y mantén la hoja por debajo de las 60 palabras, porque si te pasas, la descripción de la escena empezará a competir con la del personaje por la atención del modelo.
Escenas con múltiples personajes y storyboards de IA
Poner a dos personajes consistentes en un mismo encuadre es donde los trucos sencillos dejan de funcionar. Mezclar las hojas de texto de ambos personajes suele provocar contaminación cruzada: el personaje A toma el cabello del B, y el B hereda la chaqueta del A. Esto probablemente se pueda corregir con suficientes reintentos, pero los reintentos cuestan dinero.
Las imágenes de referencia lo solucionan de forma adecuada. Nano Banana 2 acepta hasta 4 referencias de personajes y Nano Banana Pro hasta 5, según la documentación de Google, y esos espacios se pueden dividir entre distintas personas. Sube dos o tres tomas de cada personaje y luego describe la escena refiriéndose a ellos por su papel ("la mujer pelirroja le entrega un café al hombre de barba gris"). La identidad se mantiene vinculada a la persona correcta de manera mucho más confiable, aunque las manos pasando objetos entre dos personas siguen siendo, en este 2026, una lotería.
Los storyboards son el siguiente paso natural, y hay dos formas de hacerlos. Cuadro por cuadro: una generación por panel, con las referencias de personaje correspondientes adjuntas a cada uno. A $0.06 por panel en Nano Banana 2, un tablero de seis paneles te costará $0.36. O bien, en una sola imagen: pídele a Nano Banana Pro una composición multipanel en una sola generación. El ejemplo de abajo se hizo de esa forma, con una única petición de $0.11 y usando la misma hoja de personaje de antes:

La consistencia dentro de una sola imagen es prácticamente gratis, ya que el modelo dibuja todos los paneles en una sola pasada y puede ver su propio trabajo. La desventaja es la resolución: cada panel ocupa una cuarta parte del encuadre. Para presentaciones de proyectos y animáticas está perfecto. Para paneles que vayas a entregar de manera individual, genéralos cuadro por cuadro y paga los $0.36.
¿Se puede llevar un personaje al formato de video?
Sí, y aquí es donde el flujo de trabajo se pone divertido. Veo 3.1 admite lo que la documentación de Vertex AI de Google llama imágenes de referencia de recursos (asset reference images): hasta 3 fotos de una persona, personaje o producto, y el modelo conserva la apariencia de ese sujeto en el video generado. En nuestro generador, esta es la sección de Referencia del Sujeto (Subject Reference), y Gemini Omni Flash, que siempre incluye sonido, es más generoso: hasta 10 imágenes de referencia por clip, y se pueden combinar con un fotograma inicial ($0.10 por segundo, reseña completa de Omni aquí).
La hoja de personaje sigue demostrando su utilidad en los prompts de video. El siguiente clip se generó con Veo 3.1 Fast, solo con texto, usando la misma descripción detallada de arriba más indicaciones de movimiento y cámara:
El prompt: la hoja de personaje, y luego "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field." Seis segundos, resolución 720p sin sonido, por $0.52. Es reconociblemente el mismo personaje de las imágenes estáticas, lo cual, tratándose de una transición basada solo en texto entre dos modelos diferentes, supera con creces mis expectativas.
Una advertencia de nuestros registros de generación: las referencias de recursos a veces limitan la expresividad. La cara coincide, pero se ve un poco artificial (como de cera), especialmente en planos abiertos donde ocupa pocos píxeles. Los primeros planos funcionan mejor. Si un video te devuelve un protagonista con la mirada perdida, prueba con un encuadre más cerrado en lugar de volver a generar la misma toma.
El flujo completo sería: hoja de personaje → imágenes principales en Nano Banana Pro → esas imágenes como referencias de personaje para cada imagen estática y como referencias de recurso para video. Una identidad, un solo flujo, imágenes desde $0.06 y clips de video desde $0.10 en la página de precios.
Preguntas frecuentes (FAQ)
¿Qué modelo de IA es mejor para lograr consistencia de personajes?
Nano Banana Pro es el ganador sobre el papel: hasta 5 imágenes de referencia de personajes y el bloqueo de identidad más potente de la familia, a $0.11 por imagen de 1K o 2K. Nano Banana 2 es la opción de mejor relación calidad-precio a $0.06, con 4 espacios para personajes más referencias de estilo, algo de lo que carece Pro. Evita Nano Banana 2 Lite para este propósito; no admite referencias de personajes en absoluto.
¿Cómo mantengo la misma cara en las imágenes de IA sin fotos de referencia?
Escribe una hoja de personaje: una descripción fija de 40 a 60 palabras que abarque edad, cabello, ojos, piel, marcas distintivas y un accesorio clave, y pégala sin cambios en cada prompt. Luego, usa tu mejor resultado como imagen de referencia de ahí en adelante. El texto por sí solo te acerca bastante; el texto combinado con referencias de imagen te asegura mantenerte ahí.
¿Puedo usar la foto de una persona real como referencia de personaje?
Técnicamente, la API acepta cualquier foto. Legal y éticamente, solo debes usar fotos sobre las cuales tengas derechos y cuentes con el consentimiento de la persona. Generar imágenes reconocibles de personas reales sin su consentimiento infringe las condiciones de servicio de la mayoría de las plataformas, incluida la nuestra.
¿Cuántas imágenes de referencia debo subir?
Subir pocas imágenes pero más variadas es mejor que muchas imágenes similares. Tres tomas que cubran el frente, el perfil y un ángulo de tres cuartos suelen dar mejores resultados que cinco selfies casi idénticas. Los límites estrictos son: 4 imágenes de personaje en Nano Banana 2, 5 en Nano Banana Pro y 3 en video con Veo 3.1.
¿Funciona la consistencia de personajes para personajes no humanos?
En su mayoría, sí. Las mascotas, los robots y los animales estilizados suelen mantener la consistencia incluso mejor que los humanos, porque su identidad reside en formas y colores llamativos en lugar de en la sutil geometría facial. Se aplican los mismos métodos: rasgos fijos distintivos en la hoja de personaje e imágenes de referencia una vez que tengas un diseño canónico.