Geração de Imagens com Personagens Consistentes: Guia
Mantenha o mesmo personagem de IA em imagens e vídeos: limites de referência para Nano Banana 2 e Pro, método de ficha de personagem, storyboards, Veo 3.1.

A geração de imagens com personagens consistentes é um conjunto de técnicas que faz um modelo de IA desenhar o mesmo personagem, com o mesmo rosto, cabelo e roupas, em várias imagens separadas, em vez de inventar uma pessoa nova a cada vez. É a diferença entre gerar "uma mulher ruiva em um café" e receber uma desconhecida a cada tentativa, ou ver a sua mulher ruiva — aquela do primeiro quadrinho da sua HQ, da sua campanha publicitária ou do seu storyboard.
A versão rápida: existem dois métodos que funcionam, e eles se somam. Primeiro, envie imagens de referência do seu personagem — o mesmo mecanismo de referência que alimenta a troca de rosto por IA na plataforma. O Nano Banana 2 aceita até 4 referências de personagem, o Nano Banana Pro até 5, e o Veo 3.1 leva até 3 para vídeos. Segundo, crie um prompt de ficha de personagem: uma descrição detalhada e fixa que você cola em todas as gerações. Na BananaBanana, um personagem consistente custa a partir de $0.06 por 1K imagens no Nano Banana 2, e todas as demonstrações deste post foram geradas na plataforma, então os prompts aqui podem ser copiados e colados exatamente como estão.
Vou ser sincero logo de cara sobre as falhas também. A consistência nos modelos atuais é boa, mas não perfeita. Você vai ver onde ela escorrega.
Por que o mesmo personagem parece diferente a cada vez?
Modelos de imagem não têm memória entre as requisições. Cada geração começa do ruído, e seu prompt é a única ponte. Se o prompt diz "uma jovem ruiva", o modelo escolhe uma entre as milhões de jovens ruivas que ele é capaz de desenhar. Rode cinco vezes e você terá cinco pessoas diferentes. Elas podem até ter a mesma vibe. Mas não o mesmo rosto.
Isso se chama desvio de personagem (character drift), e piora muito com prompts vagos. Digitar "a mesma mulher de antes" não adianta nada, porque não existe um "antes". O modelo nunca viu sua imagem anterior, a menos que você a envie explicitamente.
O desvio também aparece dentro de um mesmo fluxo de trabalho. Mude o ângulo da câmera e a linha do maxilar muda. Troque a roupa e, de repente, as sardas desaparecem. Na minha experiência, as características mais frágeis são justamente as que nós usamos para reconhecer alguém: o formato dos olhos, o nariz, o contorno do cabelo. Cenários e roupas se mantêm sem problemas. Já os rostos mudam.

Quantas imagens de referência cada modelo aceita?
As imagens de referência são o método mais forte dos dois: você envia fotos do personagem e o modelo as trata como a verdade absoluta. De acordo com a documentação de imagens da API Gemini do Google, os limites variam bastante entre os modelos, e vale a pena conhecer essas diferenças antes de escolher um.
| Modelo | Referências de personagem | Referências de objeto | Referências de estilo | Preço por 1K imagens |
|---|---|---|---|---|
| Nano Banana 2 Lite | nenhuma | até 14 | nenhuma | $0.03 |
| Nano Banana 2 | até 4 | até 10 | até 3 | $0.06 |
| Nano Banana Pro | até 5 | até 6 | nenhuma | $0.11 |
A surpresa nessa tabela é o Lite. Ele aceita o maior número de imagens no total (14), mas a documentação é explícita: são apenas referências de objeto, sem suporte para consistência de personagem. Aprendemos isso na prática: o Lite aceita tranquilamente um rosto como entrada e o trata como se fosse a foto de um produto, combinando a jaqueta e perdendo a pessoa de vista. Se o seu fluxo de trabalho é focado em personagens, o Lite está fora de cogitação, não importa o preço. (Para tudo o mais, ele é um modelo econômico excelente; escrevemos um guia separado sobre quando o Lite é suficiente.)
Entre os outros dois: eu começaria com o Nano Banana 2 a $0.06. O quinto slot de personagem do Pro e sua retenção de identidade mais forte fazem a diferença para cenas com vários personagens e entregas finais, e a $0.11 por imagem, a diferença de preço é irrisória quando o projeto final realmente vai ao ar.
O ângulo da imagem enviada importa mais do que a quantidade. Três referências do mesmo ângulo ensinam ao modelo apenas um ângulo. Uma foto de frente, uma de perfil e uma em três quartos ensinam como é a cabeça inteira.

O que é o método da ficha de personagem?
Uma ficha de personagem é um bloco fixo de texto que descreve seu personagem detalhadamente, o qual você cola literalmente em cada prompt. É a alternativa apenas em texto para quando você ainda não tem fotos de referência, e é justamente como você cria as fotos de referência para começo de conversa. É também o método que funciona a partir de agentes de IA: se você gerar imagens no Claude Code através do nosso servidor MCP, a ficha de personagem viaja dentro do prompt, sem necessidade de uploads.
A regra é: descreva o personagem como um desenhista de retratos falados da polícia gostaria. Idade, porte físico, pele, cor e corte de cabelo, cor dos olhos, sinais particulares e um ou dois acessórios de destaque. Adjetivos vagos causam desvios; substantivos concretos mantêm a consistência.
a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt
Ambas as imagens abaixo foram geradas com o Nano Banana Pro a partir desse mesmo bloco. Apenas o texto da cena ao redor foi alterado. Nenhuma imagem de referência foi anexada — isso é pura consistência ancorada em texto:


A mesma pessoa? Quase. O rosto se mantém muito bem, a jaqueta e o brinco estão idênticos, as sardas sobreviveram a ambas as cenas. Se você olhar bem de perto (pixel por pixel), vai notar que o comprimento do cabelo varia um pouco. Esse é o limite real da consistência baseada apenas em texto, e é por isso que o fluxo de trabalho profissional combina os métodos: gere a sua melhor imagem de personagem com a ficha e, depois, use essa imagem como referência de personagem para tudo o que vier a seguir. O texto define a identidade, os pixels a garantem.
Duas dicas extras de quem usa isso em produção. Acessórios marcantes (como o brinco ou a jaqueta) ajudam muito no reconhecimento visual consumindo pouquíssimos tokens; dê um para cada personagem. E mantenha a ficha com menos de 60 palavras, porque, acima disso, a descrição do cenário começa a disputar a atenção do modelo com a descrição do personagem.
Cenas com vários personagens e storyboards com IA
Colocar dois personagens consistentes no mesmo quadro é onde os truques fáceis param de funcionar. Uma ficha de texto que mistura ambos tende a gerar uma confusão: o personagem A pega o cabelo do B, e o B herda a jaqueta do A. Provavelmente dá para resolver com várias tentativas, mas gerar novamente custa dinheiro.
As imagens de referência resolvem isso de verdade. O Nano Banana 2 aceita até 4 referências de personagem e o Nano Banana Pro até 5, segundo os documentos do Google, e esses slots podem ser divididos entre pessoas diferentes. Envie duas ou três fotos de cada personagem e depois descreva a cena identificando-os pelos seus papéis ("a mulher ruiva entrega um café para o homem de barba grisalha"). A identidade fica associada à pessoa certa com muito mais confiança — embora duas pessoas passando objetos de mão em mão ainda seja, em 2026, uma verdadeira loteria.
Storyboards são o próximo passo natural, e existem duas maneiras de fazê-los. Quadro a quadro: uma geração por cena, com as referências de personagem anexadas a cada uma, custando $0.06 por quadro no Nano Banana 2 (assim, um storyboard de seis quadros sai por $0.36). Ou imagem única: peça ao Nano Banana Pro um layout de vários quadros em uma única geração. O painel abaixo foi feito exatamente assim: um único pedido de $0.11, usando a mesma ficha de personagem de antes:

A consistência dentro de uma única imagem é basicamente de graça, já que o modelo desenha todos os quadros de uma só vez e consegue ver o próprio trabalho. O preço a pagar é a resolução: cada quadro ocupa um quarto da imagem total. Para pitch decks e animatics, isso é ótimo. Mas para quadros que você vai usar individualmente, gere quadro a quadro e pague os $0.36.
É possível levar um personagem para o vídeo?
Sim, e é aqui que o processo fica divertido. O Veo 3.1 suporta o que a documentação do Vertex AI do Google chama de imagens de referência de recurso (asset reference images): até 3 fotos de uma pessoa, personagem ou produto, e o modelo preserva a aparência desse elemento no clipe gerado. No nosso gerador, essa é a seção "Subject Reference" (Referência de Assunto). Já o Gemini Omni Flash, que sempre vem com som, é mais generoso: até 10 imagens de referência por clipe, que podem ser combinadas com um frame inicial ($0.10 por segundo, análise completa do Omni aqui).
A ficha de personagem continua valendo cada centavo nos prompts de vídeo. O clipe abaixo é do Veo 3.1 Fast, apenas em texto, com o mesmo bloco de descrição das imagens acima, acrescido de instruções de movimento e câmera:
O prompt: a ficha de personagem, seguida de "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field". Seis segundos, silencioso, 720p, $0.52. Ela é reconhecidamente a mesma personagem das fotos, o que, para uma transição baseada apenas em texto entre dois modelos diferentes, é sinceramente melhor do que eu esperava.
Um porém dos nossos registros de geração: as referências de recursos às vezes deixam as expressões faciais meio artificiais. O rosto bate, mas fica com uma expressão meio engessada (com aspecto de cera), especialmente em planos abertos onde ocupa poucos pixels. Planos fechados (close-ups) se saem melhor. Se o clipe vier com o protagonista com um olhar sem vida, feche mais o enquadramento em vez de tentar gerar a mesma cena de novo.
O fluxo completo, então, fica assim: ficha de personagem → imagens principais no Nano Banana Pro → essas imagens como referências de personagem para as fotos e como referências de recurso para os vídeos. Uma única identidade, um único fluxo, com imagens a partir de $0.06 e clipes a partir de $0.10 na página de preços.
FAQ
Qual modelo de IA é o melhor para consistência de personagem?
O Nano Banana Pro, pelos números: até 5 imagens de referência de personagem e a retenção de identidade mais forte da família, custando $0.11 por imagem de 1K ou 2K. O Nano Banana 2 é a melhor escolha em termos de custo-benefício a $0.06, com 4 slots de personagem mais referências de estilo (que o Pro não possui). Evite o Nano Banana 2 Lite para essa finalidade; ele não suporta referências de personagem de forma alguma.
Como manter o mesmo rosto em imagens de IA sem fotos de referência?
Crie uma ficha de personagem: uma descrição fixa de 40 a 60 palavras cobrindo idade, cabelo, olhos, pele, marcas características e um acessório de destaque, e cole-a sem alterações em todos os prompts. Depois, use o seu melhor resultado como imagem de referência daqui em diante. O texto sozinho te deixa perto do objetivo; texto mais imagens de referência te mantêm lá.
Posso usar a foto de uma pessoa real como referência de personagem?
Tecnicamente, a API aceita qualquer foto. Legal e eticamente falando, use apenas fotos das quais você possua os direitos e que tenham o consentimento da pessoa. Gerar imagens de pessoas reais reconhecíveis sem consentimento viola os termos da maioria das plataformas, incluindo a nossa.
Quantas imagens de referência devo enviar?
Poucas imagens, porém variadas, superam muitas imagens parecidas. Três fotos cobrindo ângulos frontal, perfil e três quartos costumam funcionar melhor do que cinco selfies quase idênticas. Os limites máximos são: 4 imagens de personagem no Nano Banana 2, 5 no Nano Banana Pro e 3 no vídeo do Veo 3.1.
A consistência de personagem funciona para personagens não humanos?
Na maioria das vezes, sim. Mascotes, robôs e animais estilizados costumam manter a consistência até melhor do que humanos, porque suas identidades dependem de formas marcantes e cores fortes, em vez de uma geometria facial sutil. Aplicam-se os mesmos métodos: características fixas e marcantes na ficha, e imagens de referência assim que você tiver um design definitivo.