Voltar ao blog
BananaBanana Teamtutorialvideoveoprompts

Guia de Prompt do Veo 3.1: Como Escrever Prompts que Funcionam de Verdade

Um guia prático de prompts para o Veo 3.1: estrutura em sete partes, termos de movimento de câmera, dicas de áudio e clipes reais de antes e depois a partir de $0.10.

Guia de Prompt do Veo 3.1: Como Escrever Prompts que Funcionam de Verdade

Um prompt do Veo 3.1 é uma breve descrição de cena que instrui o modelo de vídeo do Google sobre o que filmar e como filmar. Os modelos tratam o seu texto como o briefing de um diretor: eles extraem o sujeito, a ação, o estilo, os movimentos de câmera, a composição, a escolha da lente e a iluminação, e depois preenchem tudo o que você não especificou com as suas próprias suposições. Escrever um bom prompt consiste, principalmente, em deixar o menor espaço possível para adivinhações.

A versão rápida, se você for ler apenas um parágrafo: descreva um sujeito realizando uma ação e, em seguida, adicione a câmera. Um modelo prático é "[tipo de plano] de [sujeito] [fazendo uma ação] em [cenário], [movimento de câmera], [lente ou foco], [iluminação e atmosfera]". Esse simples hábito de especificar a câmera e a luz elimina a maior parte da diferença entre um clipe sem graça e um vídeo profissional. Tudo o que você verá abaixo são detalhes e provas práticas.

Tenho usado o Veo 3.1 diariamente no BananaBanana desde que lançamos a geração de vídeo, e a diferença entre um prompt feito sem cuidado e um estruturado é muito maior aqui do que em qualquer modelo de imagem que eu utilizo. As imagens perdoam a imprecisão. O vídeo a pune duas vezes: uma no enquadramento e outra no movimento.

O que faz um bom prompt de Veo 3.1?

De acordo com a documentação oficial do Veo do Google, um prompt robusto cobre sete elementos: sujeito, ação, estilo, posicionamento da câmera, composição, foco e efeitos de lente, e atmosfera. Você não precisa usar todos os sete todas as vezes, mas precisa saber quais está deixando de fora, pois o modelo improvisará o resto.

ElementoO que controlaFrase de exemplo
SujeitoQuem ou o que está na tela"an elderly potter with clay-stained hands"
AçãoO que acontece durante o clipe"shaping a bowl on a spinning wheel"
EstiloEstética geral"cinematic documentary style"
CâmeraPosição e movimento"slow dolly-in at eye level"
ComposiçãoEnquadramento"close-up"
Lente / FocoCaráter óptico"shallow depth of field"
AtmosferaTom de luz e coloor"warm window light, dust in the air"

A ordem das palavras importa menos do que a maioria das pessoas pensa. Eu costumo colocar o sujeito e a ação no início, pois é onde o modelo se ancora, e deixo as indicações de câmera e luz para o final. O que realmente importa é a especificidadde: escrever "a horse" dá ao modelo uma chance de 50/50 de escolher aleatoriamente entre quarenta raças, enquanto "a chestnut Arabian horse" não deixa dúvidas.

Um detalhe importante. O Veo 3.1 possui um otimizador de prompts integrado do lado do Google que expande prompts curtos antes da geração, e você não consegue ver exatamente o que foi adicionado. Por isso, prompts curtos às vezes retornam com detalhes que você nunca pediu. Descrever os detalhes você mesmo é a melhor forma de tirar essa decisão do otimizador.

Anatomia de um prompt de Veo 3.1 dividido em sete elementos principais: sujeito, ação, estilo, câmera, composição, lente e atmosfera

Como controlar a câmera no Veo 3.1?

O vocabulário cinematográfico é a ferramenta mais poderosa em um prompt do Veo 3.1, e é a parte que a maioria das pessoas esquece. O modelo entende o jargão técnico padrão do cinema, então use-o literalmente.

Para posição: aerial view (vista aérea), eye-level (ao nível dos olhos), low-angle shot (contra-plongée/ângulo baixo), top-down shot (plano zenital/de cima para baixo), over-the-shoulder (plano sobre o ombro). Para movimento: dolly in ou out (aproximação ou afastamento com trilho), tracking shot (plano de acompanhamento), pan left ou right (movimento panorâmico para a esquerda ou direita), tilt up (inclinação para cima), slow zoom (zoom lento), POV shot (câmera em primeira pessoa). Para enquadramento: extreme close-up (primeiríssimo plano), close-up (primeiro plano), medium shot (plano médio), wide shot (plano aberto), establishing shot (plano de estabelecimento/geral). Para óptica: shallow focus (foco raso), deep focus (foco profundo/grande profundidade de campo), macro lens (lente macro), wide-angle lens (lente grande-angular), soft focus (foco suave).

Duas regras práticas baseadas nas nossas gerações. Primeiro, apenas um movimento de câmera por clipe. Um prompt que pede "a pan that becomes a dolly-in and then tilts up" geralmente resulta em apenas um dos três movimentos escolhido ao acaso, ou em uma mistura confusa. Os clipes duram de 4 a 8 segundos; há tempo apenas para um único movimento bem executado. Segundo, os verbos de movimento do sujeito superam as orientações estáticas da câmera em caso de conflito. Se o seu sujeito corre ("sprints"), mas a câmera é um plano aberto estático ("static wide shot"), espere que o modelo priorize a corrida e acabe movendo a câmera de qualquer maneira. Faça com que ambos entrem em acordo.

A iluminação funciona da mesma forma: descreva-a como um diretor de fotografia faria. Termos como "golden hour backlight", "cool blue moonlight", "harsh overhead fluorescent" ou "flickering torchlight" funcionam perfeitamente. Palavras vagas como "beautiful lighting" não trazem resultado algum.

Vocabulário de câmera de cinema para prompts do Veo 3.1 ilustrado como um storyboard de posições dolly, panorâmica, ângulo baixo e aérea ao redor de um único sujeito

Antes e depois: a mesma ideia, dos prompts

La teoria é boa, mas vamos ver a prática. Aqui está a mesma cena gerada duas vezes com o Veo 3.1 Fast no BananaBanana, sem som, de 6 segundos e em 720p. O custo total para ambos os testes: cerca de $1.

Primeiro, o prompt básico que todo mundo escreve no primeiro dia. Apenas "A horse running on a beach":

Ficou bom. Mas note que o modelo escolheu um pôr do sol por conta própria; esse é o otimizador de prompts tomando decisões por você. O enquadramento continua sendo um plano aberto distante, a câmera nunca se define em um movimento claro e nada disso foi escolha sua. Agora, vejamos a mesma ideia reescrita com a estrutura de sete elementos: "A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun":

Mesmo sujeito, mesmo modelo, mesmo preço. O segundo clipe tem um movimento de câmera intencional, uma direção de luz consistente e a água respingada capturando a contraluz; tudo definido pelas palavras exatas no prompt, e não pelo acaso.

Uma lição que aprendi ao produzir este teste (e que me custou duas tentativas perdidas): uma versão anterior desse prompt terminava com "cinematic 35mm look", e o Veo interpretou a referência de filme literalmente, adicionando faixas pretas (letterbox) fixas no enquadramento. Duas vezes. Palavras de estilo como "35mm", "anamorphic" ou "cinematic film look" podem trazer junto toda a apresentação clássica de cinema de tela larga, incluindo as faixas pretas. Se você quer o clima de cinema sem as faixas pretas, descreva a luz e o comportamento da lente diretamente no prompt e evite o vocabulário técnico de celuloide.

Se você está começando de uma foto em vez de texto, o fluxo muda um pouco (sua imagem define o primeiro fotograma e o prompt descreve apenas o movimento). Cobrimos esse fluxo detalhadamente no nosso guia de imagem para vídeo.

Como criar prompts de áudio no Veo 3.1?

O Veo 3.1 gera áudio nativo e, de acordo com a documentação do Google, essa função está sempre ativa na API: inclui diálogos, efeitos sonores e ruídos de ambiente sincronizados com a imagem. Você pode controlar cada um desses aspectos por meio de formatos de texto diferentes.

  • Diálogos vão entre aspas, associados a um interlocutor: A man murmurs, "This must be it."
  • Efeitos sonores são descritos como eventos: "tires screeching", "waves crashing against rocks".
  • O ambiente é descrito como atmosfera de fundo: "faint hum of fluorescent lights", "distant seagulls".

O próprio prompt de exemplo do Google ilustra esse padrão: "A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'" O trecho do diálogo entre aspas produz uma fala perfeitamente sincronizada com os lábios, enquanto as palavras "flickering" e "torchlight" definem o som ambiente do cenário.

Mantenha as linhas de diálogo curtas. Em nossos testes, qualquer frase que passe de aproximadamente uma dúzia de palavras corre o risco de ser cortada no final ou de soar muito acelerada dentro de um clipe de 8 segundos. Além disso, escreva falas para apenas um ou dois personagens, nunca para multidões; vozes sobrepostas tendem a soar confusas e distorcidas.

No BananaBanana, o áudio é opcional e tem uma tarifa distinta porque o Google cobra por ele separadamente: um clipe de 8 segundos no Veo 3.1 Fast custa $0.70 em silêncio ou $1.00 com áudio em 720p ou 1080p. Os exemplos demonstrados acima são silenciosos de propósito, o que é uma escolha orçamentária inteligente quando o vídeo se destina a reproduzir automaticamente e sem som em uma página web. (Se você prefere ter áudio em todos os clipes por padrão, o modelo Omni Flash adota a abordagem oposta: som sempre ativo, cobrado a $0.10 por segundo.)

Ondas de som, um balão de diálogo e símbolos de ruído ambiente fluindo para dentro de um fotograma de filme, ilustrando a estrutura dos prompts de áudio do Veo 3.1

Prompts negativos, durações e preços do Veo 3.1

O funcionamento dos prompts negativos costuma ser bastante confuso, então aqui está o que observamos a nível de API. A documentação da API do Gemini para o Veo 3.1 não menciona um parâmetro de prompt negativo. No entanto, o endpoint da Vertex AI (que é o que o BananaBanana utiliza) aceita negativePrompt e, em nossos testes, ele afeta significativamente o resultado gerado. Portanto, este campo existe em nosso gerador e funciona perfeitamente, só não espere que ele aja como um filtro absoluto.

Escrever termos negativos traz uma regra pouco intuitiva baseada nas diretrizes de prompts do Google: nunca use palavras como "não" ou "sem" no campo negativo. Em vez disso, liste o que deseja evitar como substantivos simples. Por exemplo, "Cartoon, low quality, text overlay, watermark" funciona muito bem; já "no cartoons" pode falhar porque a palavra "cartoon" continua presente no contexto analisado pelo modelo.

Durações e formatos, conforme a documentação do Google e nossa estrutura de produção: os clipes duram 4, 6, 7 ou 8 segundos nos formatos 16:9 ou 9:16, com resoluções de 720p, 1080p e 4K. A duração de 8 segundos é obrigatória para resoluções de 1080p, 4K, imagens de referência e extensões de vídeo. A extensão, aliás, é um recurso excelente do Veo: cada solicitação adiciona 7 segundos extras de vídeo, até um limite de 20 vezes, permitindo que você passe de dois minutos de filme a partir de um único fio de prompts.

Preços atuais no BananaBanana para um clipe de 8 segundos em 720p:

ModeloSem somCom áudio
Veo 3.1 Lite$0.20$0.36
Veo 3.1 Fast$0.70$1.00
Veo 3.1$1.40$3.00

Um clipe silencioso de 4 segundos usando o Lite custa $0.10, e o saldo gratuito que cada nova conta recebe cobre dois deles. Portanto, seu primeiro vídeo com o Veo não custará nada e, sendo sinceros, o Lite em 720p é ideal para praticar a estrutura de seus prompts antes de investir seu saldo no Fast ou no modelo completo. A tabela de tarifas completa está disponível na nossa página de preços.

Meu fluxo de trabalho padrão: crio o rascunho do prompt no Lite, realizo ajustes até que o movimento e o enquadramento fiquem adequados e, em seguida, gero a versão final no Fast ou no Veo 3.1. A estrutura de escrita do prompt é interpretada de maneira idêntica entre as diferentes opções; a diferença de preço reflete exclusivamente na qualidade final do render.

Perguntas frequentes

Qual é a melhor estrutura de prompt para o Veo 3.1?

Sujeito, ação, estilo, câmera, composição, lente e atmosfera, aproximadamente nessa ordem. Um modelo simplificado: "[tipo de plano] de [sujeito] [ação] em [cenário], [movimento de câmera], [lente], [iluminação]". Substantivos concretos funcionam melhor do que adjetivos, e é recomendável escolher apenas um movimento de câmera por clipe em vez de vários.

O Veo 3.1 suporta prompts negativos?

Na Vertex AI, sim: o parâmetro negativePrompt é aceito e funciona, embora a documentação oficial da API do Gemini não o mencione diretamente para o Veo 3.1. Liste os elementos indesejados como substantivos simples ("cartoon, blurry, watermark"), nunca em frases negativas como "no X".

Como faço para o Veo 3.1 gerar falas/diálogos?

Escreva o diálogo entre aspas e atribua-o a um interlocutor dentro do prompt: A woman whispers, "We're not alone." O Veo sincroniza os lábios de forma muito eficiente com frases curtas; procure manter os diálogos abaixo de doze palavras por clipe.

Qual a duração máxima de um vídeo gerado pelo Veo 3.1?

Os clipes básicos duram de 4 a 8 segundos. Utilizando a extensão de vídeo (7 segundos extras por solicitação, até um máximo de 20 extensões conforme a documentação do Google), uma única sequência de geração pode atingir até 148 segundos em 720p.

Quanto custa para gerar um vídeo com o Veo 3.1?

No BananaBanana, os valores variam de $0.10 (um clipe silencioso de 4 segundos com o Veo 3.1 Lite em 720p) até $4.40 (um clipe de 8 segundos em resolução 4K com o Veo 3.1 e áudio). A opção padrão intermediária, que é um clipe de 8 segundos sem som no Fast, tem o custo de $0.70.

tutorialvideoveoprompts