Voltar ao blog
BananaBanana Teamtutorialvideoimage-to-video

IA de imagem para vídeo: Dê vida a qualquer foto

IA de imagem para vídeo: veja como funciona, qual modelo escolher (Veo 3.1 vs Omni Flash), preços reais desde $0.10, prompts de movimento e loops de até 148s.

IA de imagem para vídeo: Dê vida a qualquer foto

A IA de imagem para vídeo é uma técnica de geração em que o modelo recebe uma foto estática, trata ela como o primeiro frame do clipe e inventa tudo o que vem a seguir: movimentos, ângulo de câmera, mudanças de iluminação e até som. Você só precisa enviar uma foto e descrever em texto o que deve se mover. O modelo devolve um vídeo curto, geralmente de 4 a 10 segundos, dando vida à sua imagem exatamente como ela é.

Se você quer ir direto ao ponto: envie uma foto no gerador BananaBanana, descreva o movimento e espere de 2–5 minutos. Um clipe silencioso de 4 segundos começa em $0.10 com o Veo 3.1 Lite (com som vai para $0.18), e o Gemini Omni Flash anima uma foto com trilha sonora completa a partir de $0.30 (ele cobra $0.10 por segundo). Contas novas ganham $0.20 grátis, o que cobre dois clipes de teste silenciosos.

Como rodamos quatro modelos de vídeo em produção, este guia foi feito com base em logs reais de geração, e não em páginas de marketing. Incluindo as falhas. E olha que algumas delas ensinam muito mais do que os acertos.

Como funciona a IA de imagem para vídeo?

Nos bastidores, a imagem estática é enviada ao modelo como um frame condicionador. A documentação de vídeo da API Gemini do Google explica que o Veo 3.1 suporta "direcionamento baseado em imagem" e "geração focada em frames". Em bom português: a sua foto dita o rumo de todo o clipe, e dá para fixar frames exatos onde você quiser. O modelo analisa a cena, deduz as leis da física (como a água na foto deve ondular ou como o cabelo balançaria com o vento) e renderiza frame por frame a partir do ponto inicial.

Na prática, o primeiro frame do vídeo gerado é a sua foto quase pixel por pixel. Todo o restante é pura imaginação da IA. Os melhores prompts focam em descrever o que deve ser criado, em vez de repetir o que o modelo já está vendo.

Isso funciona surpreendentemente bem em cenas com movimento implícito. Um retrato ganha respiração e piscadas de olho. O vapor sobe do café. Um carro estacionado arranca. Já para fotos sem nenhuma pista de movimento, o resultado não é tão empolgante: se você enviar a imagem estática de um produto sobre fundo branco sem indicar nenhum movimento no prompt, o modelo provavelmente vai entregar um zoom lento e meio hesitante. Não chega a ser um erro, mas fica bem sem graça.

Uma fotografia antiga segurada por duas mãos enquanto a cena dentro dela começa a ondular e se mover, ilustrando a animação de IA de imagem para vídeo

Qual modelo transforma melhor uma foto em vídeo?

Todos os quatro modelos de vídeo da plataforma aceitam uma imagem como frame inicial. As diferenças ficam por conta dos limites técnicos e do custo de geração.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
Preço (4s, sem som)$0.70$0.35$0.10
Preço (4s, com som)$1.50$0.50$0.18$0.40 ($0.10 por segundo)
Resolução máxima4K4K1080papenas 720p
Duraçãoexatos 4/6/7/8 sexatos 4/6/7/8 sexatos 4/6/7/8 sexatos 3–10 s
Áudioseletor opcionalseletor opcionalseletor opcionalsempre ativo
Último frame + loopssimsimsimnão
Estender até 148 ssimsimnãonão, apenas edição conversacional

Minha escolha padrão é o Veo 3.1 Fast. Ele mantém os controles essenciais (duração exata, último frame opcional, extensão) pela metade do preço do modelo topo de linha, e a diferença de qualidade para o Veo 3.1 completo quase não aparece em posts para redes sociais. O Lite de $0.10 é onde eu testo se uma ideia realmente se move antes de investir dinheiro de verdade. O Veo 3.1 completo vale o investimento se o clipe envolver água, tecidos, colisões, ou se o formato de entrega exigir 4K. Já o Omni Flash é a pedida ideal quando o som importa tanto quanto a imagem; nós analisamos ele a fundo em um review da API Omni Flash separado caso queira os detalhes, inclusive sobre o limite de 720p que, para ser sincero, incomoda bastante em tela cheia.

O clipe acima é uma geração do Veo 3.1 Fast direto do nosso pipeline de produção, feito exclusivamente para este artigo: uma fotografia emoldurada de um veleiro sobre uma mesa, onde o prompt pede para o mar dentro do quadro começar a se mover enquanto a câmera se aproxima lentamente. Sem edições, gerado de primeira e silencioso por escolha (a versão sem som do Fast é perfeita para rascunhos). Esse efeito de "foto ganhando vida" é basicamente o que o modelo faz com as suas próprias imagens.

Como gerar vídeo a partir de uma foto: passo a passo

Todo o processo no gerador leva cerca de um minuto do seu tempo, mais o período de renderização.

  1. Mude o gerador para o modo de vídeo e escolha um modelo. Para começar, o Veo 3.1 Lite a $0.10 é a forma mais barata de aprender.
  2. Envie sua foto como o primeiro frame. Ela precisa ser JPG ou PNG, e será cortada na proporção do vídeo. Verifique as bordas antes de gerar.
  3. Escolha entre 16:9 ou 9:16. O formato vertical funciona super bem para o TikTok e Reels; o modelo lida perfeitamente com o enquadramento em retrato.
  4. Escreva o prompt de movimento (veja a próxima seção) e, se quiser, use um prompt negativo de até 1.000 caracteres para listar o que deseja evitar.
  5. Escolha a duração e se quer áudio. Nos modelos Veo, esses ajustes são exatos; no Omni Flash, você escolhe qualquer duração de 3 a 10 segundos e o áudio está sempre ativo.
  6. Clique em gerar. Os vídeos demoram de 2–5 minutos para ficarem prontos. Você pode fechar a aba; os resultados ficam salvos no seu histórico por 30 dias.

O saldo só é debitado se a geração der certo. Renderizações que falharem são reembolsadas na hora, o que é fundamental em vídeo, já que você vai precisar fazer vários testes.

Um storyboard de três painéis mostrando uma mão enviando uma foto, um painel de configurações e um player de vídeo finalizado, ilustrando o fluxo de trabalho de imagem para vídeo

Como escrever prompts de movimento para imagem em vídeo?

Regra número um: descreva o movimento, não o cenário. O cenário já está na foto. "A woman in a red coat stands on a bridge" desperdiça o prompt com fatos que o modelo já tem. "She turns toward the camera and smiles as wind lifts her hair, slow dolly-in" tem o mesmo tamanho e foca 100% no que importa.

Termos de câmera funcionam muito bem no Veo. Dolly in, orbit, handheld, static tripod shot, slow pan left. Os modelos foram claramente treinados com descrições técnicas de filmagem e reagem melhor ao vocabulário de cinema do que a frases genéricas como "deixe dinâmico". Eu recomendo passar longe de termos como "dinâmico". Ninguém sabe exatamente o que isso significa, muito menos o modelo.

Uma lição que aprendemos do jeito mais caro enquanto produzíamos os clipes de demonstração para este blog: esses modelos mantêm o que já está acontecendo no primeiro frame e simplesmente ignoram ações programadas para começar depois. Uma vez pedimos ao Omni Flash para virar uma panqueca "no meio do clipe" e o que recebemos foram dez segundos de uma panqueca totalmente imóvel. Três vezes seguidas, um dólar por tentativa. Reescrever a ação como se já estivesse em andamento resolveu logo na primeira. Por isso: "syrup is pouring onto the stack" funciona muito melhor do que "syrup starts pouring after two seconds". Para geração de imagem para vídeo, prefira fotos iniciais onde o movimento desejado já pareça plausível.

Alguns padrões que sempre trazem bons resultados:

  • Retratos: "subtle breathing, a slow blink, then a small smile; camera locked" dá um aspecto vivo à cena sem as distorções bizarras causadas por movimentos bruscos.
  • Produtos: "slow 180-degree orbit around the object, studio lighting stays constant" é a nossa fórmula favorita. Lembre-se de manter o fundo da foto original o mais simples possível.
  • Paisagens: liste os elementos em movimento ("clouds drift right, grass sways, light shifts warmer") ou você acabará caindo naquele zoom lento e hesitante.

Uma claquete de cinema ao lado de notas de prompt escritas à mão com setas esboçando movimentos de câmera sobre uma fotografia, ilustrando a escrita de prompts de movimento

Loops, últimos frames e vídeos de 148 segundos

Os modelos Veo 3.1 aceitam um último frame opcional além do primeiro. Se você enviar duas fotos diferentes, ele renderiza uma transição entre elas — excelente para transformar uma cena diurna em noturna ou um rascunho em um produto finalizado. Enviando a mesma foto para o início e o fim, o resultado é um clipe que termina exatamente onde começou: um loop perfeito, pronto para fundos de sites ou posts no estilo cinemagraph. Essa é a minha função favorita (e menos aproveitada) da plataforma.

A extensão é o outro truque do Veo. Um clipe pronto pode ser prolongado por mais 7 segundos com um novo prompt, e essa sequência pode chegar a até 148 segundos no total com continuidade visual completa (apenas no Veo 3.1 e Fast; o Lite e o Omni Flash ficam de fora dessa). Criar uma longa sequência a partir de uma foto autoral é o mais próximo que as APIs atuais chegam de um cinema sem storyboard. Mas atenção: o custo acumula rápido, então faça as contas antes de se apaixonar pela ideia.

O Omni Flash substitui a extensão pela edição: descreva uma mudança no clipe finalizado ("make it dusk, keep everything else the same") e pague novamente pelos segundos — ele também aceita vídeos que não gerou, incluindo os seus próprios uploads, e os retorna com a mesma duração. Uma filosofia diferente. A edição refina um momento; a extensão aumenta uma linha do tempo.

Um rolo de filme curvado em um círculo perfeito sobre um fundo pastel, ilustrando um vídeo em loop de IA que termina exatamente onde começou

FAQ

Consigo transformar uma foto em vídeo de graça?

Quase. Ao criar uma nova conta na BananaBanana, você ganha $0.20 de saldo sem precisar cadastrar cartão, o que cobre dois clipes silenciosos de 4 segundos no Veo 3.1 Lite usando sua foto. Depois disso, você paga por clipe, a partir de $0.10.

Qual é a opção de API mais barata de imagem para vídeo?

Na BananaBanana é o Veo 3.1 Lite: $0.10 para um clipe silencioso de 4 segundos em 720p, e $0.18 com áudio. Esse valor é cobrado apenas por geração bem-sucedida, com reembolsos automáticos em caso de erro, sem taxas de assinatura ou necessidade de configurar o Google Cloud.

O vídeo gerado pode ter som?

Sim. Os modelos Veo 3.1 vêm com um seletor de áudio (diálogos, efeitos e som ambiente descritos no seu prompt), e o Gemini Omni Flash sempre gera áudio, incluso no seu preço de $0.10 por segundo.

Consigo animar uma foto vertical para o TikTok ou Reels?

Sim, todos os quatro modelos suportam a proporção 9:16. Basta enviar a foto, selecionar 9:16 e lembrar que a imagem original será cortada nesse formato, então deixe um espaço extra no topo da foto original.

Qual a duração máxima de um vídeo gerado por IA a partir de uma foto?

Cada clipe individual dura de 4–8 segundos nos modelos Veo (3–10 segundos, sua escolha, no Omni Flash), mas... os clipes do Veo 3.1 e Veo 3.1 Fast podem ser estendidos em intervalos de 7 segundos até atingirem 148 segundos no total, mantendo a continuidade visual da sua foto original.

tutorialvideoimage-to-video