Análise da API do Gemini Omni Flash: O que a versão prévia realmente oferece
Análise prática da API do Gemini Omni Flash: o que o gemini-omni-flash-preview realmente suporta, o que permanece exclusivo do Flow e custos reais por clipe.

O Gemini Omni Flash é o primeiro modelo multimodal "any-to-any" do Google que gera vídeo: você envia texto, imagens ou um resultado anterior e ele retorna um curto clipe em 720p com som que você pode continuar editando descrevendo as alterações em linguagem natural. O Google lançou o modelo em prévia pública em 30 de junho de 2026, junto com o Nano Banana 2 Lite, e o ID do modelo na API é gemini-omni-flash-preview.
Resposta rápida, se você veio apenas por uma informação: a API do Gemini Omni Flash suporta text-to-video, image-to-video, reference-to-video com até dez imagens de objeto (que se combinam com um quadro inicial), edição conversacional e edição vídeo-para-vídeo de um clipe fornecido. Não suporta 1080p, seeds, parâmetros de prompt negativo, extensão de vídeo ou desligar o áudio. O controle de duração também não está na documentação, mas o campo existe e funciona — mais sobre isso abaixo. Se você viu as demonstrações do Omni Flash no Google Flow e esperava o mesmo conjunto de ferramentas da API, ficará decepcionado. Nós o integramos ao nosso gerador durante a semana de lançamento, portanto esta análise é baseada no que o endpoint realmente retorna, não na página de marketing.
O que a API do Gemini Omni Flash realmente entrega
A API expõe o Omni Flash por meio da Interactions API (interactions.create), não pelo endpoint generateVideos que o Veo usa. Esse detalhe importa porque as interações mantêm estado (stateful). Cada resposta possui um id ao qual você pode se referir mais tarde.
De acordo com a documentação do Omni do Google, além de uma semana testando o endpoint, cinco tarefas funcionam hoje:
- Text-to-video. Um prompt entra, um clipe em 720p sai, com trilha sonora incluída.
- Image-to-video. Sua imagem torna-se o quadro de abertura e o prompt descreve o movimento.
- Reference-to-video. Imagens de objeto mantêm um personagem ou produto consistente em uma nova cena — a requisição aceita até dez delas e, ao contrário do Veo, elas podem ser combinadas com um quadro inicial.
- Edição conversacional. Passe o
previous_interaction_ide uma instrução curta, e o modelo altera o clipe mantendo o restante intacto. - Edição vídeo-para-vídeo. Envie um vídeo real como conteúdo com
task: "edit"e ele retorna reestilizado — sem necessidade de ID de interação, então funciona em clipes que o modelo nunca criou (incluindo renderizações do Veo e gravações de celular). A pegadinha: o resultado tem sempre exatamente a mesma duração da entrada, e a entrada é limitada a 10 segundos.
O clipe acima veio diretamente do gemini-omni-flash-preview por meio do nosso próprio pipeline, então você está vendo uma amostra real, não um material promocional. Um único prompt de texto: um barco de papel à deriva em tinta derramada, "single continuous scene" para evitar cortes de montagem do modelo, e uma linha "Audio:" pedindo ruído de papel e marolas. Pedimos os 10 segundos completos. Ligue o som; o áudio também é gerado.
Cada clipe dura de 3 a 10 segundos a 24 fps. A documentação não lista nenhum parâmetro de duração e, no lançamento, presumimos que o modelo decidia sozinho. Acontece que o formato de requisição aceita discretamente uma duração e ela é exata: peça 3 segundos e você recebe 3.008 deles, cobrados por três. É isso que expomos no gerador, então editar no ritmo da música não é mais uma loteria.
O prompt funciona também como painel de controle para tudo o que a API não expõe. Deixado sozinho, o modelo tende a cortar entre várias tomadas, por isso "single unbroken shot, no cuts" ganhou seu lugar na maioria dos prompts; intervalos de código de tempo como [0-3s] ... [3-6s] ... são respeitados; e textos entre aspas são renderizados na tela com precisão impressionante. Nosso gerador oferece isso em botões de um clique.
O áudio é a segunda surpresa, e muito agradável. Cada geração vem com som: ruído ambiente, efeitos, às vezes fala se você pedir. Você não pode desligá-lo, no entanto. O único controle que você tem é texto, então acabamos adicionando uma linha "Audio: ..." aos prompts e funciona razoavelmente bem.
O que o Flow tem que a API não tem?
O Google Flow é uma ferramenta de produção completa construída em torno de vários modelos, e essa interface é exatamente o que falta na API bruta. O Flow oferece um Scene Builder para sequências multitomada e controles de câmera pré-configurados (tipo de plano, ângulo, movimento). Um detalhe sobre resolução: o Flow renderiza em 720p por padrão também. As versões em 1080p e 4K aparecem na etapa de download, como uma opção de exportação sobre a renderização do Veo, não como um modo de geração diferente. Nenhuma dessas ferramentas existe no gemini-omni-flash-preview.
Aqui está a comparação honesta após uma semana testando ambos:
| Capacidade | Flow / app Gemini | API do Gemini Omni Flash |
|---|---|---|
| Resolução | Renderização em 720p; 1080p / 4K no download | Apenas 720p, 24 fps |
| Duração do clipe | Scene Builder encadeia tomadas | 3–10 s, exata |
| Controles de câmera | Tipos de plano, ângulos e movimento pré-definidos | Apenas prompt de texto |
| Estender um vídeo | Sim (via Veo) | Não suportado |
| Editar um vídeo existente | Remix no aplicativo | Conversacional ou vídeo-para-vídeo em qualquer clipe |
| Áudio | Ativado, com controles de interface | Sempre ativado, controle apenas por prompt |
| Seed / prompt negativo | Oculto do usuário de qualquer forma | Não suportado |
| Clipes por requisição | Um por vez | Um por interação, sem sampleCount |
A documentação é transparente sobre parte disso. Os docs do Google afirmam que a extensão e interpolação de vídeo "não são suportadas", e o mesmo se aplica a instruções do sistema, temperatura e parâmetros de prompt negativo (sugerem escrever negativas no prompt comum, o que na minha experiência funciona metade das vezes). Referências de vídeo estão listadas no schema da API com limite de 3 segundos, mas os docs admitem que o modelo ainda não as processa corretamente.
Portanto, a API em versão prévia é uma fatia estreita do que o modelo pode fazer nas plataformas do próprio Google. Isso é normal para uma prévia. Ainda assim incomoda quando um cliente pede uma exportação em 1080p e o limite é 720p.

A edição conversacional é o recurso que realmente cumpre o que promete
A edição é onde o Omni Flash se destaca. Você gera um clipe, analisa e envia um ajuste como "faça a jaqueta ficar vermelha e desacelere a câmera" com o previous_interaction_id do primeiro resultado. O modelo reativa o vídeo aplicando sua alteração e preservando a maior parte do original. Sem reenvio de arquivos, sem máscaras, sem linha do tempo.
A documentação do Gemini Enterprise do Google diz que você pode encadear até três edições sequenciais enquanto a sessão mantiver o contexto. Na prática, cada edição é uma nova renderização em 720p, então a consistência oscila um pouco a cada passo. Rostos resistem melhor do que textos em placas. Movimentos complexos às vezes mudam mesmo quando você só pediu uma alteração de cor.
Um contratempo que enfrentamos em produção: as interações pai expiram no lado do Google. Se tentar editar um clipe gerado há algum tempo, a API pode retornar um erro 404 para a interação referenciada. No BananaBanana, exibimos isso como vídeo expirado e reembolsamos a tentativa, mas se desenvolver na API bruta, planeje essa lógica.

Quanto custa o Gemini Omni Flash?
O anúncio de lançamento do Google fixa o preço do Omni Flash em $0.10 por segundo de vídeo gerado: um resultado de 3 segundos custa $0.30 e um de 10 segundos custa $1.00.
No BananaBanana repassamos essa taxa diretamente: $0.10 por segundo, então você escolhe 3 segundos por $0.30 ou os dez segundos completos por $1.00, e uma edição custa a mesma taxa porque é uma renderização completa (ela também retorna com a mesma duração da fonte — o modelo não pode esticar ou cortar). O Nano Banana 2 Lite, lançado no mesmo dia, custa $0.03 por imagem aqui (a taxa da API do Google é $0.034 para uma imagem em 1K). A lista de preços completa está na seção de preços.
Dez centavos por segundo vale a pena? Para um rascunho com som que de outra forma exigiria uma etapa de geração de vídeo mais trabalho de áudio separado, provavelmente sim — e um teste de 3 segundos custa menos do que um clipe do Veo. Para b-roll silencioso, não. O Veo 3.1 Fast produz clipes silenciosos mais baratos em resolução mais alta.
Você deve usar o Omni Flash ou o Veo 3.1?
Resumo: eles dividem o trabalho, mas não ao longo da linha "rascunho vs final" que você poderia esperar.
Uma coisa a saber antes de escolher: a diferença de qualidade entre eles não é apenas sobre resolução. O Veo 3.1 renderiza movimento e física de forma muito mais convincente. A água se comporta naturalmente, tecidos se dobram onde deveriam, objetos colidem em vez de atravessarem uns aos outros como fantasmas. O Omni Flash acerta com frequência, mas não de forma constante, e em alguns clipes você notará isso sem procurar.
Escolha o Veo 3.1 quando precisar de uma exportação real em 4K, duração exata do clipe (você define segundos inteiros, de 4 a 8; frações não existem), saída silenciosa, extensão posterior ou controle sobre o primeiro e o último quadros. Este último par é subestimado: forneça a mesma imagem como primeiro e último quadros e você terá um loop perfeito, que é todo o truque por trás de vídeos de fundo em loop. É a ferramenta de produção para qualquer projeto widescreen ou com muita física.
Escolha o Omni Flash quando o destino for a tela de um celular. Para TikTok, Shorts ou Reels, 720p é sinceramente tudo o que a plataforma preserva após sua própria compressão, o som vem integrado na mesma etapa e a edição conversacional supera reescrever prompts do zero enquanto você busca a ideia. Nessa categoria, não é a ferramenta de rascunho: é simplesmente a melhor escolha.
Meu fluxo de trabalho pessoal após dois dias de testes: para trabalhos widescreen de clientes, ainda rascunho o conceito no Omni Flash — tomadas de três segundos a $0.30 — e refaço a versão escolhida no Veo em qualidade final. Para um clipe vertical que vai direto para as redes sociais, a tomada do Omni frequentemente vai ao ar exatamente como saiu.

Ambos os modelos estão disponíveis no gerador do BananaBanana, para que você possa compará-los com o mesmo prompt sem escrever código ou configurar um projeto no Google Cloud. E se você quiser a versão condensada desta análise — capacidades, limites e preços em uma só página —, ela está na página do Gemini Omni.
FAQ
O que é gemini-omni-flash-preview?
É o ID do modelo na API para o Gemini Omni Flash, o modelo conversacional de geração de vídeo do Google lançado em prévia pública em 30 de junho de 2026. Ele gera e edita clipes em 720p de 3 a 10 segundos com áudio por meio da Interactions API.
O Gemini Omni Flash pode gerar vídeos em 1080p ou 4K?
Não. A API gera apenas em 720p a 24 fps. O Google Flow renderiza em 720p por padrão também; suas versões em 1080p e 4K são oferecidas na etapa de download nos renderizados do Veo. Se você precisar de uma exportação em alta resolução real, use o Veo 3.1.
Posso definir a duração do vídeo na API do Omni Flash?
Sim, embora você não encontre isso na documentação. O formato de resposta aceita uma duração e o resultado corresponde ao quadro: 3 segundos solicitados, 3.008 segundos gerados, cobrados por três. Exibimos isso como um seletor de 3 a 10 segundos no gerador. A exceção é a edição — um clipe editado sempre herda a duração do vídeo do qual foi feito.
O Omni Flash sempre gera áudio?
Sim, cada clipe inclui uma trilha sonora gerada e não há parâmetro para desativá-la. Descreva o áudio desejado (ou peça "quiet ambient room tone") diretamente no prompt.
O Omni Flash pode estender ou interpolar vídeos existentes?
Ele não pode torná-los mais longos: extensão e interpolação não são suportadas, e a tarefa extend no schema responde "this model does not support video extension". A edição é o que ele faz em seu lugar — seja de forma conversacional, em um clipe gerado por ele, ou vídeo-para-vídeo em qualquer vídeo terminado que você fornecer, incluindo um render do Veo ou sua própria gravação. O resultado mantém a duração da entrada.