模型 · Google Gemini Omni Flash

Gemini Omni Flash — 自带声音的 AI 视频,每段统一 $1.00

Google 专为短视频设计的世界模型:每个片段都附带同步音频、物理感知的运动,以及对话式编辑功能 — 描述修改,场景即可重新生成。3–10 秒时长,720p 分辨率,支持 16:9 或 9:16 竖屏(适用于 Shorts 和 Reels)。每次生成统一收费 $1.00,支持加密货币支付。无需订阅。

在 BananaBanana 上生成的 Gemini Omni Flash 真实片段 — 一个文本提示,10 秒时长(模型自主选择),720p 分辨率,音频同时生成。统一收费 $1.00。请开启声音播放。
01工作原理

什么是 Gemini Omni Flash?

Gemini Omni Flash 是 Google Gemini Omni 系列的首个模型 — 一个能够像物理引擎一样推理场景,然后将其渲染成视频的世界模型。您只需发送文本、图像或之前的生成结果;它将返回一个3 到 10 秒的 720p 24 帧每秒短片,自带原生同步音频 — 环境音、音效,甚至语音 — 这些都与像素同步生成,而非后期添加。Google 于 2026 年 5 月将其应用于 Gemini 应用、Flow 和 YouTube Shorts,并于 2026 年 6 月 30 日开放了 API (gemini-omni-flash-preview)。在 BananaBanana 平台上,它与 Veo 3.1 系列同步投入生产使用:同样的定价策略,每次生成统一收费 $1.00,支持加密货币支付。

它为何专为 Shorts、Reels 和 TikTok 而生?

短视频需要三点:默认开启声音、逼真的运动和快速迭代。Omni Flash 完美满足这三点。音频始终开启 — 模型会根据场景内容决定其应有的声音。运动效果源于一个能推理场景的世界模型:糖浆倾泻、纸张漂浮、蒸汽上升,一切都如应有般自然 — 通常无需繁琐的提示词调试(对于最要求物理效果的镜头,Veo 3.1 仍是更稳妥的选择)。而且,您无需从零开始重新输入提示词,而是通过对话进行精修 — “让它变成黄昏”、“在窗户上加上雨水” — 模型会保持角色、光照和摄像机角度的一致性。生成 9:16 竖屏视频,即可无需裁剪直接用于 Shorts、Reels 或 TikTok。

一次 Omni Flash 9:16 竖屏生成 — 泰式炒河粉在街头煤气灶上的炒锅中翻炒,热气腾腾,滋滋声和市场环境音同步生成。统一收费 $1.00,无需裁剪即可用于 Shorts、Reels 或 TikTok。
02功能亮点

Gemini Omni Flash 的强大功能

始终同步的音频

每个视频片段都自带生成的声音 — 环境音、音效、语音。您可以在提示词中通过“Audio:”行来引导音频生成。

对话式编辑

描述修改,场景即可重新生成,同时保持角色、光照和摄像机角度一致。编辑可逐轮累积。

物理感知的世界模型

该模型像物理引擎一样推理场景 — 液体、烟雾和布料通常在初次尝试即可呈现逼真效果。

图像转视频

任何照片都可成为起始帧;提示词描述运动和音景。

主体参考图

最多 3 张参考图可帮助您在全新场景中保持角色或产品的一致性。

竖屏 9:16 或宽屏 16:9

每次生成时选择宽高比 — 竖屏输出专为 Shorts、Reels 和 TikTok 优化构图。

另一次 Omni Flash 单次生成 — 糖浆淋在煎饼上,包含声音(请打开声音:滴落声也已生成)。一个提示词,无需音频后期制作,统一收费 $1.00。
03局限性

坦诚相告:其局限之处

这些是 Google API 本身的限制,而非我们集成的问题 — 在您投入成本前至关重要。仅支持 720p:没有 1080p 或 4K 的切换选项;如果您需要更高分辨率,请使用 Veo 3.1。模型自主选择时长:没有时长参数,因此剪辑到音乐的片段可能需要几次尝试。无延长功能:与 Veo 不同,您无法将片段延长至 10 秒以上 — 对话式编辑会改变场景,但不会延长其时长。

预览版 API 还缺少以下功能:种子、负面提示词参数、提示词增强、每次请求多个样本,以及关闭音频。如果其中任何一项是您不可接受的限制,Veo 3.1 系列能够满足这些需求 — 同样的定价策略,同样的生成器。

04运作方式

从提示词到视频片段,分分钟搞定

  1. 免费注册

    只需邮箱和密码 — 无需信用卡,无需 Google 账户,免费赠送 $0.10 起始余额。

  2. 加密货币充值

    支持 USDT, USDC, BTC, ETH, SOL, TON 等多种加密货币,最低充值 $1。充值 $50 及以上赠送 5% 额外奖励,充值 $100 及以上赠送 10%。

  3. 生成视频,然后与其对话

    撰写提示词(添加“Audio:”行),选择 16:9 或 9:16,生成视频,费用 $1.00 — 然后通过描述修改进行精修。

05定价

统一价格,包含音频

Gemini Omni Flash 与 Veo 3.1 带音频视频片段的价格对比
模型每个片段价格时长分辨率音频
Gemini Omni Flash统一费率$1.003–10 秒 (模型自主选择)720p始终开启
Veo 3.1 Fast含音频$0.50–$1.004–8 秒 (您可选择)最高 4K可选
Veo 3.1含音频$1.50–$3.004–8 秒 (您可选择)最高 4K可选

Veo 价格显示为 720p/1080p;4K 分辨率费用另计。使用 Omni Flash 进行对话式编辑,每次都视为一次新的生成,费用统一为 $1.00。完整价目表请见定价页面。

完整定价页面上比较所有模型 — 或者在消费前阅读Gemini Omni Flash API 实测评测

06了解更多

来自博客的指南

07常见问题

关于 Gemini Omni Flash,您想知道的都在这里

什么是 Gemini Omni Flash?

Gemini Omni Flash 是 Google Gemini Omni 系列的首个模型 — 一个能将文本、图像或现有视频片段转换为带同步声音的短片(720p),音频同时生成。它于 2026 年 5 月面向消费者发布,并于 2026 年 6 月 30 日通过 gemini-omni-flash-preview 作为 API 提供。在 BananaBanana 平台上,它与 Veo 3.1 系列同步投入生产使用。

Gemini Omni Flash 视频如何收费?

在 BananaBanana 平台上,每次生成统一收费 $1.00,无论模型选择何种时长(3–10 秒)— 包含音频,无需订阅。对现有视频进行对话式编辑,每次都视为一次新的生成,费用统一为 $1.00。您可以通过加密货币充值,最低 $1,并按片段付费。

Gemini Omni Flash 会生成声音吗?

是的 — 始终如此。每个片段都自带原生同步音频:环境音、音效,甚至根据您的要求生成语音。您无法将其关闭;唯一的控制方式是通过文本提示,因此请在提示词中的“Audio:”行描述您期望的音景。

我能选择视频片段的时长或分辨率吗?

不能。API 没有时长参数 — 模型会根据提示词自主选择 3 到 10 秒的时长 — 输出仅限 720p 24 帧每秒。您可以选择宽高比:16:9 用于宽屏,或 9:16 竖屏用于 Shorts、Reels 和 TikTok。

对话式编辑如何运作?

生成一个视频片段后,描述您希望的修改 — “让它下雪”、“将马克杯换成玻璃杯” — Gemini Omni Flash 就会重新生成场景,同时保持角色、光照和摄像机角度一致。编辑可逐层叠加。每次编辑费用与 $1.00 相同。这取代了 Veo 风格的“延长”功能,Omni 不支持此功能。

我应该使用 Gemini Omni Flash 还是 Veo 3.1?

当声音表现至关重要,且格式为短竖屏或社交媒体视频时,请选择 Omni Flash:音频始终开启,物理效果逼真,并通过对话以统一 $1.00 的价格进行迭代。当您需要更多控制权时,请选择 Veo 3.1 — 例如精确的 4/6/7/8 秒时长、最高 4K 分辨率、可选音频、起始/结束帧以及最长 148 秒的扩展。

我需要 Google 账户或信用卡吗?

不需要。BananaBanana 仅接受加密货币支付 — USDT、USDC、BTC、ETH、SOL、TON 及其他主流币种,最低充值 $1。只需使用邮箱注册,充值,即可生成;未使用的余额永不过期。

制作您的第一个带音频视频

Gemini Omni Flash — 每个片段统一 $1.00,自带常驻音频;Veo 3.1 起价 $0.10。按需使用加密货币支付,无需订阅,免费赠送 $0.10 起始余额。