始终同步的音频
每个视频片段都自带生成的声音 — 环境音、音效、语音。您可以在提示词中通过“Audio:”行来引导音频生成。
模型 · Google Gemini Omni Flash
Google 专为短视频设计的世界模型:每个片段都附带同步音频、物理感知的运动,以及对话式编辑功能 — 描述修改,场景即可重新生成。3–10 秒时长,720p 分辨率,支持 16:9 或 9:16 竖屏(适用于 Shorts 和 Reels)。每次生成统一收费 $1.00,支持加密货币支付。无需订阅。
Gemini Omni Flash 是 Google Gemini Omni 系列的首个模型 — 一个能够像物理引擎一样推理场景,然后将其渲染成视频的世界模型。您只需发送文本、图像或之前的生成结果;它将返回一个3 到 10 秒的 720p 24 帧每秒短片,自带原生同步音频 — 环境音、音效,甚至语音 — 这些都与像素同步生成,而非后期添加。Google 于 2026 年 5 月将其应用于 Gemini 应用、Flow 和 YouTube Shorts,并于 2026 年 6 月 30 日开放了 API (gemini-omni-flash-preview)。在 BananaBanana 平台上,它与 Veo 3.1 系列同步投入生产使用:同样的定价策略,每次生成统一收费 $1.00,支持加密货币支付。
短视频需要三点:默认开启声音、逼真的运动和快速迭代。Omni Flash 完美满足这三点。音频始终开启 — 模型会根据场景内容决定其应有的声音。运动效果源于一个能推理场景的世界模型:糖浆倾泻、纸张漂浮、蒸汽上升,一切都如应有般自然 — 通常无需繁琐的提示词调试(对于最要求物理效果的镜头,Veo 3.1 仍是更稳妥的选择)。而且,您无需从零开始重新输入提示词,而是通过对话进行精修 — “让它变成黄昏”、“在窗户上加上雨水” — 模型会保持角色、光照和摄像机角度的一致性。生成 9:16 竖屏视频,即可无需裁剪直接用于 Shorts、Reels 或 TikTok。
每个视频片段都自带生成的声音 — 环境音、音效、语音。您可以在提示词中通过“Audio:”行来引导音频生成。
描述修改,场景即可重新生成,同时保持角色、光照和摄像机角度一致。编辑可逐轮累积。
该模型像物理引擎一样推理场景 — 液体、烟雾和布料通常在初次尝试即可呈现逼真效果。
任何照片都可成为起始帧;提示词描述运动和音景。
最多 3 张参考图可帮助您在全新场景中保持角色或产品的一致性。
每次生成时选择宽高比 — 竖屏输出专为 Shorts、Reels 和 TikTok 优化构图。
这些是 Google API 本身的限制,而非我们集成的问题 — 在您投入成本前至关重要。仅支持 720p:没有 1080p 或 4K 的切换选项;如果您需要更高分辨率,请使用 Veo 3.1。模型自主选择时长:没有时长参数,因此剪辑到音乐的片段可能需要几次尝试。无延长功能:与 Veo 不同,您无法将片段延长至 10 秒以上 — 对话式编辑会改变场景,但不会延长其时长。
预览版 API 还缺少以下功能:种子、负面提示词参数、提示词增强、每次请求多个样本,以及关闭音频。如果其中任何一项是您不可接受的限制,Veo 3.1 系列能够满足这些需求 — 同样的定价策略,同样的生成器。
只需邮箱和密码 — 无需信用卡,无需 Google 账户,免费赠送 $0.10 起始余额。
支持 USDT, USDC, BTC, ETH, SOL, TON 等多种加密货币,最低充值 $1。充值 $50 及以上赠送 5% 额外奖励,充值 $100 及以上赠送 10%。
撰写提示词(添加“Audio:”行),选择 16:9 或 9:16,生成视频,费用 $1.00 — 然后通过描述修改进行精修。
| 模型 | 每个片段价格 | 时长 | 分辨率 | 音频 |
|---|---|---|---|---|
| Gemini Omni Flash统一费率 | $1.00 | 3–10 秒 (模型自主选择) | 720p | 始终开启 |
| Veo 3.1 Fast含音频 | $0.50–$1.00 | 4–8 秒 (您可选择) | 最高 4K | 可选 |
| Veo 3.1含音频 | $1.50–$3.00 | 4–8 秒 (您可选择) | 最高 4K | 可选 |
Veo 价格显示为 720p/1080p;4K 分辨率费用另计。使用 Omni Flash 进行对话式编辑,每次都视为一次新的生成,费用统一为 $1.00。完整价目表请见定价页面。
在完整定价页面上比较所有模型 — 或者在消费前阅读Gemini Omni Flash API 实测评测。
Gemini Omni Flash 是 Google Gemini Omni 系列的首个模型 — 一个能将文本、图像或现有视频片段转换为带同步声音的短片(720p),音频同时生成。它于 2026 年 5 月面向消费者发布,并于 2026 年 6 月 30 日通过 gemini-omni-flash-preview 作为 API 提供。在 BananaBanana 平台上,它与 Veo 3.1 系列同步投入生产使用。
在 BananaBanana 平台上,每次生成统一收费 $1.00,无论模型选择何种时长(3–10 秒)— 包含音频,无需订阅。对现有视频进行对话式编辑,每次都视为一次新的生成,费用统一为 $1.00。您可以通过加密货币充值,最低 $1,并按片段付费。
是的 — 始终如此。每个片段都自带原生同步音频:环境音、音效,甚至根据您的要求生成语音。您无法将其关闭;唯一的控制方式是通过文本提示,因此请在提示词中的“Audio:”行描述您期望的音景。
不能。API 没有时长参数 — 模型会根据提示词自主选择 3 到 10 秒的时长 — 输出仅限 720p 24 帧每秒。您可以选择宽高比:16:9 用于宽屏,或 9:16 竖屏用于 Shorts、Reels 和 TikTok。
生成一个视频片段后,描述您希望的修改 — “让它下雪”、“将马克杯换成玻璃杯” — Gemini Omni Flash 就会重新生成场景,同时保持角色、光照和摄像机角度一致。编辑可逐层叠加。每次编辑费用与 $1.00 相同。这取代了 Veo 风格的“延长”功能,Omni 不支持此功能。
当声音表现至关重要,且格式为短竖屏或社交媒体视频时,请选择 Omni Flash:音频始终开启,物理效果逼真,并通过对话以统一 $1.00 的价格进行迭代。当您需要更多控制权时,请选择 Veo 3.1 — 例如精确的 4/6/7/8 秒时长、最高 4K 分辨率、可选音频、起始/结束帧以及最长 148 秒的扩展。
不需要。BananaBanana 仅接受加密货币支付 — USDT、USDC、BTC、ETH、SOL、TON 及其他主流币种,最低充值 $1。只需使用邮箱注册,充值,即可生成;未使用的余额永不过期。