返回博客
BananaBanana Teamnewsvideoomni-flashapi

Gemini Omni Flash API 深度测评:Preview 预览版究竟支持什么

Gemini Omni Flash API 实测:gemini-omni-flash-preview 实际支持哪些功能, 哪些依然是 Flow 独占,以及每条视频的真实生成成本。

Gemini Omni Flash API 深度测评:Preview 预览版究竟支持什么

Gemini Omni Flash 是 Google 首款能够输出视频的“任意到任意”(any-to-any)多模态模型:你发送文本、图像或先前的生成结果,它就会返回一段带有音效的 720p 短视频,并且你可以用自然语言继续描述修改要求。Google 于 2026 年 6 月 30 日将其与 Nano Banana 2 Lite 一起推向公开预览(Public Preview),API 模型 ID 为 gemini-omni-flash-preview

如果你只想了解核心结论:Gemini Omni Flash API 支持文生视频(text-to-video)、图生视频(image-to-video)、最多支持 10 张主体图像(可与首帧结合)的角色参考生视频(reference-to-video)、对话式编辑(conversational editing)以及对传入视频进行视频到视频编辑(video-to-video)。它不支持 1080p、随机种子(seeds)、负面提示词参数、视频延长(video extension)或关闭音频。虽然官方文档中未列出时长控制参数,但该字段实际存在且完全有效——详情见下文。如果你在 Google Flow 中看过 Omni Flash 的演示并期待 API 提供完全相同的工具链,可能会感到有些落差。我们在上线首周就将其集成到了我们的生成器中,因此本测评基于 Endpoint 的真实返回结果,而非宣传页面。

Gemini Omni Flash API 究竟能为你提供什么

API 通过 Interactions API(interactions.create)暴露 Omni Flash,而非 Veo 所使用的 generateVideos 端点。这一细节非常关键,因为 Interaction 是有状态的(stateful)。每个返回结果都包含一个 ID,方便后续引用。

根据 Google 的 Omni 官方文档 以及我们为期一周的实测,目前有 5 项任务可以正常运行:

  • Text-to-video(文生视频)。 输入提示词,输出带背景音效的 720p 视频。
  • Image-to-video(图生视频)。 你的图片作为起始帧,提示词用于描述动态。
  • Reference-to-video(参考生视频)。 主体图像可在新场景中保持角色或产品的一致性——单次请求最多支持 10 张,且与 Veo 不同的是,它们可以与起始帧结合使用。
  • Conversational editing(对话式编辑)。 传入 previous_interaction_id 和简短修改指令,模型即可在保持其余部分不变的情况下修改视频。
  • Video-to-video editing(视频到视频编辑)。 将真实视频作为内容传入并设置 task: "edit",即可返回重绘风格后的视频——无需交互 ID,因此适用于模型从未生成过的视频(包括 Veo 渲染剪辑或手机拍摄片段)。需要注意的是:输出时长始终与输入完全一致,且输入时长上限为 10 秒。

上面的视频直接来自 gemini-omni-flash-preview 并在我们的渲染管线中生成,因此你看到的是真实样例,而非宣传素材。使用了一条文本提示词:一纸帆船在洒落的墨水中漂流,加上 "single continuous scene" 防止模型进行剪辑分镜,以及一行 "Audio:" 要求纸张沙沙声和水波纹音效。我们指定生成满额的 10 秒。请开启声音,音效也是由 AI 同步生成的。

每段视频在 24 fps 下运行 3 到 10 秒。官方文档并未列出时长参数,上线初期我们以为时长全凭模型决定。后来发现请求格式暗中支持时长设置,且精度极高:请求 3 秒,实际输出 3.008 秒,按 3 秒计费。我们在生成器中开放了这一控制,因此卡卡点剪辑不再是凭运气的赌博。

提示词同时充当了 API 未公开的所有控制项的面板。如果不加干预,模型倾向于在多个镜头间切换,因此 "single unbroken shot, no cuts" 几乎成了每个提示词的标配;像 [0-3s] ... [3-6s] ... 这样的时间轴标记也能得到较好执行;用引号括起来的字符串会被惊人准确地渲染为字幕文本。

音频是第二个令人惊喜的地方。每次生成都附带声音:环境音、音效,如果要求甚至会有语音。但你无法关闭音频。唯一的控制方式是文本,因此我们在提示词末尾加上 "Audio: ...",效果相当不错。

Flow 有哪些 API 缺乏的功能?

Google Flow 是围绕多个模型封装的完整生产级工具,而这种封装恰恰是裸 API 所缺乏的。Flow 提供了用于多镜头序列的 Scene Builder(场景构建器)以及预设的镜头控制(镜头类型、角度、运镜)。关于分辨率有一个普遍误区:Flow 默认也是渲染 720p。1080p 和 4K 版本是在下载阶段对 Veo 渲染进行超分辨率导出的选项,而非不同的生成模式。这些工具在 gemini-omni-flash-preview 中统统不存在。

经过一周的对比测试,真实对比如下:

能力Flow / Gemini AppGemini Omni Flash API
分辨率720p 渲染;下载时提供 1080p / 4K 导出仅 720p, 24 fps
剪辑时长Scene Builder 拼接镜头3–10 秒,精确控制
运镜控制预设镜头类型、角度、运动仅靠文本提示词
视频延长支持(通过 Veo)不支持
编辑现有视频应用内 Remix对话式编辑,或对任意片段进行视频到视频编辑
音频开启,UI 提供控制选项始终开启,仅靠提示词控制
Seed / 负面提示词对用户隐藏不支持
每次请求生成数每次 1 条每次交互 1 条,无 sampleCount

官方文档对部分限制十分坦诚。Google 文档明确指出不支持视频延长和插帧,系统指令、Temperature 和负面提示词参数亦然(他们建议将负面要求写进常规提示词中,经验表明成功率大概只有一半)。API Schema 中列出了限制为 3 秒的视频参考,但文档承认模型目前尚无法正确处理它们。

因此,预览版 API 只是该模型在 Google 自有平台上完整能力的一个缩小集。对于 Preview 版本这很正常,但当客户要 1080p 导出而上限只有 720p 时,确实会有些尴尬。

对比完整导演控制台与小型遥控器的对比插图,隐喻 Flow 与 Omni Flash API 的功能差异

对话式编辑是真正出彩的核心功能

编辑是 Omni Flash 展现价值的舞台。生成一段片段后,你可以附带第一条结果的 previous_interaction_id 发送后续指令,比如“把夹克改成红色,放慢镜头”。模型就会重新构建视频,应用你的修改并保留绝大部分原始画面。无需重新上传、无需遮罩、无需时间轴。

Google Gemini Enterprise 文档提到,只要会话保持上下文,最多可以连续叠加 3 次编辑。在实际操作中,每次编辑都是一次全新的 720p 渲染,因此随着次数增加,一致性会略有漂移。人脸比指示牌上的文字能更好地保持一致。有时即使只要求微调颜色,复杂的运动轨迹也可能发生改变。

我们在生产环境中遇到的一个坑:父级 Interaction 会在 Google 侧过期。如果尝试编辑很久以前生成的剪辑,API 可能会针对引用的 Interaction 返回 404 错误。在 BananaBanana 上,我们将其显示为视频已过期并退还扣费,但如果你基于裸 API 开发,请务必提前规划好该逻辑。

对话气泡展示带有微小修改的同一视频帧的聊天对话,图解对话式视频编辑

Gemini Omni Flash 费用如何?

Google 的发布公告将 Omni Flash 的定价定为每秒输出视频 $0.10:3 秒结果花费 $0.30,10 秒结果花费 $1.00。

在 BananaBanana 上,我们直接透传该费率:每秒 $0.10,因此你可以选择 3 秒($0.30)或满额 10 秒($1.00),编辑与新渲染费率相同(且输出时长与源视频完全一致——模型无法拉伸或裁切)。同日上线的 Nano Banana 2 Lite 在我们这里的价格为每张图片 $0.03(Google 官方 API 费率为 1K 图像 $0.034)。完整价格表请见价格页面

每秒 10 美分划算吗?对于需要带音效且原本需要单独生成视频加后期配音草稿来说,答案是肯定的——而且 3 秒测试成本比 Veo 剪辑更便宜。对于无声空镜头(b-roll),答案是否定的。Veo 3.1 Fast 可以以更低的价格生成更高分辨率的无声剪辑。

你应该选择 Omni Flash 还是 Veo 3.1?

简而言之:它们分工明确,但并非简单的“草稿 vs 正式”界限。

选择前需要明确一点:它们之间的质量差距并不单单在于分辨率。Veo 3.1 在运动和物理规律的渲染上要逼真得多。水流自然,布料褶皱符合物理,物体之间是真实的碰撞而非穿模。Omni Flash 经常能做对,但不够稳定,在某些片段中你打眼一瞧就能发现异常。

当你需要真正的 4K 导出、精确的剪辑时长(按整秒设置,4 到 8 秒;没有小数秒)、无声输出、后续延长或同时控制首尾帧时,请选择 Veo 3.1。首尾帧功能被严重低估了:将同一张图片作为首帧和尾帧,就能得到无缝循环视频,这是制作循环背景视频的核心技巧。

当目标平台是手机屏幕时,请选择 Omni Flash。对于 TikTok、Shorts 或 Reels,720p 经过平台二次压缩后完全足够,音频在一次生成中直接搞定,对话式编辑也免去了不断重写提示词的麻烦。在短视频赛道,它不仅仅是草稿工具,更是更优的选择。

经过两天测试后我的个人工作流:对于横屏客户项目,我依然先在 Omni Flash 中快速打样概念(3 秒测试耗资 $0.30),然后用 Veo 以最终质量重做满意版本。而对于直接发布到社交媒体的竖屏剪辑,Omni 的输出常常可以直接交卷。

两架不同尺寸的摄影无人机在粉彩山谷上空并排飞行,象征 Omni Flash 与 Veo 3.1 之间的选择

这两个模型均已在 BananaBanana 生成器中上线,你可以使用相同的提示词直接对比它们,无需编写代码或配置 Google Cloud 项目。如果你想在一页中查看包含功能、限制和价格的简明版本,可以访问 Gemini Omni 专题页

常见问题 (FAQ)

什么是 gemini-omni-flash-preview?

这是 Gemini Omni Flash 的 API 模型 ID,它是 Google 于 2026 年 6 月 30 日公开预览发布的对话式视频生成模型。它通过 Interactions API 生成并编辑带音效的 720p、3–10 秒视频剪辑。

Gemini Omni Flash 能生成 1080p 或 4K 视频吗?

不能。API 仅能输出 24 fps 的 720p 视频。Google Flow 默认也渲染 720p;其 1080p 和 4K 版本是在 Veo 渲染的下载阶段提供的超分选项。如果你需要真正的高分辨率导出,请使用 Veo 3.1。

我可以在 Omni Flash API 中指定视频时长吗?

可以,尽管文档中未明确标注。响应格式支持设置时长,且结果精确到帧:输入 3 秒,输出 3.008 秒,按 3 秒计费。我们在生成器中将其作为 3–10 秒的选择器展示。编辑功能除外——编辑后的剪辑始终继承原视频的长度。

Omni Flash 总是会生成音频吗?

是的,每段剪辑都包含生成的背景音效,且没有关闭选项。可以直接在提示词中描述你想要的音频(或要求 "quiet ambient room tone")。

Omni Flash 能否延长或插帧现有的视频?

无法将视频变长:模型不支持延长(extension)和插帧(interpolation),Schema 中的 extend 任务也会返回“此模型不支持视频延长”。编辑是其替代功能——既可以对它生成的剪辑进行对话式编辑,也可以对你提供的任何成品视频(包括 Veo 渲染或自拍视频)进行视频到视频编辑。输出视频保持输入视频的长度。

newsvideoomni-flashapi