首帧保真
剪辑从您的精确图像开始——构图、面部和产品保持不变。
工具 · 图像转视频
上传一张静态图片,描述所需动作,即可获得一段视频——以您精确的构图作为首帧。Veo 3.1 支持高达 4K 的控制,Gemini Omni Flash 提供带声音的即时剪辑。每段视频低至 $0.10,支持加密货币支付,无需订阅。

图像转视频生成将您的照片视为剪辑的第一帧。您上传图片,撰写一个简短的动作描述——例如“缓慢推入,杯中冒出蒸汽,温暖的晨光”——然后模型会合成接下来的几秒钟素材,确保第一帧与您上传的图像像素完全一致。由于视频是基于您的实际图像而非文字描述生成的,因此面部、产品、无标志包装和构图在转换后都能保持原样。在 BananaBanana 上,您可以使用四种模型进行动画制作:Veo 3.1 和 Veo 3.1 Fast(支持高达 4K,可选原生音频、末帧、延长),用于制作廉价草稿的 Veo 3.1 Lite,以及 Gemini Omni Flash——Google 的世界模型,它会自动选择 3-10 秒的时长,始终添加声音,并允许您之后通过对话方式编辑结果。
主要用例包括:产品横幅——一张静态的产品图片可以变成一个六秒钟的循环,带有漂移的光线和旋转的产品,适用于市场和广告;社交内容——将肖像和旅行照片制作成 9:16 比例的 Reels 和 Shorts 动画;动态照片(cinemagraphs)——将末帧设置为与首帧相同,只让烟雾、水或头发动起来;以及故事讲述——使用面部参考生成角色静态图像,然后制作动画,接着将 Extend 操作链接成一个具有完整连续性的 148 秒序列。团队可以使用 Veo 3.1 Lite 以 $0.10 的价格制作草稿,然后使用 Veo 3.1 在 4K 分辨率下带音频重新渲染最终版本。一个完成的营销剪辑通常价格在一到五美元之间——按剪辑收费,而非按席位收费。
剪辑从您的精确图像开始——构图、面部和产品保持不变。
添加可选的最后一帧以实现受控过渡,或循环回第一帧以制作动态照片。
Veo 3.1 可按需添加环境音、效果和对话;Omni Flash 会自动为每个剪辑配乐。
横屏用于 YouTube 和网页,竖屏用于 Reels、Shorts 和 TikTok——Veo 3.1 和 Fast 支持高达 4K。
以完整的视觉连续性连接剪辑——从一张起始照片生成长篇序列。
在 Omni Flash 上,描述一个变化——例如“让它下雨”——剪辑就会在保留场景的同时重新生成。
任何高达 4K 的清晰图像——肖像、产品照、风景或插画。它将成为第一帧。
相机移动、主体动作、氛围、声音。可选地添加末帧以进行过渡或循环。
选择模型和时长,渲染,如果需要更多秒数则延长,然后下载 MP4。
| 模型 | 4 s | 6 s | 8 s | 带音频 · 8 秒 |
|---|---|---|---|---|
| Veo 3.1 Lite草稿,高达 1080p | $0.10 | $0.15 | $0.20 | $0.36 |
| Veo 3.1 Fast生产速度 | $0.35 | $0.52 | $0.70 | $1.00 |
| Veo 3.1最高保真度 | $0.70 | $1.05 | $1.40 | $3.00 |
| Gemini Omni Flash固定价格,始终带声音 | — | — | — | $1.00 固定价格 |
Veo 3.1 Fast 上 4K 渲染:$1.10 无声 / $1.30 带音频。完整价格表请参见定价页面。
在Veo 3.1 页面上比较所有视频模型,或在定价页面上查看所有价格。
将照片作为第一帧上传,用简单语言描述您想要的动作——相机移动、主体动作、氛围——然后生成。模型会根据您的精确图像制作动画,因此构图、面部和产品将保持可识别性。
Veo 3.1 Lite 上 4 秒无声 720p 剪辑的起价为 $0.10。Veo 3.1 Fast 的起价为 $0.35,旗舰版 Veo 3.1 的起价为 $0.70,Gemini Omni Flash 则是 $1.00 固定价格并始终带声音。您按剪辑付费——无需订阅。
是的——Veo 3.1 除了第一帧外,还支持可选的末帧。您可以用它来控制两个静态图像之间的过渡,或者将末帧设置为与第一帧相同以实现无缝循环,这对于动态照片和产品横幅来说是理想选择。
是的。所有 Veo 3.1 模型都支持生成原生音频——环境音、效果,甚至是对话——作为一个按剪辑切换的选项(无声剪辑费用较低)。Gemini Omni Flash 始终生成音频,您可以在提示中指导它。
单个剪辑时长为 4–8 秒(Veo)或 3–10 秒(Omni Flash)。使用 Veo 3.1 和 Veo 3.1 Fast,您可以将 Extend 操作链接起来,实现完整的视觉连续性,总时长可达 148 秒。
清晰、光线充足且主题明确的图像:肖像、产品照、风景、插画。支持高达 4K 的输入;当描述与画面中可能存在的内容匹配时,模型会更忠实地遵循您的动作提示。