模型 · xAI Grok Imagine Video 1.5

Grok Imagine Video 1.5——一张开口说话的照片

xAI 的视频模型,也是这里最擅长这件事的模型:以你的照片开场,说出你的台词。给它一张人像和一句加了引号的话,短片的第一帧就是那张人像,那句话会被说出来,口型同步。片长 4 到 15 秒,任意整数秒,720p 或 1080p,五种画幅。按秒付费——720p 为 $0.14,1080p 为 $0.25——与 xAI 为自家 API 标的价格相同。加密货币或银行卡支付,无订阅。

BananaBanana 上一次真实的 Grok 生成:一张照片作首帧,提示词里一句带引号的台词,720p 五秒。声音和口型同步都出自模型本身。这一条花了 $0.70。
01它是什么

Grok Imagine Video 1.5 是什么?

Grok Imagine Video 1.5 是 xAI 的视频生成模型——Grok Imagine 视频功能背后的那一个——它把提示词,或一张静态图加提示词,变成最长 15 秒的短片,并且声音在同一次生成中完成。它自 2026 年 6 月起进入 xAI API,自 2026 年 9 月 16 日起上线 BananaBanana,与其他所有模型共用同一余额。我们按 xAI 自己的每秒价格收费,720p 为 $0.14,1080p 为 $0.25,xAI 对每张输入图片加收的费用我们不转嫁。

它真正擅长什么?

台词和首帧。写在引号里的一句话会被说出来,口型同步,并以日常对话的音量混音,创作者风格的广告要的正是这个。当你交给它一张照片作首帧,短片就从那张照片开场——同一个人、同一个房间、毛衣上同样的花纹——而不是重新摆拍出来的相似者。纯文字提示词同样可用,竖屏也是实打实的:一份 1080p 的 9:16 订单返回的是 1088×1920 的文件,而不是裁切过的横屏渲染。

文生视频,9:16,订购 1080p 十五秒(为了页面轻量,这里转码为 720p)。文件实际时长 15.04 秒。按每秒 $0.25 计算,这次渲染花费 $3.75。
02它的强项

花钱之前值得知道的六件事

首帧就是你的照片

带首帧的订单会被送到 xAI 原生的图生视频端点,我们逐帧核对过结果:开场帧就是输入图片,而不是对它的重新演绎。

台词说出口,口型同步

把句子放进引号,模型就会说出来。音频始终开启、始终包含在价格里;没有无声档,也不需要为声音额外付费。

4 到 15 秒之间任意时长

不是三个时长的菜单,而是区间里的每一个整数秒。一句台词七秒,两句十一秒,花的就是这么多。

五种画幅

16:9、9:16、1:1、3:2 和 2:3。正方形和 3:2 是这里其他视频模型完全不渲染的格式。

最多 7 张参考图

参考图引导主体和环境,场景则由模型自己调度。它是首帧的替代方案,不是附加项——两者发一种即可。

两档价格

720p 每秒 $0.14,1080p 每秒 $0.25。先在 720p 把提示词打磨好,再把要留用的文生视频用 1080p 渲染一次。

03坦白的局限

Grok 不会做的事

在这里,从图片开始的短片以 720p 运行。xAI 把参考引导的视频限制在 720p,而我们可用的首帧通道暂时还不接受 1080p,所以 1080p 留给文生视频。我们不会收你 1080p 的价格却交付一个更小的文件,而是在扣费之前就拒绝这种组合;在工作室里,选了 1080p 后图片槽位会直接关闭并给出提示。首帧和参考图不能同时使用。没有尾帧,没有 seed,没有反向提示词,也没有视频输入。

15 秒是单次渲染的最长时长,之后也没有延长或修改——一条四十秒的广告就是三段片子加一次剪辑。音频在人声和点了名的声音事件上很强,在含糊的环境音上很弱:“soft ambient kitchen sounds”返回时大约 −50 dB,等于静音。请给声音点名(“a kettle starting to whistle off-screen”),或者在剪辑时加环境底噪。提示词上限为 2048 个字符。如果你需要一镜到底半分钟、参考片段或 seed,Wan 3.0 能覆盖;如果你想通过描述改动来修改成片,那是 Gemini Omni Flash

04怎么用

从照片到短片,三步完成

  1. 做出你想用来开场的那一帧

    一张人像、手里的产品、身后的房间。在这里生成,或上传你自己的。那张图里有什么,短片就从什么开始,所以在为动态付费之前先把帧定好。

  2. 一句描述、一句带引号的台词、一条镜头说明

    描述画面里是谁,把要说的台词放进引号,再说明镜头怎么动。“Natural handheld motion, quiet room tone”就够了。控制在 2048 个字符以内。

  3. 为你订购的秒数付费

    720p 四秒是 $0.56。任务开始时从余额扣费,失败或被过滤器拒绝时自动退回。用加密货币或银行卡充值;没有月费。

05价格

一段片子到底多少钱

Grok Imagine Video 1.5 按分辨率和时长的价格,与这里其他视频模型对比
模型4 秒8 秒15 秒声音
Grok Imagine Video 1.5 · 720p$0.14/秒——首帧、参考图、草稿$0.56$1.12$2.10始终开启,已包含
Grok Imagine Video 1.5 · 1080p$0.25/秒——仅文生视频$1.00$2.00$3.75始终开启,已包含
Wan 3.0 · 720p阿里巴巴的模型,最长 30 秒$0.40$0.80$1.50包含,免费
Veo 3.1 Fast · 720pGoogle 的模型,仅 4–8 秒$0.35$0.70额外收费
Gemini Omni Flash · 720pGoogle 的模型,按秒计费,3–10 秒$0.40$0.80始终开启

价格按每段成片计算,含音轨。输入图片免费。短横线表示该模型无法一次渲染出该时长。充值 $50 余额加赠 5%,充值 $100 加赠 10%;有效的优惠码会在同一笔充值上再加 10%。

全部模型的完整价格表在价格页

06延伸阅读

讲得更深的指南

07常见问题

大家真正会问的问题

Grok Imagine Video 1.5 会生成声音吗?

会,始终会。写在引号里的台词会被说出来并对上口型,点了名的音效也会被渲染。含糊的环境音请求往往返回接近静音,所以需要声音时请点出一个具体的声音。声音包含在价格里。

一段 Grok 短片多少钱?

按秒付费:720p 每秒 $0.14,1080p 每秒 $0.25,与 xAI 在自家 API 上的收费相同。所以 720p 四秒是 $0.56,八秒依分辨率为 $1.12 或 $2.00,最高档——1080p 15 秒——是 $3.75。在这里,输入图片不另收费。

阅读完整解答
我能用 1080p 让自己的照片动起来吗?

目前不能。从首帧开始或使用参考图的短片都是 720p:xAI 把参考引导的视频限制在 720p,而我们能用的原生首帧通道暂时还不接受 1080p。带图片的 1080p 订单我们会在扣费前拒绝,而不是以更高的价格交付一个更小的文件。1080p 可用于文生视频。

能把短片延长到 15 秒以上吗?

这个模型不行。每段最多渲染 15 秒,更长的作品靠剪辑拼接;或者用 Wan 3.0 一镜到底最长 30 秒,或者用 Gemini Omni Flash,它能把自己的片段延长到 40 秒。

它接受尾帧或 seed 吗?

不接受。它接受一张首帧,或最多 7 张参考图,仅此而已。需要首尾帧控制请用 Veo 3.1、Omni 或 Wan 3.0;需要 seed 请用 Veo 或 Wan。

生成失败会怎样?

全部金额会自动退回余额,被内容过滤器拒绝的情况也一样。平台上每个模型都是这条规则。

阅读完整解答
Grok 生成的视频能商用吗?

可以。你生成的内容归你使用,包括客户项目和商业用途,前提是符合我们条款中的内容规则。输出没有水印,也不需要另外购买授权。

一张照片,一句台词

新账户余额自带 $0.20——足够做出第一帧。短片 $0.56 起,无订阅,无绑定。