最初のフレームはあなたの写真
最初のフレーム付きの注文は xAI ネイティブの image-to-video エンドポイントに送り、結果をフレーム単位で確認しました。冒頭のフレームは入力画像そのもので、再解釈ではありません。
モデル · xAI Grok Imagine Video 1.5
xAI の動画モデルであり、ここにあるどのモデルよりも得意なことがあります。あなたの写真で始まり、あなたのセリフを話すことです。ポートレートと引用符で囲んだ一文を渡すと、クリップの最初のフレームはそのポートレートになり、その一文が声に出され、口の動きも合います。クリップは4〜15秒の任意の整数秒、720p または 1080p、5種類のアスペクト比。料金は秒単位——720p で$0.14、1080p で$0.25——xAI が自社 API に掲げている料金と同じです。暗号資産またはカード払い、サブスクなし。
Grok Imagine Video 1.5 は xAI の動画生成モデル——Grok Imagine の動画機能を支えているモデル——で、プロンプト、または静止画とプロンプトから、音声も同じパスで生成した最長15秒のクリップを作ります。2026年6月から xAI API で提供され、BananaBanana では2026年9月16日から利用でき、他のすべてのモデルと同じ残高から支払います。料金は xAI 自身の秒単価どおりで、720p が$0.14、1080p が$0.25。xAI が入力画像ごとに加算する手数料は転嫁していません。
セリフと最初のフレームです。引用符で書いたセリフは発話され、リップシンクされ、会話の音量でミックスされます。クリエイター風の広告に必要なのはまさにこれです。そして写真を最初のフレームとして渡すと、クリップはその写真から始まります——同じ人物、同じ部屋、セーターの同じ柄——演出し直されたそっくりさんではありません。テキストのみのプロンプトも使えますし、縦型も本物です。1080p の 9:16 の注文は、横長レンダーの切り抜きではなく 1088×1920 のファイルで返ってきました。
最初のフレーム付きの注文は xAI ネイティブの image-to-video エンドポイントに送り、結果をフレーム単位で確認しました。冒頭のフレームは入力画像そのもので、再解釈ではありません。
文を引用符で囲めば、モデルがそれを話します。音声は常にオンで、常に料金に含まれます。無音プランも、音声への追加料金もありません。
3種類の尺から選ぶメニューではなく、範囲内のすべての整数秒です。セリフ1つなら7秒、2つなら11秒、払うのはちょうどその分だけ。
16:9、9:16、1:1、3:2、2:3。正方形と 3:2 は、ここにある他の動画モデルでは生成できないフォーマットです。
参照画像は被写体と舞台を方向づけ、シーンの組み立てはモデル自身が行います。最初のフレームへの追加ではなく代替です——どちらか一方を送ってください。
720p で1秒$0.14、1080p で$0.25。プロンプトは 720p で詰め、残したい text-to-video を 1080p で一度だけレンダーしましょう。
ここでは、画像から始まるクリップは 720p で動きます。xAI は参照ガイド付き動画を 720p に制限しており、私たちが利用できる最初のフレーム用ルートもまだ 1080p を受け付けないため、1080p は text-to-video 用です。1080p の料金を請求して小さいファイルを届けるのではなく、この組み合わせは課金前に拒否します。スタジオでは、1080p を選ぶと画像スロットが注記付きでオフになるだけです。最初のフレームと参照画像は併用できません。最後のフレーム、seed、ネガティブプロンプト、動画入力はありません。
15秒が単一レンダーの最長で、その後の延長や編集はありません——40秒のスポットは3本のクリップと1回のカットです。音声は発話と名指しした効果音に強く、あいまいな環境音に弱いです。「soft ambient kitchen sounds」は約 −50 dB、つまり無音で返ってきました。音は名指しする(「a kettle starting to whistle off-screen」)か、編集でルームトーンを足してください。プロンプトの上限は2048文字。ワンテイクで30秒、参照クリップ、seed が必要なら Wan 3.0 がカバーします。完成したクリップを変更内容の説明で作り変えたいなら Gemini Omni Flash です。
ポートレート、手に持った商品、背後の部屋。ここで生成するか、自分の画像をアップロードしてください。その画像に写っているものがクリップの始まりになるので、動きにお金を払う前にフレームを仕上げましょう。
フレームに誰がいるかを説明し、話すセリフを引用符で囲み、カメラの動きを伝えます。「Natural handheld motion, quiet room tone」で十分です。2048文字以内に収めてください。
720p で4秒は$0.56。残高はジョブ開始時に引き落とされ、失敗した場合やフィルターに拒否された場合は自動で返金されます。チャージは暗号資産またはカードで。月額料金はありません。
| モデル | 4秒 | 8秒 | 15秒 | 音声 |
|---|---|---|---|---|
| Grok Imagine Video 1.5 · 720p$0.14/秒 — 最初のフレーム、参照、下書き | $0.56 | $1.12 | $2.10 | 常にオン、料金込み |
| Grok Imagine Video 1.5 · 1080p$0.25/秒 — text-to-video のみ | $1.00 | $2.00 | $3.75 | 常にオン、料金込み |
| Wan 3.0 · 720pAlibaba のモデル、最長30秒 | $0.40 | $0.80 | $1.50 | 込み・無料 |
| Veo 3.1 Fast · 720pGoogle のモデル、4〜8秒のみ | $0.35 | $0.70 | — | 追加料金 |
| Gemini Omni Flash · 720pGoogle のモデル、秒単位課金、3〜10秒 | $0.40 | $0.80 | — | 常にオン |
価格は完成クリップ1本あたりで、音声トラックを含みます。入力画像は無料です。ダッシュは、そのモデルがその尺を1回で生成できないことを示します。$50 の入金で残高に5%、$100 で10%が加算され、有効なプロモコードがあれば同じ入金にさらに10%が上乗せされます。
全モデルの一覧表は料金ページにあります。
はい、常に生成します。引用符で書いたセリフはリップシンク付きで発話され、名指しした効果音も生成されます。あいまいな環境音の依頼はほぼ無音で返ってくることが多いので、必要なら具体的な音を指定してください。音声は料金に含まれます。
秒単位で支払います。720p が$0.14、1080p が$0.25で、xAI が自社 API で請求する料金と同じです。つまり 720p の4秒は$0.56、8秒は解像度に応じて$1.12または$2.00、最大の 1080p・15秒は$3.75です。ここでは入力画像に追加料金はかかりません。
詳しい回答を読む現時点ではできません。最初のフレームから始まるクリップや参照画像を使うクリップは 720p です。xAI は参照ガイド付き動画を 720p に制限しており、私たちが使えるネイティブの最初のフレーム用ルートもまだ 1080p を受け付けません。画像付きの 1080p 注文は、高い料金で小さいファイルを届けるのではなく、課金前に拒否します。1080p は text-to-video で使えます。
このモデルではできません。1クリップ最長15秒でレンダーして長い作品は編集でつなぐか、最長30秒のワンテイクなら Wan 3.0、自分のクリップを最長40秒まで延長できる Gemini Omni Flash を使ってください。
いいえ。受け付けるのは最初のフレーム1枚、または最大7枚の参照画像だけです。最初と最後のフレームを制御したいなら Veo 3.1、Omni、Wan 3.0 を、seed が必要なら Veo か Wan を使ってください。
はい。生成したものはあなたのもので、クライアントワークや商用利用も含まれます(利用規約のコンテンツルールの範囲内で)。出力にウォーターマークはなく、別途ライセンスを買う必要もありません。