पहला फ़्रेम आपकी फ़ोटो है
पहले फ़्रेम वाले ऑर्डर हम xAI के नेटिव image-to-video एंडपॉइंट पर भेजते हैं, और हमने नतीजा फ़्रेम-दर-फ़्रेम जाँचा है: शुरुआती फ़्रेम इनपुट इमेज ही है, उसकी कोई नई व्याख्या नहीं।
मॉडल · xAI Grok Imagine Video 1.5
xAI का वीडियो मॉडल, और वह काम जो यह यहाँ किसी भी और से बेहतर करता है: यह आपकी फ़ोटो से खुलता है और आपकी लाइन बोलता है। इसे एक पोर्ट्रेट और उद्धरण चिह्नों में एक वाक्य दीजिए, और क्लिप का पहला फ़्रेम वही पोर्ट्रेट होता है, वाक्य ज़ोर से बोला जाता है और होंठ उससे मेल खाते हैं। क्लिप 4 से 15 सेकंड की होती हैं, किसी भी पूरे सेकंड की लंबाई में, 720p या 1080p पर, पाँच आस्पेक्ट रेशियो में। आप प्रति सेकंड भुगतान करते हैं — 720p पर $0.14, 1080p पर $0.25 — वही दरें जो xAI अपनी API के लिए बताता है। क्रिप्टो या कार्ड, कोई सब्सक्रिप्शन नहीं।
Grok Imagine Video 1.5 xAI का वीडियो जनरेशन मॉडल है — वही जो Grok Imagine के वीडियो हिस्से के पीछे है — और यह एक प्रॉम्प्ट को, या एक स्थिर इमेज और प्रॉम्प्ट को, 15 सेकंड तक की क्लिप में बदलता है, जिसमें आवाज़ उसी पास में रेंडर होती है। यह जून 2026 से xAI API में है और 16 सितंबर 2026 से BananaBanana पर, और बाक़ी हर मॉडल वाले उसी बैलेंस से भुगतान होता है। हम xAI की अपनी प्रति-सेकंड दरें लेते हैं, 720p पर $0.14 और 1080p पर $0.25, और xAI हर इनपुट इमेज पर जो शुल्क जोड़ता है वह आप पर नहीं डालते।
संवाद और पहले फ़्रेम में। उद्धरण चिह्नों में लिखी लाइन बोली जाती है, लिप-सिंक होती है और बातचीत के स्तर पर मिक्स होती है — क्रिएटर-शैली के विज्ञापन को यही चाहिए। और जब आप इसे पहले फ़्रेम के रूप में फ़ोटो देते हैं, तो क्लिप उसी फ़ोटो से खुलती है — वही व्यक्ति, वही कमरा, स्वेटर पर वही पैटर्न — दोबारा मंचित किसी हमशक्ल से नहीं। सिर्फ़ टेक्स्ट वाले प्रॉम्प्ट भी चलते हैं, और वर्टिकल सच्चा है: 1080p पर 9:16 का ऑर्डर 1088×1920 की फ़ाइल के रूप में लौटा, क्रॉप किए हुए हॉरिज़ॉन्टल रेंडर के रूप में नहीं।
पहले फ़्रेम वाले ऑर्डर हम xAI के नेटिव image-to-video एंडपॉइंट पर भेजते हैं, और हमने नतीजा फ़्रेम-दर-फ़्रेम जाँचा है: शुरुआती फ़्रेम इनपुट इमेज ही है, उसकी कोई नई व्याख्या नहीं।
वाक्य को उद्धरण चिह्नों में रखिए और मॉडल उसे बोल देता है। ऑडियो हमेशा चालू है और हमेशा क़ीमत में शामिल है; न कोई साइलेंट टियर है, न आवाज़ के लिए कुछ अतिरिक्त।
तीन अवधियों का मेन्यू नहीं: रेंज का हर पूरा सेकंड। संवाद की एक लाइन के लिए सात सेकंड, दो के लिए ग्यारह, और भुगतान ठीक उतने का।
16:9, 9:16, 1:1, 3:2 और 2:3। स्क्वेयर और 3:2 ऐसे फ़ॉर्मैट हैं जिन्हें यहाँ के बाक़ी वीडियो मॉडल रेंडर ही नहीं करते।
रेफ़रेंस विषय और जगह को दिशा देते हैं, जबकि सीन मॉडल ख़ुद सजाता है। ये पहले फ़्रेम का विकल्प हैं, उसका जोड़ नहीं — दोनों में से एक भेजिए।
720p पर $0.14 प्रति सेकंड, 1080p पर $0.25। प्रॉम्प्ट 720p पर पक्का कीजिए, फिर रखने लायक text-to-video को 1080p पर एक बार रेंडर कीजिए।
यहाँ इमेज से शुरू होने वाली क्लिप 720p पर चलती हैं। xAI रेफ़रेंस-निर्देशित वीडियो को 720p तक सीमित रखता है, और पहले फ़्रेम का जो रास्ता हमें उपलब्ध है वह अभी 1080p नहीं लेता, इसलिए 1080p text-to-video के लिए है। आपसे 1080p की दर लेकर छोटी फ़ाइल देने के बजाय हम इस संयोजन को कुछ भी चार्ज होने से पहले ही अस्वीकार कर देते हैं; स्टूडियो में 1080p चुनते ही इमेज स्लॉट एक नोट के साथ बंद हो जाते हैं। पहला फ़्रेम और रेफ़रेंस इमेज साथ नहीं चल सकते। न आख़िरी फ़्रेम है, न seed, न नेगेटिव प्रॉम्प्ट, न वीडियो इनपुट।
15 सेकंड सबसे लंबा एकल रेंडर है, और उसके बाद न extend है न एडिट — चालीस सेकंड का विज्ञापन यानी तीन क्लिप और एक कट। ऑडियो बोली और नाम लेकर बताई गई ध्वनियों में मज़बूत है और अस्पष्ट माहौल में कमज़ोर: "soft ambient kitchen sounds" क़रीब −50 dB पर लौटा, यानी सन्नाटा। किसी ध्वनि का नाम लीजिए ("a kettle starting to whistle off-screen") या एडिट में रूम टोन जोड़िए। प्रॉम्प्ट की सीमा 2048 अक्षर है। अगर आपको एक टेक में आधा मिनट, रेफ़रेंस क्लिप या seed चाहिए, तो Wan 3.0 यह सब देता है; अगर आप तैयार क्लिप को बदलाव बताकर बदलना चाहते हैं, तो वह Gemini Omni Flash है।
एक पोर्ट्रेट, हाथ में प्रोडक्ट, पीछे कमरा। यहीं जनरेट कीजिए या अपनी इमेज अपलोड कीजिए। उस तस्वीर में जो भी है, क्लिप उसी से शुरू होती है, इसलिए मोशन के पैसे देने से पहले फ़्रेम ठीक कर लीजिए।
बताइए कि फ़्रेम में कौन है, बोली जाने वाली लाइन उद्धरण चिह्नों में रखिए, फिर बताइए कि कैमरा कैसे चलता है। "Natural handheld motion, quiet room tone" काफ़ी है। इसे 2048 अक्षरों के भीतर रखिए।
720p पर चार सेकंड $0.56 के हैं। जॉब शुरू होते ही बैलेंस से राशि कटती है, और विफल होने या फ़िल्टर के अस्वीकार करने पर अपने आप लौट आती है। क्रिप्टो या कार्ड से टॉप-अप कीजिए; कोई मासिक शुल्क नहीं।
| मॉडल | 4 सेकंड | 8 से. | 15 से. | ध्वनि |
|---|---|---|---|---|
| Grok Imagine Video 1.5 · 720p$0.14/से. — पहला फ़्रेम, रेफ़रेंस, ड्राफ़्ट | $0.56 | $1.12 | $2.10 | हमेशा चालू, शामिल |
| Grok Imagine Video 1.5 · 1080p$0.25/से. — सिर्फ़ text-to-video | $1.00 | $2.00 | $3.75 | हमेशा चालू, शामिल |
| Wan 3.0 · 720pAlibaba का मॉडल, 30 से. तक | $0.40 | $0.80 | $1.50 | शामिल, मुफ़्त |
| Veo 3.1 Fast · 720pGoogle का मॉडल, सिर्फ़ 4–8 सेकंड | $0.35 | $0.70 | — | अलग से शुल्क |
| Gemini Omni Flash · 720pGoogle का मॉडल, प्रति सेकंड, 3–10 से. | $0.40 | $0.80 | — | हमेशा चालू |
क़ीमतें प्रति तैयार क्लिप हैं और इनमें ऑडियो ट्रैक शामिल है। इनपुट इमेज मुफ़्त हैं। डैश का मतलब है कि मॉडल वह लंबाई एक रन में रेंडर नहीं कर सकता। $50 के डिपॉज़िट पर बैलेंस में 5% और $100 पर 10% जुड़ता है; सक्रिय प्रोमो कोड उसी डिपॉज़िट पर 10% और जोड़ता है।
हर मॉडल की पूरी तालिका क़ीमत वाले पेज पर है।
शुरुआती फ़्रेम, आख़िरी फ़्रेम और लूप असल में कैसा बर्ताव करते हैं, उन्हीं प्रॉम्प्ट के साथ जिनसे ये बने।
गाइड पढ़ेंकैमरे की भाषा, रोशनी, गति। लिखा Veo के लिए गया है, पर ढाँचा Wan पर लगभग ज्यों का त्यों चलता है।
गाइड पढ़ेंवह मॉडल जिसे तब चुनिए जब क्लिप को नया प्रॉम्प्ट लिखकर नहीं, बात करके बदलना हो।
गाइड पढ़ेंहाँ, हमेशा। उद्धरण चिह्नों में लिखा संवाद लिप-सिंक के साथ बोला जाता है, और नाम लेकर बताए गए साउंड इफ़ेक्ट रेंडर होते हैं। अस्पष्ट माहौल वाले अनुरोध अक्सर लगभग ख़ामोश लौटते हैं, इसलिए ज़रूरत हो तो किसी ख़ास ध्वनि का नाम लीजिए। आवाज़ क़ीमत में शामिल है।
आप प्रति सेकंड भुगतान करते हैं: 720p पर $0.14 और 1080p पर $0.25, वही दरें जो xAI अपनी API पर लेता है। तो 720p पर चार सेकंड $0.56 के हैं, आठ सेकंड रिज़ॉल्यूशन के हिसाब से $1.12 या $2.00 के, और अधिकतम — 1080p पर 15 सेकंड — $3.75 का। यहाँ इनपुट इमेज पर कुछ अतिरिक्त नहीं लगता।
पूरा उत्तर पढ़ेंआज नहीं। पहले फ़्रेम से शुरू होने वाली या रेफ़रेंस इमेज वाली क्लिप 720p की होती हैं: xAI रेफ़रेंस-निर्देशित वीडियो को 720p तक सीमित रखता है, और पहले फ़्रेम का जो नेटिव रास्ता हमारी पहुँच में है वह अभी 1080p नहीं लेता। ज़्यादा क़ीमत पर छोटी फ़ाइल देने के बजाय हम इमेज वाले 1080p ऑर्डर को चार्ज करने से पहले ही अस्वीकार कर देते हैं। 1080p text-to-video के लिए काम करता है।
इस मॉडल पर नहीं। प्रति क्लिप 15 सेकंड तक रेंडर कीजिए और लंबे हिस्से एडिट में जोड़िए, या 30 सेकंड तक के एक टेक के लिए Wan 3.0 इस्तेमाल कीजिए, या Gemini Omni Flash, जो अपनी ही क्लिप को 40 सेकंड तक बढ़ाता है।
नहीं। यह एक पहला फ़्रेम या 7 तक रेफ़रेंस इमेज लेता है, बस। पहले और आख़िरी फ़्रेम के नियंत्रण के लिए Veo 3.1, Omni या Wan 3.0 इस्तेमाल कीजिए; seed के लिए Veo या Wan।
पूरी राशि अपने आप आपके बैलेंस में लौट आती है, कंटेंट फ़िल्टर के इनकार समेत। प्लेटफ़ॉर्म के हर मॉडल के लिए यही नियम है।
पूरा उत्तर पढ़ेंहाँ। आप जो बनाते हैं वह आपका है, क्लाइंट और व्यावसायिक काम समेत, बशर्ते हमारी शर्तों में दिए कंटेंट नियम माने जाएँ। आउटपुट पर कोई वॉटरमार्क नहीं है और अलग से कोई लाइसेंस नहीं ख़रीदना पड़ता।
नए खाते बैलेंस में $0.20 के साथ शुरू होते हैं — पहला फ़्रेम बनाने के लिए काफ़ी। क्लिप $0.56 से, कोई सब्सक्रिप्शन नहीं, कोई बंधन नहीं।