ब्लॉग पर वापस
BananaBanana Teamtutorialvideoimage-to-video

AI Image to Video: फोटो को चलती-फिरती वीडियो क्लिप में बदलें

जानें AI image to video कैसे काम करता है, Veo 3.1 या Omni Flash में से कौन सा मॉडल चुनें। $0.10 से शुरू होने वाले असली दाम, मोशन प्रॉम्प्ट और लूप्स की पूरी जानकारी।

AI Image to Video: फोटो को चलती-फिरती वीडियो क्लिप में बदलें

AI image to video एक ऐसी तकनीक है जहाँ मॉडल एक स्थिर फोटो को वीडियो के पहले फ्रेम की तरह इस्तेमाल करता है और आगे की पूरी कहानी खुद लिखता है — जैसे हलचल, कैमरे का घूमना, रोशनी का बदलना और कभी-कभी तो साउंड भी। आपको बस एक फोटो देनी है और लिखकर बताना है कि उसमें क्या हिलना-डुलना चाहिए। मॉडल आपको 4 से 10 seconds का एक छोटा सा वीडियो बनाकर दे देगा, जिसमें आपकी फोटो बिल्कुल ज़िंदा हो जाएगी।

अगर आप जल्दबाज़ी में हैं और तुरंत काम की बात जानना चाहते हैं: BananaBanana generator में एक फोटो अपलोड करें, हलचल (motion) को डिस्क्राइब करें और 2–5 minutes इंतज़ार करें। Veo 3.1 Lite पर आपकी फोटो से बिना आवाज़ वाली 4-second की क्लिप सिर्फ़ $0.10 में बन जाती है। अगर साउंड भी चाहिए, तो कीमत $0.18 हो जाती है। वहीं, Gemini Omni Flash पूरी आवाज़ के साथ एक फोटो को $0.30 से एनिमेट करता है (इसका बिल $0.10 प्रति सेकंड लगता है)। नए अकाउंट्स को मुफ्त में $0.20 मिलते हैं, जिससे आप बिना आवाज़ वाली दो टेस्ट क्लिप बना सकते हैं।

हम खुद प्रोडक्शन में चार वीडियो मॉडल्स का इस्तेमाल करते हैं, इसलिए यह गाइड किसी मार्केटिंग पेज को देखकर नहीं, बल्कि हमारे असली जनरेशन लॉग्स और अनुभवों के आधार पर लिखी गई है। इसमें हमारी गलतियाँ भी शामिल हैं — क्योंकि कई बार असफलताओं से ही सबसे ज़्यादा सीखने को मिलता है।

AI image to video कैसे काम करता है?

पर्दे के पीछे की बात करें, तो आपकी फोटो मॉडल के पास एक कंडीशनिंग फ्रेम (conditioning frame) के रूप में जाती है। Google के Gemini API video docs के मुताबिक, Veo 3.1 "इमेज-बेस्ड डायरेक्शन" और "फ्रेम-स्पेसिफिक जनरेशन" को सपोर्ट करता है। आसान शब्दों में कहें तो, आपकी फोटो ही पूरे वीडियो को गाइड करती है और आप तय कर सकते हैं कि कौन सी चीज़ किस फ्रेम पर कैसी दिखेगी। मॉडल फोटो के पूरे सीन को समझता है, उसके पीछे के भौतिक विज्ञान या फिजिक्स का अंदाज़ा लगाता है (जैसे कि पानी में लहरें कैसे उठेंगी या हवा में बाल कैसे उड़ेंगे) और आपकी शुरुआती फोटो से आगे एक-एक करके फ्रेम तैयार (render) करता जाता है।

इसका सीधा सा असर यह होता है: वीडियो का पहला फ्रेम हूबहू आपकी फोटो ही होता है, एक-एक पिक्सेल वैसे का वैसा। उसके बाद जो कुछ भी होता है, वह सब मॉडल की कल्पना होती है। इसलिए एक अच्छा प्रॉम्प्ट लिखते समय उन चीज़ों पर शब्द खर्च करें जो वीडियो में बदलनी हैं, न कि उस चीज़ को दोबारा समझाने में जो मॉडल फोटो में पहले से ही देख सकता है।

यह तकनीक उन दृश्यों पर हैरान करने वाले बेहतरीन नतीजे देती है जिनमें पहले से ही कोई स्वाभाविक हलचल छिपी हो। जैसे कि कोई पोर्ट्रेट सांस लेता है या पलकें झपकाता है, गर्म कॉफी से भाप उठने लगती है, या खड़ी हुई कार आगे बढ़ जाती है। लेकिन अगर फोटो में कोई स्वाभाविक हलचल होने की गुंजाइश ही न हो, तो यह उतने अच्छे से काम नहीं करता। मिसाल के लिए, सफ़ेद बैकग्राउंड पर किसी प्रोडक्ट की एक सपाट 3D रेंडर फोटो अपलोड करें और प्रॉम्प्ट में भी कोई मोशन गाइड न दें, तो आपको सिर्फ़ एक धीमा और अजीब सा ज़ूम-इन वीडियो मिलेगा। यह खराब नहीं है, बस काफी उबाऊ लगता है।

दो हाथों में थमी एक पुरानी फोटो जिसमें अंदर का दृश्य हिलने-डुलने लगता है, जो AI image to video एनिमेशन को दिखाता है

फोटो को वीडियो में बदलने के लिए कौन सा मॉडल सबसे अच्छा है?

हमारे प्लेटफॉर्म पर मौजूद चारों वीडियो मॉडल्स पहली फ्रेम के रूप में इमेज को स्वीकार करते हैं। फर्क बस उनकी सीमाओं (capabilities) और आपकी जेब पर पड़ने वाले असर का है।

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
दाम (4s, बिना आवाज़)$0.70$0.35$0.10
दाम (4s, आवाज़ के साथ)$1.50$0.50$0.18$0.40 ($0.10 प्रति सेकंड)
अधिकतम रेजोल्यूशन4K4K1080pसिर्फ़ 720p
अवधिबिल्कुल 4/6/7/8 sबिल्कुल 4/6/7/8 sबिल्कुल 4/6/7/8 sबिल्कुल 3–10 s
ऑडियोवैकल्पिक टॉगलवैकल्पिक टॉगलवैकल्पिक टॉगलहमेशा चालू
आखिरी फ्रेम + लूपहाँहाँहाँनहीं
148 s तक बढ़ाएंहाँहाँनहींनहीं, इसकी जगह कन्वर्सेशनल एडिटिंग

मेरा पसंदीदा विकल्प (default) Veo 3.1 Fast है। यह अपने फ्लैगशिप मॉडल की आधी कीमत पर सभी काम के कंट्रोल्स देता है (जैसे सटीक अवधि, आखिरी फ्रेम चुनने का विकल्प और वीडियो की लंबाई बढ़ाना)। सोशल मीडिया के लिए बनाए जाने वाले वीडियो के मामले में, इसकी क्वालिटी और ओरिजिनल Veo 3.1 की क्वालिटी में कोई खास अंतर नज़र नहीं आता। वहीं $0.10 की कीमत वाला Lite मॉडल मेरे लिए टेस्ट ड्राइव जैसा है — जब भी कोई नया आइडिया टेस्ट करना हो कि वह वीडियो में कैसा लगेगा, तो पैसे बर्बाद करने से पहले मैं इसी का इस्तेमाल करता हूँ। Veo 3.1 की कीमत तब वसूल होती है जब वीडियो में पानी, कपड़े की हलचल या कोई टक्कर दिखानी हो, या फिर आपकी ज़रूरत बिल्कुल 4K क्वालिटी की हो। Gemini Omni Flash को तब चुनें जब आपके लिए वीडियो की तरह ही उसका साउंड भी बहुत ज़रूरी हो। इसके बारे में हमने अलग से एक Omni Flash API review लिखा है, जहाँ आप इसकी 720p की सीमा समेत सारी जानकारी पढ़ सकते हैं (सच कहें तो, फुल-स्क्रीन वीडियो के लिए 720p थोड़ा खटकता ज़रूर है)।

ऊपर दिया गया क्लिप हमारे प्रोडक्शन पाइपलाइन से निकाला गया एक Veo 3.1 Fast जनरेशन है, जिसे खास तौर पर इसी लेख के लिए बनाया गया है। इसमें मेज पर रखी एक फ्रेम वाली बोट (नाव) की तस्वीर है, और प्रॉम्प्ट में कहा गया है कि कैमरा धीरे-धीरे आगे बढ़े और फ्रेम के अंदर का समुद्र बहने लगे। यह बिना किसी एडिटिंग के पहली बार में ही बना लिया गया था, और हमने जानबूझकर इसे म्यूट रखा है (हम आमतौर पर ड्राफ्ट के लिए Fast का बिना आवाज़ वाला प्लान ही इस्तेमाल करते हैं)। फोटो में "जान आ जाने" का यही जादू मॉडल आपकी अपलोड की हुई तस्वीरों के साथ करता है।

फोटो से वीडियो कैसे बनाएं: स्टेप-बाय-स्टेप तरीका

the generator पर पूरा प्रोसेस करने में मुश्किल से एक मिनट का समय लगता है, इसके बाद बस रेंडर होने का इंतज़ार करना होता.है।

  1. जनरेटर को वीडियो मोड पर स्विच करें और कोई एक मॉडल चुनें। शुरुआत करने के लिए $0.10 वाला Veo 3.1 Lite सबसे सही और सस्ता तरीका है।
  2. अपनी फोटो को पहले फ्रेम के रूप में अपलोड करें। आप JPG या PNG फाइल अपलोड कर सकते हैं। ध्यान रखें कि फोटो आपके चुने हुए वीडियो रेशियो के हिसाब से क्रॉप हो जाएगी, इसलिए जनरेट करने से पहले किनारों को ज़रूर चेक कर लें।
  3. 16:9 या 9:16 का रेशियो चुनें। वर्टिकल (9:16) रेशियो TikTok और Reels के लिए एकदम सही है और मॉडल इसे बहुत अच्छे से संभाल लेता है।
  4. अपना मोशन प्रॉम्प्ट (अगला सेक्शन देखें) लिखें। आप चाहें तो एक नेगेटिव प्रॉम्प्ट (अधिकतम 1,000 कैरेक्टर) भी लिख सकते हैं, ताकि अनचाही चीज़ों को वीडियो से दूर रखा जा सके।
  5. वीडियो की अवधि (duration) और ऑडियो का विकल्प चुनें। Veo मॉडल्स पर ये सटीक सेटिंग्स होती हैं; Omni Flash पर आप 3 से 10 सेकंड के बीच कोई भी लंबाई चुन सकते हैं और ऑडियो हमेशा चालू रहता है।
  6. जनरेट पर क्लिक करें। वीडियो बनने में लगभग 2–5 minutes का समय लगता है। आप चाहें तो टैब बंद कर सकते हैं; आपके नतीजे 30 days तक आपकी हिस्ट्री में सुरक्षित रहेंगे।

पैसे आपके अकाउंट से तभी कटते हैं जब वीडियो सफलतापूर्वक बन जाता है। फेल होने वाले रेंडर के पैसे तुरंत और खुद-ब-खुद वापस आ जाते हैं। वीडियो के मामले में यह बहुत ज़रूरी है क्योंकि मनमुताबिक नतीजा पाने के लिए आपको कई बार बदलाव करने पड़ते हैं।

तीन-पैनल वाला स्टोरीबोर्ड जिसमें हाथ से फोटो अपलोड करना, सेटिंग्स पैनल और पूरा हुआ वीडियो प्लेयर दिखाया गया है, जो इमेज से वीडियो बनाने के प्रोसेस को दर्शाता है

इमेज से वीडियो बनाने के लिए मोशन प्रॉम्प्ट कैसे लिखें?

पहला नियम: हलचल (motion) को समझाएं, न कि पूरे सीन को। सीन तो पहले से ही आपकी फोटो में मौजूद है। "एक महिला लाल कोट पहने पुल पर खड़ी है" जैसा प्रॉम्प्ट लिखना शब्दों की बर्बादी है, क्योंकि मॉडल यह बात फोटो देखकर खुद जानता है। इसकी जगह लिखें: "वह कैमरे की तरफ मुड़ती है और मुस्कुराती है, हवा में उसके बाल उड़ रहे हैं, धीमा डॉली-इन कैमरा मूवमेंट।" यह प्रॉम्प्ट भी उतना ही लंबा है, लेकिन मॉडल को साफ निर्देश देता है कि करना क्या है।

Veo मॉडल्स के साथ कैमरे से जुड़े शब्द जादुई काम करते हैं। जैसे: dolly in (डॉली इन), orbit (ऑर्बिट), handheld (हैंडहेल्ड), static tripod shot (स्टेटिक ट्राइपॉड शॉट), slow pan left (धीमा पैन लेफ्ट)। इन मॉडल्स को प्रोफेशनल फिल्म फुटेज के विवरणों पर ट्रेन किया गया है, इसलिए ये कैमरे की भाषा को बेहतर समझते हैं, बजाय कि "इसे गतिशील या एनर्जेटिक बनाएं" जैसे गोल-मोल शब्दों के। मैं तो यही कहूँगा कि "डायनेमिक" या "गतिशील" जैसे शब्दों से पूरी तरह बचें। इसका कोई एक साफ़ मतलब नहीं है, यहाँ तक कि मॉडल के लिए भी नहीं।

इस ब्लॉग के लिए डेमो क्लिप बनाते समय हमने पैसे खर्च करके एक बड़ा सबक सीखा: ये मॉडल उस एक्शन को जारी रखते हैं जो पहले फ्रेम में पहले से ही हो रहा हो, और बाद में शुरू होने वाले निर्देशों को अक्सर नज़रअंदाज़ कर देते हैं। एक बार हमने Omni Flash को "वीडियो के बीच में" पैनकेक पलटने का निर्देश दिया और नतीजे में हमें 10-second तक चुपचाप रखा हुआ पैनकेक मिला। ऐसा लगातार तीन बार हुआ, यानी हर प्रयास के लिए एक डॉलर पानी में गया। जब हमने प्रॉम्प्ट को बदलकर ऐसे लिखा जैसे एक्शन पहले से ही चल रहा हो, तो पहली ही बार में काम बन गया। इसलिए: "पैनकेक पर सिरप गिर रहा है" लिखना "दो सेकंड के बाद सिरप गिरना शुरू हो" से कहीं बेहतर है। जब आप इमेज से वीडियो बना रहे हों, तो हमेशा ऐसी फोटो चुनें जिसमें आपकी मनचाही हलचल का होना स्वाभाविक लगे।

कुछ ऐसे प्रॉम्प्ट पैटर्न्स जो हमेशा बेहतरीन काम करते हैं:

  • पोर्ट्रेट (Portraits): "हल्की सांस लेना, धीमी पलक झपकाना, और फिर एक छोटी सी मुस्कान; स्थिर कैमरा।" इससे चेहरे के बिगड़ने का डर नहीं रहता और वीडियो एकदम प्राकृतिक लगता है।
  • प्रोडक्ट्स (Products): "ऑब्जेक्ट के चारों ओर धीमा 180-डिग्री ऑर्बिट मूवमेंट, स्टूडियो लाइटिंग एक समान बनी रहे।" यह तरीका सबसे भरोसेमंद है। इसके लिए बस अपनी ओरिजिनल फोटो का बैकग्राउंड जितना हो सके सिंपल रखें।
  • लैंडस्केप (Landscapes): हिलने-डुलने वाले तत्वों के नाम साफ-साफ लिखें जैसे, "बादल दाईं ओर बह रहे हैं, घास हिल रही है, रोशनी हल्की गर्म हो रही है" वरना आपको सिर्फ़ एक अजीब सा कैमरा ज़ूम-इन ही मिलेगा।

एक डायरेक्टर का क्लैपरबोर्ड जिसके पास हाथ से लिखे प्रॉम्प्ट नोट्स हैं, और फोटो के ऊपर कैमरे की मूवमेंट को दर्शाते हुए तीर के निशान बने हैं, जो मोशन प्रॉम्प्ट लिखने की कला को दिखाते हैं

लूप्स, आखिरी फ्रेम्स और 148-second वाले लंबे वीडियो

Veo 3.1 मॉडल्स पहली फ्रेम के साथ-साथ एक वैकल्पिक आखिरी फ्रेम भी स्वीकार करते हैं। अगर आप इन्हें दो अलग-अलग तस्वीरें देंगे, तो यह उनके बीच एक स्मूद बदलाव (transition) तैयार कर देगा — जैसे दिन के सीन को रात में बदलना या किसी रफ स्केच को तैयार प्रोडक्ट में बदलना। अगर आप दोनों जगह एक ही फोटो अपलोड कर देंगे, तो आपको एक ऐसा क्लिप मिलेगा जो जहाँ से शुरू हुआ था वहीं खत्म होगा: यानी एक परफेक्ट लूप वीडियो, जो वेबसाइट बैकग्राउंड या सिनेमाग्राफ पोस्ट के लिए एकदम बेस्ट है। प्लेटफॉर्म पर मेरा पसंदीदा लेकिन सबसे कम इस्तेमाल किया जाने वाला फीचर यही है।

एक्सटेंशन (Extension) Veo का दूसरा कमाल का फीचर है। आप किसी तैयार क्लिप को नए प्रॉम्प्ट के साथ और 7 seconds के लिए आगे बढ़ा सकते हैं, और यह सिलसिला बिना किसी विज़ुअल ब्रेक के कुल 148 seconds तक चल सकता है (यह सिर्फ़ Veo 3.1 और Fast में उपलब्ध है; Lite और Omni Flash में यह काम नहीं करता)। अपनी खुद की किसी फोटो से शुरुआत करके इतनी लंबी वीडियो चेन बनाना बिना किसी स्टोरीबोर्ड के फिल्म बनाने जैसा है। लेकिन याद रखें कि इसमें खर्च भी हर कदम के साथ बढ़ता जाता है, इसलिए अपना बजट पहले ही तय कर लें।

Omni Flash में वीडियो की लंबाई बढ़ाने के बजाय कन्वर्सेशनल एडिटिंग की सुविधा मिलती है: आप तैयार क्लिप में किसी भी बदलाव को लिखकर बता सकते हैं (जैसे "शाम का वक्त कर दो, बाकी सब वैसा ही रहने दो") और इसके लिए इसके सेकंड का फिर से भुगतान करते हैं — यह उन वीडियो को भी स्वीकार करता है जो इसने जनरेट नहीं किए, जिनमें आपके अपने अपलोड किए गए वीडियो भी शामिल हैं, और उन्हें उसी लंबाई में वापस करता है। दोनों का तरीका अलग है। एडिटिंग एक पल को बेहतर बनाती है, जबकि एक्सटेंशन समयसीमा को आगे बढ़ाता है।

एक पेस्टल बैकग्राउंड पर एक परफेक्ट सर्कल में मुड़ी हुई फिल्म स्ट्रिप की कतरनें, जो एक ऐसे लूप वाले AI वीडियो को दर्शाती हैं जो वहीं खत्म होता है जहाँ से शुरू हुआ था

अक्सर पूछे जाने वाले सवाल (FAQ)

क्या मैं फोटो को वीडियो में मुफ्त में बदल सकता हूँ?

हाँ, लगभग मुफ्त में। BananaBanana पर नया अकाउंट बनाने पर आपको $0.20 का बैलेंस मिलता है जिसके लिए किसी कार्ड की ज़रूरत नहीं होती। यह रकम आपकी फोटो से बिना आवाज़ वाली दो 4-second की Veo 3.1 Lite क्लिप बनाने के लिए काफी है। इसके बाद, आप $0.10 प्रति क्लिप की दर से भुगतान कर सकते हैं।

इमेज से वीडियो बनाने का सबसे सस्ता API विकल्प कौन सा है?

BananaBanana पर सबसे सस्ता विकल्प Veo 3.1 Lite है: बिना आवाज़ वाली 4-second की 720p क्लिप के लिए सिर्फ़ $0.10 और आवाज़ के साथ $0.18। यह खर्च केवल सफल जनरेशन पर होता है। इसमें रेंडर फेल होने पर पैसे अपने आप वापस मिल जाते हैं और आपको किसी सब्सक्रिप्शन या Google Cloud सेटअप की ज़रूरत भी नहीं होती।

क्या जनरेट किए गए वीडियो में आवाज़ शामिल हो सकती है?

हाँ, बिल्कुल। Veo 3.1 मॉडल्स में ऑडियो ऑन करने का विकल्प मिलता है (आपके प्रॉम्प्ट में लिखे गए संवाद, साउंड इफेक्ट्स और माहौल की आवाज़ें), ...और Gemini Omni Flash हमेशा ऑडियो के साथ ही वीडियो बनाता है, जो कि इसकी $0.10-प्रति-सेकंड कीमत में पहले से ही शामिल है।

क्या मैं TikTok या Reels के लिए वर्टिकल फोटो को वीडियो में बदल सकता हूँ?

हाँ, हमारे चारों मॉडल्स 9:16 का वर्टिकल रेशियो सपोर्ट करते हैं। अपनी फोटो अपलोड करें, 9:16 चुनें, और ध्यान रखें कि आपकी मुख्य इमेज इस रेशियो के हिसाब से क्रॉप होगी, इसलिए फोटो लेते समय ऊपर थोड़ा स्पेस (headroom) ज़रूर रखें।

फोटो से बनने वाला AI वीडियो अधिकतम कितना लंबा हो सकता है?

Veo मॉडल्स पर प्रत्येक क्लिप आमतौर पर 4–8 seconds की होती है (Omni Flash पर आपकी पसंद के अनुसार 3–10 seconds)। लेकिन Veo 3.1 और Veo 3.1 Fast क्लिप्स को आप हर बार 7-second आगे बढ़ाकर कुल 148 seconds तक लंबा कर सकते हैं, जिससे आपकी मूल फोटो से शुरू हुई वीडियो की विज़ुअल निरंतरता (continuity) वैसी ही बनी रहती है।

tutorialvideoimage-to-video