ब्लॉग पर वापस
BananaBanana Teamtutorialimagesvideo

Character Consistent Image Generation: एक व्यावहारिक गाइड

इमेज और वीडियो में एक ही AI कैरेक्टर को बनाए रखें: Nano Banana 2 और Pro के लिए रेफरेंस इमेज लिमिट्स, कैरेक्टर शीट विधि, स्टोरीबोर्ड और Veo 3.1।

Character Consistent Image Generation: एक व्यावहारिक गाइड

Character consistent image generation उन तकनीकों का एक समूह है, जो AI मॉडल को हर बार एक नया व्यक्ति बनाने के बजाय कई अलग-अलग इमेज में एक ही चेहरे, बालों और कपड़ों के साथ बिल्कुल वही कैरेक्टर बनाने में सक्षम बनाती हैं। यह उस अंतर को दिखाता है जहाँ "a red-haired woman in a cafe" प्रॉम्प्ट डालने पर हर बार एक नया अजनबी चेहरा मिलने के बजाय आपकी अपनी वही लाल बालों वाली महिला दिखाई देती है—वही जो आपके कॉमिक, विज्ञापन अभियान या स्टोरीबोर्ड के पहले फ्रेम में थी।

संक्षेप में कहें तो: इसके दो व्यावहारिक तरीके हैं, और ये दोनों एक साथ काम कर सकते हैं। पहला, अपने कैरेक्टर की रेफरेंस इमेज अपलोड करें—यह ठीक उसी तकनीक पर काम करता है जो प्लेटफॉर्म पर AI फेस स्वैप को संचालित करती है। Nano Banana 2 में 4 कैरेक्टर रेफरेंस, Nano Banana Pro में 5 तक और Veo 3.1 वीडियो जनरेशन के लिए 3 तक रेफरेंस स्वीकार किए जा सकते हैं। दूसरा, एक कैरेक्टर शीट प्रॉम्प्ट (character sheet prompt) तैयार करें—यह एक विस्तृत और निश्चित विवरण होता है जिसे आप प्रत्येक जनरेशन में इस्तेमाल करते हैं। BananaBanana पर Nano Banana 2 की मदद से कंसिस्टेंट कैरेक्टर जनरेट करने की कीमत $0.06 प्रति 1K इमेज से शुरू होती है। इस पोस्ट में दिखाए गए सभी डेमो इसी प्लेटफॉर्म पर जनरेट किए गए हैं, इसलिए आप यहाँ दिए गए प्रॉम्प्ट्स को बिना किसी बदलाव के सीधे इस्तेमाल कर सकते हैं।

मैं शुरुआत में ही इसकी सीमाओं को लेकर भी ईमानदार रहना चाहता हूँ। वर्तमान मॉडल्स में कंसिस्टेंसी काफी अच्छी है, लेकिन यह परफेक्ट नहीं है। आगे आपको दिखेगा कि यह कहाँ चूक जाती है।

एक ही कैरेक्टर हर बार अलग क्यों दिखता है?

इमेज जनरेशन मॉडल्स के पास पुरानी रिक्वेस्ट्स को याद रखने की कोई मेमोरी नहीं होती। हर जनरेशन केवल रैंडम नॉइज़ (noise) से शुरू होती है, और आपका प्रॉम्प्ट ही दोनों के बीच का एकमात्र पुल है। यदि प्रॉम्प्ट कहता है "a young woman with red hair," तो मॉडल उन लाखों लाल बालों वाली युवतियों में से किसी एक की छवि चुन लेता है जिन्हें वह बना सकता है। इसे पांच बार चलाएं, और आपको पांच अलग-अलग चेहरे मिलेंगे। उनका वाइब (vibe) भले ही एक जैसा हो, लेकिन उनका चेहरा एक नहीं होगा।

इसे कैरेक्टर ड्रिफ्ट (character drift) कहा जाता है, और अस्पष्ट प्रॉम्प्ट देने पर यह समस्या और बढ़ जाती है। "The same woman as before" (पहले जैसी ही महिला) लिखने से कुछ नहीं होता, क्योंकि मॉडल के लिए कोई 'पहले' था ही नहीं। जब तक आप पिछली इमेज को स्पष्ट रूप से अटैच नहीं करते, मॉडल ने उसे कभी देखा ही नहीं होता।

ड्रिफ्ट की समस्या एक ही वर्कफ़्लो के भीतर भी आ सकती है। कैमरा एंगल बदलते ही जबड़े की रेखा (jawline) बदल जाती है। आउटफ़िट बदलते ही चेहरे की झाइयाँ (freckles) अचानक गायब हो जाती हैं। मेरे अनुभव के अनुसार, सबसे नाजुक फीचर्स वही होते हैं जिनका इस्तेमाल इंसान दूसरों को पहचानने के लिए करते हैं: आँखों का आकार, नाक और हेयरलाइन। बैकग्राउंड और कपड़े तो ठीक रहते हैं, लेकिन चेहरे बदल जाते हैं।

इसलिए पूरा खेल हर एक रिक्वेस्ट में मॉडल को कैरेक्टर की पहचान दोबारा याद दिलाने का है, चाहे वह पिक्सल (रेफरेंस इमेज) के रूप में हो या टेक्स्ट (एक तय विवरण) के रूप में। सबसे अच्छा होगा कि दोनों का ही इस्तेमाल किया जाए।

AI द्वारा जनरेट किए गए पोर्ट्रेट फ्रेम की एक श्रृंखला जहां एक ही कैरेक्टर धीरे-धीरे दूसरे व्यक्ति में बदल जाता है, जो इमेज जनरेशन में कैरेक्टर ड्रिफ्ट को दर्शाता है

प्रत्येक मॉडल कितने रेफरेंस इमेज स्वीकार करता है?

रेफरेंस इमेज दोनों तरीकों में से अधिक प्रभावी तरीका है: आप कैरेक्टर की तस्वीरें अपलोड करते हैं और मॉडल उन्हें अंतिम सत्य (ground truth) मान लेता है। Google के Gemini API इमेज डॉक्स के अनुसार, अलग-अलग मॉडल्स की सीमाएं काफी भिन्न हैं, और कोई भी मॉडल चुनने से पहले इन अंतरों को जानना आपके लिए फायदेमंद होगा।

मॉडलकैरेक्टर रेफरेंसऑब्जेक्ट रेफरेंसस्टाइल रेफरेंसप्रति 1K इमेज की कीमत
Nano Banana 2 Liteकोई नहीं14 तककोई नहीं$0.03
Nano Banana 24 तक10 तक3 तक$0.06
Nano Banana Pro5 तक6 तककोई नहीं$0.11

इस तालिका में सबसे हैरान करने वाला मॉडल Lite है। यह कुल मिलाकर सबसे अधिक इमेजेस (14) स्वीकार करता है, लेकिन इसके डॉक्स में स्पष्ट किया गया है कि ये केवल ऑब्जेक्ट रेफरेंस हैं, इसमें कैरेक्टर कंसिस्टेंसी का कोई सपोर्ट नहीं है। हमने इसे व्यावहारिक अनुभव से सीखा: Lite किसी चेहरे को इनपुट के रूप में खुशी-खुशी स्वीकार कर लेता है और फिर उसे किसी प्रोडक्ट फोटो की तरह ट्रीट करता है—वह जैकेट का मिलान तो कर देगा लेकिन व्यक्ति के चेहरे को खो देगा। यदि आपका वर्कफ़्लो कैरेक्टर-केंद्रित है, तो कीमत चाहे जो भी हो, Lite आपके काम का नहीं है। (अन्य सभी कामों के लिए यह वास्तव में एक बढ़िया बजट मॉडल है; हमने एक अलग गाइड लिखा है कि कब Lite पर्याप्त है।)

बाकी दोनों मॉडल्स में से: मैं $0.06 वाले Nano Banana 2 से शुरुआत करना पसंद करूँगा। Pro का पांचवां कैरेक्टर स्लॉट और अधिक मजबूत आइडेंटिटी लॉक (identity lock) मल्टी-कैरेक्टर दृश्यों और फाइनल एसेट्स के लिए काफी मायने रखता है। $0.11 प्रति इमेज की दर से यह बहुत अधिक प्रीमियम नहीं लगता, खासकर तब जब इमेज वास्तव में कहीं पब्लिश होनी हो।

अपलोड किए गए एंगल्स की संख्या से अधिक महत्वपूर्ण उनके एंगल्स की विविधता है। एक ही एंगल से तीन रेफरेंस इमेज अपलोड करने पर मॉडल केवल उसी एंगल को सीख पाता है। इसके बजाय, एक फ्रंट शॉट, एक प्रोफाइल शॉट और एक थ्री-क्वार्टर (तिरछा) व्यू मॉडल को पूरे सिर की बनावट सिखाते हैं।

अलग-अलग एंगल्स से ली गई कैरेक्टर रेफरेंस तस्वीरों का स्टैक जो AI इमेज मॉडल को इनपुट दी जा रही हैं, यह दर्शाते हुए कि रेफरेंस इमेज किस प्रकार कैरेक्टर कंसिस्टेंट जनरेशन को निर्देशित करती हैं

कैरेक्टर शीट विधि (character sheet method) क्या है?

एक कैरेक्टर शीट टेक्स्ट का एक निश्चित ब्लॉक होता है जो आपके कैरेक्टर का बेहद बारीकी से वर्णन करता है, जिसे आप हर प्रॉम्प्ट में बिना किसी बदलाव के पेस्ट करते हैं। यह उस स्थिति के लिए केवल-टेक्स्ट वाला एक बेहतरीन विकल्प है जब आपके पास अभी तक कोई रेफरेंस फोटो नहीं है, और वास्तव में इसी तरीके से आप शुरुआत में रेफरेंस फोटो तैयार करते हैं। यह तरीका AI एजेंट्स के माध्यम से भी काम करता है: यदि आप हमारे MCP सर्वर के जरिए Claude Code में इमेज जनरेट करते हैं, तो बिना किसी इमेज अपलोड के कैरेक्टर शीट सीधे प्रॉम्प्ट के अंदर चली जाती है।

नियम: कैरेक्टर का वर्णन इस तरह करें जैसे कोई पुलिस स्केच आर्टिस्ट चाहता हो। उम्र, शरीर की बनावट, त्वचा का रंग, बालों का रंग और कट, आँखों का रंग, कोई खास पहचान चिन्ह, और एक या दो मुख्य एक्सेसरीज़। अस्पष्ट विशेषण (adjectives) ड्रिफ्ट पैदा करते हैं; ठोस संज्ञाएं (nouns) स्थिरता देती हैं।

नीचे दिए गए डेमो के लिए उपयोग किया गया सटीक ब्लॉक यहाँ दिया गया है:

a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt

नीचे दी गई दोनों इमेज इसी ब्लॉक का उपयोग करके Nano Banana Pro के साथ जनरेट की गई थीं। केवल इसके आसपास का सीन टेक्स्ट बदला गया था। कोई भी रेफरेंस इमेज अटैच नहीं की गई थी, यह पूरी तरह से टेक्स्ट-आधारित कंसिस्टेंसी (text-anchored consistency) का उदाहरण है:

AI जनरेटेड कैरेक्टर कंसिस्टेंसी डेमो: Nano Banana Pro के साथ जनरेट की गई, सरसों जैसी पीली कॉरडरॉय जैकेट में एक कैफे की खिड़की के पास पढ़ती हुई लाल बालों वाली महिला

वही AI कैरेक्टर, सरसों जैसी पीली कॉरडरॉय जैकेट में एक लाल बालों वाली महिला, गोल्डन आवर (सुनहरी शाम) के समय एक छत पर, जो Nano Banana Pro के साथ कैरेक्टर कंसिस्टेंट इमेज जनरेशन को प्रदर्शित करती है

क्या यह वही व्यक्ति है? काफी हद तक। चेहरा काफी मिलता-जुलता है, जैकेट और ईयररिंग अपनी जगह बने हुए हैं, और दोनों ही सीन में चेहरे की झाइयाँ भी बची रहीं। यदि आप बहुत बारीकी से (pixel-peep) देखेंगे, तो पाएंगे कि बालों की लंबाई थोड़ी भिन्न है। केवल-टेक्स्ट कंसिस्टेंसी की अपनी एक ईमानदार सीमा है, यही वजह है कि प्रो वर्कफ़्लो दोनों तरीकों को मिलाता है: अपनी कैरेक्टर शीट से सबसे बेहतरीन इमेज जनरेट करें, और फिर आने वाले सभी जनरेशन्स के लिए उसी इमेज को वापस एक कैरेक्टर रेफरेंस के रूप में इनपुट करें। टेक्स्ट पहचान तय करता है, और पिक्सल्स उसे मजबूती से लागू करते हैं।

प्रोडक्शन में इसे चलाने से प्राप्त दो छोटी टिप्स। एंकर एक्सेसरीज़ (जैसे ईयररिंग या जैकेट) बहुत कम टोकन्स में कैरेक्टर को पहचानने का बड़ा काम करती हैं; इसलिए हर कैरेक्टर को ऐसी कोई एक एक्सेसरी जरूर दें। साथ ही, अपनी कैरेक्टर शीट को लगभग 60 शब्दों से कम रखें, क्योंकि इससे अधिक होने पर सीन का विवरण मॉडल का ध्यान खींचने के लिए कैरेक्टर विवरण के साथ प्रतिस्पर्धा करने लगता है।

मल्टी-कैरेक्टर सीन और AI स्टोरीबोर्ड

एक ही फ्रेम में दो कंसिस्टेंट कैरेक्टर लाना वह जगह है जहाँ सस्ते तरीके काम करना बंद कर देते हैं। दोनों कैरेक्टर्स के लिए मिला-जुला टेक्स्ट शीट इस्तेमाल करने से अक्सर विशेषताएं आपस में मिक्स (cross-contaminate) हो जाती हैं: कैरेक्टर A के बाल कैरेक्टर B जैसे दिखने लगते हैं, और कैरेक्टर B को कैरेक्टर A की जैकेट मिल जाती है। शायद कई बार दोबारा जनरेट (reruns) करके इसे ठीक किया जा सकता है, लेकिन हर रिरन के लिए पैसे लगते हैं।

रेफरेंस इमेज इस समस्या को पूरी तरह ठीक कर देती हैं। Google के डॉक्स के अनुसार, Nano Banana 2 में 4 कैरेक्टर रेफरेंस और Nano Banana Pro में 5 तक रेफरेंस लिए जा सकते हैं, और इन स्लॉट्स को अलग-अलग लोगों में विभाजित किया जा सकता है। प्रत्येक कैरेक्टर के दो या तीन शॉट अपलोड करें, और फिर उनकी भूमिका के अनुसार सीन का विवरण लिखें ("लाल बालों वाली महिला ग्रे दाढ़ी वाले व्यक्ति को कॉफी सौंपती है")। इससे पहचान सही व्यक्ति के साथ काफी विश्वसनीय तरीके से जुड़ी रहती है, हालांकि दो लोगों के बीच हाथों से वस्तुओं का लेन-देन होना, साल 2026 में भी, किस्मत के खेल जैसा है।

स्टोरीबोर्ड इसका अगला स्वाभाविक कदम हैं, और इन्हें बनाने के दो तरीके हैं। फ्रेम दर फ्रेम (Frame by frame): प्रति पैनल एक जनरेशन, जिसमें प्रत्येक के साथ कैरेक्टर रेफरेंस अटैच हो। Nano Banana 2 पर प्रति पैनल की लागत $0.06 आती है, इसलिए छह पैनल वाले बोर्ड की कुल लागत $0.36 होगी। या फिर सिंगल-इमेज तरीका: Nano Banana Pro से एक ही जनरेशन में मल्टी-पैनल लेआउट बनाने के लिए कहें। नीचे दिया गया पैनल इसी तरह से बनाया गया था, केवल एक $0.11 की रिक्वेस्ट में, ऊपर दी गई उसी कैरेक्टर शीट के साथ:

एक ही Nano Banana Pro रिक्वेस्ट में जनरेट किया गया चार पैनल वाला AI स्टोरीबोर्ड, जिसमें सभी पैनलों में वही लाल बालों वाला कैरेक्टर कंसिस्टेंट है: सोकर उठना, साइकिल चलाना, प्रेजेंटेशन देना और छत पर होना

एक ही इमेज के भीतर कंसिस्टेंसी प्राप्त करना मूल रूप से मुफ्त है, क्योंकि मॉडल एक ही बार में सभी पैनल ड्रॉ करता है और अपने खुद के काम को देख सकता है। इसका एकमात्र समझौता रिज़ॉल्यूशन (resolution) के साथ होता है: प्रत्येक पैनल पूरे फ्रेम का केवल एक चौथाई होता है। पिच डेक और एनिमेटिक्स के लिए यह बिल्कुल ठीक है। लेकिन जिन पैनल्स को आप व्यक्तिगत रूप से उपयोग करना चाहते हैं, उनके लिए फ्रेम दर फ्रेम जनरेट करें और $0.36 का भुगतान करें।

क्या आप किसी कैरेक्टर को वीडियो में ले जा सकते हैं?

हाँ, और यहीं से यह पाइपलाइन और भी दिलचस्प हो जाती है। Veo 3.1 उस फीचर का सपोर्ट करता है जिसे Google के Vertex AI डॉक्स में एसेट रेफरेंस इमेज (asset reference images) कहा गया है: किसी व्यक्ति, कैरेक्टर या प्रोडक्ट की अधिकतम 3 तस्वीरें, और मॉडल जनरेट की गई क्लिप में उस सब्जेक्ट के लुक को सुरक्षित रखता है। हमारे जनरेटर में, यह Subject Reference सेक्शन है। यदि आपको साउंड भी चाहिए, तो Gemini Omni Flash, जिसमें हमेशा साउंड शामिल होता है, अब और भी बेहतर है: प्रति क्लिप 10 रेफरेंस इमेज तक, और उन्हें शुरुआती फ्रेम के साथ जोड़ा जा सकता है ($0.10 प्रति सेकंड, पूरी Omni समीक्षा यहाँ पढ़ें)।

कैरेक्टर शीट अभी भी वीडियो प्रॉम्प्ट्स में अपना मूल्य साबित करती है। नीचे दी गई क्लिप Veo 3.1 Fast की है, जो केवल-टेक्स्ट आधारित है, इसमें ऊपर दी गई इमेज के समान ही डिस्क्रिप्शन ब्लॉक है, साथ ही मोशन और कैमरा लैंग्वेज को जोड़ा गया है:

प्रॉम्प्ट: वही कैरेक्टर शीट, और फिर "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field." छह सेकंड, साइलेंट 720p, $0.52। वह स्थिर तस्वीरों (stills) के समान ही पहचानी जाने वाली कैरेक्टर है, जो दो अलग-अलग मॉडल्स के बीच केवल-टेक्स्ट आधारित ट्रांसफर के लिए मेरी उम्मीद से काफी बेहतर है।

हमारे जनरेशन लॉग्स की एक चेतावनी: एसेट रेफरेंस कभी-कभी चेहरे के भावों को सपाट (flatten) कर देते हैं। चेहरा तो मेल खाता है लेकिन थोड़ा बेजान (waxy) दिखता है, खासकर वाइड शॉट्स में जहां चेहरे का हिस्सा बहुत कम पिक्सल्स घेरता है। क्लोज़-अप्स में यह बेहतर परिणाम देता है। यदि कोई क्लिप बेजान आँखों वाले मुख्य किरदार के साथ आती है, तो उसी शॉट को दोबारा जनरेट करने के बजाय कैमरे को थोड़ा क्लोज़-अप पर रीफ़्रेम करें।

तो पूरा वर्कफ़्लो कुछ इस प्रकार होगा: कैरेक्टर शीट → Nano Banana Pro पर मुख्य (hero) इमेजेस → फिर उन इमेजेस को हर स्टिल के लिए कैरेक्टर रेफरेंस के रूप में और वीडियो के लिए एसेट रेफरेंस के रूप में उपयोग करना। एक पहचान, एक ही पाइपलाइन, कीमत वाले पेज पर इमेजेस $0.06 से और वीडियो क्लिप्स $0.10 से शुरू।

FAQ

कैरेक्टर कंसिस्टेंसी के लिए कौन सा AI मॉडल सबसे अच्छा है?

आंकड़ों के अनुसार, Nano Banana Pro सबसे बेहतरीन है: इसमें 5 तक कैरेक्टर रेफरेंस इमेज और इस श्रेणी का सबसे मजबूत आइडेंटिटी लॉक मिलता है, वो भी $0.11 प्रति 1K या 2K इमेज पर। Nano Banana 2 एक किफायती विकल्प है जो $0.06 में 4 कैरेक्टर स्लॉट्स और साथ ही स्टाइल रेफरेंस प्रदान करता है, जो Pro में उपलब्ध नहीं है। इस काम के लिए Nano Banana 2 Lite से बचें; यह कैरेक्टर रेफरेंस का बिल्कुल भी समर्थन नहीं करता है।

रेफरेंस फोटो के बिना मैं अलग-अलग AI इमेजेस में एक ही चेहरा कैसे बनाए रख सकता हूँ?

एक कैरेक्टर शीट लिखें: एक निश्चित 40-60 शब्दों का विवरण जिसमें उम्र, बाल, आँखें, त्वचा, कोई खास पहचान चिन्ह और एक मुख्य एक्सेसरी शामिल हो, और इसे बिना किसी बदलाव के हर प्रॉम्प्ट में पेस्ट करें। फिर भविष्य के लिए अपने सबसे अच्छे परिणाम का उपयोग रेफरेंस इमेज के रूप में करें। केवल टेक्स्ट आपको लगभग वहाँ तक पहुँचाता है; टेक्स्ट के साथ इमेज रेफरेंस आपको पूरी तरह वहाँ बनाए रखता है।

क्या मैं किसी वास्तविक व्यक्ति की फोटो का उपयोग कैरेक्टर रेफरेंस के रूप में कर सकता हूँ?

तकनीकी रूप से API किसी भी फोटो को स्वीकार करता है। कानूनी और नैतिक रूप से, केवल उन्हीं तस्वीरों का उपयोग करें जिनके अधिकार आपके पास हैं और जिसके लिए संबंधित व्यक्ति की सहमति है। बिना सहमति के पहचाने जाने योग्य वास्तविक लोगों की छवियां जनरेट करना अधिकांश प्लेटफॉर्म्स की शर्तों का उल्लंघन करता, जिसमें हमारा प्लेटफॉर्म भी शामिल है।

मुझे कितनी रेफरेंस इमेज अपलोड करनी चाहिए?

एक जैसी कई तस्वीरों की तुलना में कम लेकिन अलग-अलग एंगल्स की तस्वीरें अधिक प्रभावी होती हैं। फ्रंट, प्रोफाइल और थ्री-क्वार्टर एंगल्स को कवर करने वाले तीन शॉट्स आमतौर पर लगभग एक जैसे पांच सेल्फ़ीज़ से बेहतर प्रदर्शन करते हैं। इसकी निश्चित सीमाएं हैं: Nano Banana 2 पर 4 कैरेक्टर इमेज, Nano Banana Pro पर 5 और Veo 3.1 वीडियो पर 3।

क्या कैरेक्टर कंसिस्टेंसी गैर-मानवीय (non-human) कैरेक्टर्स के लिए भी काम करती है?

ज्यादातर हाँ। मैस्कॉट्स (mascots), रोबोट और स्टाइल वाले जानवर अक्सर इंसानों की तुलना में बेहतर कंसिस्टेंसी बनाए रखते हैं, क्योंकि उनकी पहचान चेहरे के सूक्ष्म ज्यामिति के बजाय स्पष्ट आकृतियों और रंगों में छिपी होती है। नियम यहाँ भी समान रूप से लागू होते हैं: शीट में विशिष्ट निश्चित विशेषताएं लिखना, और एक बार कैनोनिकल डिज़ाइन (canonical design) तैयार हो जाने के बाद रेफरेंस इमेज का उपयोग करना।

tutorialimagesvideo