توليد صور متسقة الشخصية: دليل ميداني عملي
الحفاظ على نفس شخصية الذكاء الاصطناعي عبر الصور والفيديو: حدود الصور المرجعية لـ Nano Banana 2 و Pro، طريقة ورقة الشخصية، لوحات القصة، و Veo 3.1.

توليد صور متسقة الشخصية (Character consistent image generation) هو مجموعة من التقنيات التي تجعل نموذج الذكاء الاصطناعي يرسم نفس الشخصية، بنفس الوجه والشعر والملابس، عبر العديد من الصور المنفصلة بدلاً من ابتكار شخص جديد في كل مرة. إنه الفرق بين كتابة "امرأة ذات شعر أحمر في مقهى" والحصول على شخص غريب في كل مرة، وبين الحصول على امرأتك ذات الشعر الأحمر نفسها، تلك التي ظهرت في الإطار الأول من قصتك المصورة، أو حملتك الإعلانية، أو لوحة القصة الخاصة بك.
النسخة السريعة: هناك طريقتان صالحتان للعمل، ويمكن دمجهما معاً. أولاً، ارفع صوراً مرجعية لشخصيتك — وهي نفس آلية المراجع التي تشغل ميزة تبديل الوجه بالذكاء الاصطناعي على المنصة. يقبل Nano Banana 2 ما يصل إلى 4 مراجع للشخصية، ويقبل Nano Banana Pro ما يصل إلى 5، بينما ينقل Veo 3.1 ما يصل إلى 3 مراجع إلى الفيديو. ثانياً، اكتب برومبت ورقة الشخصية (character sheet prompt)، وهو وصف ثابت وشامل تقوم بنسخه ولصقه في كل عملية توليد. على BananaBanana، تبدأ تكلفة الشخصية المتسقة من $0.06 لكل 1K صورة على Nano Banana 2، وقد تم توليد كل العينات التجريبية في هذا المنشور على المنصة، لذا فإن البرومبتات هنا قابلة للنسخ واللصق كما هي تماماً.
سأكون صادقاً معك منذ البداية بشأن حالات الإخفاق أيضاً. الاتساق في النماذج الحالية جيد، ولكنه ليس مثالياً. وسترى بنفسك أين يتراجع هذا الاتساق.
لماذا تبدو الشخصية نفسها مختلفة في كل مرة؟
لا تملك نماذج الصور ذاكرة بين الطلبات. تبدأ كل عملية توليد من الضوضاء عشوائياً، ويمثل البرومبت الخاص بك الجسر الوحيد. إذا كان البرومبت يقول "امرأة شابة ذات شعر أحمر"، فإن النموذج يختار عينات عشوائية من بين ملايين النساء الشابات ذوات الشعر الأحمر اللواتي يمكنه رسمهن بشكل مقنع. شغل النموذج خمس مرات، وستحصل على خمسة أشخاص مختلفين. قد يتشاركون في الطابع العام، لكنهم لن يتشاركوا في نفس الوجه.
يُطلق على هذا اسم انحراف الشخصية (character drift)، ويزداد الأمر سوءاً مع البرومبتات الغامضة. عبارة "نفس المرأة السابقة" لا تفعل شيئاً، لأنه لا يوجد شيء "سابق" بالنسبة للنموذج. لم يسبق للنموذج أن شاهد صورتك السابقة ما لم ترفقها بشكل صريح.
يتسلل الانحراف أيضاً ضمن سير العمل الواحد. غيّر زاوية الكاميرا وسيتغير خط الفك. غيّر الزي وفجأة يختفي النمش. من واقع خبرتي، فإن الميزات الأكثر هشاشة وعرضة للتغير هي بالضبط تلك التي يستخدمها البشر للتعرف على الأشخاص: شكل العينين، الأنف، وخط الشعر. أما الخلفيات والملابس فتنجو وتظل ثابتة بشكل جيد، بينما تتشتت الوجوه وتتغير.
لذا فإن اللعبة بأكملها تكمن في إعادة تغذية الهوية إلى النموذج في كل طلب فردي، إما في شكل بكسلات (صور مرجعية) أو في شكل نص (وصف مقفل). ويفضل كلاهما معاً.

كم عدد الصور المرجعية التي يقبلها كل نموذج؟
تعتبر الصور المرجعية الطريقة الأقوى بين الطريقتين: حيث تقوم برفع صور للشخصية ويعاملها النموذج باعتبارها الحقيقة المطلقة المقاسة (ground truth). وفقاً لـ وثائق صور Gemini API من Google، تختلف الحدود بشكل حاد حسب النموذج، وتلك الاختلافات تستحق المعرفة قبل اختيار النموذج المناسب.
| النموذج | مراجع الشخصية | مراجع الكائنات | مراجع النمط | السعر لكل 1K صورة |
|---|---|---|---|---|
| Nano Banana 2 Lite | لا يوجد | ما يصل إلى 14 | لا يوجد | $0.03 |
| Nano Banana 2 | ما يصل إلى 4 | ما يصل إلى 10 | ما يصل إلى 3 | $0.06 |
| Nano Banana Pro | ما يصل إلى 5 | ما يصل إلى 6 | لا يوجد | $0.11 |
المفاجأة в هذا الجدول هي النموذج Lite. إنه يستقبل أكبر عدد من الصور إجمالاً (14)، لكن الوثائق واضحة في كونها مراجع للكائنات فقط، دون وجود أي دعم لاتساق الشخصيات. لقد تعلمنا هذا بالطريقة العملية: يقبل Lite وجهاً كمدخلات بكل سرور ثم يعامله كصورة منتج، فيطابق سترة الشخص ويفقد ملامحه الفردية. إذا كان سير عملك يعتمد على الشخصيات، فإن Lite خارج الحسابات تماماً، بغض النظر عما يقوله السعر. (بالنسبة لأي شيء آخر، فهو نموذج اقتصادي جيد حقاً؛ لقد كتبنا دليل منفصل حول متى يكون Lite كافياً.)
بين النموذجين الآخرين: سأبدأ من Nano Banana 2 بسعر $0.06. إن الخانة الخامسة للشخصيات في Pro والقفل الأقوى للهوية يمثلان أهمية بالغة في المشاهد متعددة الشخصيات والأصول النهائية، وبسعر $0.11 لكل صورة، لا يعتبر هذا فارقاً كبيراً في السعر عندما يتم تسليم الصورة واستخدامها بالفعل في مشروعك.
زاوية الصور المرفوعة تهم أكثر من عددها. فرفع ثلاثة مراجع من زاوية واحدة يعلم النموذج زاوية واحدة فقط. بينما اللقطة الأمامية، والجانبية (البروفايل)، ولقطة بزاوية ثلاثة أرباع تعلمه الرأس بالكامل.

ما هي طريقة ورقة الشخصية (character sheet)؟
ورقة الشخصية هي كتلة نصية ثابتة تصف شخصيتك بدقة متناهية، وتقوم بنسخها حرفياً في كل برومبت. إنها البديل النصي الوحيد عندما لا تتوفر لديك صور مرجعية بعد، وهي الطريقة التي تنشئ بها الصور المرجعية في المقام الأول. وهي أيضاً الطريقة التي تعمل من خلال وكلاء الذكاء الاصطناعي: إذا قمت بـ توليد الصور في Claude Code من خلال خادم MCP الخاص بنا، فإن ورقة الشخصية تنتقل داخل البرومبت دون الحاجة لأي عمليات رفع للصور.
القاعدة: صف الشخصية بالطريقة التي يريدها رسام اللوحات الجنائية في الشرطة. العمر، البنية، البشرة، لون وقصة الشعر، لون العينين، العلامات المميزة، وإكسسوار واحد أو اثنين من الإكسسوارات الثابتة. تنجرف الصفات الغامضة والفضفاضة، بينما تثبت الأسماء الملموسة والمحددة.
إليك الكتلة النصية الدقيقة المستخدمة في العروض التوضيحية أدناه:
a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt
تم توليد كلتا الصورتين أدناه باستخدام Nano Banana Pro من تلك الكتلة النصية نفسها. فقط نص المشهد المحيط بها هو الذي تغير. لم يتم إرفاق أي صور مرجعية، هذا اتساق خالص يرتكز على النص فقط:


هل هو نفس الشخص؟ نعم، بنسبة قريبة جداً. الوجه يبدو متماسكاً بشكل جيد، والسترة والقرط ثابتان، ونجا النمش في كلا المشهدين. إذا قمت بفحص البكسلات بدقة (pixel-peep)، فستجد أن طول الشعر يختلف قليلاً. هذا هو السقف الحقيقي والأمين للاتساق القائم على النص فقط، ولهذا السبب يجمع سير العمل الاحترافي بين الطريقتين: قم بتوليد أفضل صورة لشخصيتك من ورقة الشخصية، ثم أعد تغذية تلك الصورة كمرجع للشخصية في كل شيء تلا ذلك. يحدد النص الهوية، بينما تفرضها البكسلات.
نصيحتان صغيرتان إضافيتان من واقع تشغيل هذا في بيئة العمل الفعلية. تلعب الإكسسوارات الثابتة المرجعية (القرط، السترة) دوراً كبيراً في التعرف على الشخصية مقابل عدد قليل جداً من التوكينات (tokens)؛ لذا امنح كل شخصية واحدة منها. واجعل طول ورقة الشخصية أقل من 60 كلمة تقريباً، لأنه بعد ذلك الحد يبدأ وصف المشهد في منافسة وصف الشخصية على انتباه النموذج ودقته.
المشاهد متعددة الشخصيات ولوحات القصة بالذكاء الاصطناعي (AI storyboards)
وجود شخصيتين متسقتين في إطار واحد هو النقطة التي تتوقف عندها الحيل الرخيصة عن العمل. تميل ورقة النصوص المدمجة لكلا الشخصيتين إلى التداخل والتلوث الخلطي: فتستعير الشخصية "أ" شعر الشخصية "ب"، وترث الشخصية "ب" سترة الشخصية "أ". ربما يكون ذلك قابلاً للإصلاح من خلال تكرار التوليد عدة مرات، لكن إعادة التشغيل تكلف أموالاً.
الصور المرجعية تحل هذه المشكلة بشكل سليم. يقبل Nano Banana 2 ما يصل إلى 4 مراجع للشخصية ويقبل Nano Banana Pro ما يصل إلى 5، وفقاً لوثائق Google، ويمكن تقسيم هذه الخانات على أشخاص مختلفين. ارفع لقطتين أو ثلاثاً لكل شخصية، ثم اكتب المشهد محدداً إياهم بأدوارهم ("امرأة ذات شعر أحمر تسلم قهوة لرجل ذي لحية رمادية"). تظل الهوية مرتبطة بالشخص المناسب بشكل أكثر موثوقية، على الرغم من أن الأيدي التي تمرر الأشياء بين شخصين لا تزال، في عام 2026، أشبه بورقة اليانصيب وتعتمد على الحظ.
تعتبر لوحات القصة الخطوة الطبيعية التالية، وهناك طريقتان لعملها. إطاراً بإطار: توليد واحد لكل لوحة، مع إرفاق مراجع الشخصية بكل منها، بتكلفة $0.06 لكل لوحة على Nano Banana 2، مما يعني أن اللوحة المكونة من ست إطارات تكلف $0.36. أو صورة واحدة: اطلب من Nano Banana Pro تخطيطاً متعدد الألواح (multi-panel layout) في عملية توليد واحدة. تم تصميم اللوحة أدناه بهذه الطريقة، بطلب واحد بقيمة $0.11، وبنفس ورقة الشخصية الموضحة أعلاه:

الاتساق داخل صورة واحدة مجاني أساساً، لأن النموذج يرسم جميع اللوحات في تمريرة واحدة ويمكنه رؤية عمله الخاص. المقايضة هنا هي الدقة: كل لوحة تمثل ربع الإطار الإجمالي. بالنسبة للعروض التقديمية (pitch decks) والرسوم المتحركة التخطيطية (animatics)، فإن هذا جيد تماماً. أما بالنسبة للوحات التي ستنشرها بشكل فردي، فقم بالتوليد إطاراً تلو الآخر وادفع $0.36.
هل يمكنك نقل الشخصية إلى الفيديو؟
نعم، وهنا يصبح مسار العمل ممتعاً. يدعم Veo 3.1 ما تطلق عليه وثائق Vertex AI من Google الصور المرجعية للأصول (asset reference images): وهي ما يصل إلى 3 صور لشخص، أو شخصية، أو منتج، ويحافظ النموذج على مظهر ذلك الموضوع في المقطع المولد. في المولد الخاص بنا، هذا هو قسم مرجع الموضوع (Subject Reference)، بينما Gemini Omni Flash، الذي يأتي دائماً مع الصوت، أكثر سخاءً: ما يصل إلى 10 صور مرجعية لكل مقطع، ويمكن دمجها مع إطار بدء ($0.10 في الثانية، مراجعة Omni الكاملة هنا).
لا تزال ورقة الشخصية تثبت جدارتها وفائدتها في برومبتات الفيديو. المقطع أدناه تم توليده بواسطة Veo 3.1 Fast، نصياً فقط، باستخدام نفس كتلة الوصف الخاصة بالصور أعلاه، بالإضافة إلى لغة الكاميرا والحركة:
البرومبت: ورقة الشخصية، ثم "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field." ست ثوانٍ، صامت وبدقة 720p، وبسعر $0.52. من الواضح أنها نفس الشخصية الموجودة في الصور الثابتة، وهو ما يُعد بصراحة أفضل مما توقعت لنقل نصي خالص بين نموذجين مختلفين.
تنبيه من واقع سجلات التوليد الخاصة بنا: تؤدي مراجع الأصول في بعض الأحيان إلى تسطيح التعبيرات. يتطابق الوجه ولكنه يبدو جامداً قليلاً كالشمع (waxy)، خاصة في اللقطات الواسعة حيث يشغل بكسلات قليلة جداً. اللقطات القريبة (Close-ups) تبلي بلاءً أفضل. إذا ظهر مقطع بنظرات عين هامدة للشخصية الرئيسية، فقم بإعادة تأطير اللقطة لتكون أضيق بدلاً من إعادة تشغيل نفس اللقطة مجدداً.
بناءً على ما سبق، فإن النظام المتكامل بالكامل هو: ورقة الشخصية ← الصور النموذجية (hero images) على Nano Banana Pro ← تلك الصور كمراجع للشخصية لكل لقطة ثابتة وكمراجع أصول للفيديو. هوية واحدة، مسار عمل واحد، وتبدأ الصور من $0.06 والمقاطع من $0.10 على صفحة الأسعار.
الأسئلة الشائعة
أي نماذج الذكاء الاصطناعي هو الأفضل لاتساق الشخصيات؟
نموذج Nano Banana Pro، لغة الأرقام تتحدث: ما يصل إلى 5 صور مرجعية للشخصية وأقوى قفل للهوية في هذه الفئة من النماذج، بسعر $0.11 لكل صورة بدقة 1K أو 2K. بينما يعتبر Nano Banana 2 الخيار الاقتصادي المميز بسعر $0.06 مع 4 خانات للشخصية بالإضافة إلى مراجع النمط، وهي ميزة يفتقر إليها Pro. تجنب Nano Banana 2 Lite لحالة الاستخدام هذه، حيث إنه لا يدعم مراجع الشخصيات على الإطلاق.
كيف يمكنني الحفاظ على نفس الوجه عبر صور الذكاء الاصطناعي بدون صور مرجعية؟
اكتب ورقة الشخصية (character sheet): وصفاً ثابتاً يتراوح بين 40 و 60 كلمة يغطي العمر، الشعر، العينين، البشرة، العلامات المميزة، وإكسسواراً مرجعياً واحداً، والصقه دون تغيير في كل برومبت. بعد ذلك، استخدم أفضل مخرجاتك كصورة مرجعية في المستقبل. يوصلك النص بمفرده إلى النتيجة التقريبية، بينما النص المدمج مع مراجع الصور يبقيك هناك تماماً.
هل يمكنني استخدام صورة لشخص حقيقي كمرجع للشخصية؟
من الناحية التقنية، يقبل الـ API أي صورة. أما من الناحية القانونية والأخلاقية، استخدم فقط الصور التي تملك حقوقها وحصلت على موافقة الشخص المعني بها. إن توليد صور لأشخاص حقيقيين يمكن التعرف عليهم دون موافقتهم ينتهك شروط معظم المنصات، بما في ذلك منصتنا.
كم عدد الصور المرجعية التي يجب علي رفعها؟
الصور الأقل والأكثر تنوعاً تتفوق على الصور المتعددة المتشابهة. ثلاث لقطات تغطي الزاوية الأمامية، والجانبية، وزاوية ثلاثة أرباع تؤدي عادةً أداءً أفضل من خمس صور شخصية (selfies) متطابقة تقريباً. الحدود القصوى الصارمة هي: 4 صور للشخصية في Nano Banana 2، و 5 صور في Nano Banana Pro، و 3 صور في فيديو Veo 3.1.
هل يعمل اتساق الشخصيات مع الشخصيات غير البشرية؟
نعم، في الغالب. غالباً ما تثبت التمائم (mascots)، والروبوتات، والحيوانات ذات التصميم الفني بشكل أفضل من البشر، لأن هويتها تكمن في الأشكال والألوان الواضحة البارزة بدلاً من التفاصيل الهندسية الدقيقة للوجه. وتطبق نفس الأساليب: سمات ثابتة ومميزة في ورقة الشخصية، وصور مرجعية بمجرد حصولك على التصميم النموذجي المعتمد.