العودة إلى المدونة
BananaBanana Teamtutorialvideoimage-to-video

تحويل الصور إلى فيديو بالذكاء الاصطناعي: حوّل أي صورة إلى مقطع متحرك

تعرف على كيفية تحويل الصورة إلى فيديو بالذكاء الاصطناعي، وكيفية اختيار النموذج الأنسب (Veo 3.1 وOmni Flash وWan 3.0 وGrok)، والأسعار الحقيقية من $0.10 للمقطع، وموجهات الحركة، والتكرارات، وسلاسل بطول 148 ثانية.

تحويل الصور إلى فيديو بالذكاء الاصطناعي: حوّل أي صورة إلى مقطع متحرك

إن تحويل الصورة إلى فيديو هو تقنية توليد يأخذ فيها النموذج صورة ثابتة واحدة، ويعاملها كإطار أول للمقطع، ويبتكر كل ما يحدث بعد ذلك: الحركة، وحركة الكاميرا، وتغيرات الإضاءة، وأحيانًا الصوت. كل ما عليك هو تقديم صورة ووصف نصي لما يجب أن يتحرك، ليعيد إليك النموذج مقطع فيديو قصيرًا يتراوح عادة بين 4 إلى 10 ثوانٍ، تبث فيه الحياة في صورتك بدقة.

الملخص السريع، إذا كان هذا كل ما تحتاج لمعرفته: ارفع صورة في مولد BananaBanana، وصف الحركة المطلوبة، ثم انتظر من دقيقتين إلى 5 دقائق. يبدأ سعر المقطع الصامت مدته 4 ثوانٍ من صورتك من $0.10 على Veo 3.1 Lite، ويرتفع السعر مع الصوت إلى $0.18، ويحرّك Gemini Omni Flash الصورة مع مقطع صوتي كامل بدءًا من $0.09 (يُحتسب بالثانية، من $0.03 بدقة 360p إلى $0.30 بدقة 4K)، ويفعل Wan 3.0 ذلك مع صوت مجاني بدءًا من $0.20 لمقطع 4 ثوانٍ بدقة 480p. تحصل الحسابات الجديدة على $0.20 مجانًا، وهو ما يغطي مقطعين تجريبيين صامتين.

نحن نشغّل سبعة نماذج فيديو في بيئة الإنتاج الفعلي، وكل واحد منها يقبل صورة كإطار أول، لذا يغطي هذا الدليل السبعة جميعًا، وقد كُتب بناءً على سجلات توليد حقيقية لا صفحات التسويق، بما في ذلك المحاولات الفاشلة، والتي يُعد بعضها أكثر فائدة وتعليمًا من النجاحات.

كيف يعمل تحويل الصورة إلى فيديو بالذكاء الاصطناعي؟

خلف الكواليس، تُمرر الصورة الثابتة إلى النموذج كإطار توجيهي (conditioning frame). تصف وثائق فيديو Gemini API الخاصة بجوجل نموذج Veo 3.1 بأنه يدعم "التوجيه المستند إلى الصورة" (image-based direction) و"التوليد المخصص لإطارات معينة" (frame-specific generation)، وهو ما يعني بلغة بسيطة أن صورتك تقود مقطع الفيديو بالكامل ويمكنك تثبيت إطارات محددة بدقة في الأماكن التي تريدها. يقرأ النموذج المشهد، ويتوقع قوانين الفيزياء (كيف تتماوج المياه في صورتك، أو كيف يتحرك الشعر في مهب الريح)، ثم يرنّد الإطار تلو الآخر بدءًا من نقطة انطلاقك.

النتيجة العملية: الإطار الأول من الفيديو الناتج هو صورتك نفسها، بكسلًا ببكسل تقريبًا، وكل ما يليه هو من ابتكار النموذج. لذا، فإن الموجهات (prompts) الجيدة تُركز كلماتها على الابتكار والحركة المطلوبة، وليس على إعادة وصف ما يمكن للنموذج رؤيته بالفعل.

يعمل هذا الأمر بشكل مذهل مع المشاهد التي تحتوي على حركة كامنة واضحة؛ فالشخصية في الصورة الشخصية تتنفس وتغمش عينيها، والبخار يتصاعد من فنجان القهوة، والسيارة المتوقفة تنطلق. لكنه يعمل بكفاءة أقل عندما لا تحتوي الصورة على أي حركة منطقية محتملة: فإذا قمت بتغذية النموذج بصورة مسطحة لمنتج على خلفية بيضاء دون أي إشارة للحركة في الموجه، فستحصل غالبًا على تقريب (zoom) بطيء ومتذبذب قليلًا. الفيديو ليس تالفًا، لكنه ببساطة ممل.

صورة فوتوغرافية قديمة ممسكة بين يدين حيث يبدأ المشهد بداخلها في التماوج والتحرك، لتوضيح تحريك الصورة إلى فيديو بالذكاء الاصطناعي

أي نموذج هو الأفضل في تحويل الصورة إلى فيديو؟

تقبل جميع نماذج الفيديو السبعة المتوفرة على المنصة الصورة كإطار أول، لكنها تختلف في قدراتها القصوى وفي التكلفة التي تدفعها. لنبدأ بنماذج Google:

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
السعر (4s، صامت)$0.70$0.35$0.10—
السعر (4s، مع الصوت)$1.50$0.50$0.18$0.12 بدقة 360p، و$0.40 بدقة 720p
أقصى دقة4K4K1080p4K (بالترقية)
المدةتحديدًا 4/6/7/8 sتحديدًا 4/6/7/8 sتحديدًا 4/6/7/8 sتحديدًا 3–10 s
الصوتخيار تفعيل اختياريخيار تفعيل اختياريخيار تفعيل اختياريمفعّل دائمًا
الإطار الأخير + التكرار اللانهائينعمنعمنعمنعم (Omni 1.1)
التمديدحتى 148sحتى 148sلاحتى 40s، إضافة إلى تعديل الفيديو

خياري الافتراضي هو Veo 3.1 Fast؛ فهو يوفر أدوات التحكم المفيدة (المدة المحددة بدقة، إمكانية تحديد إطار أخير اختياري، وتمديد المقطع) بنصف سعر النموذج الرائد، وبالنسبة للمقاطع المخصصة لوسائل التواصل الاجتماعي، نادرًا ما تظهر فجوة الجودة مقارنة بنموذج Veo 3.1 الكامل. أما نموذج Lite بسعر $0.10 فهو المكان الذي أختبر فيه ما إذا كانت الفكرة قابلة للحركة أصلًا قبل إنفاق أموال حقيقية عليها. يثبت Veo 3.1 الكامل جدارته بسعره عندما يشتمل المقطع على الماء أو الأقمشة أو التصادمات، أو عندما تتطلب مواصفات التسليم دقة 4K. ويكون Omni Flash هو الخيار الأنسب عندما يكون الصوت بأهمية الصورة نفسها؛ وقد قمنا بتحليله بالتفصيل في مراجعة واجهة برمجة تطبيقات Omni Flash منفصلة إذا كنت ترغب في معرفة التفاصيل، بما في ذلك كيف يتدرج سعره بالثانية من دقة 360p وحتى 4K. أما الجيل السابق، Omni Flash 1.0، فما زال متاحًا للاختيار بمدة من 4 إلى 10 ثوانٍ ويقبل إطارًا أول فقط.

المقطع أعلاه هو من توليد Veo 3.1 Fast من نظام الإنتاج لدينا، وقد تم إعداده خصيصًا لهذا المقال: صورة فوتوغرافية مؤطرة لقارب شراعي على مكتب، ويطلب الموجه من البحر داخل الإطار البدء في التحرك بينما تتقدم الكاميرا ببطء للداخل. تم التوليد من لقطة واحدة، ودون أي تعديل، وصامت باختياري (الفئة الصامتة لنموذج Fast هي ما نستخدمه للمسودات). تأثير "استيقاظ الصورة" هذا هو بالضبط ما يفعله النموذج بالصور التي ترفعها.

ثم النموذجان اللذان انضمّا في سبتمبر، من Alibaba وxAI:

Wan 3.0Grok Imagine Video 1.5
السعر (4s، مع الصوت)$0.20 بدقة 480p، و$0.40 بدقة 720p، و$0.80 بدقة 1080p$0.56 بدقة 720p
أقصى دقة1080p1080p (الصور المرجعية بدقة 720p فقط)
المدة4 أو 6 أو 8 أو 10 أو 15 أو 20 أو 30 sأي عدد صحيح من 4 إلى 15 s
الصوتمفعّل افتراضيًا ومجاني، ويمكن إيقافهمفعّل دائمًا، مع حوار متزامن مع الشفاه
الإطار الأخير + التكرار اللانهائينعملا
التمديدلا، لكن 30s في لقطة واحدةلا

Wan 3.0 هو ما أوجّه إليه الصورة حين يجب أن يتجاوز المقطع عشر ثوانٍ أو أن يأتي بصوت دون دفع مبلغ إضافي مقابله. أما Grok فهو لصورة شخص عليه أن يقول شيئًا بعد ذلك: اكتب الجملة بين علامتي اقتباس وستتبعها حركة الفم. الصورة نفسها للمنطاد (من توليد Nano Banana Pro، فلا يظهر فيها وجه أي شخص حقيقي) عبر النموذجين، مع الموجه نفسه الذي يطلب أن يرتفع المنطاد المربوط قليلًا بينما يتوهج موقده وينجرف الضباب:

Wan 3.0، ست ثوانٍ بدقة 720p، بـ $0.60. حافظ على الصورة بكسلًا ببكسل تقريبًا، ورفع المنطاد بضعة أمتار، وكشف حبل ربط لم يكن ظاهرًا في الصورة الثابتة، ووضع على المسار الصوتي نفثات قصيرة من الموقد وتغريد طيور دون الحاجة إلى طلب ذلك مرتين.

Grok Imagine Video 1.5، ست ثوانٍ بدقة 720p، بـ $0.84. حركة أهدأ، والوفاء نفسه للمصدر، وتفصيل من السجلات يستحق المعرفة: عاد الملف بدقة 1280×704، لا 720 صفًا حقيقيًا. لا بأس بذلك في موجز منصات التواصل، لكنه مزعج إن كنت تدمج اللقطات في مونتاج.

كيفية توليد فيديو من صورة، خطوة بخطوة

تستغرق العملية بالكامل في المولد حوالي دقيقة واحدة من وقتك، بالإضافة إلى وقت الرندرة (التوليد).

  1. حوّل المولد إلى وضع الفيديو واختر النموذج. للتجربة الأولى، يُعد Veo 3.1 Lite بسعر $0.10 طريقة اقتصادية للتعلم.
  2. ارفع صورتك كإطار أول. تقبل المنصة صيغ JPG أو PNG، وسيتم قص الصورة لتناسب نسبة العرض إلى الارتفاع الخاصة بالفيديو، لذا تحقق من الأطراف قبل البدء في التوليد.
  3. اختر نسبة العرض إلى الارتفاع 16:9 أو 9:16. تعمل الأبعاد الرأسية بشكل ممتاز لمنصات TikTok و Reels، حيث يتعامل النموذج مع التوجيه الرأسي دون أي مشاكل.
  4. اكتب موجه الحركة (القسم التالي)، واكتب اختياريًا موجهًا سلبيًا (negative prompt) يصل إلى 1000 حرف لتجنب الأشياء التي لا تريدها.
  5. اختر المدة وما إذا كنت تريد تشغيل الصوت. كلاهما إعدادات دقيقة في نماذج Veo؛ أما في Omni Flash، فتختار أي مدة من 3 إلى 10 ثوانٍ ويكون الصوت مفعّلاً دائمًا. ويصل Wan 3.0 إلى 30 ثانية مع مسار صوتي مجاني يمكنك إيقافه، بينما يقبل Grok أي مدة من 4 إلى 15 ثانية ويتكلم دائمًا.
  6. اضغط على توليد (Generate). تستغرق الفيديوهات عادةً من دقيقتين إلى 5 دقائق. يمكنك إغلاق التبويب؛ حيث ستبقى النتائج محفوظة في سجل المحفوظات الخاص بك لمدة 30 يومًا.

يتم خصم الرصيد فقط عندما تنجح عملية التوليد. وتُسترد تكلفة عمليات الرندرة الفاشلة تلقائيًا، وهو أمر بالغ الأهمية في إنتاج الفيديو مقارنة بالصور لأنك ستحتاج إلى التكرار والتجربة المستمرة.

مخطط تسلسلي (storyboard) من ثلاثة أقسام يظهر يدًا ترفع صورة، ولوحة إعدادات، ومشغل فيديو مكتمل، لتوضيح سير عمل تحويل الصورة إلى فيديو

كيف تكتب موجهات الحركة لتحويل الصورة إلى فيديو؟

القاعدة الأولى: صف الحركة، لا المشهد؛ فالمشهد موجود بالفعل في الصورة. كتابة "امرأة ترتدي معطفًا أحمر تقف على جسر" تستهلك الموجه في تفاصيل يراها النموذج بالفعل. بينما جملة مثل "تلتفت نحو الكاميرا وتبتسم بينما تداعب الرياح شعرها، مع تقريب بطيء للكاميرا (slow dolly-in)" لها نفس الطول ولكنها تحمل التوجيه الفعلي بالكامل.

تؤدي مصطلحات حركة الكاميرا دورًا كبيرًا مع نماذج Veo، مثل: Dolly in، و orbit، و handheld، و static tripod shot، و slow pan left. من الواضح أن هذه النماذج قد تدرّبت على أوصاف حقيقية لمقاطع الفيديو، لذا فهي تستجيب للمصطلحات السينمائية بشكل أكثر موثوقية من العبارات الفضفاضة مثل "اجعله حيويًا" (make it dynamic). أنصحك بتجنب كلمة "حيوي" تمامًا؛ فلم يتفق أحد على معناها بدقة، بما في ذلك النموذج نفسه.

أحد الدروس التي تعلمناها بالطريقة الصعبة والمكلفة أثناء إنتاج المقاطع التجريبية لهذا المدونة: تحتفظ هذه النماذج بما يحدث بالفعل في الإطار الأول وتتجاهل بهدوء الإجراءات المجدولة للبدء لاحقًا. لقد طلبنا ذات مرة من Omni Flash قلب شطيرة بان كيك "في منتصف المقطع تقريبًا"، وحصلنا على عشر ثوانٍ لبان كيك ساكنة تمامًا دون حراك. تكرر هذا ثلاث مرات متتالية، بتكلفة دولار واحد لكل محاولة. لكن إعادة صياغة الحركة لتكون قيد التنفيذ بالفعل أصلحت المشكلة من المحاولة الأولى. لذلك: جملة "الشراب ينسكب فوق طبقات البان كيك" تتفوق تمامًا على "يبدأ انسكاب الشراب بعد ثانيتين". وبالنسبة لتحويل الصورة إلى فيديو تحديدًا، اختر صورة بداية تكون فيها الحركة التي تريدها منطقية ومن المحتمل حدوثها في منتصف المشهد.

إليك بعض الأنماط الفعالة التي أثبتت كفاءتها دائمًا:

  • الصور الشخصية (Portraits): كتابة موجه مثل "subtle breathing, a slow blink, then a small smile; camera locked" (تنفس خفيف، وغمضة عين بطيئة، ثم ابتسامة صغيرة؛ مع تثبيت الكاميرا) تعطي إحساسًا بالحياة دون حدوث التشوهات الغريبة الناتجة عن الحركات الكبيرة.
  • المنتجات (Products): موجه مثل "slow 180-degree orbit around the object, studio lighting stays constant" (دوران بطيء بمقدار 180 درجة حول المنتج، مع بقاء إضاءة الاستوديو ثابتة) هو الخيار المعتمد دائمًا لهذه الفئة. احرص على إبقاء الخلفية بسيطة في الصورة الأصلية.
  • المناظر الطبيعية (Landscapes): حدد العناصر المتحركة بالاسم (مثل: "clouds drift right, grass sways, light shifts warmer" - السحب تتحرك نحو اليمين، والأعشاب تتمايل، والإضاءة تتحول لدرجة أكثر دفئًا) وإلا ستحصل على تأثير التقريب المتذبذب الافتراضي.

لوحة كلاكيت مخرج بجانب ملاحظات مكتوبة بخط اليد لموجهات مع أسهم توضح حركات الكاميرا فوق صورة فوتوغرافية، لتوضيح كيفية كتابة موجهات الحركة

التكرارات، الإطارات الأخيرة، والفيديوهات بطول 148 ثانية

تقبل نماذج Veo 3.1 إطارًا أخيرًا اختياريًا بالإضافة إلى الإطار الأول، وكذلك Omni 1.1 وWan 3.0. إذا زوّدت النموذج بصورتين مختلفتين، فسيقوم برندرة انتقال بينهما، وهذه هي الطريقة التي يمكنك بها تحويل لقطة نهارية إلى لقطة ليلية، أو رسم تخطيطي إلى منتج نهائي. وإذا زودتها بالصورة نفسها في البداية والنهاية، فستحصل على مقطع ينتهي من حيث بدأ: تكرار سلس ونظيف (clean loop)، جاهز ليكون خلفية لموقع إلكتروني أو منشورًا بأسلوب السينماغراف (cinemagraph). هذه هي ميزتي المفضلة غير المستغلة بما يكفي على المنصة.

ميزة التمديد (Extension) هي الخدعة الأخرى التي تقدمها نماذج Veo. حيث يمكن تمديد المقطع المكتمل بمقدار 7 ثوانٍ إضافية باستخدام موجه جديد، ويمكن أن تستمر السلسلة لتصل إلى 148 ثانية إجمالاً مع استمرارية بصرية كاملة (هذه الميزة مدعومة في Veo 3.1 و Fast فقط، بينما لا يدعمها نموذج Lite). إن بدء سلسلة طويلة من صورة تملكها هو أقرب شيء لصناعة الأفلام دون الحاجة إلى لوحة عمل (storyboard) تقدمه واجهات برمجة التطبيقات الحالية. تذكر أن هذا الأمر يضاعف التكلفة أيضًا، لذا احسب ميزانيتك جيدًا قبل أن تقع في حب هذه الفكرة. وإن كانت 30 ثانية تكفيك، فإن Wan 3.0 يولّدها في لقطة واحدة من صورتك، بلا لصق ولا انحراف في الاستمرارية، مقابل $1.50 بدقة 480p أو $3.00 بدقة 720p.

أصبح لدى Omni Flash الآن ميزة تمديد خاصة به: تضيف كل خطوة من 3 إلى 10 ثوانٍ إلى المقطع الأخير، بحد أقصى يصل تراكميًا إلى نحو 40 ثانية إجمالاً، وهو سقف أقل من حد Veo البالغ 148 ثانية. كما يحتفظ Omni Flash بالتعديل الحواري إلى جانب ذلك: صف تغييرًا للمقطع النهائي ("make it dusk, keep everything else the same" - اجعله وقت الغسق، وحافظ على بقاء كل شيء آخر كما هو) وادفع مقابل ثوانيه مرة أخرى — كما يقبل الفيديوهات التي لم ينتجها هو، بما في ذلك تحميلاتك الخاصة، ويعيدها بنفس الطول. فلسفة مختلفة. التحرير يُنقّح لحظة واحدة؛ والتمديد ينمّي جدولًا زمنيًا.

شريط من إطارات الأفلام منحني ليشكّل دائرة كاملة على خلفية ملونة، لتوضيح تكرار فيديو الذكاء الاصطناعي الذي ينتهي من حيث بدأ

الأسئلة الشائعة

هل يمكنني تحويل صورة إلى فيديو مجانًا؟

تقريبًا. يأتي حساب BananaBanana الجديد برصيد ترحيبي قدره $0.20 ودون الحاجة لإدخال بطاقة دفع، وهو ما يكفي لمقطعين صامتين مدة كل منهما 4 ثوانٍ باستخدام نموذج Veo 3.1 Lite من صورتك. بعد ذلك، يتم الدفع مقابل كل مقطع تولده، بدءًا من $0.10.

ما هو الخيار الأرخص لواجهة برمجة تطبيقات تحويل الصورة إلى فيديو؟

على منصة BananaBanana، الخيار الأرخص هو نموذج Veo 3.1 Lite: حيث تبلغ التكلفة $0.10 لمقطع صامت مدته 4 ثوانٍ بدقة 720p، و $0.18 مع الصوت. هذا السعر يُحتسب لكل عملية توليد ناجحة، مع استرداد تلقائي للمبالغ في حالة الفشل، ودون الحاجة إلى اشتراك أو إعداد حساب Google Cloud.

هل يمكن أن يشتمل الفيديو المولد على صوت؟

نعم. تشتمل نماذج Veo 3.1 على زر لتفعيل الصوت (الحوارات، المؤثرات، والأصوات المحيطية الموصوفة في موجهك)، ويولّد Gemini Omni Flash الصوت دائمًا، وهو مشمول في سعره بالثانية (من $0.03 بدقة 360p إلى $0.30 بدقة 4K)، ويضيف Wan 3.0 مسارًا صوتيًا مجانًا، وينطق Grok Imagine Video 1.5 الحوار الذي تكتبه.

هل يمكنني تحريك صورة عمودية لمنصات TikTok أو Reels؟

نعم، تدعم النماذج السبعة جميعها نسبة 9:16، ويضيف Grok Imagine Video 1.5 النسب 1:1 و3:2 و2:3. ارفع الصورة، واختر أبعاد 9:16، وتذكر أن الصورة المصدر سيتم قصها لتناسب هذه النسبة، لذا احرص على ترك مساحة كافية أعلى الصورة الأصلية.

ما أقصى مدة يمكن أن يصل إليها فيديو ذكاء اصطناعي مصنوع من صورة؟

تتراوح مدة كل مقطع بين 4 و8 ثوانٍ في نماذج Veo، ومن 3 إلى 10 ثوانٍ في Omni Flash، ومن 4 إلى 15 في Grok، وحتى 30 ثانية في لقطة واحدة على Wan 3.0. كما يمكن تمديد المقاطع المولدة بنماذج Veo 3.1 و Veo 3.1 Fast بخطوات مدتها 7 ثوانٍ لتصل إلى 148 ثانية إجمالاً، مع الحفاظ الكامل على الاستمرارية البصرية لصورتك الأصلية، بينما يمدّد Omni 1.1 المقطع حتى نحو 40 ثانية.

tutorialvideoimage-to-video