العودة إلى المدونة
BananaBanana Teamtutorialvideoimage-to-video

تحويل الصور إلى فيديو بالذكاء الاصطناعي: حوّل أي صورة إلى مقطع متحرك

تعرف على كيفية تحويل الصورة إلى فيديو بالذكاء الاصطناعي، وكيفية اختيار النموذج الأنسب (Veo 3.1 مقابل Omni Flash)، والأسعار الحقيقية التي تبدأ من $0.10 للمقطع، مع نصائح لكتابة موجهات الحركة، والتكرارات اللانهائية، وسلاسل الفيديو بطول 148 ثانية.

تحويل الصور إلى فيديو بالذكاء الاصطناعي: حوّل أي صورة إلى مقطع متحرك

إن تحويل الصورة إلى فيديو هو تقنية توليد يأخذ فيها النموذج صورة ثابتة واحدة، ويعاملها كإطار أول للمقطع، ويبتكر كل ما يحدث بعد ذلك: الحركة، وحركة الكاميرا، وتغيرات الإضاءة، وأحيانًا الصوت. كل ما عليك هو تقديم صورة ووصف نصي لما يجب أن يتحرك، ليعيد إليك النموذج مقطع فيديو قصيرًا يتراوح عادة بين 4 إلى 10 ثوانٍ، تبث فيه الحياة في صورتك بدقة.

الملخص السريع، إذا كان هذا كل ما تحتاج لمعرفته: ارفع صورة في مولد BananaBanana، وصف الحركة المطلوبة، ثم انتظر من دقيقتين إلى 5 دقائق. يبدأ سعر المقطع الصامت مدته 4 ثوانٍ من صورتك من $0.10 على Veo 3.1 Lite، ويرتفع السعر مع الصوت إلى $0.18، بينما يقوم Gemini Omni Flash بتحريك الصورة مع مقطع صوتي كامل بدءًا من $0.30 (يتم احتساب $0.10 للثانية). تحصل الحسابات الجديدة على $0.20 مجانًا، وهو ما يغطي مقطعين تجريبيين صامتين.

نحن نشغّل أربعة نماذج فيديو في بيئة الإنتاج الفعلي، لذلك كُتب هذا الدليل بناءً على سجلات توليد حقيقية لا صفحات التسويق، بما في ذلك المحاولات الفاشلة، والتي يُعد بعضها أكثر فائدة وتعليمًا من النجاحات.

كيف يعمل تحويل الصورة إلى فيديو بالذكاء الاصطناعي؟

خلف الكواليس، تُمرر الصورة الثابتة إلى النموذج كإطار توجيهي (conditioning frame). تصف وثائق فيديو Gemini API الخاصة بجوجل نموذج Veo 3.1 بأنه يدعم "التوجيه المستند إلى الصورة" (image-based direction) و"التوليد المخصص لإطارات معينة" (frame-specific generation)، وهو ما يعني بلغة بسيطة أن صورتك تقود مقطع الفيديو بالكامل ويمكنك تثبيت إطارات محددة بدقة في الأماكن التي تريدها. يقرأ النموذج المشهد، ويتوقع قوانين الفيزياء (كيف تتماوج المياه في صورتك، أو كيف يتحرك الشعر في مهب الريح)، ثم يرنّد الإطار تلو الآخر بدءًا من نقطة انطلاقك.

النتيجة العملية: الإطار الأول من الفيديو الناتج هو صورتك نفسها، بكسلًا ببكسل تقريبًا، وكل ما يليه هو من ابتكار النموذج. لذا، فإن الموجهات (prompts) الجيدة تُركز كلماتها على الابتكار والحركة المطلوبة، وليس على إعادة وصف ما يمكن للنموذج رؤيته بالفعل.

يعمل هذا الأمر بشكل مذهل مع المشاهد التي تحتوي على حركة كامنة واضحة؛ فالشخصية في الصورة الشخصية تتنفس وتغمش عينيها، والبخار يتصاعد من فنجان القهوة، والسيارة المتوقفة تنطلق. لكنه يعمل بكفاءة أقل عندما لا تحتوي الصورة على أي حركة منطقية محتملة: فإذا قمت بتغذية النموذج بصورة مسطحة لمنتج على خلفية بيضاء دون أي إشارة للحركة في الموجه، فستحصل غالبًا على تقريب (zoom) بطيء ومتذبذب قليلًا. الفيديو ليس تالفًا، لكنه ببساطة ممل.

صورة فوتوغرافية قديمة ممسكة بين يدين حيث يبدأ المشهد بداخلها في التماوج والتحرك، لتوضيح تحريك الصورة إلى فيديو بالذكاء الاصطناعي

أي نموذج هو الأفضل في تحويل الصورة إلى فيديو؟

تقبل جميع نماذج الفيديو الأربعة المتوفرة على المنصة الصورة كإطار أول، لكنها تختلف في قدراتها القصوى وفي التكلفة التي تدفعها.

Veo 3.1Veo 3.1 FastVeo 3.1 LiteGemini Omni Flash
السعر (4s، صامت)$0.70$0.35$0.10
السعر (4s، مع الصوت)$1.50$0.50$0.18$0.40 ($0.10 لكل ثانية)
أقصى دقة4K4K1080p720p فقط
المدةتحديدًا 4/6/7/8 sتحديدًا 4/6/7/8 sتحديدًا 4/6/7/8 sتحديدًا 3–10 s
الصوتخيار تفعيل اختياريخيار تفعيل اختياريخيار تفعيل اختياريمفعّل دائمًا
الإطار الأخير + التكرار اللانهائينعمنعمنعملا
التمديد حتى 148sنعمنعملالا، متاح التعديل الحواري بدلًا من ذلك

خياري الافتراضي هو Veo 3.1 Fast؛ فهو يوفر أدوات التحكم المفيدة (المدة المحددة بدقة، إمكانية تحديد إطار أخير اختياري، وتمديد المقطع) بنصف سعر النموذج الرائد، وبالنسبة للمقاطع المخصصة لوسائل التواصل الاجتماعي، نادرًا ما تظهر فجوة الجودة مقارنة بنموذج Veo 3.1 الكامل. أما نموذج Lite بسعر $0.10 فهو المكان الذي أختبر فيه ما إذا كانت الفكرة قابلة للحركة أصلًا قبل إنفاق أموال حقيقية عليها. يثبت Veo 3.1 الكامل جدارته بسعره عندما يشتمل المقطع على الماء أو الأقمشة أو التصادمات، أو عندما تتطلب مواصفات التسليم دقة 4K. ويكون Omni Flash هو الخيار الأنسب عندما يكون الصوت بأهمية الصورة نفسها؛ وقد قمنا بتحليله بالتفصيل في مراجعة واجهة برمجة تطبيقات Omni Flash منفصلة إذا كنت ترغب في معرفة التفاصيل، بما في ذلك حد دقة 720p، والذي يبدو صراحةً مزعجًا عند العرض بملء الشاشة.

المقطع أعلاه هو من توليد Veo 3.1 Fast من نظام الإنتاج لدينا، وقد تم إعداده خصيصًا لهذا المقال: صورة فوتوغرافية مؤطرة لقارب شراعي على مكتب، ويطلب الموجه من البحر داخل الإطار البدء في التحرك بينما تتقدم الكاميرا ببطء للداخل. تم التوليد من لقطة واحدة، ودون أي تعديل، وصامت باختياري (الفئة الصامتة لنموذج Fast هي ما نستخدمه للمسودات). تأثير "استيقاظ الصورة" هذا هو بالضبط ما يفعله النموذج بالصور التي ترفعها.

كيفية توليد فيديو من صورة، خطوة بخطوة

تستغرق العملية بالكامل في المولد حوالي دقيقة واحدة من وقتك، بالإضافة إلى وقت الرندرة (التوليد).

  1. حوّل المولد إلى وضع الفيديو واختر النموذج. للتجربة الأولى، يُعد Veo 3.1 Lite بسعر $0.10 طريقة اقتصادية للتعلم.
  2. ارفع صورتك كإطار أول. تقبل المنصة صيغ JPG أو PNG، وسيتم قص الصورة لتناسب نسبة العرض إلى الارتفاع الخاصة بالفيديو، لذا تحقق من الأطراف قبل البدء في التوليد.
  3. اختر نسبة العرض إلى الارتفاع 16:9 أو 9:16. تعمل الأبعاد الرأسية بشكل ممتاز لمنصات TikTok و Reels، حيث يتعامل النموذج مع التوجيه الرأسي دون أي مشاكل.
  4. اكتب موجه الحركة (القسم التالي)، واكتب اختياريًا موجهًا سلبيًا (negative prompt) يصل إلى 1000 حرف لتجنب الأشياء التي لا تريدها.
  5. اختر المدة وما إذا كنت تريد تشغيل الصوت. كلاهما إعدادات دقيقة في نماذج Veo؛ أما في Omni Flash، فتختار أي مدة من 3 إلى 10 ثوانٍ ويكون الصوت مفعّلاً دائمًا.
  6. اضغط على توليد (Generate). تستغرق الفيديوهات عادةً من دقيقتين إلى 5 دقائق. يمكنك إغلاق التبويب؛ حيث ستبقى النتائج محفوظة في سجل المحفوظات الخاص بك لمدة 30 يومًا.

يتم خصم الرصيد فقط عندما تنجح عملية التوليد. وتُسترد تكلفة عمليات الرندرة الفاشلة تلقائيًا، وهو أمر بالغ الأهمية في إنتاج الفيديو مقارنة بالصور لأنك ستحتاج إلى التكرار والتجربة المستمرة.

مخطط تسلسلي (storyboard) من ثلاثة أقسام يظهر يدًا ترفع صورة، ولوحة إعدادات، ومشغل فيديو مكتمل، لتوضيح سير عمل تحويل الصورة إلى فيديو

كيف تكتب موجهات الحركة لتحويل الصورة إلى فيديو؟

القاعدة الأولى: صف الحركة، لا المشهد؛ فالمشهد موجود بالفعل في الصورة. كتابة "امرأة ترتدي معطفًا أحمر تقف على جسر" تستهلك الموجه في تفاصيل يراها النموذج بالفعل. بينما جملة مثل "تلتفت نحو الكاميرا وتبتسم بينما تداعب الرياح شعرها، مع تقريب بطيء للكاميرا (slow dolly-in)" لها نفس الطول ولكنها تحمل التوجيه الفعلي بالكامل.

تؤدي مصطلحات حركة الكاميرا دورًا كبيرًا مع نماذج Veo، مثل: Dolly in، و orbit، و handheld، و static tripod shot، و slow pan left. من الواضح أن هذه النماذج قد تدرّبت على أوصاف حقيقية لمقاطع الفيديو، لذا فهي تستجيب للمصطلحات السينمائية بشكل أكثر موثوقية من العبارات الفضفاضة مثل "اجعله حيويًا" (make it dynamic). أنصحك بتجنب كلمة "حيوي" تمامًا؛ فلم يتفق أحد على معناها بدقة، بما في ذلك النموذج نفسه.

أحد الدروس التي تعلمناها بالطريقة الصعبة والمكلفة أثناء إنتاج المقاطع التجريبية لهذا المدونة: تحتفظ هذه النماذج بما يحدث بالفعل في الإطار الأول وتتجاهل بهدوء الإجراءات المجدولة للبدء لاحقًا. لقد طلبنا ذات مرة من Omni Flash قلب شطيرة بان كيك "في منتصف المقطع تقريبًا"، وحصلنا على عشر ثوانٍ لبان كيك ساكنة تمامًا دون حراك. تكرر هذا ثلاث مرات متتالية، بتكلفة دولار واحد لكل محاولة. لكن إعادة صياغة الحركة لتكون قيد التنفيذ بالفعل أصلحت المشكلة من المحاولة الأولى. لذلك: جملة "الشراب ينسكب فوق طبقات البان كيك" تتفوق تمامًا على "يبدأ انسكاب الشراب بعد ثانيتين". وبالنسبة لتحويل الصورة إلى فيديو تحديدًا، اختر صورة بداية تكون فيها الحركة التي تريدها منطقية ومن المحتمل حدوثها في منتصف المشهد.

إليك بعض الأنماط الفعالة التي أثبتت كفاءتها دائمًا:

  • الصور الشخصية (Portraits): كتابة موجه مثل "subtle breathing, a slow blink, then a small smile; camera locked" (تنفس خفيف، وغمضة عين بطيئة، ثم ابتسامة صغيرة؛ مع تثبيت الكاميرا) تعطي إحساسًا بالحياة دون حدوث التشوهات الغريبة الناتجة عن الحركات الكبيرة.
  • المنتجات (Products): موجه مثل "slow 180-degree orbit around the object, studio lighting stays constant" (دوران بطيء بمقدار 180 درجة حول المنتج، مع بقاء إضاءة الاستوديو ثابتة) هو الخيار المعتمد دائمًا لهذه الفئة. احرص على إبقاء الخلفية بسيطة في الصورة الأصلية.
  • المناظر الطبيعية (Landscapes): حدد العناصر المتحركة بالاسم (مثل: "clouds drift right, grass sways, light shifts warmer" - السحب تتحرك نحو اليمين، والأعشاب تتمايل، والإضاءة تتحول لدرجة أكثر دفئًا) وإلا ستحصل على تأثير التقريب المتذبذب الافتراضي.

لوحة كلاكيت مخرج بجانب ملاحظات مكتوبة بخط اليد لموجهات مع أسهم توضح حركات الكاميرا فوق صورة فوتوغرافية، لتوضيح كيفية كتابة موجهات الحركة

التكرارات، الإطارات الأخيرة، والفيديوهات بطول 148 ثانية

تقبل نماذج Veo 3.1 إطارًا أخيرًا اختياريًا بالإضافة إلى الإطار الأول. إذا زودتها بصورتين مختلفتين، فستقوم برندرة انتقال بينهما، وهذه هي الطريقة التي يمكنك بها تحويل لقطة نهارية إلى لقطة ليلية، أو رسم تخطيطي إلى منتج نهائي. وإذا زودتها بالصورة نفسها في البداية والنهاية، فستحصل على مقطع ينتهي من حيث بدأ: تكرار سلس ونظيف (clean loop)، جاهز ليكون خلفية لموقع إلكتروني أو منشورًا بأسلوب السينماغراف (cinemagraph). هذه هي ميزتي المفضلة غير المستغلة بما يكفي على المنصة.

ميزة التمديد (Extension) هي الخدعة الأخرى التي تقدمها نماذج Veo. حيث يمكن تمديد المقطع المكتمل بمقدار 7 ثوانٍ إضافية باستخدام موجه جديد، ويمكن أن تستمر السلسلة لتصل إلى 148 ثانية إجمالاً مع استمرارية بصرية كاملة (هذه الميزة مدعومة في Veo 3.1 و Fast فقط، بينما لا تدعمها نماذج Lite و Omni Flash). إن بدء سلسلة طويلة من صورة تملكها هو أقرب شيء لصناعة الأفلام دون الحاجة إلى لوحة عمل (storyboard) تقدمه واجهات برمجة التطبيقات الحالية. تذكر أن هذا الأمر يضاعف التكلفة أيضًا، لذا احسب ميزانيتك جيدًا قبل أن تقع في حب هذه الفكرة.

يستبدل Omni Flash ميزة التمديد بالتحرير: صف تغييرًا للمقطع النهائي ("make it dusk, keep everything else the same" - اجعله وقت الغسق، وحافظ على بقاء كل شيء آخر كما هو) وادفع مقابل ثوانيه مرة أخرى — كما يقبل الفيديوهات التي لم ينتجها هو، بما في ذلك تحميلاتك الخاصة، ويعيدها بنفس الطول. فلسفة مختلفة. التحرير يُنقّح لحظة واحدة؛ والتمديد ينمّي جدولًا زمنيًا.

شريط من إطارات الأفلام منحني ليشكّل دائرة كاملة على خلفية ملونة، لتوضيح تكرار فيديو الذكاء الاصطناعي الذي ينتهي من حيث بدأ

الأسئلة الشائعة

هل يمكنني تحويل صورة إلى فيديو مجانًا؟

تقريبًا. يأتي حساب BananaBanana الجديد برصيد ترحيبي قدره $0.20 ودون الحاجة لإدخال بطاقة دفع، وهو ما يكفي لمقطعين صامتين مدة كل منهما 4 ثوانٍ باستخدام نموذج Veo 3.1 Lite من صورتك. بعد ذلك، يتم الدفع مقابل كل مقطع تولده، بدءًا من $0.10.

ما هو الخيار الأرخص لواجهة برمجة تطبيقات تحويل الصورة إلى فيديو؟

على منصة BananaBanana، الخيار الأرخص هو نموذج Veo 3.1 Lite: حيث تبلغ التكلفة $0.10 لمقطع صامت مدته 4 ثوانٍ بدقة 720p، و $0.18 مع الصوت. هذا السعر يُحتسب لكل عملية توليد ناجحة، مع استرداد تلقائي للمبالغ في حالة الفشل، ودون الحاجة إلى اشتراك أو إعداد حساب Google Cloud.

هل يمكن أن يشتمل الفيديو المولد على صوت؟

نعم. تشتمل نماذج Veo 3.1 على زر لتفعيل الصوت (الحوارات، المؤثرات، والأصوات المحيطية الموصوفة في موجهك)، ...وبينما يقوم Gemini Omni Flash دائمًا بتوليد الصوت، وهو مشمول في سعره البالغ $0.10 للثانية.

هل يمكنني تحريك صورة عمودية لمنصات TikTok أو Reels؟

نعم، تدعم النماذج الأربعة جميعها نسبة 9:16. ارفع الصورة، واختر أبعاد 9:16، وتذكر أن الصورة المصدر سيتم قصها لتناسب هذه النسبة، لذا احرص على ترك مساحة كافية أعلى الصورة الأصلية.

ما أقصى مدة يمكن أن يصل إليها فيديو ذكاء اصطناعي مصنوع من صورة؟

...تتراوح مدة كل مقطع بين 4 إلى 8 ثوانٍ في نماذج Veo (3–10 ثوانٍ، حسب اختيارك، في Omni Flash)، ولكن... يمكن تمديد المقاطع المولدة بنماذج Veo 3.1 و Veo 3.1 Fast بخطوات مدتها 7 ثوانٍ لتصل إلى 148 ثانية إجمالاً، مع الحفاظ الكامل على الاستمرارية البصرية لصورتك الأصلية.

tutorialvideoimage-to-video