زاوية منتج واحدة جيدة
لقطة واحدة مسطحة بإضاءة متساوية تتفوق على خمس لقطات عابرة. الوهج، وضبابية الحركة، ويد تغطي نصف الملصق — كلها يعاد بناؤها اختراعًا.
حالة استخدام · فيديو UGC بالذكاء الاصطناعي
إعلان UGC هو ببساطة شخص يتحدث إلى كاميرا الهاتف وبيده منتجك. هنا لا يُصوَّر بل يُولَّد: تُحضِر صورة للمنتج وصورة للشخص، فيبني النموذج اللقطة الافتتاحية ثم يحرّكها مع الصوت وأجواء الغرفة في التمريرة نفسها. يكلّف المقطع من $0.30 إلى $1.00 على Gemini Omni Flash، ويصل إلى $3.00 على Veo 3.1 مع الصوت، واللقطة الافتتاحية $0.11، ولا شيء من ذلك اشتراك شهري.
فيديو UGC بالذكاء الاصطناعي هو إعلان قصير بصيغة محتوى المستخدمين — شخص يتحدث إلى كاميرا هاتفه، ممسكًا بمنتج، في مطبخ أو غرفة معيشة بدل الاستوديو — لكنه مُولَّد بنموذج فيديو بدل تصويره مع صانع محتوى. الإنتاج ثلاثة نداءات: صور مرجعية للمنتج وللشخص، لقطة ثابتة واحدة تثبّت مَن على الشاشة وماذا يحمل، ثم نموذج فيديو يحرّك تلك اللقطة مع كلام متزامن. النموذجان المستخدمان هنا اثنان. Gemini Omni Flash هو الأرخص والأحدث: بطاقة النموذج من Google تضع محاكاة فيزياء العالم الحقيقي ضمن قدراته، والحركة المعقّدة ضمن نقاط ضعفه المتبقّية — وهو ما يطابق ما أراه: التعامل العادي مع الأشياء يمرّ غالبًا، والتعامل المركّب حظّ. أمّا Veo 3.1 فتلجأ إليه حين تتوقف اللقطة كلها على أن يتصرّف الجسم بشكل صحيح. المقطع الواحد $0.30–$1.00 على Omni Flash، و$1.00 على Veo 3.1 Fast، و$3.00 على Veo 3.1 الكامل لثماني ثوانٍ مع الصوت، وحتى $4.40 بدقة 4K. ثم إنه يُعالَج في دقيقتين بدل الأسبوعين إلى الأربعة التي يلتهمها عادةً التعاقد مع صانع محتوى.
فاتورة المقطع أعلاه بلا تدوير: $0.11 للمرجع الخاص بالمنتج، و$0.11 للشخص، و$0.11 للإطار الافتتاحي الذي يجمعهما، و$0.80 لثماني ثوانٍ من Omni Flash — $1.13 في المجموع. النسخة العمودية بست ثوانٍ الموجودة أسفل الصفحة كلفت $0.60. وإعادة تسجيل الصوت منفصلًا تكلف $0.01 لكل 200 حرف من النص، أي نحو سنت واحد للجملة. الحسابات الجديدة تحصل على $0.20 مجانًا، وهو ما يغطي صورة مرجعية وإطارًا أول — يكفي لترى إن كانت الشخصية تنجح قبل أن تدفع مقابل الفيديو.
هذا رقم اللقطة الأولى، واللقطة الأولى ليست خطة عمل. بعض المقاطع تخرج من المحاولة الأولى، وكثير منها يحتاج محاولتين أو ثلاثًا: جملة تخرج باهتة، يد تفعل شيئًا غريبًا، أو رفض للملابس. ثم هناك ما لا يضعه أحد في السعر: الإعلان نادرًا ما يكون مقطعًا واحدًا. الإعلان بطول 20–30 ثانية عادةً ثلاث أو أربع لقطات مركّبة معًا — الخطّاف، المنتج في اليد، لقطة قريبة، الخاتمة — لذا فالفاتورة الواقعية لإعلان جاهز هي بضعة دولارات لا بضعة سنتات، وترتفع بسرعة إن صوّرت اللقطات كثيرة الحركة على Veo 3.1 الكامل بسعر $3.00 للمقطع. أما التركيب فمجاني: ffmpeg يقصّ ويصل ويضع الصوت فوق الفيديو من سطر الأوامر، دون أي برنامج مونتاج.
لقطة نظيفة للمنتج وصورة للشخص. أي شيء ضبابي أو مقصوص أو سيّئ الإضاءة في المدخلات يعود إليك مضاعفًا في الفيديو.
ولّد صورة ثابتة واحدة تحمل المرجعين معًا — الشخص مع المنتج، مؤطَّرًا بالطريقة التي يجب أن يفتتح بها الإعلان. $0.11 على Nano Banana Pro، ويمكنك إعادتها حتى تبدو كما تريد.
أرسل اللقطة الثابتة كإطار أول، وصف الحركة والجملة التي تقولها. يحسب Omni Flash $0.10 لكل ثانية بدقة 720p مع الصوت؛ أمّا Veo 3.1 فأغلى، وهو الذي يستحق التجربة حين تحتاج لقطة واحدة إلى حمل عدّة أفعال متتالية.



هذا هو الجزء الذي يتخطاه الناس، وهو الذي يحسم النتيجة. النموذج الذي تعطيه لقطة هاتف ضبابية بزاوية ثلاثة أرباع لزجاجة لا يفشل بصوت عالٍ — بل يخترع بهدوء الجانب الذي لا يراه، وهذا الجانب المخترع هو ما ينتهي على الشاشة ثماني ثوانٍ. أعطه لقطة منتج مسطحة بإضاءة متساوية والملصق مواجه للكاميرا، وستنجو الزجاجة نفسها من خطوة الإطار وخطوة الفيديو والمونتاج بعدهما.
الشخص يهم بالطريقة نفسها. توثيق Veo من Google صريح في ذلك: اختر صورًا واضحة جيدة الإضاءة تُظهر الشخص من الزاوية التي تريدها، وحافظ على لغة العدسة والإضاءة متطابقة بين اللقطات. قاعدتي بعد بضع عشرات من هذه المقاطع: إذا اختلفت الصورة المرجعية والمشهد المقصود حول مصدر الضوء، فسينزلق الوجه إلى مكان في المنتصف ويتوقف عن أن يبدو الشخص نفسه.
لقطة واحدة مسطحة بإضاءة متساوية تتفوق على خمس لقطات عابرة. الوهج، وضبابية الحركة، ويد تغطي نصف الملصق — كلها يعاد بناؤها اختراعًا.
أبقِ قصة الشعر والملابس والمكياج ثابتة عبر الصور المرجعية. المظاهر المختلطة تُحسب كمتوسط فيخرج وجه لا يشبه أيًّا منها.
صورة شخصية بفلاش موضوعة داخل مشهد مطبخ بضوء نهار ناعم تُقرأ كتركيب مركّب. اختر في المرجع الضوء الذي سيكون في الإعلان فعلًا.
يحافظ Nano Banana Pro على نص ملصق قصير؛ أما قائمة مكونات مكتظة فتتحول إلى ملمس بلا معنى. إذا كان الخط مهمًا، خطط للقطة مقرّبة بعبوة حقيقية بدلًا من ذلك.
لا يلزم أن تُركَّب المراجع كإعلان. التكوين مهمة الإطار الافتتاحي — تلك هي الخطوة التي تتجادل فيها مع النموذج.
قصاصة بعرض 300 بكسل مسحوبة من إعلان في متجر إلكتروني لا تترك للنموذج شيئًا تقريبًا ليحافظ عليه. أصول بدقة كاملة، في كل مرة.
الطريقان يعملان: يمكنك تسليم نموذج الفيديو صورك المرجعية وتتركه يركّب المشهد، أو تولّد صورة ثابتة أولًا وتحرّكها. عمليًا الثاني أفضل، والسبب بسيط ومملّ — نموذج الفيديو المطلوب منه اختراع التكوين يخترعه في كل إطار، بينما النموذج الذي يُسلَّم صورة ثابتة عليه فقط أن يكملها. على Gemini Omni Flash الفارق كبير لدرجة أنني توقفت عن استخدام المراجع وحدها في لقطات المنتجات.
مقطعان أدناه، نفس الموجه، نفس المراجع، ست ثوانٍ لكل منهما، $0.60 للواحد. الفارق الوحيد هو هل دخلت صورة ثابتة معتمدة كإطار أول أم لا. لم يتغير شيء آخر ولم يُعَد توليد أي من المقطعين.
المراجع فقط
من إطار أول معتمد
النسخة الصادقة: مسار «المراجع فقط» ليس معطوبًا — الوجه صمد جيدًا، ولمشهد بلا منتج في اليد يكفي غالبًا. بل إن الإضاءة أجمل في تلك اللقطة: أنعم على الوجه، وتباين النافذة أقل، لأن النموذج كان يؤلّف غرفة تعجبه هو بدل أن يكمل غرفتنا. وثمّة تحفّظ يستحق الذكر لأنه يغيّر قراءة النتيجة: الشخصية عندنا مُولَّدة، وليست صورة إنسان حقيقي، فكان للنموذج متّسع لإعادة إضاءتها. البورتريه الحقيقي يثبّت الضوء والبشرة بصرامة أكبر بكثير، وعندها يصبح لمسار «المراجع فقط» حرية أقل في التجميل. ما تشتريه هنا هو التحكّم لا الجودة. أمّا على Veo 3.1 فالاختيار محسوم سلفًا: واجهة Google تقبل إمّا إطارًا أول وإمّا حتى ثلاث صور مرجعية، ولا تقبلهما معًا في الطلب نفسه، كما أن الصور المرجعية تفرض مدة ثماني ثوانٍ.
Omni Flash ممتاز تحديدًا في الصيغة التي يعيش فيها UGC فعلًا: شخص يتحدث إلى العدسة. مقابلات، مقاطع بأسلوب البودكاست، مؤسِّس يشرح منتجه، أحدهم يمسك عبوة ويتحدث عنها. يُخرِج الفم والحركة الدقيقة وأجواء الغرفة في تمريرة واحدة، وهو أرخص طريقة للحصول على صوت متزامن من نموذج فيديو. وهو أيضًا الأحدث بين الاثنين، وGoogle تسوّقه بالفيزياء تحديدًا: يتحدث الإعلان عن فهم حدسي للجاذبية والطاقة الحركية وديناميكا الموائع، بينما تُدرِج بطاقة النموذج محاكاة فيزياء العالم الحقيقي ضمن القدرات وتسمّي الحركة المعقّدة نقطة ضعف معروفة. والنصفان صحيحان عمليًا. الأشياء تسقط، والسوائل تنسكب، والوزن يُقرأ صحيحًا — إلى أن تطلب اللقطة سلسلة أفعال دقيقة بجسم واحد.
إذن الفارق ليس بين «رأس يتكلم» و«حركة»، بل في مقدار الكوريغرافيا التي يجب أن تحملها لقطة واحدة. الاختبار أدناه يقع في الطرف الصعب من هذا المقياس، وليس حُكمًا على أيٍّ من النموذجين: اللقطة الافتتاحية ذاتها، المطالبة ذاتها، مقطع واحد لكل نموذج — افتحي القارورة، اضغطي القطّارة، قطرتان في راحة اليد المفتوحة، وكل ذلك في ثماني ثوانٍ.
Gemini Omni Flash · 8 ث · $0.80
Veo 3.1 Fast · 8 ث مع الصوت · $1.00
حركة الشفاه وصوت الغرفة والكلام تصل معًا، بـ $0.10 للثانية. لمراجعة أو شهادة عميل أو حوار بين شخصين هو الخيار البديهي.
حركة واحدة يتولّاها Omni؛ أربع حركات متتالية هي النقطة التي تبدأ عندها اللقطات بإسقاط الأفعال. مقارنتنا استخدمت Veo 3.1 Fast بسعر $1.00 لثماني ثوانٍ مع الصوت، فيما Veo 3.1 الكامل بسعر $3.00 — ولّد على الاثنين واحتفظ باللقطة التي نجحت.
فلتر الأمان في Omni أكثر صرامة بوضوح تجاه الملابس: صانعة محتوى رياضية بملابس تمرين تُرفض هناك أكثر بكثير من Veo 3.1، بنفس الموجه ونفس المرجع. خطط للملابس أو خطط للنموذج.
Omni Flash بدقة 720p ومن 3 إلى 10 ثوانٍ، تدفع بالضبط مقابل ما تأخذه. أما Veo 3.1 فيعطي 4 أو 6 أو 8 ثوانٍ حتى 4K، ويمكن تمديد مقاطعه بعد اللقطة الأولى.
كل مقطع من Omni فيه صوت سواء طلبته أم لا. على Veo الصوت مفتاح تشغيل — الرندر الصامت أرخص، وهذا يهم حين يأتي الصوت من مكان آخر أصلًا.
التوليد المحجوب يُسترد تلقائيًا على النموذجين. الجزء الغالي في الرفض هو الأربع دقائق، لا الدولار.
يكتب Omni Flash الكلام في التمريرة نفسها مع الصورة، ومع الإنجليزية المحكية يكون الأمر مقبولًا عادةً. تعثّره في الأسماء: أسماء منتجات مخترعة، كلمات أجنبية، أرقام موديلات — كل ما يحتاج حتى الناطق الأصلي أن يُشرح له كيف يُنطق. لكن النسخة الكبرى من هذه المشكلة هي اللغات غير الإنجليزية، وكل نماذج الفيديو تعاني منها: مختبِرون ناطقون بالروسية جرّبوا Seedance 2.5 يصفون جملة تبدأ مقبولة ثم تتفكّك في الطريق — اختزال خاطئ لحركات غير مشدّدة، ونبر يقع على المقطع الخطأ، وبنهاية مشهد من خمس عشرة ثانية تصبح اللكنة أقرب إلى خليط سلافي منها إلى الروسية، لأن الروسية والأوكرانية والبيلاروسية متقاربة بما يكفي ليمزجها النموذج. بعض الكلمات تخرج نظيفة، والكلمة التالية تفضح اللقطة كلها. إن لم يكن نصّك بالإنجليزية، فاستمع إليه كاملًا قبل اعتماده.
الحل أن تتوقف عن طلب الصوت من نموذج الفيديو وتولّده منفصلًا. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) يعمل على الرصيد نفسه عبر خادم MCP لدينا: $0.01 لكل 200 حرف من النص، و30 صوتًا، متحدث واحد أو حوار بين اثنين، والمخرج WAV بتردد 24 kHz. التوجيه بلغة عادية — الشخصية، والإيقاع، واللكنة، والتهجئة الصوتية لأي كلمة تريدها منطوقة بشكل صحيح. ثم ضع المسار الصوتي فوق المقطع في أي محرر. أبقِ جملتك المعاد كتابتها بطول قريب من التسجيل الأصلي وستظل حركة الفم متوافقة تقريبًا؛ وحيث لا تتوافق، انتقل بالقطع إلى المنتج.
تعليق صوتي مُولَّد · $0.01
تركيب الإعلان أيضًا لا يحتاج برنامج مونتاج. يصل ffmpeg اللقطات ببعضها، ويقصّ نصف الثانية التي تفعل فيها اليد شيئًا غريبًا، ويستبدل الصوت المُولَّد بمسار TTS الخاص بك، ويضيف انتقالًا متلاشيًا، ويُصدِّر نسخة 9:16 — كل ذلك من سطر أوامر واحد، مجانًا، وعلى أي جهاز. صياغته صعبة بشهرة، ولهذا بالذات ينسجم مع نموذج لغوي: صِف المونتاج الذي تريده لـ Claude أو لأي LLM، خذ الأمر، ونفّذه. بالنسبة لإعلان UGC من ثلاثة مقاطع، هذه هي مرحلة ما بعد الإنتاج كلها — وهي سبب بقاء الأرقام في هذه الصفحة عند كلفة التوليد دون اشتراك يُضاف فوقها.
| النموذج | السعر | الوحدة | الصوت |
|---|---|---|---|
| Nano Banana Proالمراجع والإطار الأول | $0.11 | صورة 1K–2K | — |
| Nano Banana 2المسودات والنسخ البديلة | $0.03–$0.13 | صورة 512px–4K | — |
| Gemini Omni Flash$0.10 للثانية | $0.30–$1.00 | 3–10 ث، 720p | دائمًا مفعّل |
| Veo 3.1 Fastمع الصوت | $0.50–$1.00 | 4–8 ث، 720p/1080p | اختياري |
| Veo 3.1 Liteأرخص فيديو | $0.10–$0.36 | 4–8 ث، 720p | اختياري |
| Gemini 3.1 Flash TTSعبر MCP فقط | $0.01 | لكل 200 حرف | صوت فقط |
أسعار Veo للدقتين 720p و1080p؛ أما 4K فتكلف أكثر. ويحاسب Omni Flash بـ $0.10 عن كل ثانية من المخرج، أي أن طول المقطع هو السعر. الجداول الكاملة في صفحة الأسعار.
كل نموذج وكل دقة مذكوران في صفحة الأسعار الكاملة، وتشرح صفحة Gemini Omni Flash ما يستطيعه هذا النموذج وما لا يستطيعه.
كيف يعمل التحريك من الإطار الأول، وماذا تكتب في موجه الحركة، وأين ينهار كل شيء.
اقرأ الدليلكيف يصمد المنتج من الصورة المرجعية حتى الإطار النهائي، مع موجهات حقيقية.
اقرأ الدليلتجربة عملية مع واجهة الإصدار التجريبي: ما يدعمه، وما يرفضه، وكم يكلف كل مقطع حقًا.
اقرأ الدليللا. صانع المحتوى يمكن أن يكون مُولَّدًا أيضًا — كل شخص تراه في هذه الصفحة خرج من موجه نصي ولم يوجد قط. أما إذا استخدمت وجه شخص حقيقي فأنت تحتاج إذنه: قواعد استخدام الملامح تنطبق على الفيديو المُولَّد كما تنطبق على جلسة تصوير، وسياسات المنصات بشأن الملامح الاصطناعية أشد مما يفترض معظم الناس.
نعم، ما دمت تحتفظ بالصور المرجعية نفسها وتعيد استخدام الإطار الافتتاحي نفسه. إعادة توليد الإطار من المراجع نفسها تقرّبك كثيرًا لكن ليس بكسلًا ببكسل — والعادة الأأمن هي أن تحتفظ بكل إطار أول معتمد وتحرّكه من جديد بدل إعادة بنائه.
على TikTok نعم: سياسته الإعلانية بشأن الوسائط المعدَّلة والمحتوى المُولَّد بالذكاء الاصطناعي تشترط إما وسم AIGC من Ads Manager وإما تنويهًا مرئيًا خاصًا بك على المادة الإعلانية. أما Meta فتطبّق وسومها الخاصة تلقائيًا على الإعلانات التي ترصدها كمُولَّدة. وقد تغيّرت السياستان خلال 2026، فراجع النسخة الحالية قبل أي حملة كبيرة بدل الوثوق بتدوينة — بما فيها هذه.
ابدأ بـGemini Omni Flash بسعر $0.10 للثانية شاملًا الصوت: لشخص يتحدث إلى الكاميرا هو الأرخص والأقل إزعاجًا، وهو النموذج الأحدث الذي تروّج Google لفيزيائه صراحةً. لكن لا تقرأ ذلك على أنه «Omni لا يجيد الحركة»: هو يسكب، ويُسقِط، وينقل الوزن. ما يسقط منه هو سلاسل التعامل الدقيق الطويلة داخل لقطة واحدة — في اختبار القطّارة ذي الأفعال الأربعة أضاع القارورة بينما أبقاها Veo 3.1 Fast. لذا للخطّاف أو الشهادة الترويجية: Omni. أمّا اللقطة القائمة على الكوريغرافيا فولّدها على الاثنين واحتفظ بالناجحة؛ الفاشلة تكلّف سنتات.
نعم، حتى 10 ثوانٍ منها. ارفع مقطعك وسيعدّله Omni Flash كفيديو-إلى-فيديو — غيّر الإضاءة أو الخلفية أو ما يمسكه الشخص — مع الحفاظ على اللقطة الأصلية. المصادر الأطول تُقصّ إلى حد النموذج قبل التوليد.
يُسترد الرصيد تلقائيًا، على Omni Flash وعلى Veo. حالات الرفض تتجمع حول الملابس والقاصرين والأشخاص الحقيقيين المعروفين؛ وقاعدة الملابس من قسم اختيار النموذج أعلاه هي التي توفّر أكبر عدد من المحاولات المعادة.
نعم — النماذج نفسها متاحة عبر خادم MCP لدينا، بما فيها نموذج الصوت الذي لا واجهة ويب له إطلاقًا. ويمكن تمرير الصور المرجعية والإطارات الأولى كمعرّفات مهام أو روابط عامة أو base64 مضمّن، فتُبرمَج دفعة UGC كاملة من وكيل ذكي.
احسب اللقطات لا المقاطع. الإعلان بطول 20–30 ثانية هو عادةً ثلاثة أو أربعة مقاطع مركّبة معًا، ويحتاج كل منها محاولتين قبل أن يصلح للاستخدام: أداء باهت، يد غريبة، أو رفض. وبسعر $0.80 لثماني ثوانٍ من Omni Flash يبقى الإعلان الجاهز في حدود بضعة دولارات؛ أمّا تصوير اللقطات كثيرة الحركة على Veo 3.1 الكامل بسعر $3.00 لكل مقطع فينقله إلى العشرات. والمونتاج لا يضيف شيئًا: ffmpeg يصل اللقطات ويقصّها ويضع التعليق الصوتي فوقها من سطر الأوامر، ويمكن لنموذج لغوي أن يكتب لك تلك الأوامر.
سجّل مجانًا مع $0.20 على الرصيد، واشحن بالعملات الرقمية ابتداءً من $1. الإطار الأول خلال دقيقة تقريبًا، وأول مقطع خلال خمس.