العودة إلى المدونة
BananaBanana Teamnewsvideoomni-flashapi

مراجعة Gemini Omni Flash API: ماذا يقدم الإصدار التجريبي فعليًا

مراجعة عملية لـ Gemini Omni Flash API: ما يدعمه gemini-omni-flash-preview حقًا، وما يظل حصريًا لـ Flow والتكلفة الحقيقية لكل مقطع.

مراجعة Gemini Omni Flash API: ماذا يقدم الإصدار التجريبي فعليًا

Gemini Omni Flash هو أول نموذج متعدد الوسائط "any-to-any" من Google يُنتج الفيديو: ترسل نصًا أو صورًا أو نتيجة سابقة، فيعيد إليك مقطعًا قصيرًا مع الصوت، قابلاً الآن للاختيار حتى دقة 4K، والذي يمكنك الاستمرار في تعديله بوصف التغييرات بلغة طبيعية. أطلقته Google في معاينة تجريبية عامة (Public Preview) في 30 يونيو 2026، جنبًا إلى جنب مع Nano Banana 2 Lite، ومعرّف النموذج في الـ API هو gemini-omni-flash-preview.

إجابة سريعة إذا كنت تبحث عن المعلومة الأساسية فقط: يدعم Gemini Omni Flash API إمكانية تحويل النص إلى فيديو (text-to-video)، والصورة إلى فيديو (image-to-video)، والإشارة المرجعية إلى فيديو (reference-to-video) بحد أقصى يصل إلى 10 صور للعنصر (والتي يمكن دمجها مع إطار بداية)، والتعديل التفاعلي عبر المحادثة (conversational editing)، وتعديل فيديو-إلى-فيديو (video-to-video) لمقطع تحمّله. لا يدعم النموذج البذور (seeds)، أو معلمات المطالبات السلبية (negative prompt parameters)، أو إيقاف تشغيل الصوت — أما الدقة فتصل الآن حتى 4K، وتمت إضافة تمديد المشهد (scene extension) منذ ذلك الحين، وكلاهما مشروح أدناه. كما أن التحكم في المدة غير مدرج في التوثيق الرسمي، لكن الحقل موجود ويعمل بالفعل — المزيد عن ذلك أدناه. إذا شاهدت العروض التوضيحية لـ Omni Flash داخل Google Flow وتوقعت نفس أدوات التحكم من الـ API، فستشعر ببعض الخيبة. لقد قمنا بدمجه في المولد الخاص بنا خلال أسبوع الإطلاق، لذا تعتمد هذه المراجعة على ما يرجعه نقطة النهاية (Endpoint) فعليًا، وليس على صفحات التسويق.

ما الذي يقدمه لك Gemini Omni Flash API فعليًا

يعرض الـ API نموذج Omni Flash من خلال Interactions API (interactions.create)، وليس من خلال نقطة النهاية generateVideos التي يستخدمها Veo. هذا التفصيل مهم لأن التفاعلات تحافظ على الحالة (stateful). كل استجابة تحمل معرّفًا (id) يمكنك الإشارة إليه لاحقًا.

وفقًا لـ توثيق Omni الرسمي من Google، بالإضافة إلى أسبوع من اختبار نقطة النهاية، تعمل اليوم 5 مهام:

  • Text-to-video. إدخال المطالبة، وإخراج مقطع بدقة تصل حتى 4K مع المقطع الصوتي.
  • Image-to-video. تصبح صورتك هي الإطار الافتتاحي وتصف المطالبة الحركة.
  • Reference-to-video. تحافظ صور العنصر على اتساق الشخصية أو المنتج في مشهد جديد — يقبل الطلب ما يصل إلى 10 صور، وعلى عكس Veo يمكن دمجها مع إطار بداية.
  • Conversational editing. مرر previous_interaction_id مع تعليمات قصيرة، وسيقوم النموذج بتغيير المقطع مع الحفاظ على بقية العناصر.
  • Video-to-video editing. أرسل فيديو حقيقيًا كـ content مع task: "edit" وسيعود بنمط جديد — لا حاجة لمعرّف تفاعل، لذا فهو يعمل على المقاطع التي لم ينشئها النموذج مطلقًا (بما في ذلك عروض Veo ومقاطع الهاتف). النقطة المهمة: طول الخرج دائمًا مساوٍ تمامًا لطول الدخل، والدخل محدد بحد أقصى 10 ثوانٍ.

المقطع أعلاه جاء مباشرة من gemini-omni-flash-preview عبر خط المعالجة الخاص بنا، لذا فأنت تنظر إلى عينة حقيقية وليست مادة ترويجية. مطالبة نصية واحدة: قارب ورقي ينجرف فوق حبر مسكوب، وعبارة "single continuous scene" لمنع النموذج من عمل قطع مونتاج، وسطر "Audio:" يطلب حفيف الورق وتموجات الماء. طلبنا الـ 10 ثوانٍ كاملة. شغل الصوت؛ الصوت مُنشأ بواسطة الذكاء الاصطناعي أيضًا.

يعمل كل مقطع من 3 إلى 10 ثوانٍ بمعدل 24 إطارًا في الثانية. لا يدرج التوثيق أي معلمة للمدة، وفي البداية افترضنا أن النموذج يحدد المدة بنفسه. تبين أن تنسيق الطلب يقبل المدة بهدوء وهي دقيقة تمامًا: اطلب 3 ثوانٍ وستحصل على 3.008 ثانية، وتتم المحاسبة على 3 ثوانٍ. هذا ما نعرضه في المولد، لذا فإن المونتاج على الإيقاع الموسيقي لم يعد يانصيبًا.

تعمل المطالبة النصية أيضًا كلوحة تحكم لكل ما لا يعرضه الـ API. إذا تُرك النموذج وشأنه فإنه يميل للقطع بين لقطات متعددة، لذا فإن عبارة "single unbroken shot, no cuts" تجد مكانها في معظم المطالبات؛ ويتم اتباع نطاقات الأكواد الزمنية مثل [0-3s] ... [3-6s] ...؛ والنصوص بين علامتي تنصيص تُعرض على الشاشة بدقة مذهلة. يوفر مولدنا هذه العبارات كمقتطفات جاهزة بنقرة واحدة لأننا تعبنا من كتابتها يدويًا في كل مرة.

الصوت هو المفاجأة الثانية، وهي مفاجأة سارة. كل إنشاء يأتي مع صوت: ضوضاء محيطة، تأثيرات، وأحيانًا كلام إذا طلبت ذلك. ومع ذلك لا يمكنك إيقافه. التحكم الوحيد لديك هو النص، لذلك انتهى بنا المطاف بإضافة سطر "Audio: ..." إلى نهاية المطالبات ويوفر ذلك نتائج جيدة جدًا.

ما الذي يحتوي عليه Flow ولا يحتوي عليه الـ API؟

Google Flow هو أداة إنتاج كاملة ملتفة حول عدة نماذج، وهذا الغلاف هو بالضبط ما يفتقده الـ API الخام. يوفر لك Flow ميزة Scene Builder لتسلسلات اللقطات المتعددة وعناصر تحكم مسبقة للكاميرا (نوع اللقطة، الزاوية، الحركة). هناك تفصيل يخطئ فيه الناس بشأن الدقة: ينشئ Flow بدقة 720p افتراضيًا أيضًا. تظهر إصدارات 1080p و 4K في خطوة التنزيل، كخيار تصدير فوق إنشاء Veo، وليس كوضع إنشاء مختلف. لا توجد أي من هذه الأدوات في gemini-omni-flash-preview.

إليك المقارنة الصريحة بعد أسبوع من اختبار الاثنين:

القدرةFlow / تطبيق GeminiGemini Omni Flash API
الدقةإنشاء 720p؛ 1080p / 4K متاحة عند التنزيل360p–4K، 24 fps (1080p/4K بالترقية)
طول المقطعScene Builder يربط اللقطات3–10 ثوانٍ، دقيق
أدوات التحكم بالكاميراأنواع اللقطات والزوايا والحركة المسبقةمطالبة نصية فقط
تمديد الفيديونعم (عبر Veo)نعم، بخطوات متسلسلة من 3–10 ثوانٍ حتى 40 ثانية إجمالاً
تعديل فيديو حاليRemix داخل التطبيقتفاعلي عبر المحادثة، أو فيديو-إلى-فيديو لأي مقطع
الصوتمفعل، مع عناصر تحكم في الواجهةمفعل دائمًا، التحكم عبر المطالبة فقط
Seed / المطالبة السلبيةمخفية عن المستخدم على أي حالغير مدعومة
المقاطع لكل طلبمقطع واحد في كل مرةمقطع واحد لكل تفاعل، لا يوجد sampleCount

التوثيق واضح بشأن بعض هذه النقاط. تذكر وثائق Google أن تمديد الفيديو والاستكمال "غير مدعومين"، وسري نفس الشيء على تعليمات النظام والحرارة ومعلمات المطالبة السلبية (يقترحون كتابة السلبيات في المطالبة العادية، وهو ما يعمل ناتج تجاربي بنسبة النصف تقريبًا). مراجع الفيديو مدرجة في مخطط الـ API بحد أقصى 3 ثوانٍ، لكن الوثائق تعترف بأن النموذج لا يعالجها بشكل صحيح بعد.

لذا فإن الـ API التجريبي هو شريحة ضيقة مما يمكن للنموذج فعله على واجهات Google الخاصة. هذا أمر طبيعي لإصدار تجريبي. لكنه يظل مزعجًا عندما يطلب العميل تصدير 1080p بينما السقف هو 720p.

رسم توضيحي مقسم يقارن بين مكتب تحكم مخرج كامل وجهاز تحكم عن بعد صغير، كاستعارة لمقارنة Flow بـ Omni Flash API

التعديل التفاعلي عبر المحادثة هو الميزة التي تقدم أدائًا حقيقيًا

التعديل هو المجال الذي يثبت فيه Omni Flash قيمته. تنشئ مقطعًا وتلقي نظرة عليه، ثم ترسل طلب متابعة مثل "اجعل السترة حمراء وأبطئ الكاميرا" مع ارفاق previous_interaction_id للنتيجة الأولى. يعيد النموذج بناء الفيديو مع تطبيق تغييرك والحفاظ على معظم الأصل. لا إعادة تحميل، لا أقنعة (masks)، لا خط زمني.

تذكر وثائق Google Gemini Enterprise أنه يمكنك تتابع ما يصل إلى ثلاثة تعديلات متتالية طالما أن الجلسة تحتفظ بالسياق. في الممارسة العملية، كل تعديل هو إنشاء جديد بدقة 720p، لذا تتراجع الاستمرارية قليلاً مع كل خطوة. تصمد الوجوه بشكل أفضل من النصوص على اللوحات. تتغير الحركة المعقدة أحيانًا حتى عندما تطلب فقط ضبط اللون.

عقبة واجهناها في الإنتاج: التفاعلات الأبوية تنتهي صلاحيتها على جانب Google. حاول تعديل مقطع تم إنشاؤه منذ فترة وقد يرجع الـ API خطأ 404 للتفاعل المرجعي. على BananaBanana نعرض ذلك كفيديو منتهي الصلاحية ونرجع تكلفة المحاولة، ولكن إذا كنت تبني على الـ API الخام، فخطط لذلك.

محادثة دردشة حيث تظهر كل فقرة إجابة نفس إطار الفيديو مع تغيير صغير واحد، مما يوضح التعديل التفاعلي للفيديو

كم تكلفة Gemini Omni Flash؟

يحدد إعلان الإطلاق من Google سعر Omni Flash بـ $0.10 لكل ثانية من الفيديو الناتج: النتيجة ذات الـ 3 ثوانٍ تكلف $0.30، والنتيجة ذات الـ 10 ثوانٍ تكلف $1.00.

على BananaBanana أصبح هذا المعدل الثابت مقسّمًا حسب الدقة: $0.03 للثانية بدقة 360p، و$0.10 بدقة 720p، و$0.15 بدقة 1080p، و$0.30 بدقة 4K — فتختار 3 ثوانٍ بدقة 720p مقابل $0.30 أو الـ 10 كاملة مقابل $1.00، والتعديل يكلف نفس السعر لكل ثانية لأنه إعادة إنشاء كاملة (كما يعود بنفس طول المصدر تمامًا — لا يمكن للنموذج تمديده أو قصّه). نموذج Nano Banana 2 Lite الذي تم إطلاقه في نفس اليوم يكلف $0.03 لكل صورة هنا (سعر Google API هو $0.034 لصورة بدقة 1K). قائمة الأسعار الكاملة موجودة في قسم الأسعار.

هل عشرة سنتات للثانية — سعر دقة 720p — قيمة جيدة؟ بالنسبة لمسودة مع الصوت والتي كانت ستتطلب بخلاف ذلك تمريرة إنشاء فيديو بالإضافة إلى عمل صوتي منفصل، فربما نعم — واختبار الـ 3 ثوانٍ يكلف أقل من مقطع Veo. بالنسبة للقطات الخلفية الصامتة، لا. ينشئ Veo 3.1 Fast مقاطع صامتة أرخص وبدقة أعلى.

هل يجب أن تستخدم Omni Flash أم Veo 3.1؟

باختصار: هما يتقاسمان العمل، ولكن ليس على طول خط "مسودة مقابل إنتاج نهائي" كما قد تتوقع.

شيء واحد يجب معرفته قبل الاختيار: الفجوة في الجودة بينهما ليست مجرد دقة. يعرض Veo 3.1 الحركة والفيزياء بشكل أكثر إقناعًا بكثير. يتصرف الماء بطبيعية، وتتنثي الأقمشة حيث ينبغي، وتتصادم الأجسام بدلاً من التداخل مثل الأشباح. يحقق Omni Flash ذلك غالبًا وليس بشكل دائم، وفي بعض المقاطع ستلاحظ ذلك دون البحث عنه.

اختر Veo 3.1 عندما تحتاج إلى طول مقطع دقيق (تحدد ثوانٍ كاملة من 4 إلى 8؛ لا توجد أجزاء من الثانية)، أو إخراج صامت، أو فيزياء أكثر ثباتًا — أما Omni Flash فقد لحق منذ ذلك الحين بتصدير 4K وتمديد المشهد والتحكم في الإطارين الأول والأخير، وكلها مشروحة أعلاه. هذه الحيلة الأخيرة تعمل الآن على كلا النموذجين: أطعم نفس الصورة كإطار أول وأخير وستحصل على تكرار سلس للغاية، وهو السر وراء مقاطع الفيديو الخلفية المتكررة. يبقى Veo أداة الإنتاج لأي شيء عريض الشاشة أو يعتمد على الفيزياء.

اختر Omni Flash عندما تكون الوجهة هي شاشة الهاتف. بالنسبة لـ TikTok أو Shorts أو Reels، فإن دقة 720p هي بصدق كل ما تحتفظ به المنصة بعد الضغط الخاص بها، ويصل الصوت مدمجًا في نفس التمريرة، والتعديل التفاعلي يتغلب على إعادة كتابة المطالبات من الصفر. في هذا المسار، فهو ليس أداة للتخطيط الأولي بل هو الخيار الأفضل.

سير العمل الشخصي الخاص بي بعد يومين من الاختبار: بالنسبة لأعمال العملاء ذات الشاشة العريضة، ما زلت أصمم المفهوم الأول في Omni Flash — محاولات لمدة ثلاث ثوانٍ بسعر $0.30 — ثم أعيد عمل اللقطة المقبولة في Veo بالجودة النهائية. بالنسبة لمقطع رأسي يذهب مباشرة إلى وسائل التواصل الاجتماعي، غالبًا ما يُنشر مقطع Omni كما هو.

طائرتان بدون طيار بكاميرا بأحجام مختلفة تطيران جنبًا إلى جنب فوق وادٍ بألوان فاتحة، مما يمثل الاختيار بين Omni Flash و Veo 3.1

كلا النموذجين متاحان في مولد BananaBanana، لذا يمكنك المقارنة بينهما على نفس المطالبة دون كتابة سطر برمجية واحد أو إعداد مشروع Google Cloud. وإذا كنت تريد النسخة المكثفة من هذه المراجعة — الإمكانيات والحدود والأسعار في صفحة واحدة — فهذا متوفر في صفحة Gemini Omni.

FAQ

ما هو gemini-omni-flash-preview؟

هو معرّف النموذج في الـ API لـ Gemini Omni Flash، نموذج إنشاء الفيديو التفاعلي من Google الذي تم إصداره في معاينة تجريبية عامة في 30 يونيو 2026. أنشئ ويعدل مقاطع لمدة 3–10 ثوانٍ مع الصوت عبر Interactions API، وتمتد دقته الآن من 360p حتى 4K.

هل يمكن لـ Gemini Omni Flash إنشاء فيديو بدقة 1080p أو 4K؟

نعم، الآن. أطلق الـ API في البداية بدقة 720p فقط؛ أما Omni Flash على BananaBanana فيوفر الآن 360p و720p و1080p و4K، مع تسليم 1080p و4K عبر الترقية (upscale) وليس كرندر أصلي بدقة أعلى. لا يزال Google Flow ينشئ بدقة 720p افتراضيًا؛ وتتوفر إصداراته بدقة 1080p و4K في خطوة التنزيل على إنشاءات Veo.

هل يمكنني تحديد مدة الفيديو في Omni Flash API؟

نعم، على الرغم من أنك لن تجد ذلك في الوثائق الرسمية. يتقبل تنسيق الطلب المدة، وتتطابق النتيجة مع الإطار: 3 ثوانٍ مدخلة، 3.008 ثانية مخرجة، وتتم المحاسبة على 3 ثوانٍ. نعرضه كمحدد من 3–10 ثوانٍ في المولد. الاستثناء هو التعديل — يتوارث المقطع المعدل دائمًا طول الفيديو الذي صُنع منه.

هل ينشئ Omni Flash الصوت دائمًا؟

نعم، يتضمن كل مقطع مسارًا صوتيًا مُنشأ ولا توجد علامة لإيقاف تشغيله. صف الصوت الذي تريده (أو اطلب "quiet ambient room tone") مباشرة في المطالبة النصية.

هل يمكن لـ Omni Flash تمديد أو استكمال مقاطع الفيديو الحالية؟

أصبح بإمكانه ذلك الآن: يدعم جيل Omni Flash الحالي تمديد المشهد (scene extension)، بإضافة استكمالات من 3–10 ثوانٍ إلى المقطع حتى 40 ثانية إجمالاً (كان الإصدار الأصلي يجيب على مهمة extend بعبارة "this model does not support video extension"). أما التعديل التفاعلي وتعديل فيديو-إلى-فيديو فيعملان كما كانا — على مقطع أنشأه هو، أو على أي فيديو مكتمل تزوده به، بما في ذلك إنشاء Veo أو التحميل الخاص بك؛ وهذان يحافظان على طول الدخل.

newsvideoomni-flashapi