مراجعة Gemini Omni Flash API: ماذا يقدم الإصدار التجريبي فعليًا
مراجعة عملية لـ Gemini Omni Flash API: ما يدعمه gemini-omni-flash-preview حقًا، وما يظل حصريًا لـ Flow والتكلفة الحقيقية لكل مقطع.

Gemini Omni Flash هو أول نموذج متعدد الوسائط "any-to-any" من Google يُنتج الفيديو: ترسل نصًا أو صورًا أو نتيجة سابقة، فيعيد إليك مقطعًا قصيرًا بدقة 720p مع الصوت والذي يمكنك الاستمرار في تعديله بوصف التغييرات بلغة طبيعية. أطلقته Google في معانية تجريبية عامة (Public Preview) في 30 يونيو 2026، جنبًا إلى جنب مع Nano Banana 2 Lite، ومعرّف النموذج في الـ API هو gemini-omni-flash-preview.
إجابة سريعة إذا كنت تبحث عن المعلومة الأساسية فقط: يدعم Gemini Omni Flash API إمكانية تحويل النص إلى فيديو (text-to-video)، والصورة إلى فيديو (image-to-video)، والإشارة المرجعية إلى فيديو (reference-to-video) بحد أقصى يصل إلى 10 صور للعنصر (والتي يمكن دمجها مع إطار بداية)، والتعديل التفاعلي عبر المحادثة (conversational editing)، وتعديل فيديو-إلى-فيديو (video-to-video) لمقطع تحمّله. لا يدعم النموذج دقة 1080p، أو البذور (seeds)، أو معلمات المطالبات السلبية (negative prompt parameters)، أو تمديد الفيديو (video extension)، أو إيقاف تشغيل الصوت. كما أن التحكم في المدة غير مدرج في التوثيق الرسمي، لكن الحقل موجود ويعمل بالفعل — المزيد عن ذلك أدناه. إذا شاهدت العروض التوضيحية لـ Omni Flash داخل Google Flow وتوقعت نفس أدوات التحكم من الـ API، فستشعر ببعض الخيبة. لقد قمنا بدمجه في المولد الخاص بنا خلال أسبوع الإطلاق، لذا تعتمد هذه المراجعة على ما يرجعه نقطة النهاية (Endpoint) فعليًا، وليس على صفحات التسويق.
ما الذي يقدمه لك Gemini Omni Flash API فعليًا
يعرض الـ API نموذج Omni Flash من خلال Interactions API (interactions.create)، وليس من خلال نقطة النهاية generateVideos التي يستخدمها Veo. هذا التفصيل مهم لأن التفاعلات تحافظ على الحالة (stateful). كل استجابة تحمل معرّفًا (id) يمكنك الإشارة إليه لاحقًا.
وفقًا لـ توثيق Omni الرسمي من Google، بالإضافة إلى أسبوع من اختبار نقطة النهاية، تعمل اليوم 5 مهام:
- Text-to-video. إدخال المطالبة، وإخراج مقطع 720p مع المقطع الصوتي.
- Image-to-video. تصبح صورتك هي الإطار الافتتاحي وتصف المطالبة الحركة.
- Reference-to-video. تحافظ صور العنصر على اتساق الشخصية أو المنتج في مشهد جديد — يقبل الطلب ما يصل إلى 10 صور، وعلى عكس Veo يمكن دمجها مع إطار بداية.
- Conversational editing. مرر
previous_interaction_idمع تعليمات قصيرة، وسيقوم النموذج بتغيير المقطع مع الحفاظ على بقية العناصر. - Video-to-video editing. أرسل فيديو حقيقيًا كـ content مع
task: "edit"وسيعود بنمط جديد — لا حاجة لمعرّف تفاعل، لذا فهو يعمل على المقاطع التي لم ينشئها النموذج مطلقًا (بما في ذلك عروض Veo ومقاطع الهاتف). النقطة المهمة: الطول الخرج دائمًا مساوٍ تمامًا لطول الدخل، والدخل محدد بحد أقصى 10 ثوانٍ.
المقطع أعلاه جاء مباشرة من gemini-omni-flash-preview عبر خط المعالجة الخاص بنا، لذا فأنت تنظر إلى عينة حقيقية وليست مادة ترويجية. مطالبة نصية واحدة: قارب ورقي ينجرف فوق حبر مسكوب، وعبارة "single continuous scene" لمنع النموذج من عمل قطع مونتاج، وسطر "Audio:" يطلب حفيف الورق وتموجات الماء. طلبنا الـ 10 ثوانٍ كاملة. شغل الصوت؛ الصوت مُنشأ بواسطة الذكاء الاصطناعي أيضًا.
يعمل كل مقطع من 3 إلى 10 ثوانٍ بمعدل 24 إطارًا في الثانية. لا يدرج التوثيق أي معلمة للمدة، وفي البداية افترضنا أن النموذج يحدد المدة بنفسه. تبين أن تنسيق الطلب يقبل المدة بهدوء وهي دقيقة تمامًا: اطلب 3 ثوانٍ وستحصل على 3.008 ثانية، وتتم المحاسبة على 3 ثوانٍ. هذا ما نعرضه في المولد، لذا فإن المونتاج على الإيقاع الموسيقي لم يعد يانصيبًا.
تعمل المطالبة النصية أيضًا كلوحة تحكم لكل ما لا يعرضه الـ API. إذا تُرك النموذج وشأنه فإنه يميل للقطع بين لقطات متعددة، لذا فإن عبارة "single unbroken shot, no cuts" تجد مكانها في معظم المطالبات؛ ويتم اتباع نطاقات الأكواد الزمنية مثل [0-3s] ... [3-6s] ...؛ والنصوص بين علامتي تنصيص تُعرض على الشاشة بدقة مذهلة.
الصوت هو المفاجأة الثانية، وهي مفاجأة سارة. كل إنشاء يأتي مع صوت: ضوضاء محيطة، تأثيرات، وأحيانًا كلام إذا طلبت ذلك. ومع ذلك لا يمكنك إيقافه. التحكم الوحيد لديك هو النص، لذلك انتهى بنا المطاف بإضافة سطر "Audio: ..." إلى نهاية المطالبات ويوفر ذلك نتائج جيدة جدًا.
ما الذي يحتوي عليه Flow ولا يحتوي عليه الـ API؟
Google Flow هو أداة إنتاج كاملة ملتفة حول عدة نماذج، وهذا الغلاف هو بالضبط ما يفتقده الـ API الخام. يوفر لك Flow ميزة Scene Builder لتسلسلات اللقطات المتعددة وعناصر تحكم مسبقة للكاميرا (نوع اللقطة، الزاوية، الحركة). هناك تفصيل يخطئ فيه الناس بشأن الدقة: ينشئ Flow بدقة 720p افتراضيًا أيضًا. تظهر إصدارات 1080p و 4K في خطوة التنزيل، كخيار تصدير فوق إنشاء Veo، وليس كوضع إنشاء مختلف. لا توجد أي من هذه الأدوات في gemini-omni-flash-preview.
إليك المقارنة الصريحة بعد أسبوع من اختبار الاثنين:
| القدرة | Flow / تطبيق Gemini | Gemini Omni Flash API |
|---|---|---|
| الدقة | إنشاء 720p؛ 1080p / 4K متاحة عند التنزيل | 720p فقط، 24 fps |
| طول المقطع | Scene Builder يربط اللقطات | 3–10 ثوانٍ، دقيق |
| أدوات التحكم بالكاميرا | أنواع اللقطات والزوايا والحركة المسبقة | مطالبة نصية فقط |
| تمديد الفيديو | نعم (عبر Veo) | غير مدعوم |
| تعديل فيديو حالي | Remix داخل التطبيق | تفاعلي عبر المحادثة، أو فيديو-إلى-فيديو لأي مقطع |
| الصوت | مفعل، مع عناصر تحكم في الواجهة | مفعل دائمًا، التحكم عبر المطالبة فقط |
| Seed / المطالبة السلبية | مخفية عن المستخدم على أي حال | غير مدعومة |
| المقاطع لكل طلب | مقطع واحد في كل مرة | مقطع واحد لكل تفاعل، لا يوجد sampleCount |
التوثيق واضح بشأن بعض هذه النقاط. تذكر وثائق Google أن تمديد الفيديو والاستكمال "غير مدعومين"، وسري نفس الشيء على تعليمات النظام والحرارة ومعلمات المطالبة السلبية (يقترحون كتابة السلبيات في المطالبة العادية، وهو ما يعمل ناتج تجاربي بنسبة النصف تقريبًا). مراجع الفيديو مدرجة في مخطط الـ API بحد أقصى 3 ثوانٍ، لكن الوثائق تعترف بأن النموذج لا يعالجها بشكل صحيح بعد.
لذا فإن الـ API التجريبي هو شريحة ضيقة مما يمكن للنموذج فعله على واجهات Google الخاصة. هذا أمر طبيعي لإصدار تجريبي. لكنه يظل مزعجًا عندما يطلب العميل تصدير 1080p بينما السقف هو 720p.

التعديل التفاعلي عبر المحادثة هو الميزة التي تقدم أدائًا حقيقيًا
التعديل هو المجال الذي يثبت فيه Omni Flash قيمته. تنشئ مقطعًا وتلقي نظرة عليه، ثم ترسل طلب متابعة مثل "اجعل السترة حمراء وأبطئ الكاميرا" مع ارفاق previous_interaction_id للنتيجة الأولى. يعيد النموذج بناء الفيديو مع تطبيق تغييرك والحفاظ على معظم الأصل. لا إعادة تحميل، لا أقتطاعات، لا خط زمني.
تذكر وثائق Google Gemini Enterprise أنه يمكنك تتابع ما يصل إلى ثلاثة تعديلات متتالية طالما أن الجلسة تحتفظ بالسياق. في الممارسة العملية، كل تعديل هو إنشاء جديد بدقة 720p، لذا تتراجع الاستمرارية قليلاً مع كل خطوة. تصمد الوجوه بشكل أفضل من النصوص على اللوحات. تتغير الحركة المعقدة أحيانًا حتى عندما تطلب فقط ضبط اللون.
عقبة واجهناها في الإنتاج: التفاعلات الأبوية تنتهي صلاحيتها على جانب Google. حاول تعديل مقطع تم إنشاؤه منذ فترة وقد يرجع الـ API خطأ 404 للتفاعل المرجعي. على BananaBanana نعرض ذلك كفيديو منتهي الصلاحية ونرجع تكلفة المحاولة، ولكن إذا كنت تبني على الـ API الخام، فخطط لذلك.

كم تكلفة Gemini Omni Flash؟
يحدد إعلان الإطلاق من Google سعر Omni Flash بـ $0.10 لكل ثانية من الفيديو الناتج: النتيجة ذات الـ 3 ثوانٍ تكلف $0.30، والنتيجة ذات الـ 10 ثوانٍ تكلف $1.00.
على BananaBanana نمرر هذا المعدل مباشرة: $0.10 لكل ثانية، لذا تختار 3 ثوانٍ مقابل $0.30 أو الـ 10 كاملة مقابل $1.00، والتعديل يكلف نفس السعر لأنه إعادة إنشاء كاملة (كما يعود بنفس طول المصدر تمامًا — لا يمكن للنموذج تمديده أو قصّه). نموذج Nano Banana 2 Lite الذي تم إطلاقه في نفس اليوم يكلف $0.03 لكل صورة هنا (سعر Google API هو $0.034 لصورة بدقة 1K). قائمة الأسعار الكاملة موجودة في قسم الأسعار.
هل عشرة سنتات للثانية قيمة جيدة؟ بالنسبة لمسودة مع الصوت والتي كانت ستتطلب بخلاف ذلك تمريرة إنشاء فيديو بالإضافة إلى عمل صوتي منفصل، فربما نعم — واختبار الـ 3 ثوانٍ يكلف أقل من مقطع Veo. بالنسبة لللقطات الخلفية الصامتة، لا. ينشئ Veo 3.1 Fast مقاطع صامتة أرخص وبدقة أعلى.
هل يجب أن تستخدم Omni Flash أم Veo 3.1؟
باختصار: هما يتقاسمان العمل، ولكن ليس على طول خط "مسودة مقابل إنتاج نهائي" كما قد تتوقع.
شيء واحد يجب معرفته قبل الاختيار: الفجوة في الجودة بينهما ليست مجرد دقة. يعرض Veo 3.1 الحركة والفيزياء بشكل أكثر إقناعًا بكثير. يتصرف الماء بطبيعية، وتتنثي الأقمشة حيث ينبغي، وتتصادم الأجسام بدلاً من التداخل مثل الأشباح. يحقق Omni Flash ذلك غالبًا وليس بشكل دائم، وفي بعض المقاطع ستلاحظ ذلك دون البحث عنه.
اختر Veo 3.1 عندما تحتاج إلى تصدير 4K حقيقي، أو طول مقطع دقيق (تحدد ثوانٍ كاملة من 4 إلى 8؛ لا توجد أجزاء من الثانية)، أو إخراج صامت، أو تمديد لاحق، أو التحكم في كل من الإطار الأول والأخير. هذه الميزة الأخيرة غير مقدرة حق قدرها: أطعم نفس الصورة كإطار أول وأخير وستحصل على تكرار سلس للغاية، وهو السر وراء مقاطع الفيديو الخلفية المتكررة. إنها أداة الإنتاج لأي شيء عريض الشاشة أو يعتمد على الفيزياء.
اختر Omni Flash عندما تكون الوجهة هي شاشة الهاتف. بالنسبة لـ TikTok أو Shorts أو Reels، فإن دقة 720p هي بصدق كل ما تحتفظ به المنصة بعد الضغط الخاص بها، ويصل الصوت مدمجًا في نفس التمريرة، والتعديل التفاعلي يتغلب على إعادة كتابة المطالبات من الصفر. في هذا المسار، فهو ليس أداة للتخطيط الأولي بل هو الخيار الأفضل.
سير العمل الشخصي الخاص بي بعد يومين من الاختبار: بالنسبة لأعمال العملاء ذات الشاشة العريضة، ما زلت أصمم المفهوم الأول في Omni Flash — محاولات لمدة ثلاث ثوانٍ بسعر $0.30 — ثم أعيد عمل اللقطة المقبولة في Veo بالجودة النهائية. بالنسبة لمقطع رأسي يذهب مباشرة إلى وسائل التواصل الاجتماعي، غالبًا ما يُنشر مقطع Omni كما هو.

كلا النموذجين متاحان في مولد BananaBanana، لذا يمكنك المقارنة بينهما على نفس المطالبة دون كتابة سطر برمجية واحد أو إعداد مشروع Google Cloud. وإذا كنت تريد النسخة المكثفة من هذه المراجعة — الإمكانيات والحدود والأسعار في صفحة واحدة — فهذا متوفر في صفحة Gemini Omni.
FAQ
ما هو gemini-omni-flash-preview؟
هو معرّف النموذج في الـ API لـ Gemini Omni Flash، نموذج إنشاء الفيديو التفاعلي من Google الذي تم إصداره في معاينة تجريبية عامة في 30 يونيو 2026. أنشئ ويعدل مقاطع بدقة 720p لمدة 3–10 ثوانٍ مع الصوت عبر Interactions API.
هل يمكن لـ Gemini Omni Flash إنشاء فيديو بدقة 1080p أو 4K؟
لا. يخرج الـ API دقة 720p بمعدل 24 fps فقط. ينشئ Google Flow بدقة 720p افتراضيًا أيضًا؛ وتتوفر إصدارات 1080p و 4K في خطوة التنزيل على إنشاءات Veo. إذا كنت بحاجة إلى تصدير عالي الدقة حقيقي، استخدم Veo 3.1.
هل يمكنني تحديد مدة الفيديو في Omni Flash API؟
نعم، على الرغم من أنك لن تجد ذلك في الوثائق الرسمية. يتقبل تنسيق الاستجابة المدة، وتتطابق النتيجة مع الإطار: 3 ثوانٍ مدخلة، 3.008 ثانية مخرجة، وتتم المحاسبة على 3 ثوانٍ. نعرضه كمحدد من 3–10 ثوانٍ في المولد. الاستثناء هو التعديل — يتوارث المقطع المعدل دائمًا طول الفيديو الذي صُنع منه.
هل ينشئ Omni Flash الصوت دائمًا؟
نعم، يتضمن كل مقطع مسارًا صوتيًا مُنشأ ولا توجد علامة لإيقاف تشغيله. صف الصوت الذي تريده (أو اطلب "quiet ambient room tone") مباشرة في المطالبة النصية.
هل يمكن لـ Omni Flash تمديد أو استكمال مقاطع الفيديو الحالية؟
لا يمكنه جعلها أطول: التمديد والاستكمال غير مدعومين، وتجيب مهمة extend في المخطط بـ "this model does not support video extension". التعديل هو ما يفعله بدلاً من ذلك — إما تفاعليًا عبر المحادثة على مقطع أنشأه، أو فيديو-إلى-فيديو على أي فيديو مكتمل تزوده به، بما في ذلك إنشاء Veo أو التحميل الخاص بك. يحافظ الخرج على طول الدخل.