Gemini Omni Flash API جائزہ: پریویو ورژن کی اصل صلاحیتیں
Gemini Omni Flash API کا عملی جائزہ: gemini-omni-flash-preview کی اصل صلاحیتیں، Flow کے خصوصی فیچرز اور فی کلپ حقیقی اخراجات۔

Gemini Omni Flash گوگل کا پہلا "any-to-any" ملٹی موڈل ماڈل ہے جو ویڈیو آؤٹ پٹ دیتا ہے: آپ متن، تصاویر یا سابقہ نتیجہ بھیجتے ہیں، اور یہ آواز کے ساتھ ایک مختصر 720p کلپ واپس کرتا ہے جسے آپ عام زبان میں تبدیلیوں کی وضاحت کر کے مزید ایڈٹ کر سکتے ہیں۔ گوگل نے اسے 30 جون 2026 کو Nano Banana 2 Lite کے ساتھ پبلک پریویو میں جاری کیا تھا، اور API ماڈل ID gemini-omni-flash-preview ہے۔
اگر آپ صرف ایک بات جاننے آئے ہیں، تو مختصر جواب: Gemini Omni Flash API ٹیکسٹ ٹو ویڈیو (text-to-video)، امیج ٹو ویڈیو (image-to-video)، زیادہ سے زیادہ 10 سبجیکٹ تصاویر (جو ابتدائی فریم کے ساتھ مل سکتی ہیں) کے ساتھ ریفرنس ٹو ویڈیو (reference-to-video)، مکالماتی ایڈٹنگ (conversational editing) اور آپ کی بھیجی گئی کلپ کی ویڈیو ٹو ویڈیو ایڈٹنگ کو سپورٹ کرتا ہے۔ یہ 1080p، سیڈز، نیگیٹو پرامپٹ پیرامیٹرز، ویڈیو ایکسٹینشن یا آڈیو بند کرنے کو سپورٹ نہیں کرتا۔ دورانیے کا کنٹرول بھی دستاویزات میں نہیں ہے، لیکن یہ فیلڈ موجود ہے اور کام کرتی ہے — ذیل میں مزید تفصیلات ملاحظہ کریں۔ اگر آپ نے Google Flow میں Omni Flash کا ڈیمو دیکھا تھا اور API سے بھی اسی ٹول کٹ کی توقع کر رہے تھے، تو آپ کو مایوسی ہوگی۔ ہم نے اسے لانچ کے ہفتے کے دوران ہی اپنے جنریٹر میں شامل کر لیا تھا، لہذا یہ جائزہ مارکیٹنگ پیج کے بجائے اینڈ پوائنٹ کے حقیقی نتائج پر مبنی ہے۔
Gemini Omni Flash API درحقیقت آپ کو کیا فراہم کرتا ہے
API Omni Flash کو Interactions API (interactions.create) کے ذریعے فراہم کرتا ہے، نہ کہ generateVideos اینڈ پوائنٹ کے ذریعے جو Veo استعمال کرتا ہے۔ یہ تفصیل اہم ہے کیونکہ انٹرایکشنز اسٹیٹ فل (stateful) ہوتے ہیں۔ ہر جواب میں ایک id ہوتی ہے جسے آپ بعد میں حوالہ کے طور پر استعمال کر سکتے ہیں۔
گوگل کی Omni دستاویزات اور ایک ہفتے کے اینڈ پوائنٹ ٹیسٹنگ کے مطابق، آج 5 ٹاسکس کام کرتے ہیں:
- Text-to-video. پرامپٹ دیں، ساؤنڈ ٹریک کے ساتھ 720p کلپ حاصل کریں۔
- Image-to-video. آپ کی تصویر پہلا فریم بنتی ہے اور پرامپٹ حرکت کی وضاحت کرتا ہے۔
- Reference-to-video. سبجیکٹ تصاویر نئے منظر میں کردار یا پروڈکٹ کی تسلسل برقرار رکھتی ہیں — درخواست میں زیادہ سے زیادہ 10 تصاویر لی جا سکتی ہیں، اور Veo کے برعکس انہیں ابتدائی فریم کے ساتھ ملایا جا سکتا ہے۔
- Conversational editing.
previous_interaction_idاور ایک مختصر ہدایت بھیجیں، اور ماڈل باقی حصے کو برقرار رکھتے ہوئے کلپ میں تبدیلی کر دیتا ہے۔ - Video-to-video editing.
task: "edit"کے ساتھ مواد کے طور پر ایک اصل ویڈیو بھیجیں اور یہ نئے اسٹائل میں واپس آتی ہے — اس کے لیے انٹرایکشن آئی ڈی کی ضرورت نہیں ہوتی، لہذا یہ ان کلپس پر بھی کام کرتی ہے جو ماڈل نے کبھی نہیں بنائے (بشمول Veo رینڈرز اور فون فوٹیج)۔ خاص بات: آؤٹ پٹ کی لمبائی ہمیشہ ان پٹ کے بالکل برابر ہوتی ہے، اور ان پٹ زیادہ سے زیادہ 10 سیکنڈ تک محدود ہے۔
اوپر دی گئی کلپ ہماری اپنی پائپ لائن کے ذریعے براہ راست gemini-omni-flash-preview سے حاصل کی گئی ہے، لہذا آپ ایک حقیقی نمونہ دیکھ رہے ہیں۔ ایک ٹیکسٹ پرامپٹ: بکھری ہوئی روشنائی میں بہتی کاغذ کی کشتی، ماڈل کو کٹ لگانے سے روکنے کے لیے "single continuous scene"، اور کاغذ کی سرسراہٹ اور پانی کی لہروں کی درخواست کرنے والی "Audio:" لائن۔ ہم نے پورے 10 سیکنڈ کی درخواست کی تھی۔ آواز آن کر کے سنیں؛ آڈیو بھی AI نے تیار کی ہے۔
ہر کلپ 24 fps پر 3 سے 10 سیکنڈ تک چلتی ہے۔ دستاویزات میں دورانیے کا پیرامیٹر درج نہیں ہے، اور لانچ کے وقت ہم نے فرض کیا تھا کہ ماڈل خود فیصلہ کرتا ہے۔ لیکن معلوم ہوا کہ درخواست کی فارمیٹ خاموشی سے دورانیہ قبول کرتی ہے اور یہ بالکل درست ہے: 3 سیکنڈ مانگیں اور آپ کو 3.008 سیکنڈ ملتے ہیں، جس کے لیے 3 سیکنڈ کا چارج لیا جاتا ہے۔ جنریٹر میں ہم یہی فیچر فراہم کرتے ہیں، لہذا موسیقی کی دھن پر ایڈٹ کرنا اب کوئی جوئے کا کھیل نہیں رہا۔
پرامپٹ ان تمام چیزوں کے لیے کنٹرول پینل کا کام کرتا ہے جو API میں دستیاب نہیں ہیں۔ اکیلا چھوڑنے پر ماڈل کئی شاٹس کے درمیان کٹ لگانے لگتا ہے، لہذا "single unbroken shot, no cuts" زیادہ تر پرامپٹس میں جگہ بنا لیتا ہے؛ [0-3s] ... [3-6s] ... جیسے ٹائم کوڈز کی پیروی کی جاتی ہے؛ اور اقتباسات میں لکھے گئے الفاظ اسکرین پر حیرت انگیز درستگی کے ساتھ دکھائے جاتے ہیں۔
آڈیو دوسری حیرت انگیز اور خوشگوار بات ہے۔ ہر جنریشن کے ساتھ آواز شامل ہوتی ہے: ماحول کا شور، اثرات، اور اگر آپ مانگیں تو بات چیت بھی۔ تاہم، آپ اسے بند نہیں کر سکتے۔ آپ کے پاس واحد کنٹرول متن کا ہے، لہذا ہم نے پرامپٹس کے آخر میں "Audio: ..." لائن شامل کرنا شروع کی اور یہ کافی بہتر کام کرتی ہے۔
Flow میں ایسا کیا ہے جو API میں نہیں ہے؟
Google Flow کئی ماڈلز کے ساتھ تیار کردہ ایک مکمل پروڈکشن ٹول ہے، اور وہی لیئر را API میں غائب ہے۔ Flow آپ کو ملٹی شاٹ سیکوئنس کے لیے Scene Builder اور پری سیٹ کیمرہ کنٹرولز (شاٹ ٹائپ، اینگل، موومنٹ) دیتا ہے۔ ریزولیوشن کے بارے میں ایک غلط فہمی: Flow بھی ڈیفالٹ طور پر 720p پر رینڈر کرتا ہے۔ 1080p اور 4K ورژنز ڈاؤن لوڈ اسٹیپ پر ملتے ہیں، جو Veo رینڈر پر ایکسپورٹ کا آپشن ہیں، نہ کہ الگ جنریشن موڈ۔ ان میں سے کوئی ٹول gemini-omni-flash-preview میں موجود نہیں ہے۔
ایک ہفتے کے ٹیسٹ کے بعد سچا موازنہ یہ ہے:
| صلاحیت | Flow / Gemini ایپ | Gemini Omni Flash API |
|---|---|---|
| ریزولیوشن | 720p رینڈر؛ ڈاؤن لوڈ پر 1080p / 4K دستیاب | صرف 720p, 24 fps |
| کلپ کی لمبائی | Scene Builder شاٹس جوڑتا ہے | 3–10 سیکنڈ، بالکل درست |
| کیمرہ کنٹرول | پری سیٹ شاٹ ٹائپ، اینگل، موومنٹ | صرف ٹیکسٹ پرامپٹ |
| ویڈیو بڑھانا (Extend) | ہاں (Veo کے ذریعے) | سپورٹڈ نہیں |
| موجودہ ویڈیو ایڈٹ کرنا | ایپ میں Remix | مکالماتی، یا کسی بھی کلپ پر ویڈیو ٹو ویڈیو |
| آڈیو | آن، UI کنٹرولز کے ساتھ | ہمیشہ آن، صرف پرامپٹ کنٹرول |
| سیڈ / نیگیٹو پرامپٹ | ویسے بھی صارف سے چھپا ہوا | سپورٹڈ نہیں |
| فی درخواست کلپس | ایک وقت میں ایک | فی انٹرایکشن ایک، کوئی sampleCount نہیں |
دستاویزات میں کچھ حدود کی وضاحت کی گئی ہے۔ گوگل کی دستاویزات بتاتی ہیں کہ ویڈیو ایکسٹینشن اور انٹرپولیشن "سپورٹڈ نہیں ہیں"، اور یہی بات سسٹم ہدایات، درجہ حرارت اور نیگیٹو پرامپٹ پیرامیٹرز پر لاگو ہوتی ہے (وہ عام پرامپٹ میں ہی منفی باتیں لکھنے کی تجویز دیتے ہیں، جو میرے تجربے میں صرف آدھی بار کام کرتا ہے)۔ ویڈیو ریفرنسز 3 سیکنڈ کی حد کے ساتھ API اسکیما میں درج ہیں، لیکن دستاویزات تسلیم کرتی ہیں کہ ماڈل ابھی انہیں درست طریقے سے پروسیس نہیں کرتا۔
لہذا پریویو API گوگل کے اپنے پلیٹ فارمز پر ماڈل کی صلاحیتوں کا ایک محدود حصہ ہے۔ پریویو کے لیے یہ عام بات ہے۔ پھر بھی جب کوئی کلائنٹ 1080p ایکسپورٹ مانگتا ہے اور آپ کی حد 720p ہو، تو مایوسی ہوتی ہے۔

Conversational editing وہ فیچر ہے جو واقعی کمال کرتا ہے
ایڈٹنگ وہ جگہ ہے جہاں Omni Flash اپنی صلاحیتیں دکھاتا ہے۔ آپ ایک کلپ جنریٹ کرتے ہیں، اسے دیکھتے ہیں، پھر پہلے نتیجے کی previous_interaction_id کے ساتھ "جیکٹ کو سرخ کر دو اور کیمرہ آہستہ کر دو" جیسی ہدایت بھیجتے ہیں۔ ماڈل اصل کلپ کا زیادہ تر حصہ محفوظ رکھتے ہوئے آپ کی تبدیلیاں لاگو کر کے ویڈیو دوبارہ بنا دیتا ہے۔ نہ دوبارہ اپ لوڈنگ، نہ ماسک، نہ ٹائم لائن۔
گوگل کی Gemini Enterprise دستاویزات کے مطابق، جب تک سیشن سیاق و سباق برقرار رکھتا ہے، آپ مسلسل 3 ایڈٹس کر سکتے ہیں۔ عمل میں ہر ایڈٹ ایک نیا 720p رینڈر ہوتا ہے، لہذا ہر مرحلے کے ساتھ تسلسل میں معمولی تبدیلی آتی ہے۔ سائن بورڈز کے متن کے مقابلے میں چہرے زیادہ بہتر رہتے ہیں۔ پیچیدہ حرکات کبھی کبھی بدل جاتی ہیں، چاہے آپ نے صرف رنگ بدلنے کو کہا ہو۔
پروڈکشن میں ہمارے سامنے آنے والا ایک مسئلہ: پیرنٹ انٹرایکشنز گوگل کی طرف سے ایکسپائر ہو جاتے ہیں۔ بہت پہلے جنریٹ کی گئی کلپ کو ایڈٹ کرنے کی کوشش کریں تو API 404 غلطی دے سکتا ہے۔ BananaBanana پر ہم اسے ایکسپائرڈ ویڈیو کے طور پر دکھاتے ہیں اور کوشش کا رقم واپس کر دیتے ہیں، لیکن اگر آپ را API پر کام کر رہے ہیں، تو اس کے لیے تیار رہیں۔

Gemini Omni Flash کی قیمت کتنی ہے؟
گوگل کا لانچ کا اعلان Omni Flash کی قیمت $0.10 فی سیکنڈ آؤٹ پٹ ویڈیو طے کرتا ہے: 3 سیکنڈ کا نتیجہ $0.30 کا ہوتا ہے، اور 10 سیکنڈ کا $1.00 کا۔
BananaBanana پر ہم یہی ریٹ لاگو کرتے ہیں: $0.10 فی سیکنڈ، لہذا آپ $0.30 میں 3 سیکنڈ یا $1.00 میں پورے 10 سیکنڈ منتخب کرتے ہیں، اور ایک ایڈٹ کی قیمت بھی اتنی ہی ہوتی ہے کیونکہ یہ پورا ری رینڈر ہوتا ہے (یہ اصل لمبائی کے ساتھ واپس آتا ہے — ماڈل اسے لمبا یا چھوٹا نہیں کر سکتا)۔ Nano Banana 2 Lite، جو اسی دن لانچ ہوا تھا، یہاں $0.03 فی تصویر پر دستیاب ہے (گوگل کا API ریٹ 1K تصویر کے لیے $0.034 ہے)۔ مکمل قیمتوں کی فہرست پرائسنگ سیکشن پر دستیاب ہے۔
کیا دس سینٹ فی سیکنڈ مناسب قیمت ہے؟ آواز والے ڈرافٹ کے لیے جس کے لیے وگرنہ ویڈیو جنریشن اور الگ سے آڈیو کا کام درکار ہوتا، شاید ہاں — اور 3 سیکنڈ کا ٹیسٹ Veo کلپ سے سستا پڑتا ہے۔ بغیر آواز والے بی رول کے لیے، نہیں۔ Veo 3.1 Fast زیادہ ریزولیوشن پر سستے خاموش کلپس بناتا ہے۔
کیا آپ کو Omni Flash منتخب کرنا چاہیے یا Veo 3.1؟
مختصراً: وہ کام تقسیم کر لیتے ہیں، لیکن "ڈرافٹ بمقابلہ فائنل" کے اس طریقے سے نہیں جیسا آپ سوچ سکتے ہیں۔
منتخب کرنے سے پہلے جاننے کی بات: ان کے درمیان کوالٹی کا فرق صرف ریزولیوشن کا نہیں ہے۔ Veo 3.1 حرکات اور فزکس کو زیادہ قدرتی انداز میں رینڈر کرتا ہے۔ پانی قدرتی طور پر بہتا ہے، کپڑا صحیح جگہوں پر سلوٹیں لیتا ہے، چیزیں ایک دوسرے سے ٹکراتی ہیں نہ کہ سائے کی طرح آر پار گزر جاتی ہیں۔ Omni Flash اکثر درست کرتا ہے، لیکن ہمیشہ نہیں، اور کچھ کلپس میں آپ کو فوراً اندازہ ہو جائے گا۔
جب آپ کو اصل 4K ایکسپورٹ، بالکل درست کلپ لمبائی (آپ 4 سے 8 کے درمیان مکمل سیکنڈز منتخب کرتے ہیں)، خاموش آؤٹ پٹ، بعد میں ویڈیو بڑھانے کی صلاحیت، یا پہلے اور آخری دونوں فریمز پر کنٹرول کی ضرورت ہو، تو Veo 3.1 منتخب کریں۔ آخری فیچر کو کم سمجھا جاتا ہے: پہلے اور آخری فریم کے طور پر ایک ہی تصویر دیں اور آپ کو ایک بہترین لوپ ملتا ہے، جو لوپنگ بیک گراؤنڈ ویڈیو کی اصل ترکیب ہے۔
جب ہدف فون اسکرین ہو تو Omni Flash منتخب کریں۔ TikTok، Shorts یا Reels کے لیے 720p ہی وہ ریزولیوشن ہے جو پلیٹ فارم اپنی کمپریشن کے بعد بچاتا ہے، ساؤنڈ اسی مرحلے میں تیار ہو جاتی ہے، اور خیال پر کام کرتے وقت مکالماتی ایڈٹنگ شروع سے پرامپٹ لکھنے سے بہتر ہے۔ اس میدان میں یہ صرف ڈرافٹ ٹول نہیں، بلکہ بہتر انتخاب ہے۔
دو دن کے ٹیسٹنگ کے بعد میرا ذاتی طریقہ کار: وائڈ اسکرین کلائنٹ ورک کے لیے میں اب بھی Omni Flash میں تصور بناتا ہوں — $0.30 پر تین سیکنڈ کے ٹیکس — پھر فائنل کوالٹی میں Veo میں بہترین ورژن دوبارہ بناتا ہوں۔ سوشل میڈیا کے لیے ورٹیکل کلپس کے لیے، Omni کی ویڈیو اکثر ویسے ہی پوسٹ ہو جاتی ہے۔

دونوں ماڈلز BananaBanana جنریٹر میں فعال ہیں، لہذا آپ کوڈ لکھے بغیر یا گوگل کلاؤڈ پروجیکٹ سیٹ کیے بغیر ایک ہی پرامپٹ پر ان کا موازنہ کر سکتے ہیں۔ اور اگر آپ اس جائزے کا خلاصہ چاہتے ہیں — صلاحیتیں، حدود اور قیمت ایک پیج پر — تو وہ Gemini Omni پیج پر دستیاب ہے۔
FAQ
gemini-omni-flash-preview کیا ہے؟
یہ Gemini Omni Flash کی API ماڈل ID ہے، جو گوگل کا مکالماتی ویڈیو جنریشن ماڈل ہے جسے 30 جون 2026 کو پبلک پریویو میں جاری کیا گیا تھا۔ یہ Interactions API کے ذریعے آڈیو کے ساتھ 720p، 3–10 سیکنڈ کے کلپس جنریٹ اور ایڈٹ کرتا ہے۔
کیا Gemini Omni Flash 1080p یا 4K ویڈیو بنا سکتا ہے؟
نہیں۔ API صرف 24 fps پر 720p آؤٹ پٹ دیتا ہے۔ Google Flow بھی ڈیفالٹ طور پر 720p پر رینڈر کرتا ہے؛ اس کے 1080p اور 4K ورژنز Veo رینڈرز پر ڈاؤن لوڈ اسٹیپ میں دیے جاتے ہیں۔ اگر آپ کو اصل ہائی ریزولیوشن ایکسپورٹ چاہیے، تو Veo 3.1 استعمال کریں۔
کیا میں Omni Flash API میں ویڈیو کا دورانیہ سیٹ کر سکتا ہوں؟
ہاں، اگرچہ آپ کو یہ دستاویزات میں نہیں ملے گا۔ جواب کی فارمیٹ دورانیہ قبول کرتی ہے، اور نتیجہ فریم تک ملتا ہے: 3 سیکنڈ مانگیں، 3.008 سیکنڈ حاصل کریں، چارج 3 سیکنڈ کا۔ ہم جنریٹر میں اسے 3–10 سیکنڈ کے سلیکٹر کے طور پر فراہم کرتے ہیں۔ استثناء ایڈٹنگ ہے — ایڈٹ شدہ کلپ ہمیشہ اس ویڈیو کی لمبائی حاصل کرتا ہے جس سے وہ بنا تھا۔
کیا Omni Flash ہمیشہ آڈیو جنریٹ کرتا ہے؟
ہاں، ہر کلپ میں ایک تیار شدہ ساؤنڈ ٹریک شامل ہوتا ہے اور اسے بند کرنے کا کوئی اپشن نہیں ہے۔ پسندیدہ آڈیو (یا "quiet ambient room tone") براہ راست پرامپٹ میں لکھیں۔
کیا Omni Flash موجودہ ویڈیو کو بڑھا (Extend) یا انٹرپولیٹ کر سکتا ہے؟
یہ انہیں لمبا نہیں بنا سکتا: ایکسٹینشن اور انٹرپولیشن سپورٹڈ نہیں ہیں، اور اسکیما میں extend ٹاسک "this model does not support video extension" کا جواب دیتا ہے۔ ایڈٹنگ اس کی جگہ کام کرتی ہے — یا تو اپنے بنائے گئے کلپ پر مکالماتی انداز میں، یا آپ کی دی گئی کسی بھی مکمل ویڈیو پر ویڈیو ٹو ویڈیو انداز میں (بشمول Veo رینڈر یا آپ کی اپنی اپ لوڈ کردہ ویڈیو)۔ آؤٹ پٹ ان پٹ کی لمبائی برقرار رکھتا ہے۔