Gemini Omni Flash API समीक्षा: जानिए प्रीव्यू मॉडल की असली क्षमताएं
Gemini Omni Flash API की व्यावहारिक समीक्षा: gemini-omni-flash-preview में क्या सपोर्ट मिलता है, Flow के एक्सक्लूसिव फीचर्स क्या हैं और प्रति क्लिप असली खर्च कितना है।

Gemini Omni Flash गूगल का पहला "any-to-any" मल्टीमॉडल मॉडल है जो वीडियो आउटपुट देता है: आप टेक्स्ट, इमेज या पिछला रिजल्ट भेजते हैं, और यह साउंड के साथ एक छोटा 720p क्लिप लौटाता है जिसे आप आसान भाषा में बदलाव बताकर आगे एडिट कर सकते हैं। गूगल ने इसे 30 जून 2026 को Nano Banana 2 Lite के साथ पब्लिक प्रीव्यू में लॉन्च किया था, और API मॉडल आईडी gemini-omni-flash-preview है।
अगर आप सिर्फ एक जानकारी के लिए आए हैं, तो त्वरित जवाब: Gemini Omni Flash API टेक्स्ट-टू-वीडियो (text-to-video), इमेज-टू-वीडियो (image-to-video), अधिकतम 10 सब्जेक्ट इमेज (जो शुरुआती फ्रेम के साथ कंबाइन होती हैं) के साथ रेफरेंस-टू-वीडियो (reference-to-video), कन्वर्सेशनल एडिटिंग और आपके द्वारा अपलोड क्लिप की वीडियो-टू-वीडियो एडिटिंग का सपोर्ट करता है। यह 1080p, सीड्स, नेगेटिव प्रॉम्प्ट पैरामीटर्स, वीडियो एक्सटेंशन या ऑडियो ऑफ करने का सपोर्ट नहीं करता है। ड्यूरेशन कंट्रोल भी डॉक्यूमेंटेशन में नहीं है, लेकिन फील्ड मौजूद है और काम करता है — आगे इसके बारे में विस्तार से पढ़ें। अगर आपने Google Flow के अंदर Omni Flash के डेमो देखे थे और API से भी उसी टूलकिट की उम्मीद कर रहे थे, तो आपको निराशा होगी। हमने इसे लॉन्च वीक के दौरान ही अपने जनरेटर में इंटीग्रेट कर लिया था, इसलिए यह रिव्यू मार्केटिंग पेज पर नहीं, बल्कि एंडपॉइंट के वास्तविक आउटपुट पर आधारित है।
Gemini Omni Flash API वास्तव में आपको क्या देता है
API Omni Flash को Interactions API (interactions.create) के जरिए पेश करता है, ना कि generateVideos एंडपॉइंट के जरिए जिसका इस्तेमाल Veo करता है। यह विवरण महत्वपूर्ण है क्योंकि इंटरेक्शन स्टेटफुल (stateful) होते हैं। हर रिस्पॉन्स में एक id होती है जिसे आप बाद में रेफर कर सकते हैं।
गूगल के Omni डॉक्यूमेंटेशन और एक हफ्ते के एंडपॉइंट टेस्टिंग के अनुसार, आज 5 टास्क काम करते हैं:
- Text-to-video. प्रॉम्प्ट इनपुट करें, साउंडट्रैक के साथ 720p क्लिप पाएं।
- Image-to-video. आपकी फोटो ओपनिंग फ्रेम बनती है और प्रॉम्प्ट मोशन को बयां करता है।
- Reference-to-video. सब्जेक्ट इमेज नए सीन में कैरेक्टर या प्रोडक्ट की निरंतरता बनाए रखती हैं — रिक्वेस्ट में अधिकतम 10 इमेज ली जा सकती हैं, और Veo के विपरीत इन्हें शुरुआती फ्रेम के साथ कंबाइन किया जा सकता है।
- Conversational editing.
previous_interaction_idऔर एक छोटा निर्देश भेजें, और मॉडल बाकी हिस्से को बरकरार रखते हुए क्लिप में बदलाव कर देता है। - Video-to-video editing.
task: "edit"के साथ कंटेंट के रूप में एक असली वीडियो भेजें और यह नए स्टाइल में वापस आता है — इसके लिए इंटरेक्शन आईडी की जरूरत नहीं होती, इसलिए यह उन क्लिप्स पर भी काम करता है जो मॉडल ने कभी नहीं बनाए (जिसमें Veo रेंडर्स और फोन फुटेज शामिल हैं)। खास बात: आउटपुट की लंबाई हमेशा इनपुट के बिल्कुल बराबर होती है, और इनपुट अधिकतम 10 सेकंड तक सीमित है।
ऊपर दिया गया क्लिप सीधे gemini-omni-flash-preview से हमारी अपनी पाइपलाइन के जरिए जेनरेट हुआ है, इसलिए आप एक असली सैंपल देख रहे हैं, कोई प्रेस एसेट नहीं। एक टेक्स्ट प्रॉम्प्ट: फैली हुई स्याही में तैरती कागज की नाव, मॉडल को कट लगाने से रोकने के लिए "single continuous scene", और कागज की सरसराहट व पानी की लहरों की मांग करने वाली एक "Audio:" लाइन। हमने पूरे 10 सेकंड की मांग की थी। साउंड ऑन करके सुनें; ऑडियो भी AI द्वारा जेनरेट किया गया है।
हर क्लिप 24 fps पर 3 से 10 सेकंड तक चलती है। डॉक्यूमेंटेशन में ड्यूरेशन पैरामीटर लिस्टेड नहीं है, और लॉन्च के समय हमने माना था कि मॉडल खुद तय करता है। लेकिन पता चला कि रिक्वेस्ट फॉर्मेट चुपचाप ड्यूरेशन स्वीकार करता है और यह बिल्कुल सटीक है: 3 सेकंड मांगे और आपको 3.008 सेकंड मिले, जिसके लिए 3 सेकंड का चार्ज लिया गया। जनरेटर में हम यही फीचर देते हैं, इसलिए म्यूजिक पर कट लगाना अब लॉटरी जैसा नहीं रहा।
प्रॉम्प्ट उन सभी चीजों के लिए कंट्रोल पैनल का काम करता है जो API में उपलब्ध नहीं हैं। अकेला छोड़ने पर मॉडल कई शॉट्स के बीच कट लगाने लगता है, इसलिए "single unbroken shot, no cuts" ज्यादातर प्रॉम्प्ट्स में अपनी जगह बना लेता है; [0-3s] ... [3-6s] ... जैसी टाइमकोड रेंज का पालन किया जाता है; और कोट्स में लिखे टेक्स्ट स्क्रीन पर काफी सटीकता से रेंडर होते हैं।
ऑडियो दूसरा सरप्राइज है, और एक सुखद सरप्राइज। हर जनरेशन साउंड के साथ आता है: एम्बिएंट नॉइज़, इफेक्ट्स, अगर आप मांगें तो बोली भी। हालांकि, आप इसे बंद नहीं कर सकते। आपके पास एकमात्र कंट्रोल टेक्स्ट का है, इसलिए हमने प्रॉम्प्ट्स के अंत में "Audio: ..." लाइन जोड़ना शुरू किया और यह काफी अच्छी तरह काम करता है।
Flow में ऐसा क्या है जो API में नहीं है?
Google Flow कई मॉडल्स के साथ बना एक पूरा प्रोडक्शन टूल है, और वही लेयर रॉ API में गायब है। Flow आपको मल्टी-शॉट सीक्वेंस के लिए Scene Builder और प्रीसेट कैमरा कंट्रोल (शॉट टाइप, एंगल, मूवमेंट) देता है। रिज़ॉल्यूशन के बारे में एक गलतफहमी: Flow भी डिफॉल्ट रूप से 720p पर रेंडर करता है। 1080p और 4K वर्जन डाउनलोड स्टेप पर मिलते हैं, जो Veo रेंडर पर एक्सपोर्ट का विकल्प हैं, न कि अलग जनरेशन मोड। इनमें से कोई टूल gemini-omni-flash-preview में मौजूद नहीं है।
एक हफ्ते के टेस्ट के बाद सच्चा मुकाबला यहां है:
| क्षमता | Flow / Gemini ऐप | Gemini Omni Flash API |
|---|---|---|
| रिज़ॉल्यूशन | 720p रेंडर; डाउनलोड पर 1080p / 4K उपलब्ध | केवल 720p, 24 fps |
| क्लिप की लंबाई | Scene Builder शॉट्स जोड़ता है | 3–10 सेकंड, सटीक |
| कैमरा कंट्रोल | प्रीसेट शॉट टाइप, एंगल, मूवमेंट | केवल टेक्स्ट प्रॉम्प्ट |
| वीडियो एक्सटेंड करना | हां (Veo के जरिए) | सपोर्टेड नहीं |
| मौजूदा वीडियो एडिट करना | ऐप में Remix | कन्वर्सेशनल, या किसी क्लिप पर वीडियो-टू-वीडियो |
| ऑडियो | ऑन, UI कंट्रोल्स के साथ | हमेशा ऑन, केवल प्रॉम्प्ट कंट्रोल |
| सीड / नेगेटिव प्रॉम्प्ट | वैसे भी यूजर से छुपा हुआ | सपोर्टेड नहीं |
| प्रति रिक्वेस्ट क्लिप | एक बार में एक | प्रति इंटरेक्शन एक, कोई sampleCount नहीं |
डॉक्यूमेंटेशन में कुछ सीमाओं के बारे में साफ कहा गया है। गूगल के डॉक्स बताते हैं कि वीडियो एक्सटेंशन और इंटरपोलेशन "सपोर्टेड नहीं हैं", और यही बात सिस्टम इंस्ट्रक्शन्स, टेम्परेचर और नेगेटिव प्रॉम्प्ट पैरामीटर्स पर लागू होती है (वे साधारण प्रॉम्प्ट में ही नेगेटिव बातें लिखने का सुझाव देते हैं, जो मेरे अनुभव में केवल आधी बार काम करता है)। वीडियो रेफरेंस 3-सेकंड की सीमा के साथ API स्कीमा में सूचीबद्ध हैं, लेकिन डॉक्स मानते हैं कि मॉडल अभी उन्हें सही ढंग से प्रोसेस नहीं करता है।
इसलिए प्रीव्यू API गूगल के अपने प्लेटफॉर्म्स पर मॉडल की क्षमताओं का एक सीमित हिस्सा है। प्रीव्यू के लिए यह सामान्य है। फिर भी जब कोई क्लाइंट 1080p एक्सपोर्ट मांगता है और आपकी सीमा 720p ही हो, तो निराशा होती है।

Conversational editing वह फीचर है जो वाकई कमाल करता है
एडिटिंग वह जगह है जहां Omni Flash अपनी जगह बनाता है। आप एक क्लिप जेनरेट करते हैं, उसे देखते हैं, फिर पहले रिजल्ट की previous_interaction_id के साथ "जैकेट लाल कर दो और कैमरा धीमा कर दो" जैसा निर्देश भेजते हैं। मॉडल मूल क्लिप का अधिकांश हिस्सा सुरक्षित रखते हुए आपके बदलाव लागू करके वीडियो फिर से बना देता है। कोई री-अपलोडिंग नहीं, कोई मास्क नहीं, कोई टाइमलाइन नहीं।
गूगल के Gemini Enterprise डॉक्यूमेंटेशन में कहा गया है कि जब तक सेशन कॉन्टेक्स्ट बनाए रखता है, आप लगातार 3 सीक्वेंशियल एडिट कर सकते हैं। व्यावहारिक रूप से हर एडिट एक नया 720p रेंडर होता है, इसलिए हर स्टेप के साथ निरंतरता थोड़ी खिसकती है। साइनबोर्ड के टेक्स्ट की तुलना में चेहरे बेहतर बने रहते हैं। जटिल मोशन कभी-कभी बदल जाता है, भले ही आपने केवल रंग बदलने को कहा हो।
प्रोडक्शन में हमारे सामने आई एक समस्या: पेरेंट इंटरेक्शन गूगल की तरफ से एक्सपायर हो जाते हैं। बहुत पहले जेनरेट हुए क्लिप को एडिट करने की कोशिश करें तो API रेफर किए गए इंटरेक्शन के लिए 404 लौटा सकता है। BananaBanana पर हम इसे एक्सपायर्ड वीडियो के रूप में दिखाते हैं और प्रयास का रिफंड कर देते हैं, लेकिन अगर आप रॉ API पर बिल्ड कर रहे हैं, तो इसके लिए तैयार रहें।

Gemini Omni Flash का खर्च कितना है?
गूगल का लॉन्च अनाउंसमेंट Omni Flash की कीमत $0.10 प्रति सेकंड आउटपुट वीडियो तय करता है: 3-सेकंड का रिजल्ट $0.30 का होता है, और 10-सेकंड का $1.00 का।
BananaBanana पर हम यही रेट लागू करते हैं: $0.10 प्रति सेकंड, इसलिए आप $0.30 में 3 सेकंड या $1.00 में पूरे 10 सेकंड चुनते हैं, और एक एडिट का खर्च भी उतना ही होता है क्योंकि यह पूरा री-रेंडर होता है (यह स्रोत के बराबर लंबाई के साथ वापस आता है — मॉडल इसे लंबा या छोटा नहीं कर सकता)। Nano Banana 2 Lite, जो उसी दिन लॉन्च हुआ था, यहां $0.03 प्रति इमेज पर चलता है (गूगल का API रेट 1K इमेज के लिए $0.034 है)। पूरी प्राइस लिस्ट प्राइसिंग सेक्शन पर उपलब्ध है।
क्या दस सेंट प्रति सेकंड सही कीमत है? साउंड वाले ड्रॉफ्ट के लिए जिसके लिए वरना वीडियो जनरेशन और अलग से ऑडियो काम की जरूरत होती, शायद हां — और 3-सेकंड का टेस्ट Veo क्लिप से सस्ता पड़ता है। बिना आवाज वाले बी-रोल के लिए, नहीं। Veo 3.1 Fast हायर रिज़ॉल्यूशन पर सस्ते मूक क्लिप बनाता है।
क्या आपको Omni Flash चुनना चाहिए या Veo 3.1?
संक्षेप में: वे काम बांट लेते हैं, लेकिन "ड्राफ्ट बनाम फाइनल" के उस तरीके से नहीं जैसा आप सोच सकते हैं।
चुनने से पहले जानने योग्य बात: उनके बीच क्वालिटी का अंतर केवल रिज़ॉल्यूशन का नहीं है। Veo 3.1 मोशन और फिजिक्स को ज्यादा स्वाभाविक रूप से रेंडर करता है। पानी स्वाभाविक रूप से बहता है, कपड़ा सही जगह सिलवटें लेता है, चीजें भूत की तरह आर-पार जाने के बजाय टकराती हैं। Omni Flash अक्सर सही करता है, लेकिन हमेशा नहीं, और कुछ क्लिप्स में आप बिना खोजे भी इसे भांप लेंगे।
जब आपको असली 4K एक्सपोर्ट, सटीक क्लिप लंबाई (आप पूरे सेकंड चुनते हैं, 4 से 8; पॉइंट्स नहीं होते), मूक आउटपुट, बाद में एक्सटेंशन, या पहले और आखिरी दोनों फ्रेम पर कंट्रोल की जरूरत हो, तो Veo 3.1 चुनें। आखिरी फीचर को कम आंका जाता है: पहले और आखिरी फ्रेम के रूप में एक ही इमेज दें और आपको एक सीमलेस लूप मिलता है, जो लूपिंग बैकग्राउंड वीडियो की पूरी ट्रिक है।
जब टारगेट फोन स्क्रीन हो तो Omni Flash चुनें। TikTok, Shorts या Reels के लिए 720p ही वह रिज़ॉल्यूशन है जो प्लेटफॉर्म अपने कम्प्रेशन के बाद बचाता है, साउंड उसी पास में बन जाता है, और आइडिया पर काम करते समय कन्वर्सेशनल एडिटिंग स्क्रैच से प्रॉम्प्ट लिखने से बेहतर है। उस रास्ते में यह केवल ड्राफ्ट टूल नहीं है, बल्कि बेहतर विकल्प है।
दो दिनों के टेस्टिंग के बाद मेरा पर्सनल वर्कफ़्लो: हॉरिजॉन्टल क्लाइंट वर्क के लिए मैं अभी भी Omni Flash में कॉन्सेप्ट बनाता हूं — $0.30 पर तीन-सेकंड के टेक — फिर फाइनल क्वालिटी में Veo में बेहतर वर्जन दोबारा बनाता हूं। सोशल मीडिया पर सीधे जाने वाले वर्टिकल क्लिप के लिए, Omni का टेक अक्सर वैसा ही पोस्ट हो जाता है।

दोनों मॉडल BananaBanana जनरेटर में लाइव हैं, इसलिए आप बिना कोड लिखे या गूगल क्लाउड प्रोजेक्ट सेट किए एक ही प्रॉम्प्ट पर उनकी तुलना कर सकते हैं। और अगर आप इस रिव्यू का संक्षिप्त रूप चाहते हैं — क्षमताएं, सीमाएं और कीमत एक पेज पर — तो वह Gemini Omni पेज पर उपलब्ध है।
FAQ
gemini-omni-flash-preview क्या है?
यह Gemini Omni Flash की API मॉडल आईडी है, जो गूगल का कन्वर्सेशनल वीडियो जनरेशन मॉडल है जिसे 30 जून 2026 को पब्लिक प्रीव्यू में रिलीज़ किया गया था। यह Interactions API के जरिए ऑडियो के साथ 720p, 3–10 सेकंड के क्लिप जेनरेट और एडिट करता है।
क्या Gemini Omni Flash 1080p या 4K वीडियो बना सकता है?
नहीं। API केवल 24 fps पर 720p आउटपुट देता है। Google Flow भी डिफॉल्ट रूप से 720p पर रेंडर करता है; इसके 1080p और 4K वर्जन Veo रेंडर्स पर डाउनलोड स्टेप में दिए जाते हैं। अगर आपको असली हाई-रिमॉल्यूशन एक्सपोर्ट चाहिए, तो Veo 3.1 का इस्तेमाल करें।
क्या मैं Omni Flash API में वीडियो की लंबाई सेट कर सकता हूं?
हां, हालांकि आपको यह डॉक्स में नहीं मिलेगा। रिस्पॉन्स फॉर्मेट ड्यूरेशन स्वीकार करता है, और रिज़ल्ट फ्रेम तक मैच करता है: 3 सेकंड मांगे, 3.008 सेकंड मिले, चार्ज 3 सेकंड का। हम जनरेटर में इसे 3–10 सेकंड के सिलेक्टर के रूप में देते हैं। अपवाद एडिटिंग है — एडिटेड क्लिप हमेशा उस वीडियो की लंबाई लेता है जिससे वह बना था।
क्या Omni Flash हमेशा ऑडियो जेनरेट करता है?
हां, हर क्लिप में एक जेनरेटेड साउंडट्रैक शामिल होता है और इसे बंद करने का कोई फ्लैग नहीं है। मनचाहा ऑडियो (या "quiet ambient room tone") सीधे प्रॉम्प्ट में लिखें।
क्या Omni Flash मौजूदा वीडियो को एक्सटेंड या इंटरपोलिट कर सकता है?
यह उन्हें लंबा नहीं बना सकता: एक्सटेंशन और इंटरपोलेशन सपोर्टेड नहीं हैं, और स्कीमा में extend टास्क "this model does not support video extension" जवाब देता है। एडिटिंग इसकी जगह काम करती है — या तो अपने बनाए क्लिप पर कन्वर्सेशनल तरीके से, या आपके द्वारा दिए गए किसी भी पूरे वीडियो पर वीडियो-टू-वीडियो तरीके से (जिसमें Veo रेंडर या आपका अपना अपलोड शामिल है)। आउटपुट इनपुट की लंबाई बनाए रखता है।