Ulasan API Gemini Omni Flash: Kemampuan Sebenarnya Versi Pratinjau
Ulasan praktis API Gemini Omni Flash: dukungan sebenarnya dari gemini-omni-flash-preview, fitur eksklusif Flow, dan biaya riil per klip.

Gemini Omni Flash adalah model multimodal "any-to-any" pertama dari Google yang menghasilkan video: Anda mengirimkan teks, gambar, atau hasil sebelumnya, dan model mengembalikan klip pendek 720p bersuara yang dapat terus Anda edit dengan menjelaskan perubahan dalam bahasa sehari-hari. Google merilisnya dalam pratinjau publik pada 30 Juni 2026, bersama dengan Nano Banana 2 Lite, dan id model API-nya adalah gemini-omni-flash-preview.
Jawaban cepat jika Anda hanya mencari satu hal: API Gemini Omni Flash mendukung text-to-video, image-to-video, reference-to-video hingga sepuluh gambar objek (yang digabungkan dengan bingkai awal), pengeditan percakapan, dan pengeditan video-ke-video dari klip yang Anda berikan. Model ini tidak mendukung 1080p, seed, parameter prompt negatif, perpanjangan video, atau mematikan audio. Kontrol durasi juga tidak ada dalam dokumentasi, tetapi bidang tersebut ada dan berfungsi — selengkapnya di bawah. Jika Anda melihat demo Omni Flash di dalam Google Flow dan mengharapkan perangkat yang sama dari API, Anda akan kecewa. Kami mengintegrasikannya ke dalam generator kami selama minggu peluncuran, jadi ulasan ini didasarkan pada apa yang sebenarnya dikembalikan oleh endpoint, bukan pada halaman pemasaran.
Apa yang sebenarnya diberikan oleh API Gemini Omni Flash kepada Anda
API menampilkan Omni Flash melalui Interactions API (interactions.create), bukan melalui endpoint generateVideos yang digunakan Veo. Detail itu penting karena interaksi bersifat stateful. Setiap respons membawa id yang dapat Anda referensikan nanti.
Menurut dokumentasi Omni Google, ditambah pengujian endpoint selama seminggu, lima tugas berfungsi hari ini:
- Text-to-video. Prompt masuk, klip 720p keluar, termasuk musik latar.
- Image-to-video. Gambar Anda menjadi bingkai pembuka dan prompt menjelaskan gerakannya.
- Reference-to-video. Gambar objek menjaga konsistensi karakter atau produk dalam adegan baru — permintaan menerima hingga sepuluh gambar, dan tidak seperti Veo, gambar tersebut dapat digabungkan dengan bingkai awal.
- Pengeditan percakapan. Teruskan
previous_interaction_idbeserta instruksi pendek, dan model mengubah klip sambil mempertahankan sisanya. - Pengeditan video-ke-video. Kirim video asli sebagai konten dengan
task: "edit"dan video kembali bergaya baru — tidak memerlukan id interaksi, sehingga dapat bekerja pada klip yang tidak pernah dibuat oleh model (termasuk hasil render Veo dan rekaman ponsel). Keterbatasannya: hasil selalu sama persis durasinya dengan input, dan input dibatasi maksimum 10 detik.
Klip di atas berasal langsung dari gemini-omni-flash-preview melalui pipeline kami sendiri, jadi Anda melihat contoh nyata, bukan aset pers. Satu prompt teks: perahu kertas hanyut di atas tinta yang tumpah, "single continuous scene" untuk menghentikan model melakukan pemotongan adegan, dan baris "Audio:" yang meminta suara gesekan kertas dan riak air. Kami meminta durasi penuh 10 detik. Nyalakan suaranya; audio juga dihasilkan oleh AI.
Setiap klip berjalan 3 hingga 10 detik pada 24 fps. Dokumentasi tidak mencantumkan parameter durasi, dan saat peluncuran kami menganggap model hanya menentukan sendiri. Ternyata format permintaan menerima durasi secara diam-diam dan hasilnya akurat: minta 3 detik dan Anda mendapatkan 3.008 detik, ditagih untuk tiga detik. Itulah yang kami tampilkan di generator, sehingga memotong video mengikuti musik tidak lagi menjadi perjudian.
Prompt juga berfungsi sebagai panel kontrol untuk semua hal yang tidak ditampilkan oleh API. Jika dibiarkan, model cenderung memotong di antara beberapa pengambilan gambar, sehingga "single unbroken shot, no cuts" mendapat tempat di sebagian besar prompt; rentang kode waktu seperti [0-3s] ... [3-6s] ... diikuti oleh model; dan teks dalam tanda kutip ditampilkan sebagai teks di layar dengan akurasi yang mengejutkan. Generator kami menyediakan tombol sekali klik untuk templat ini.
Audio adalah kejutan kedua, dan sangat menyenangkan. Setiap generasi dilengkapi dengan suara: kebisingan sekitar, efek suara, terkadang percakapan jika Anda memintanya. Namun, Anda tidak dapat mematikannya. Satu-satunya kontrol yang Anda miliki adalah teks, jadi kami menyisipkan baris "Audio: ..." di akhir prompt dan itu berfungsi dengan baik.
Apa yang dimiliki Flow yang tidak dimiliki oleh API?
Google Flow adalah alat produksi lengkap yang dibungkus di sekitar beberapa model, dan pembungkus itulah yang tidak dimiliki oleh API mentah. Flow memberi Anda Scene Builder untuk urutan banyak adegan dan kontrol kamera prasetel (jenis bidikan, sudut, gerakan). Satu nuansa yang sering salah dipahami orang tentang resolusi: Flow juga merender pada 720p secara bawaan. Versi 1080p dan 4K muncul pada langkah pengunduhan, sebagai pilihan ekspor di atas render Veo, bukan sebagai mode generasi yang berbeda. Tidak ada alat tersebut di gemini-omni-flash-preview.
Berikut adalah perbandingan jujur setelah seminggu menguji keduanya:
| Kemampuan | Flow / aplikasi Gemini | API Gemini Omni Flash |
|---|---|---|
| Resolusi | Render 720p; 1080p / 4K ditawarkan saat unduh | Hanya 720p, 24 fps |
| Panjang klip | Scene Builder menggabungkan adegan | 3–10 detik, pasti |
| Kontrol kamera | Jenis bidikan prasetel, sudut, gerakan | Hanya prompt teks |
| Memperpanjang video | Ya (melalui Veo) | Tidak didukung |
| Mengedit video yang ada | Remix di dalam aplikasi | Percakapan, atau video-ke-video pada klip apa pun |
| Audio | Aktif, dengan kontrol antarmuka | Selalu aktif, kontrol hanya lewat prompt |
| Seed / prompt negatif | Tetap tersembunyi dari pengguna | Tidak didukung |
| Klip per permintaan | Satu per satu | Satu per interaksi, tanpa sampleCount |
Dokumentasi cukup jelas tentang beberapa hal ini. Dokumen Google menyatakan bahwa perpanjangan dan interpolasi video "tidak didukung", begitu pula instruksi sistem, suhu, dan parameter prompt negatif (mereka menyarankan untuk menuliskan elemen negatif ke dalam prompt biasa, yang dalam pengalaman saya berfungsi sekitar separuh waktu). Referensi video terdaftar dalam skema API dengan batas 3 detik, tetapi dokumen mengakui bahwa model belum memprosesnya dengan benar.
Jadi API pratinjau adalah bagian kecil dari apa yang dapat dilakukan model pada antarmuka milik Google sendiri. Itu normal untuk versi pratinjau. Namun tetap mengecewakan saat klien meminta ekspor 1080p dan batas maksimalnya adalah 720p.

Pengeditan percakapan adalah fitur yang benar-benar memuaskan
Pengeditan adalah tempat Omni Flash membuktikan kemampuannya. Anda menghasilkan klip, melihatnya, lalu mengirim tindak lanjut seperti "buat jaket menjadi merah dan perlambat kamera" dengan previous_interaction_id dari hasil pertama. Model membangun kembali video dengan perubahan Anda dan mempertahankan sebagian besar klip asli. Tanpa mengunggah ulang, tanpa masker, tanpa linimasa.
Dokumentasi Gemini Enterprise milik Google menyatakan bahwa Anda dapat menumpuk hingga tiga editan berurutan selama sesi mempertahankan konteks. Dalam praktiknya, setiap editan adalah render 720p baru, sehingga konsistensi sedikit bergeser di setiap langkah. Wajah bertahan lebih baik daripada teks pada papan tanda. Gerakan kompleks terkadang berubah meskipun Anda hanya meminta penyesuaian warna.
Satu kendala yang kami temui di produksi: interaksi induk kadaluarsa di sisi Google. Coba edit klip yang dibuat beberapa waktu lalu dan API mungkin mengembalikan 404 untuk interaksi yang direferensikan. Di BananaBanana kami menampilkan ini sebagai video kadaluarsa dan mengembalikan dana percobaan tersebut, tetapi jika Anda membangun di atas API mentah, rencanakan hal ini.

Berapa biaya Gemini Omni Flash?
Pengumuman peluncuran Google menetapkan harga Omni Flash sebesar $0.10 per detik video output: hasil 3 detik berbiaya $0.30, dan hasil 10 detik berbiaya $1.00.
Di BananaBanana kami meneruskan tarif tersebut secara langsung: $0.10 per detik, jadi Anda memilih 3 detik seharga $0.30 atau sepuluh detik penuh seharga $1.00, dan editan berbiaya sama karena merupakan render ulang penuh (hasilnya juga kembali persis sama durasinya dengan sumbernya — model tidak dapat memperpanjang atau memotong). Nano Banana 2 Lite, yang diluncurkan pada hari yang sama, berbiaya $0.03 per gambar di sini (tarif API Google adalah $0.034 untuk gambar 1K). Daftar harga lengkap ada di bagian harga.
Apakah sepuluh sen per detik sepadan? Untuk draf bersuara yang jika tidak dilakukan akan memerlukan proses pembuatan video dan pengerjaan audio terpisah, mungkin ya — dan pengujian 3 detik berbiaya lebih murah daripada klip Veo. Untuk b-roll tanpa suara, tidak. Veo 3.1 Fast membuat klip tanpa suara yang lebih murah dengan resolusi lebih tinggi.
Haruskah Anda menggunakan Omni Flash atau Veo 3.1?
Versi singkat: keduanya berbagi tugas, tetapi tidak sepanjang garis "draf vs akhir" yang mungkin Anda perkirakan.
Satu hal yang perlu diketahui sebelum memilih: perbedaan kualitas di antara keduanya bukan hanya tentang resolusi. Veo 3.1 merender gerakan dan fisika secara lebih meyakinkan. Air berperilaku alami, kain terlipat di tempat yang seharusnya, objek bertabrakan alih-alih saling menembus seperti hantu. Omni Flash sering melakukannya dengan benar, tetapi tidak konsisten, dan pada beberapa klip Anda akan menyadarinya tanpa harus mencari.
Pilih Veo 3.1 ketika Anda memerlukan ekspor 4K nyata, durasi klip pasti (Anda menetapkan detik bulat, 4 hingga 8; pecahan tidak ada), output tanpa suara, perpanjangan nanti, atau kontrol atas bingkai pertama dan terakhir. Pasangan terakhir ini kurang diapresiasi: berikan gambar yang sama sebagai bingkai pertama dan terakhir dan Anda mendapatkan pengulangan yang mulus, yang merupakan seluruh trik di balik video latar belakang yang berulang. Ini adalah alat produksi untuk apa pun yang berformat widescreen atau mengutamakan fisika.
Pilih Omni Flash ketika tujuannya adalah layar ponsel. Untuk TikTok, Shorts, atau Reels, 720p sejujurnya adalah semua yang dipertahankan platform setelah kompresinya sendiri, suara hadir langsung dalam satu langkah, dan pengeditan percakapan mengalahkan penulisan ulang prompt dari awal saat Anda mengejar ide. Di jalur itu, ini bukan alat sketsa. Ini adalah pilihan yang lebih baik.
Alur kerja pribadi saya setelah dua hari pengujian: untuk pekerjaan klien widescreen, saya tetap membuat konsep awal di Omni Flash — pengujian tiga detik seharga $0.30 — lalu membuat ulang versi terpilih di Veo pada kualitas akhir. Untuk klip vertikal yang langsung diunggah ke media sosial, hasil dari Omni sering kali langsung diunggah apa adanya.

Kedua model aktif di generator BananaBanana, jadi Anda dapat membandingkannya pada prompt yang sama tanpa menulis kode atau menyiapkan proyek Google Cloud. Dan jika Anda menginginkan versi ringkas dari ulasan ini — kemampuan, batasan, dan harga dalam satu halaman — ada di halaman Gemini Omni.
FAQ
Apa itu gemini-omni-flash-preview?
Ini adalah id model API untuk Gemini Omni Flash, model pembuatan video percakapan Google yang dirilis dalam pratinjau publik pada 30 Juni 2026. Model ini membuat dan mengedit klip 720p berdurasi 3–10 detik dengan audio melalui Interactions API.
Bisakah Gemini Omni Flash menghasilkan video 1080p atau 4K?
Tidak. API hanya menghasilkan 720p pada 24 fps. Google Flow juga merender pada 720p secara bawaan; versi 1080p dan 4K ditawarkan pada langkah pengunduhan untuk render Veo. Jika Anda memerlukan ekspor resolusi tinggi yang asli, gunakan Veo 3.1.
Bisakah saya mengatur durasi video di API Omni Flash?
Ya, meskipun Anda tidak akan menemukannya di dokumen. Format respons menerima durasi dan hasilnya cocok hingga ke bingkai: 3 detik diminta, 3.008 detik dihasilkan, ditagih untuk tiga detik. Kami menampilkannya sebagai pemilih 3–10 detik di generator. Pengecualiannya adalah pengeditan — klip yang diedit selalu mewarisi durasi video asalnya.
Apakah Omni Flash selalu menghasilkan audio?
Ya, setiap klip menyertakan musik latar yang dihasilkan dan tidak ada parameter untuk menonaktifkannya. Jelaskan audio yang Anda inginkan (atau minta "quiet ambient room tone") langsung di dalam prompt.
Bisakah Omni Flash memperpanjang atau menginterpolasi video yang ada?
Model tidak dapat membuatnya lebih panjang: perpanjangan dan interpolasi tidak didukung, dan tugas extend dalam skema menjawab "this model does not support video extension." Pengeditan adalah apa yang dilakukannya sebagai gantinya — baik secara percakapan pada klip yang dihasilkannya, atau video-ke-video pada video selesai apa pun yang Anda berikan, termasuk render Veo atau unggahan Anda sendiri. Output tetap mempertahankan durasi input.