Satu sudut produk yang bagus
Satu foto datar dengan cahaya rata mengalahkan lima jepretan asal. Silau, blur gerakan, dan tangan yang menutupi separuh label akan direkonstruksi jadi karangan.
Studi kasus · Video UGC AI
Iklan UGC itu seseorang yang bicara ke kamera ponsel sambil memegang produk Anda. Di sini iklannya tidak difilmkan, tapi dibuat: Anda menyiapkan foto produk dan foto orangnya, model menyusun frame pembuka, lalu menghidupkannya lengkap dengan suara dan ambience ruangan dalam satu proses. Satu klip berkisar $0.30–$1.00 di Gemini Omni Flash dan sampai $3.00 di Veo 3.1 dengan suara, frame-nya $0.11, dan tidak ada langganan sama sekali.
Video UGC AI adalah iklan pendek berformat konten pengguna — seseorang berbicara ke kamera ponsel, memegang produk, di dapur atau ruang tamu alih-alih studio — tetapi dibuat oleh model video, bukan direkam bersama kreator. Produksinya tiga panggilan: foto referensi produk dan orangnya, satu frame diam yang mengunci siapa yang tampil dan apa yang dipegang, lalu model video yang menganimasikan frame itu dengan ucapan yang sinkron. Di sini ada dua model. Gemini Omni Flash yang lebih murah sekaligus lebih baru: model card Google menaruh simulasi fisika dunia nyata di antara kemampuannya dan gerakan kompleks di antara kelemahan yang tersisa — cocok dengan yang saya lihat: penanganan objek biasa umumnya lolos, yang rumit untung-untungan. Veo 3.1 dipakai saat sebuah shot bergantung pada objek yang harus berperilaku benar. Satu klip $0.30–$1.00 di Omni Flash, $1.00 di Veo 3.1 Fast, dan $3.00 di Veo 3.1 penuh untuk delapan detik bersuara, sampai $4.40 di 4K. Rendernya pun beberapa menit, bukan dua sampai empat minggu seperti brief ke kreator.
Tagihan klip di atas, tanpa pembulatan: $0.11 untuk referensi produk, $0.11 untuk orangnya, $0.11 untuk frame pembuka yang menyatukan keduanya, dan $0.80 untuk delapan detik Omni Flash — total $1.13. Versi vertikal enam detik di bawah menghabiskan $0.60. Merekam ulang suara secara terpisah berbiaya $0.01 per 200 karakter naskah, kira-kira satu sen per kalimat. Akun baru mendapat $0.20 gratis, cukup untuk satu foto referensi dan satu frame pembuka — cukup untuk melihat apakah karakternya bekerja sebelum membayar video.
Itu angka untuk take pertama, dan take pertama bukan rencana. Sebagian klip jadi sekali coba; banyak yang butuh dua atau tiga, karena kalimatnya terdengar datar, tangan melakukan hal aneh, atau model menolak pakaiannya. Lalu ada hal lain yang tak pernah masuk daftar harga: satu iklan jarang cuma satu klip. Spot 20–30 detik biasanya tiga atau empat take yang disambung — hook, produk di tangan, close-up, penutup — jadi tagihan realistis untuk iklan jadi adalah beberapa dolar, bukan beberapa sen, dan naik cepat kalau shot penuh gerakan diambil di Veo 3.1 penuh seharga $3.00 per klip. Menyambungnya justru gratis: ffmpeg memotong, menggabung, dan menimpa audio ke video lewat baris perintah, tanpa aplikasi editing.
Satu foto produk yang bersih dan satu foto orangnya. Apa pun yang masuk dalam keadaan buram, terpotong, atau salah cahaya akan kembali berlipat di videonya.
Hasilkan satu gambar diam yang memuat kedua referensi — orangnya bersama produk, dengan framing seperti pembuka iklan. $0.11 di Nano Banana Pro, dan bisa diulang sampai pas.
Kirim gambar diam itu sebagai frame pertama, lalu jelaskan gerakan dan kalimat yang diucapkan. Omni Flash menagih $0.10 per detik 720p dengan audio; Veo 3.1 lebih mahal dan layak dicoba ketika satu take harus menahan beberapa aksi berturut-turut.



Inilah bagian yang sering dilewati, dan justru bagian ini yang menentukan hasilnya. Model yang diberi foto ponsel buram dari sudut tiga perempat tidak gagal dengan berisik — ia diam-diam mengarang sisi yang tak terlihat, dan sisi karangan itulah yang tampil delapan detik di layar. Beri foto produk yang datar dan merata cahayanya dengan label menghadap kamera, dan botol yang sama akan selamat melewati tahap frame, tahap video, sampai penyuntingan setelahnya.
Orangnya juga begitu. Dokumentasi Veo dari Google menyebutnya terang-terangan: pilih gambar yang tajam dan bercahaya baik yang menampilkan subjek dari sudut yang Anda inginkan, dan pertahankan bahasa lensa serta pencahayaan yang sama antar-shot. Patokan saya setelah beberapa puluh klip semacam ini: kalau potret referensi dan adegan yang dituju berbeda pendapat soal arah datangnya cahaya, wajahnya akan melayang ke tengah-tengah dan berhenti terlihat seperti orang yang sama.
Satu foto datar dengan cahaya rata mengalahkan lima jepretan asal. Silau, blur gerakan, dan tangan yang menutupi separuh label akan direkonstruksi jadi karangan.
Pertahankan potongan rambut, busana, dan riasan yang sama di semua referensi. Tampilan campur aduk akan dirata-rata jadi wajah yang tidak mirip keduanya.
Potret berlampu kilat yang ditaruh di dapur bercahaya lembut akan terbaca seperti tempelan. Pilih cahaya di referensi yang memang akan dipakai iklannya.
Nano Banana Pro sanggup menahan teks label yang pendek; daftar bahan yang padat berubah jadi tekstur. Kalau tipografinya penting, rencanakan shot close-up dengan kemasan asli.
Referensi tidak perlu dikomposisikan seperti iklan. Komposisi adalah tugas frame pembuka — di situlah Anda berdebat dengan model.
Potongan 300 piksel dari halaman marketplace nyaris tidak menyisakan apa pun untuk model. Selalu file asli beresolusi penuh.
Dua jalur sama-sama jalan: Anda bisa menyerahkan foto referensi ke model video dan membiarkannya menyusun adegan, atau membuat satu gambar diam dulu lalu menganimasikannya. Dalam praktik yang kedua lebih baik, dan alasannya sederhana — model yang disuruh mengarang komposisi akan mengarangnya di tiap frame, sedangkan model yang diberi gambar hanya perlu melanjutkannya. Di Gemini Omni Flash jaraknya cukup besar sampai saya berhenti memakai referensi saja untuk shot berproduk.
Dua klip di bawah: prompt sama, referensi sama, enam detik masing-masing, $0.60 per klip. Bedanya hanya apakah ada frame yang sudah disetujui masuk atau tidak. Tidak ada yang lain diubah dan tidak satu pun digenerasi ulang.
Referensi saja
Dari frame pembuka yang disetujui
Versi jujurnya: jalur hanya-referensi tidak rusak — wajahnya bertahan baik, dan untuk adegan tanpa produk di tangan sering kali sudah cukup. Malah cahayanya lebih enak di take itu: lebih lembut di wajah, kontras jendelanya lebih kecil, karena modelnya menyusun ruangan yang ia suka alih-alih melanjutkan ruangan kita. Satu catatan yang mengubah pembacaan: kreator kami dihasilkan model, bukan foto orang sungguhan, jadi model punya ruang untuk menata ulang cahayanya. Potret orang sungguhan mengunci cahaya dan kulit jauh lebih keras, dan jalur hanya-referensi punya lebih sedikit kebebasan untuk mempercantiknya. Yang Anda beli di sini kendali, bukan kualitas. Di Veo 3.1 pilihan sudah dibuatkan: API Google menerima frame pertama atau maksimal tiga gambar referensi, tidak pernah keduanya dalam satu permintaan, dan referensi mengharuskan durasi delapan detik.
Omni Flash sangat bagus persis di format tempat UGC hidup: orang berbicara ke lensa. Wawancara, potongan gaya podcast, founder menjelaskan produk, seseorang memegang toples dan menceritakannya. Mulut, mikro-gerakan, dan ambience ruangan dirender dalam satu proses, dan ini cara termurah mendapat suara sinkron dari model video. Ia juga model yang lebih baru di antara keduanya, dan Google justru menjualnya lewat fisika: pengumumannya bicara soal pemahaman intuitif atas gravitasi, energi kinetik, dan dinamika fluida, sementara model card menyebut simulasi fisika dunia nyata sebagai kemampuan sekaligus menandai gerakan kompleks sebagai kelemahan yang diketahui. Kedua sisi itu benar dalam praktik. Benda jatuh, cairan tumpah, bobot terbaca wajar — sampai shot-nya meminta rantai aksi presisi dengan sebuah objek.
Jadi pembagiannya bukan talking head lawan gerakan, melainkan seberapa banyak koreografi yang harus ditahan satu take. Tes di bawah ada di ujung tersulit skala itu, bukan vonis untuk model mana pun: frame pembuka sama, prompt sama, satu klip per model — buka tutup botol, tekan pipet, dua tetes ke telapak terbuka, semuanya dalam delapan detik.
Gemini Omni Flash · 8 dtk · $0.80
Veo 3.1 Fast · 8 dtk bersuara · $1.00
Gerak bibir, ambience ruangan, dan suara datang bersamaan, $0.10 per detik. Untuk review, testimoni, atau dialog dua orang, ini pilihan yang jelas.
Satu gerakan masih dipegang Omni; empat berturut-turut adalah titik ketika take mulai menjatuhkan aksi. Perbandingan kami memakai Veo 3.1 Fast seharga $1.00 untuk delapan detik bersuara, sedangkan Veo 3.1 penuh $3.00 — buat di keduanya dan simpan take yang berhasil.
Filter keamanan Omni jelas lebih ketat soal pakaian: kreator fitness bersport bra jauh lebih sering ditolak di sana ketimbang di Veo 3.1, dengan prompt dan referensi yang sama. Rencanakan busananya, atau rencanakan modelnya.
Omni Flash 720p dan 3–10 detik, persis sebanyak yang Anda bayar. Veo 3.1 memberi 4, 6, atau 8 detik hingga 4K, dan klipnya bisa diperpanjang melewati potongan pertama.
Setiap klip Omni bersuara, diminta atau tidak. Di Veo suara adalah sakelar, dan render bisu lebih murah — penting kalau suaranya toh akan datang dari tempat lain.
Generasi yang diblokir dikembalikan otomatis di kedua model. Yang mahal dari sebuah penolakan itu empat menitnya, bukan dolarnya.
Omni Flash menulis ucapan dalam proses yang sama dengan gambarnya, dan untuk bahasa Inggris percakapan biasanya aman. Ia goyah di nama-nama: merek karangan, kata asing, nomor model — apa pun yang penutur asli pun perlu diberi tahu cara membacanya. Tapi versi besar masalah ini adalah bahasa selain Inggris, dan semua model video mengalaminya: penguji berbahasa Rusia yang mencoba Seedance 2.5 menggambarkan kalimat yang mulanya wajar lalu berantakan di tengah jalan — vokal tanpa tekanan direduksi salah, tekanan jatuh di suku kata yang keliru, dan di ujung adegan lima belas detik aksennya lebih dekat ke campuran Slavia daripada ke bahasa Rusia, karena bahasa Rusia, Ukraina, dan Belarus cukup berdekatan untuk dicampur model. Sebagian kata keluar bersih, kata berikutnya membongkar seluruh take. Kalau naskah Anda bukan bahasa Inggris, dengarkan sampai habis sebelum menyetujuinya.
Perbaikannya: berhenti meminta suara dari model video dan hasilkan terpisah. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) berjalan di saldo yang sama lewat server MCP kami: $0.01 per 200 karakter naskah, 30 suara, satu pembicara atau dialog dua orang, keluaran WAV 24 kHz. Pengarahannya pakai bahasa biasa — persona, tempo, aksen, dan ejaan fonetis untuk kata apa pun yang harus benar. Lalu tempelkan trek itu di atas klip pakai editor mana pun. Jaga kalimat tulisan ulang Anda kira-kira sepanjang take aslinya dan mulutnya masih kira-kira cocok; di bagian yang tidak cocok, potong ke produknya.
Sulih suara hasil AI · $0.01
Merangkai iklannya pun tak butuh aplikasi editing. ffmpeg menyambung take, memotong setengah detik saat tangan berulah, menukar audio hasil model dengan trek TTS Anda, menyisipkan crossfade, dan mengekspor versi 9:16 — semuanya dari satu baris perintah, gratis, di mesin apa pun. Sintaksnya terkenal tidak ramah, dan justru karena itu ia cocok dipasangkan dengan model: jelaskan potongan yang Anda mau ke Claude atau LLM mana pun, terima perintahnya, jalankan. Untuk spot UGC tiga klip, itulah seluruh tahap pasca-produksi — sekaligus alasan angka di halaman ini tetap sebatas biaya generasi, tanpa langganan tambahan.
| Model | Harga | Satuan | Audio |
|---|---|---|---|
| Nano Banana Proreferensi & frame pembuka | $0.11 | gambar 1K–2K | — |
| Nano Banana 2draf dan varian | $0.03–$0.13 | gambar 512px–4K | — |
| Gemini Omni Flash$0.10 per detik | $0.30–$1.00 | 3–10 dtk, 720p | selalu aktif |
| Veo 3.1 Fastbersuara | $0.50–$1.00 | 4–8 dtk, 720p/1080p | opsional |
| Veo 3.1 Litevideo termurah | $0.10–$0.36 | 4–8 dtk, 720p | opsional |
| Gemini 3.1 Flash TTShanya lewat MCP | $0.01 | per 200 karakter | suara saja |
Harga Veo berlaku untuk 720p dan 1080p; 4K lebih mahal. Omni Flash menagih $0.10 untuk tiap detik keluaran, jadi panjang klip itulah harganya. Tabel lengkap ada di halaman harga.
Semua model dan resolusi terdaftar di halaman harga lengkap, dan halaman Gemini Omni Flash membahas apa yang bisa dan tidak bisa dilakukan model itu.
Cara kerja animasi dari frame pertama, apa yang ditulis di prompt gerakan, dan di mana ia berantakan.
Baca panduanMembuat produk bertahan dari foto referensi sampai frame jadi, dengan prompt sungguhan.
Baca panduanPraktik langsung dengan API pratinjau: apa yang didukung, apa yang ditolak, dan biaya nyata tiap klip.
Baca panduanTidak. Kreatornya pun bisa dihasilkan — semua orang yang Anda lihat di halaman ini lahir dari prompt teks dan tidak pernah ada. Kalau Anda memakai wajah orang sungguhan, Anda butuh izinnya: aturan soal citra diri berlaku pada video hasil AI sama seperti pada syuting, dan kebijakan platform soal kemiripan sintetis lebih ketat daripada dugaan kebanyakan orang.
Ya, selama Anda menyimpan foto referensi yang sama dan memakai ulang frame pembuka yang sama. Membuat ulang frame dari referensi yang sama akan mendekati, tapi tidak identik piksel demi piksel — kebiasaan paling aman adalah menyimpan setiap frame pembuka yang disetujui dan menganimasikannya lagi, bukan membangunnya ulang.
Di TikTok, ya: kebijakan iklannya soal media yang diedit dan konten buatan AI mewajibkan label AIGC dari Ads Manager atau keterangan Anda sendiri yang terlihat di materinya. Meta memasang label AI-nya sendiri secara otomatis pada iklan yang terdeteksi sebagai hasil AI. Kedua kebijakan berubah sepanjang 2026, jadi periksa versi terbaru sebelum kampanye besar alih-alih memercayai satu tulisan blog — termasuk yang ini.
Mulailah dengan Gemini Omni Flash, $0.10 per detik sudah termasuk audio: untuk orang yang bicara ke kamera, ia paling murah sekaligus paling tidak rewel, dan ia model yang lebih baru dengan fisika yang justru dipromosikan Google. Jangan dibaca sebagai «Omni tidak bisa gerakan»: ia menuang, menjatuhkan, menyampaikan bobot. Yang lolos darinya adalah rantai penanganan presisi yang panjang dalam satu take — di tes pipet empat aksi kami, ia kehilangan botolnya sementara Veo 3.1 Fast menahannya. Jadi untuk hook atau testimoni, Omni. Untuk shot yang dibangun di atas koreografi, buat di keduanya dan simpan take yang jadi; yang gagal harganya recehan.
Bisa, sampai 10 detik. Unggah klip Anda dan Omni Flash akan menyuntingnya sebagai video-ke-video — mengganti cahaya, latar, benda yang dipegang — sambil mempertahankan take-nya. Sumber yang lebih panjang dipangkas ke batas model sebelum digenerasi.
Saldo dikembalikan otomatis, baik di Omni Flash maupun Veo. Penolakan berkumpul di sekitar pakaian, anak di bawah umur, dan orang nyata yang dikenali; aturan busana di bagian pemilihan model tadi yang paling banyak menghemat percobaan ulang.
Bisa — model yang sama tersedia lewat server MCP kami, termasuk model suara yang sama sekali tidak punya antarmuka web. Gambar referensi dan frame pembuka bisa dikirim sebagai job ID, URL publik, atau base64 inline, jadi satu batch UGC penuh bisa diskrip dari sebuah agen.
Hitung take, bukan klip. Spot 20–30 detik biasanya tiga sampai empat klip yang disambung, dan tiap klip butuh beberapa percobaan sebelum layak pakai: pembacaan yang datar, tangan yang aneh, penolakan. Dengan $0.80 untuk delapan detik Omni Flash, iklan jadi tetap di kisaran beberapa dolar; mengambil shot penuh gerakan di Veo 3.1 penuh seharga $3.00 per klip membawanya ke puluhan dolar. Editingnya tidak menambah apa-apa: ffmpeg menyambung take, memangkasnya, dan menimpakan voice-over lewat baris perintah — dan LLM bisa menuliskan perintah itu untuk Anda.
Daftar gratis dengan $0.20 di saldo, isi ulang pakai kripto mulai $1. Frame pertama sekitar semenit, klip pertama lima menit.