Studi kasus · Video UGC AI

Iklan UGC AI dari dua foto

Iklan UGC itu seseorang yang bicara ke kamera ponsel sambil memegang produk Anda. Di sini iklannya tidak difilmkan, tapi dibuat: Anda menyiapkan foto produk dan foto orangnya, model menyusun frame pembuka, lalu menghidupkannya lengkap dengan suara dan ambience ruangan dalam satu proses. Satu klip berkisar $0.30–$1.00 di Gemini Omni Flash dan sampai $3.00 di Veo 3.1 dengan suara, frame-nya $0.11, dan tidak ada langganan sama sekali.

Dibuat khusus untuk halaman ini, dari awal sampai akhir: dua foto referensi → frame pembuka Nano Banana Pro → delapan detik Gemini Omni Flash, suara dan ambience ruangan dibuat bersama gambarnya. $1.13 untuk take yang sedang Anda tonton. Nyalakan suaranya.
01Apa itu

Apa itu video UGC AI?

Video UGC AI adalah iklan pendek berformat konten pengguna — seseorang berbicara ke kamera ponsel, memegang produk, di dapur atau ruang tamu alih-alih studio — tetapi dibuat oleh model video, bukan direkam bersama kreator. Produksinya tiga panggilan: foto referensi produk dan orangnya, satu frame diam yang mengunci siapa yang tampil dan apa yang dipegang, lalu model video yang menganimasikan frame itu dengan ucapan yang sinkron. Di sini ada dua model. Gemini Omni Flash yang lebih murah sekaligus lebih baru: model card Google menaruh simulasi fisika dunia nyata di antara kemampuannya dan gerakan kompleks di antara kelemahan yang tersisa — cocok dengan yang saya lihat: penanganan objek biasa umumnya lolos, yang rumit untung-untungan. Veo 3.1 dipakai saat sebuah shot bergantung pada objek yang harus berperilaku benar. Satu klip $0.30–$1.00 di Omni Flash, $1.00 di Veo 3.1 Fast, dan $3.00 di Veo 3.1 penuh untuk delapan detik bersuara, sampai $4.40 di 4K. Rendernya pun beberapa menit, bukan dua sampai empat minggu seperti brief ke kreator.

Berapa sebenarnya biaya satu klip?

Tagihan klip di atas, tanpa pembulatan: $0.11 untuk referensi produk, $0.11 untuk orangnya, $0.11 untuk frame pembuka yang menyatukan keduanya, dan $0.80 untuk delapan detik Omni Flash — total $1.13. Versi vertikal enam detik di bawah menghabiskan $0.60. Merekam ulang suara secara terpisah berbiaya $0.01 per 200 karakter naskah, kira-kira satu sen per kalimat. Akun baru mendapat $0.20 gratis, cukup untuk satu foto referensi dan satu frame pembuka — cukup untuk melihat apakah karakternya bekerja sebelum membayar video.

Itu angka untuk take pertama, dan take pertama bukan rencana. Sebagian klip jadi sekali coba; banyak yang butuh dua atau tiga, karena kalimatnya terdengar datar, tangan melakukan hal aneh, atau model menolak pakaiannya. Lalu ada hal lain yang tak pernah masuk daftar harga: satu iklan jarang cuma satu klip. Spot 20–30 detik biasanya tiga atau empat take yang disambung — hook, produk di tangan, close-up, penutup — jadi tagihan realistis untuk iklan jadi adalah beberapa dolar, bukan beberapa sen, dan naik cepat kalau shot penuh gerakan diambil di Veo 3.1 penuh seharga $3.00 per klip. Menyambungnya justru gratis: ffmpeg memotong, menggabung, dan menimpa audio ke video lewat baris perintah, tanpa aplikasi editing.

02Alurnya

Dua foto masuk, satu iklan keluar

  1. Bawa referensi yang sungguhan

    Satu foto produk yang bersih dan satu foto orangnya. Apa pun yang masuk dalam keadaan buram, terpotong, atau salah cahaya akan kembali berlipat di videonya.

  2. Susun frame pembuka

    Hasilkan satu gambar diam yang memuat kedua referensi — orangnya bersama produk, dengan framing seperti pembuka iklan. $0.11 di Nano Banana Pro, dan bisa diulang sampai pas.

  3. Animasikan frame itu

    Kirim gambar diam itu sebagai frame pertama, lalu jelaskan gerakan dan kalimat yang diucapkan. Omni Flash menagih $0.10 per detik 720p dengan audio; Veo 3.1 lebih mahal dan layak dicoba ketika satu take harus menahan beberapa aksi berturut-turut.

Foto referensi produk hasil AI: botol pipet kaca amber tanpa merek dengan tutup keramik krem di atas linen terang
Referensi 1 — produknya, satu sudut bersih, cahaya rata. Nano Banana Pro, $0.11.
Potret referensi hasil AI: perempuan bersweter rajut krem duduk di ruang tamu yang terang
Referensi 2 — orangnya. Cahaya dan busana yang sama seperti yang Anda mau di iklan.
Frame pembuka UGC hasil AI: perempuan dari potret referensi memegang botol amber di samping bahunya, framing ala ponsel
Frame pembuka, dihasilkan dari kedua referensi sekaligus — gambar inilah yang dilanjutkan model video.
03Referensi

Semua yang berikutnya hanya sebagus apa yang Anda beri

Inilah bagian yang sering dilewati, dan justru bagian ini yang menentukan hasilnya. Model yang diberi foto ponsel buram dari sudut tiga perempat tidak gagal dengan berisik — ia diam-diam mengarang sisi yang tak terlihat, dan sisi karangan itulah yang tampil delapan detik di layar. Beri foto produk yang datar dan merata cahayanya dengan label menghadap kamera, dan botol yang sama akan selamat melewati tahap frame, tahap video, sampai penyuntingan setelahnya.

Orangnya juga begitu. Dokumentasi Veo dari Google menyebutnya terang-terangan: pilih gambar yang tajam dan bercahaya baik yang menampilkan subjek dari sudut yang Anda inginkan, dan pertahankan bahasa lensa serta pencahayaan yang sama antar-shot. Patokan saya setelah beberapa puluh klip semacam ini: kalau potret referensi dan adegan yang dituju berbeda pendapat soal arah datangnya cahaya, wajahnya akan melayang ke tengah-tengah dan berhenti terlihat seperti orang yang sama.

Satu sudut produk yang bagus

Satu foto datar dengan cahaya rata mengalahkan lima jepretan asal. Silau, blur gerakan, dan tangan yang menutupi separuh label akan direkonstruksi jadi karangan.

Orang sama, tampilan sama

Pertahankan potongan rambut, busana, dan riasan yang sama di semua referensi. Tampilan campur aduk akan dirata-rata jadi wajah yang tidak mirip keduanya.

Samakan cahayanya

Potret berlampu kilat yang ditaruh di dapur bercahaya lembut akan terbaca seperti tempelan. Pilih cahaya di referensi yang memang akan dipakai iklannya.

Awas huruf kecil

Nano Banana Pro sanggup menahan teks label yang pendek; daftar bahan yang padat berubah jadi tekstur. Kalau tipografinya penting, rencanakan shot close-up dengan kemasan asli.

Framing belakangan

Referensi tidak perlu dikomposisikan seperti iklan. Komposisi adalah tugas frame pembuka — di situlah Anda berdebat dengan model.

Jangan beri potongan kecil

Potongan 300 piksel dari halaman marketplace nyaris tidak menyisakan apa pun untuk model. Selalu file asli beresolusi penuh.

04Frame pembuka

Kenapa frame pembuka mengalahkan referensi polos

Dua jalur sama-sama jalan: Anda bisa menyerahkan foto referensi ke model video dan membiarkannya menyusun adegan, atau membuat satu gambar diam dulu lalu menganimasikannya. Dalam praktik yang kedua lebih baik, dan alasannya sederhana — model yang disuruh mengarang komposisi akan mengarangnya di tiap frame, sedangkan model yang diberi gambar hanya perlu melanjutkannya. Di Gemini Omni Flash jaraknya cukup besar sampai saya berhenti memakai referensi saja untuk shot berproduk.

Dua klip di bawah: prompt sama, referensi sama, enam detik masing-masing, $0.60 per klip. Bedanya hanya apakah ada frame yang sudah disetujui masuk atau tidak. Tidak ada yang lain diubah dan tidak satu pun digenerasi ulang.

Referensi saja

Tanpa frame pembuka. Tutup krem hilang di detik pertama, botolnya berubah jadi botol gelap yang lain, dan di akhir malah keluar dari frame. Wajahnya aman — cahaya di wajahnya bahkan bisa dibilang lebih bagus daripada take sebelah. Yang rusak adalah produknya.

Dari frame pembuka yang disetujui

Prompt sama, tapi dimulai dari gambar yang kami lihat lebih dulu. Tutup, kaca, framing, dan jarak ke kamera bertahan enam detik penuh, karena model tinggal melanjutkan frame alih-alih menebaknya.

Versi jujurnya: jalur hanya-referensi tidak rusak — wajahnya bertahan baik, dan untuk adegan tanpa produk di tangan sering kali sudah cukup. Malah cahayanya lebih enak di take itu: lebih lembut di wajah, kontras jendelanya lebih kecil, karena modelnya menyusun ruangan yang ia suka alih-alih melanjutkan ruangan kita. Satu catatan yang mengubah pembacaan: kreator kami dihasilkan model, bukan foto orang sungguhan, jadi model punya ruang untuk menata ulang cahayanya. Potret orang sungguhan mengunci cahaya dan kulit jauh lebih keras, dan jalur hanya-referensi punya lebih sedikit kebebasan untuk mempercantiknya. Yang Anda beli di sini kendali, bukan kualitas. Di Veo 3.1 pilihan sudah dibuatkan: API Google menerima frame pertama atau maksimal tiga gambar referensi, tidak pernah keduanya dalam satu permintaan, dan referensi mengharuskan durasi delapan detik.

05Pilihan model

Cocokkan shot dengan modelnya

Omni Flash sangat bagus persis di format tempat UGC hidup: orang berbicara ke lensa. Wawancara, potongan gaya podcast, founder menjelaskan produk, seseorang memegang toples dan menceritakannya. Mulut, mikro-gerakan, dan ambience ruangan dirender dalam satu proses, dan ini cara termurah mendapat suara sinkron dari model video. Ia juga model yang lebih baru di antara keduanya, dan Google justru menjualnya lewat fisika: pengumumannya bicara soal pemahaman intuitif atas gravitasi, energi kinetik, dan dinamika fluida, sementara model card menyebut simulasi fisika dunia nyata sebagai kemampuan sekaligus menandai gerakan kompleks sebagai kelemahan yang diketahui. Kedua sisi itu benar dalam praktik. Benda jatuh, cairan tumpah, bobot terbaca wajar — sampai shot-nya meminta rantai aksi presisi dengan sebuah objek.

Jadi pembagiannya bukan talking head lawan gerakan, melainkan seberapa banyak koreografi yang harus ditahan satu take. Tes di bawah ada di ujung tersulit skala itu, bukan vonis untuk model mana pun: frame pembuka sama, prompt sama, satu klip per model — buka tutup botol, tekan pipet, dua tetes ke telapak terbuka, semuanya dalam delapan detik.

Gemini Omni Flash · 8 dtk · $0.80

Membuka tutupnya meyakinkan, pipetnya keluar rapi, dan tetesannya memang jatuh ke telapak — bagian cairannya beres. Objeknya tidak: botol lenyap dari tangan bawah tepat saat telapak terbuka, muncul lagi untuk ditutup, dan klipnya berakhir dengan tangan kosong. Satu dari empat aksi hilang.

Veo 3.1 Fast · 8 dtk bersuara · $1.00

Prompt sama, frame pertama sama — dan perhatikan ini Veo 3.1 Fast, tier murahnya, bukan model penuh. Botolnya bertahan di keempat aksi. Ada setengah detik ketika tangan ketiga menembus frame seperti bayangan, jadi ini pun tidak bebas artefak; ia hanya berhasil menahan rangkaiannya.

Bicara ke kamera → Omni Flash

Gerak bibir, ambience ruangan, dan suara datang bersamaan, $0.10 per detik. Untuk review, testimoni, atau dialog dua orang, ini pilihan yang jelas.

Rantai aksi panjang → coba Veo juga

Satu gerakan masih dipegang Omni; empat berturut-turut adalah titik ketika take mulai menjatuhkan aksi. Perbandingan kami memakai Veo 3.1 Fast seharga $1.00 untuk delapan detik bersuara, sedangkan Veo 3.1 penuh $3.00 — buat di keduanya dan simpan take yang berhasil.

Busana mengubah putusan

Filter keamanan Omni jelas lebih ketat soal pakaian: kreator fitness bersport bra jauh lebih sering ditolak di sana ketimbang di Veo 3.1, dengan prompt dan referensi yang sama. Rencanakan busananya, atau rencanakan modelnya.

Durasi dan resolusi

Omni Flash 720p dan 3–10 detik, persis sebanyak yang Anda bayar. Veo 3.1 memberi 4, 6, atau 8 detik hingga 4K, dan klipnya bisa diperpanjang melewati potongan pertama.

Suara: selalu atau opsional

Setiap klip Omni bersuara, diminta atau tidak. Di Veo suara adalah sakelar, dan render bisu lebih murah — penting kalau suaranya toh akan datang dari tempat lain.

Penolakan tidak berbiaya

Generasi yang diblokir dikembalikan otomatis di kedua model. Yang mahal dari sebuah penolakan itu empat menitnya, bukan dolarnya.

06Suara & editing

Saat suaranya butuh take kedua

Omni Flash menulis ucapan dalam proses yang sama dengan gambarnya, dan untuk bahasa Inggris percakapan biasanya aman. Ia goyah di nama-nama: merek karangan, kata asing, nomor model — apa pun yang penutur asli pun perlu diberi tahu cara membacanya. Tapi versi besar masalah ini adalah bahasa selain Inggris, dan semua model video mengalaminya: penguji berbahasa Rusia yang mencoba Seedance 2.5 menggambarkan kalimat yang mulanya wajar lalu berantakan di tengah jalan — vokal tanpa tekanan direduksi salah, tekanan jatuh di suku kata yang keliru, dan di ujung adegan lima belas detik aksennya lebih dekat ke campuran Slavia daripada ke bahasa Rusia, karena bahasa Rusia, Ukraina, dan Belarus cukup berdekatan untuk dicampur model. Sebagian kata keluar bersih, kata berikutnya membongkar seluruh take. Kalau naskah Anda bukan bahasa Inggris, dengarkan sampai habis sebelum menyetujuinya.

Perbaikannya: berhenti meminta suara dari model video dan hasilkan terpisah. Gemini 3.1 Flash TTS (gemini-3.1-flash-tts-preview) berjalan di saldo yang sama lewat server MCP kami: $0.01 per 200 karakter naskah, 30 suara, satu pembicara atau dialog dua orang, keluaran WAV 24 kHz. Pengarahannya pakai bahasa biasa — persona, tempo, aksen, dan ejaan fonetis untuk kata apa pun yang harus benar. Lalu tempelkan trek itu di atas klip pakai editor mana pun. Jaga kalimat tulisan ulang Anda kira-kira sepanjang take aslinya dan mulutnya masih kira-kira cocok; di bagian yang tidak cocok, potong ke produknya.

Sulih suara hasil AI · $0.01

Naskah 200 karakter yang dibaca Gemini 3.1 Flash TTS dengan satu baris pengarahan: perempuan muda yang ramah, review pakai ponsel di dapurnya, sedikit cepat, dan nama merek rekaan diucapkan ala Prancis. Tiga belas detik audio, satu sen, tanpa model video sama sekali.

Merangkai iklannya pun tak butuh aplikasi editing. ffmpeg menyambung take, memotong setengah detik saat tangan berulah, menukar audio hasil model dengan trek TTS Anda, menyisipkan crossfade, dan mengekspor versi 9:16 — semuanya dari satu baris perintah, gratis, di mesin apa pun. Sintaksnya terkenal tidak ramah, dan justru karena itu ia cocok dipasangkan dengan model: jelaskan potongan yang Anda mau ke Claude atau LLM mana pun, terima perintahnya, jalankan. Untuk spot UGC tiga klip, itulah seluruh tahap pasca-produksi — sekaligus alasan angka di halaman ini tetap sebatas biaya generasi, tanpa langganan tambahan.

07Harga

Berapa biaya satu iklan UGC AI di sini

Harga per unit model-model yang dipakai dalam alur video UGC AI
ModelHargaSatuanAudio
Nano Banana Proreferensi & frame pembuka$0.11gambar 1K–2K
Nano Banana 2draf dan varian$0.03–$0.13gambar 512px–4K
Gemini Omni Flash$0.10 per detik$0.30–$1.003–10 dtk, 720pselalu aktif
Veo 3.1 Fastbersuara$0.50–$1.004–8 dtk, 720p/1080popsional
Veo 3.1 Litevideo termurah$0.10–$0.364–8 dtk, 720popsional
Gemini 3.1 Flash TTShanya lewat MCP$0.01per 200 karaktersuara saja

Harga Veo berlaku untuk 720p dan 1080p; 4K lebih mahal. Omni Flash menagih $0.10 untuk tiap detik keluaran, jadi panjang klip itulah harganya. Tabel lengkap ada di halaman harga.

Top-up pakai kripto, mulai $1. Deposit $50 ke atas menambah 5%, $100 ke atas menambah 10%, dan kode promo aktif menambah 10% lagi dari deposit yang sama — jadi $100 dengan kode masuk sebagai $120 di saldo. Dengan $1.13 per klip delapan detik, itu sekitar seratus take — sebutlah dua puluh lima sampai tiga puluh iklan jadi setelah menghitung pengulangan dan sambungan beberapa klip.

Semua model dan resolusi terdaftar di halaman harga lengkap, dan halaman Gemini Omni Flash membahas apa yang bisa dan tidak bisa dilakukan model itu.

08Pelajari lagi

Panduan dari blog

09FAQ

Pertanyaan yang benar-benar ditanyakan

Apakah saya butuh orang sungguhan untuk membuat video UGC AI?

Tidak. Kreatornya pun bisa dihasilkan — semua orang yang Anda lihat di halaman ini lahir dari prompt teks dan tidak pernah ada. Kalau Anda memakai wajah orang sungguhan, Anda butuh izinnya: aturan soal citra diri berlaku pada video hasil AI sama seperti pada syuting, dan kebijakan platform soal kemiripan sintetis lebih ketat daripada dugaan kebanyakan orang.

Apakah wajah yang sama akan kembali di iklan berikutnya?

Ya, selama Anda menyimpan foto referensi yang sama dan memakai ulang frame pembuka yang sama. Membuat ulang frame dari referensi yang sama akan mendekati, tapi tidak identik piksel demi piksel — kebiasaan paling aman adalah menyimpan setiap frame pembuka yang disetujui dan menganimasikannya lagi, bukan membangunnya ulang.

Apakah saya harus menyatakan bahwa iklannya dibuat dengan AI?

Di TikTok, ya: kebijakan iklannya soal media yang diedit dan konten buatan AI mewajibkan label AIGC dari Ads Manager atau keterangan Anda sendiri yang terlihat di materinya. Meta memasang label AI-nya sendiri secara otomatis pada iklan yang terdeteksi sebagai hasil AI. Kedua kebijakan berubah sepanjang 2026, jadi periksa versi terbaru sebelum kampanye besar alih-alih memercayai satu tulisan blog — termasuk yang ini.

Model mana untuk iklan UGC orang berbicara?

Mulailah dengan Gemini Omni Flash, $0.10 per detik sudah termasuk audio: untuk orang yang bicara ke kamera, ia paling murah sekaligus paling tidak rewel, dan ia model yang lebih baru dengan fisika yang justru dipromosikan Google. Jangan dibaca sebagai «Omni tidak bisa gerakan»: ia menuang, menjatuhkan, menyampaikan bobot. Yang lolos darinya adalah rantai penanganan presisi yang panjang dalam satu take — di tes pipet empat aksi kami, ia kehilangan botolnya sementara Veo 3.1 Fast menahannya. Jadi untuk hook atau testimoni, Omni. Untuk shot yang dibangun di atas koreografi, buat di keduanya dan simpan take yang jadi; yang gagal harganya recehan.

Bisakah saya memakai rekaman saya sendiri?

Bisa, sampai 10 detik. Unggah klip Anda dan Omni Flash akan menyuntingnya sebagai video-ke-video — mengganti cahaya, latar, benda yang dipegang — sambil mempertahankan take-nya. Sumber yang lebih panjang dipangkas ke batas model sebelum digenerasi.

Bagaimana kalau sebuah generasi ditolak?

Saldo dikembalikan otomatis, baik di Omni Flash maupun Veo. Penolakan berkumpul di sekitar pakaian, anak di bawah umur, dan orang nyata yang dikenali; aturan busana di bagian pemilihan model tadi yang paling banyak menghemat percobaan ulang.

Bisakah ini dijalankan dari Claude, Cursor, atau skrip saya sendiri?

Bisa — model yang sama tersedia lewat server MCP kami, termasuk model suara yang sama sekali tidak punya antarmuka web. Gambar referensi dan frame pembuka bisa dikirim sebagai job ID, URL publik, atau base64 inline, jadi satu batch UGC penuh bisa diskrip dari sebuah agen.

Berapa biaya satu iklan utuh 30 detik, bukan satu klip?

Hitung take, bukan klip. Spot 20–30 detik biasanya tiga sampai empat klip yang disambung, dan tiap klip butuh beberapa percobaan sebelum layak pakai: pembacaan yang datar, tangan yang aneh, penolakan. Dengan $0.80 untuk delapan detik Omni Flash, iklan jadi tetap di kisaran beberapa dolar; mengambil shot penuh gerakan di Veo 3.1 penuh seharga $3.00 per klip membawanya ke puluhan dolar. Editingnya tidak menambah apa-apa: ffmpeg menyambung take, memangkasnya, dan menimpakan voice-over lewat baris perintah — dan LLM bisa menuliskan perintah itu untuk Anda.

Dua foto dan beberapa dolar

Daftar gratis dengan $0.20 di saldo, isi ulang pakai kripto mulai $1. Frame pertama sekitar semenit, klip pertama lima menit.