Kembali ke blog
BananaBanana Teamtutorialvideoveoprompts

Panduan Prompt Veo 3.1: Menulis Prompt yang Benar-Benar Berhasil

Panduan praktis prompt Veo 3.1: struktur tujuh bagian, istilah gerakan kamera, isyarat audio, dan klip sebelum-sesudah nyata mulai dari $0.10 per video.

Panduan Prompt Veo 3.1: Menulis Prompt yang Benar-Benar Berhasil

Prompt Veo 3.1 adalah deskripsi singkat adegan yang memberi tahu model video Google tentang apa yang harus direkam dan bagaimana cara merekamnya. Model-model ini memperlakukan teks Anda seperti arahan sutradara: mereka membaca subjek, tindakan, gaya, kerja kamera, komposisi, pilihan lensa, dan pencahayaan, lalu mengisi semua hal yang tidak Anda tentukan dengan tebakan mereka sendiri. Penulisan prompt yang baik sebagian besar adalah tentang menyisakan lebih sedikit hal untuk ditebak.

Versi cepatnya, jika Anda hanya membaca satu paragraf: deskripsikan satu subjek yang melakukan satu tindakan, lalu tambahkan kamera. Templat yang berfungsi adalah "[tipe pengambilan gambar] dari [subjek] [melakukan tindakan] di [latar], [gerakan kamera], [lensa atau fokus], [pencahayaan dan suasana]". Satu kebiasaan itu—menambahkan kamera dan cahaya—menutup sebagian besar celah antara klip yang membosankan dan klip yang layak pakai. Semua yang ada di bawah ini adalah detail dan buktinya.

Saya telah menjalankan Veo 3.1 setiap hari di BananaBanana sejak kami meluncurkan pembuatan video, dan perbedaan antara prompt yang asal-asalan dengan yang terstruktur jauh lebih besar di sini daripada di model gambar mana pun yang saya gunakan. Gambar memaafkan ketidakjelasan. Video menghukumnya dua kali, sekali dalam bingkai gambar (frame) dan sekali dalam gerakan.

Apa yang membuat prompt Veo 3.1 bagus?

Menurut dokumentasi Veo Google, prompt yang kuat mencakup tujuh elemen: subjek, tindakan, gaya, posisi kamera, komposisi, fokus dan efek lensa, serta suasana (ambiance). Anda tidak membutuhkan ketujuhnya setiap saat. Anda hanya perlu tahu elemen mana yang Anda lewati, karena model akan mengimprovisasi sisanya.

ElemenApa yang dikontrolContoh frasa
SubjekSiapa atau apa yang ada di layar"seorang pengrajin tembikar tua dengan tangan bernoda tanah liat"
TindakanApa yang terjadi selama klip"membentuk mangkuk di atas roda yang berputar"
GayaEstetika keseluruhan"gaya dokumenter sinematik"
KameraPosisi dan gerakan"dolly-in lambat sejajar mata"
KomposisiPembingkaian (framing)"close-up"
Lensa / fokusKarakter optik"shallow depth of field (kedalaman ruang sempit)"
SuasanaSuasana cahaya dan warna"cahaya jendela yang hangat, debu di udara"

Urutan kurang penting daripada yang dipikirkan orang. Saya biasanya menaruh subjek dan tindakan di awal karena itulah yang menjadi acuan model, lalu menumpuk kamera dan cahaya di bagian akhir. Yang lebih penting adalah spesifik: "seekor kuda" membuat model harus menebak di antara empat puluh ras, sementara "seekor kuda Arab berwarna kastanya" tidak.

Satu catatan jujur. Veo 3.1 memiliki penulis ulang prompt (prompt rewriter) di sisi Google yang memperluas prompt pendek sebelum pembuatan dilakukan, dan Anda tidak dapat melihat sepenuhnya apa yang ditambahkan. Prompt pendek terkadang menghasilkan detail yang tidak pernah Anda minta. Menuliskan detailnya sendiri adalah cara Anda mengambil alih keputusan tersebut dari prompt rewriter.

Anatomi prompt Veo 3.1 yang dipecah menjadi tujuh bahan berlabel: subjek, tindakan, gaya, kamera, komposisi, lensa, dan suasana

Bagaimana cara mengontrol kamera di Veo 3.1?

Bahasa kamera adalah bagian yang paling berpengaruh dari prompt Veo 3.1, dan ini adalah bagian yang paling sering dilewatkan orang. Model memahami kosakata film standar, jadi gunakan secara harfiah.

Untuk posisi: aerial view (tampilan udara), eye-level (sejajar mata), low-angle shot (sudut rendah), top-down shot (sudut dari atas), over-the-shoulder (melewati bahu). Untuk gerakan: dolly in atau out (kamera mendekat/menjauh), tracking shot (pelacakan), pan left atau right (geser kiri/kanan), tilt up (miring ke atas), slow zoom (perbesaran lambat), POV shot (sudut pandang orang pertama). Untuk pembingkaian: extreme close-up (sangat dekat), close-up (dekat), medium shot (sedang), wide shot (lebar), establishing shot (pembuka). Untuk optik: shallow focus (fokus dangkal), deep focus (fokus dalam), macro lens (lensa makro), wide-angle lens (lensa sudut lebar), soft focus (fokus lembut).

Dua aturan praktis dari hasil pembuatan kami. Pertama, satu gerakan kamera per klip. Prompt yang meminta "geseran (pan) yang berubah menjadi dolly-in lalu miring ke atas (tilt up)" biasanya hanya menghasilkan salah satu dari ketiganya secara acak, atau kompromi yang tidak jelas. Klip berdurasi 4 hingga 8 detik; hanya ada ruang untuk satu gerakan yang dilakukan dengan baik. Kedua, kata kerja gerakan mengalahkan kata benda kamera saat keduanya bertentangan. Jika subjek Anda "berlari cepat" tetapi kameranya "static wide shot" (bidikan lebar statis), perkiraan model akan memprioritaskan lari cepat tersebut dan tetap menggerakkan kamera. Buat keduanya selaras.

Pencahayaan bekerja dengan cara yang sama: sebutkan seperti seorang sinematografer. "Golden hour backlight" (cahaya latar jam emas), "cool blue moonlight" (cahaya bulan biru dingin), "harsh overhead fluorescent" (fluoresen atas kepala yang keras), "flickering torchlight" (cahaya obor yang berkedip-kedip) semuanya terbaca dengan andal. Kata-kata suasana yang tidak jelas seperti "beautiful lighting" (pencahayaan yang indah) tidak akan terbaca sekali pun.

Kosakata kamera film untuk prompt Veo 3.1 yang diilustrasikan sebagai papan cerita (storyboard) dari posisi kamera dolly, pan, low-angle, dan aerial di sekitar satu subjek

Sebelum dan sesudah: ide yang sama, dua prompt berbeda

Jangan sekadar teori, berikut adalah adegan yang sama yang dibuat dua kali dengan Veo 3.1 Fast di BananaBanana, tanpa suara, 6 detik, 720p. Total biaya untuk kedua demo ini: sekitar $1.

Pertama, prompt yang ditulis semua orang di hari pertama. Hanya "A horse running on a beach":

Hasilnya lumayan. Perhatikan bahwa model memilih suasana matahari terbenam dengan sendirinya; itulah prompt rewriter yang membuat keputusan untuk Anda. Pembingkaian tetap berupa bidikan lebar yang jauh, kamera tidak pernah bergerak mantap, dan semua itu bukan pilihan Anda. Sekarang ide yang sama ditulis ulang dengan struktur tujuh elemen: "A chestnut Arabian horse gallops along wet sand at golden hour, kicking up spray of seawater with its hooves, low-angle tracking shot moving alongside the horse, shallow depth of field, warm backlit rim light from the setting sun":

Subjek yang sama, model yang sama, harga yang sama. Klip kedua memiliki gerakan kamera yang disengaja, arah cahaya yang konsisten, dan cipratan air yang menangkap cahaya latar, yang semuanya berasal dari kata-kata dalam prompt, bukan karena keberuntungan.

Satu pelajaran dari pembuatan demo ini yang mengharuskan saya melakukan pembuatan ulang sebanyak dua kali: versi awal prompt tersebut diakhiri dengan "cinematic 35mm look", dan Veo mengartikan referensi film tersebut secara harfiah, menghasilkan garis hitam (letterbox) yang menyatu dalam bingkai gambar. Dua kali. Kata-kata gaya seperti "35mm", "anamorphic", atau "cinematic film look" dapat memicu tampilan layar lebar secara keseluruhan, termasuk garis hitam tersebut. Jika Anda ingin mendapatkan suasana tanpa garis hitam, sebutkan perilaku cahaya dan lensa secara langsung dan lewati kosakata jenis film.

Jika Anda memulai dari foto, bukan teks, mekanismenya sedikit berubah (gambar Anda mengunci bingkai pertama dan prompt hanya mendeskripsikan gerakan). Kami membahas alur kerja tersebut secara terpisah dalam panduan gambar ke video.

Bagaimana cara menulis prompt audio di Veo 3.1?

Veo 3.1 menghasilkan audio bawaan (native), dan menurut dokumen Google, fitur ini selalu aktif di API: dialog, efek suara, dan kebisingan latar belakang (ambient noise), yang disinkronkan dengan gambar. Anda mengontrol masing-masing elemen dengan konvensi teks yang berbeda.

  • Dialog ditulis dalam tanda kutip, ditautkan ke pembicara: Seorang pria bergumam, "This must be it." (Pasti ini tempatnya.)
  • Efek suara dinyatakan sebagai peristiwa: "tires screeching" (decit ban), "waves crashing against rocks" (ombak menghantam batu karang).
  • Suasana digambarkan sebagai atmosfer: "faint hum of fluorescent lights" (dengung samar lampu fluoresen), "distant seagulls" (burung camar di kejauhan).

Contoh prompt dari Google sendiri menunjukkan polanya: "A close up of two people staring at a cryptic drawing on a wall, torchlight flickering. A man murmurs, 'This must be it.'" Kutipan dialog menghasilkan ucapan yang sinkron dengan gerakan bibir (lip-sync), sementara kata "flickering" (berkedip-kedip) ditambah "torchlight" (cahaya obor) menjadi dasar suara latar ruangan.

Jaga agar kalimat yang diucapkan tetap pendek. Dalam pengujian kami, kalimat yang melebihi belasan kata per baris berisiko terpotong di bagian akhir atau diucapkan terburu-buru dalam klip berdurasi 8 detik. Dan tulislah dialog untuk satu atau dua pembicara saja, bukan untuk orang banyak; suara yang tumpang tindih akan terdengar tidak jelas.

Di BananaBanana audio dapat diaktifkan atau dinonaktifkan, dan harganya terpisah karena Google menagihnya secara terpisah: klip Veo 3.1 Fast berdurasi 8 detik seharga $0.70 tanpa suara atau $1.00 dengan audio pada resolusi 720p atau 1080p. Demo di atas sengaja dibuat tanpa suara, yang merupakan langkah hemat anggaran yang jujur ketika klip tersebut memang ditujukan untuk pemutaran otomatis tanpa suara (autoplay muted). (Jika Anda menginginkan suara di setiap klip secara default, model Omni Flash mengambil pendekatan sebaliknya: audio selalu aktif, berbiaya $0.10 per detik.)

Gelombang suara, balon ucapan dialog, dan simbol kebisingan sekitar yang mengalir ke dalam bingkai film, menunjukkan bagaimana struktur prompt audio Veo 3.1

Prompt negatif, durasi, dan rincian biaya Veo 3.1

Situasi prompt negatif memang membingungkan, jadi inilah yang kami lihat dari sisi API. Dokumen Gemini API untuk Veo 3.1 tidak mencantumkan parameter prompt negatif. Namun, endpoint Vertex AI yang digunakan BananaBanana menerima parameter negativePrompt, dan dalam hasil pembuatan kami, ini memberikan pengaruh yang nyata terhadap output. Jadi, kolom tersebut tersedia di generator kami dan berfungsi; hanya saja jangan berharap ini akan bertindak sebagai filter yang ketat.

Menulis prompt negatif memiliki satu aturan yang tidak biasa dari panduan prompt Google: jangan pernah menulis kata "no" atau "don't" di kolom negatif. Cukup buat daftar hal-hal yang tidak diinginkan sebagai kata benda biasa. Contoh "Cartoon, low quality, text overlay, watermark" berfungsi dengan baik; sedangkan "no cartoons" justru bisa menjadi bumerang karena kata "cartoon" masih terbaca.

Durasi dan format, menurut dokumen Google dan pengaturan produksi kami: klip berjalan selama 4, 6, 7, atau 8 detik pada aspek rasio 16:9 atau 9:16, dengan output resolusi 720p, 1080p, dan 4K. Durasi 8 detik diperlukan untuk resolusi 1080p, 4K, gambar referensi, dan fitur perpanjangan (extension). Extension adalah fitur unggulan tersembunyi dari Veo: setiap permintaan menambahkan durasi 7 detik, hingga 20 kali, yang merupakan cara Anda untuk mendapatkan video berdurasi lebih dari dua menit dari satu rantai prompt.

Harga BananaBanana saat ini untuk klip 720p berdurasi 8 detik:

ModelTanpa SuaraDengan Audio
Veo 3.1 Lite$0.20$0.36
Veo 3.1 Fast$0.70$1.00
Veo 3.1$1.40$3.00

Klip Lite tanpa suara berdurasi 4 detik seharga $0.10, dan saldo gratis yang didapatkan setiap akun baru cukup untuk dua klip seperti ini. Jadi video Veo pertama Anda gratis, dan sejujurnya, Lite pada resolusi 720p sudah cukup baik untuk mempelajari struktur prompt sebelum Anda mengeluarkan uang sungguhan untuk versi Fast atau model penuh. Rincian harga lengkap ada di halaman harga.

Alur kerja standar saya: buat draf prompt di Lite, lakukan iterasi hingga gerakan dan pembingkaian stabil, lalu jalankan ulang prompt final tersebut di Fast atau Veo 3.1. Kualitas prompt berpindah antar tingkat (tier) hampir dengan sempurna; kualitas hasil akhir (render) adalah apa yang Anda bayar.

FAQ

Apa struktur prompt terbaik untuk Veo 3.1?

Subjek, tindakan, gaya, kamera, komposisi, lensa, suasana, kira-kira dalam urutan tersebut. Templat yang ringkas: "[tipe pengambilan gambar] dari [subjek] [tindakan] di [latar], [gerakan kamera], [lensa], [pencahayaan]". Kata benda spesifik mengalahkan kata sifat, dan satu gerakan kamera per klip lebih baik daripada tiga gerakan sekaligus.

Apakah Veo 3.1 mendukung prompt negatif?

Pada Vertex AI, ya: parameter negativePrompt diterima dan berfungsi, meskipun dokumen Gemini API tidak mencantumkannya untuk Veo 3.1. Tulis kata negatif sebagai kata benda biasa ("cartoon, blurry, watermark"), jangan pernah sebagai kalimat larangan seperti "no X".

Bagaimana cara membuat Veo 3.1 menghasilkan ucapan?

Masukkan kalimat dalam tanda kutip dan tautkan ke pembicara di dalam prompt: Seorang wanita berbisik, "We're not alone." Veo melakukan lip-sync kalimat pendek dengan baik; jaga dialog tetap di bawah belasan kata per klip.

Berapa lama durasi video Veo 3.1?

Klip dasar berdurasi 4 hingga 8 detik. Dengan perpanjangan (tambahan 7 detik per permintaan, hingga 20 kali perpanjangan menurut dokumen Google), satu rantai tunggal dapat mencapai durasi 148 detik pada resolusi 720p.

Berapa biaya untuk satu video Veo 3.1?

Di BananaBanana, mulai dari $0.10 (klip Veo 3.1 Lite tanpa suara berdurasi 4 detik pada resolusi 720p) hingga $4.40 (klip Veo 3.1 dengan audio berdurasi 8 detik pada resolusi 4K). Pilihan standar tingkat menengah, yaitu klip Fast tanpa suara berdurasi 8 detik, seharga $0.70.

tutorialvideoveoprompts