Kembali ke blog
BananaBanana Teamtutorialimagesvideo

Generasi Gambar Karakter Konsisten: Panduan Praktis

Jaga karakter AI tetap konsisten di seluruh gambar dan video: limit gambar referensi Nano Banana 2 dan Pro, metode lembar karakter, storyboard, Veo 3.1.

Generasi Gambar Karakter Konsisten: Panduan Praktis

Generasi gambar karakter konsisten adalah serangkaian teknik yang membuat model AI menggambar karakter yang sama—dengan wajah, rambut, dan pakaian yang sama—di berbagai gambar berbeda, alih-alih membuat orang baru setiap kali pembuatan. Ini adalah perbedaan antara prompt "seorang wanita berambut merah di kafe" yang menghasilkan orang asing yang berbeda di setiap percobaan, dengan hasil yang menampilkan wanita berambut merah milik Anda, karakter yang ada di panel pertama komik Anda, kampanye iklan Anda, atau storyboard Anda.

Versi singkatnya: ada dua metode yang berhasil digunakan, dan keduanya bisa digabungkan. Pertama, unggah gambar referensi karakter Anda — mekanisme referensi yang sama yang mendukung fitur tukar wajah AI di platform kami. Nano Banana 2 menerima hingga 4 referensi karakter, Nano Banana Pro hingga 5 referensi, dan Veo 3.1 bisa membawa hingga 3 referensi ke dalam video. Kedua, buat prompt lembar karakter (character sheet), yaitu deskripsi detail dan tetap yang Anda masukkan ke dalam setiap pembuatan gambar. Di BananaBanana, pembuatan karakter yang konsisten membutuhkan biaya mulai dari $0.06 per 1K gambar menggunakan Nano Banana 2. Semua contoh di artikel ini dibuat langsung di platform kami, jadi Anda bisa menyalin prompt yang ada di sini apa adanya.

Saya juga akan jujur sejak awal tentang potensi kegagalannya. Konsistensi pada model saat ini memang bagus, tetapi belum sempurna. Anda akan melihat bagian mana saja yang masih kurang tepat.

Mengapa karakter yang sama terlihat berbeda setiap kali dibuat?

Model gambar tidak memiliki memori antar-permintaan (request). Setiap pembuatan gambar dimulai dari nol (noise), dan prompt Anda adalah satu-satunya jembatan. Jika prompt Anda berbunyi "seorang wanita muda dengan rambut merah", model akan memilih salah satu dari jutaan wanita muda berambut merah yang bisa digambarnya. Jalankan lima kali, maka Anda akan mendapatkan lima orang yang berbeda. Mereka mungkin memiliki aura yang mirip, tetapi wajah mereka tidak akan sama.

Hal ini disebut sebagai pergeseran karakter (character drift), dan efeknya akan semakin buruk jika prompt terlalu samar. Menulis "wanita yang sama seperti sebelumnya" tidak akan berpengaruh apa-apa, karena tidak ada istilah "sebelumnya" bagi model AI. Model tersebut tidak pernah melihat gambar Anda sebelumnya kecuali jika Anda melampirkannya secara eksplisit.

Pergeseran ini juga bisa menyelinap dalam satu alur kerja yang sama. Mengubah sudut kamera bisa menggeser garis rahang. Mengubah pakaian dan tiba-tiba bintik-bintik merah di wajah (freckles) menghilang. Berdasarkan pengalaman saya, fitur wajah yang paling rentan berubah adalah bagian-bagian yang justru digunakan manusia untuk mengenali seseorang: bentuk mata, hidung, dan garis rambut. Latar belakang dan pakaian biasanya bertahan dengan baik, tetapi wajah sering kali melenceng.

So, kunci utamanya adalah terus memasukkan identitas karakter ke dalam model pada setiap permintaan, baik berupa piksel (gambar referensi) maupun teks (deskripsi yang paten). Lebih baik jika menggunakan keduanya.

Deretan bingkai potret buatan AI di mana karakter yang sama secara bertahap berubah menjadi orang lain, menggambarkan pergeseran karakter (character drift) dalam generasi gambar

Berapa banyak gambar referensi yang bisa diterima setiap model?

Gambar referensi adalah metode yang lebih kuat dari keduanya: Anda mengunggah foto karakter dan model akan menganggapnya sebagai patokan utama. Menurut dokumentasi gambar Gemini API dari Google, batasannya sangat berbeda untuk setiap model, dan perbedaan ini penting untuk diketahui sebelum Anda memilih model.

ModelRef karakterRef objekRef gayaHarga per 1K gambar
Nano Banana 2 Litetidak adahingga 14tidak ada$0.03
Nano Banana 2hingga 4hingga 10hingga 3$0.06
Nano Banana Prohingga 5hingga 6tidak ada$0.11

Hal yang mengejutkan dari tabel tersebut adalah versi Lite. Model ini menerima jumlah gambar terbanyak secara keseluruhan (14), tetapi dokumentasinya menjelaskan secara eksplisit bahwa itu hanya referensi objek, tanpa dukungan untuk konsistensi karakter. Kami mempelajari ini secara langsung: Lite dengan senang hati menerima wajah sebagai input lalu memperlakukannya seperti foto produk, mencocokkan jaketnya tetapi kehilangan kemiripan orangnya. Jika alur kerja Anda berfokus pada karakter, lupakan Lite, berapa pun harga murah yang ditawarkan. (Untuk kebutuhan lainnya, ini adalah model hemat yang sangat bagus; kami menulis panduan terpisah tentang kapan model Lite sudah cukup.)

Di antara dua model lainnya: saya menyarankan untuk memulai dengan Nano Banana 2 seharga $0.06. Slot karakter kelima dan penguncian identitas yang lebih kuat pada versi Pro sangat penting untuk adegan multi-karakter dan aset final, dan dengan harga $0.11 per gambar, selisih harganya tidak seberapa jika gambar tersebut benar-benar digunakan untuk proyek profesional Anda.

Sudut foto yang diunggah jauh lebih penting daripada jumlahnya. Tiga referensi dari satu sudut hanya akan mengajarkan model tentang satu sudut tersebut. Foto dari depan, profil samping, dan sudut tiga perempat (three-quarter view) akan mengajarkan model tentang bentuk kepala secara keseluruhan.

Kumpulan foto referensi karakter dari berbagai sudut yang dimasukkan ke dalam model gambar AI, menunjukkan bagaimana gambar referensi memandu generasi karakter yang konsisten

Apa itu metode lembar karakter (character sheet)?

Lembar karakter (character sheet) adalah blok teks tetap yang mendeskripsikan karakter Anda secara menyeluruh, yang Anda salin secara harfiah ke dalam setiap prompt. Ini adalah metode alternatif khusus teks saat Anda belum memiliki foto referensi, dan ini adalah cara Anda membuat foto referensi itu sejak awal. Ini juga merupakan metode yang berfungsi dari agen AI: jika Anda membuat gambar di Claude Code melalui server MCP kami, lembar karakter akan dikirimkan di dalam prompt tanpa perlu mengunggah gambar apa pun.

Aturannya: deskripsikan karakter seperti cara kerja seorang pelukis sketsa polisi. Umur, perawakan, kulit, warna dan potongan rambut, warna mata, tanda khusus, serta satu atau dua aksesori utama. Kata sifat yang samar akan melenceng; kata benda konkret akan bertahan dengan kokoh.

Berikut adalah blok teks persis yang digunakan untuk contoh di bawah ini:

a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt

Kedua gambar di bawah ini dibuat dengan Nano Banana Pro menggunakan blok teks yang sama. Hanya teks deskripsi adegan di sekitarnya saja yang diubah. Tidak ada gambar referensi yang dilampirkan, ini murni konsistensi yang dipandu oleh teks:

Demo konsistensi karakter buatan AI: wanita berambut merah dengan jaket korduroi kuning moster sedang membaca di dekat jendela kafe, dibuat dengan Nano Banana Pro

Karakter AI yang sama, seorang wanita berambut merah dengan jaket korduroi kuning moster, di atas atap saat golden hour, menunjukkan generasi gambar karakter yang konsisten dengan Nano Banana Pro

Orang yang sama? Sangat mirip. Wajahnya bertahan dengan baik, jaket dan anting-antingnya konsisten, bintik-bintik merah di wajah juga muncul di kedua adegan. Jika Anda memperhatikannya dengan sangat detail (pixel-peep), Anda akan menemukan bahwa panjang rambutnya sedikit berbeda. Itulah batas maksimal dari konsistensi yang hanya mengandalkan teks. Oleh karena itu, alur kerja profesional menggabungkan kedua metode: buat gambar karakter terbaik Anda dari lembar teks, lalu gunakan gambar tersebut kembali sebagai referensi karakter untuk semua gambar berikutnya. Teks menentukan identitas, piksel memperkuatnya.

Dua tips tambahan dari pengalaman kami menjalankan ini di tahap produksi. Aksesori utama (seperti anting atau jaket) sangat membantu proses pengenalan dengan menggunakan sangat sedikit token; berikan satu aksesori khas untuk setiap karakter Anda. Selain itu, usahakan lembar deskripsi tetap di bawah 60 kata, karena jika lebih dari itu, deskripsi adegan akan mulai berebut perhatian model dengan deskripsi karakter Anda.

Adegan multi-karakter dan storyboard AI

Menghadirkan dua karakter yang konsisten dalam satu bingkai adalah titik di mana trik-trik sederhana tidak lagi berfungsi. Menggabungkan lembar deskripsi teks untuk kedua karakter cenderung menyebabkan kontaminasi silang: karakter A mengambil gaya rambut karakter B, dan karakter B memakai jaket karakter A. Masalah ini mungkin bisa diatasi dengan beberapa kali percobaan ulang (rerun), tetapi percobaan ulang membutuhkan biaya.

Gambar referensi mengatasi masalah ini dengan benar. Nano Banana 2 menerima hingga 4 referensi karakter dan Nano Banana Pro menerima hingga 5 referensi, sesuai dokumentasi Google, dan slot tersebut dapat dibagi untuk orang yang berbeda. Unggah dua atau tiga foto dari masing-masing karakter, lalu tulis adegannya dengan menyebutkan peran mereka ("wanita berambut merah memberikan kopi kepada pria berjanggut abu-abu"). Identitas akan melekat pada orang yang tepat dengan jauh lebih andal, meskipun detail tangan yang menyerahkan objek di antara dua orang masih terasa seperti lotre di tahun 2026 ini.

Storyboard adalah langkah alami berikutnya, dan ada dua cara untuk membuatnya. Bingkai demi bingkai (frame-by-frame): satu pembuatan gambar per panel, dengan referensi karakter yang dilampirkan pada masing-masing gambar, seharga $0.06 per panel menggunakan Nano Banana 2 (jadi papan enam panel menghabiskan biaya sekitar $0.36). Atau satu gambar utuh: minta Nano Banana Pro untuk membuat tata letak multi-panel dalam sekali proses. Panel di bawah ini dibuat dengan cara tersebut, hanya dengan satu kali permintaan seharga $0.11 menggunakan lembar karakter yang sama seperti di atas:

Storyboard AI empat panel yang dibuat dalam satu permintaan Nano Banana Pro, karakter berambut merah yang sama tetap konsisten di semua panel: bangun tidur, bersepeda, presentasi, dan di atas atap

Konsistensi di dalam satu gambar tunggal pada dasarnya gratis, karena model menggambar semua panel dalam sekali jalan dan dapat melihat hasilnya sendiri. Komprominya adalah pada resolusi: setiap panel hanya berukuran seperempat dari bingkai utama. Untuk keperluan draf presentasi (pitch deck) dan animatik, ini sudah sangat cukup. Namun untuk panel yang ingin Anda gunakan secara terpisah dengan kualitas tinggi, buatlah secara bingkai demi bingkai dengan biaya $0.36.

Bisakah Anda membawa karakter ke dalam video?

Ya, dan di sinilah alur kerjanya menjadi menyenangkan. Veo 3.1 mendukung apa yang disebut oleh dokumentasi Vertex AI Google sebagai gambar referensi aset (asset reference images): hingga 3 foto orang, karakter, atau produk, dan model akan menjaga penampilan subjek tersebut dalam klip video yang dihasilkan. Di generator kami, ini adalah bagian Subject Reference, Gemini Omni Flash, yang selalu dilengkapi dengan suara, lebih murah hati: hingga 10 gambar referensi per klip, dan dapat digabungkan dengan bingkai awal ($0.10 per detik, ulasan lengkap Omni ada di sini).

Lembar karakter tetap sangat berguna dalam prompt video. Klip di bawah ini menggunakan Veo 3.1 Fast, murni berbasis teks, menggunakan blok deskripsi yang sama seperti gambar-gambar di atas, ditambah instruksi gerakan dan sudut kamera:

Prompt yang digunakan: lembar karakter, lalu ditambahkan teks "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field." Berdurasi enam detik, tanpa suara 720p, dengan biaya $0.52. Karakter tersebut terlihat jelas sama dengan yang ada di gambar statis, sebuah pencapaian yang sejujurnya lebih baik dari perkiraan saya untuk transfer karakter hanya berbasis teks di antara dua model yang berbeda.

Catatan penting dari log pembuatan kami: referensi aset terkadang membuat ekspresi wajah menjadi datar. Wajahnya cocok, tetapi terlihat sedikit kaku (waxy), terutama pada bidikan sudut lebar (wide shot) di mana wajah hanya menempati sedikit piksel. Bidikan jarak dekat (close-up) memberikan hasil yang jauh lebih baik. Jika klip yang dihasilkan memperlihatkan karakter utama dengan tatapan kosong, cobalah lakukan pembingkaian yang lebih rapat (reframe tighter) daripada mencoba memutar ulang (reroll) bidikan yang sama.

Jadi, alur kerja lengkapnya adalah: lembar karakter → membuat gambar utama di Nano Banana Pro → menggunakan gambar-gambar tersebut sebagai referensi karakter untuk setiap gambar statis berikutnya dan sebagai referensi aset untuk video. Satu identitas, satu alur kerja terpadu, dengan harga gambar mulai dari $0.06 dan klip video mulai dari $0.10 di halaman harga.

FAQ

Model AI mana yang terbaik untuk konsistensi karakter?

Berdasarkan data teknis, Nano Banana Pro adalah yang terbaik: mendukung hingga 5 gambar referensi karakter dan penguncian identitas paling kuat di kelasnya, dengan harga $0.11 per gambar 1K atau 2K. Nano Banana 2 adalah pilihan hemat terbaik seharga $0.06 dengan 4 slot karakter ditambah referensi gaya (style reference) yang tidak dimiliki versi Pro. Hindari penggunaan Nano Banana 2 Lite untuk kebutuhan ini karena model tersebut sama sekali tidak mendukung referensi karakter.

Bagaimana cara menjaga wajah yang sama di seluruh gambar AI tanpa foto referensi?

Buatlah lembar karakter (character sheet): deskripsi tetap sepanjang 40–60 kata yang mencakup usia, rambut, mata, kulit, tanda khusus, dan satu aksesori utama, lalu tempelkan teks tersebut tanpa diubah ke dalam setiap prompt. Setelah itu, gunakan hasil terbaik Anda sebagai gambar referensi untuk proses selanjutnya. Teks saja hanya akan membantu Anda mendekati kemiripan; gabungan teks dan referensi gambar akan memastikan konsistensinya tetap terjaga.

Bisakah saya menggunakan foto orang sungguhan sebagai referensi karakter?

Secara teknis, API menerima foto apa pun. Namun, secara hukum dan etika, gunakan hanya foto yang hak ciptanya Anda miliki dan telah mendapatkan persetujuan dari orang yang bersangkutan. Membuat gambar orang asli yang dapat dikenali tanpa persetujuan melanggar ketentuan layanan di sebagian besar platform, termasuk milik kami.

Berapa banyak gambar referensi yang harus saya unggah?

Unggahan yang lebih sedikit namun bervariasi jauh lebih baik daripada banyak foto yang serupa. Tiga foto yang mencakup sudut depan, profil samping, dan sudut tiga perempat biasanya memberikan hasil yang lebih baik daripada lima foto selfie yang hampir identik. Batas maksimalnya: 4 gambar karakter di Nano Banana 2, 5 di Nano Banana Pro, dan 3 di video Veo 3.1.

Apakah konsistensi karakter juga berfungsi untuk karakter non-manusia?

Sebagian besar ya. Maskot, robot, dan hewan yang distilisasi sering kali bertahan dengan lebih baik daripada manusia karena identitas mereka terletak pada bentuk dan warna yang mencolok, bukan pada geometri wajah yang halus. Metode yang sama tetap berlaku: gunakan fitur tetap yang khas pada lembar karakter Anda, serta gunakan gambar referensi setelah Anda mendapatkan desain standarnya.

tutorialimagesvideo