Генерація зображень зі збереженням персонажа: практичний гайд
Збереження одного AI-персонажа на зображеннях та відео: ліміти референсів для Nano Banana 2 та Pro, метод character sheet, розкадровки, Veo 3.1.

Генерація зображень зі збереженням персонажа — це набір технік, які змушують AI-модель малювати одного й того самого героя, з однаковим обличчям, зачіскою та одягом на багатьох різних зображеннях, замість того щоб щоразу створювати нову людину. Це різниця між тим, коли за запитом «рудоволоса жінка в кафе» ви щоразу отримуєте абсолютно незнайоме обличчя, та генерацією саме вашої рудоволосої героїні — тієї самої, що з першого кадру вашого коміксу, рекламної кампанії чи розкадровки.
Коротко про головне: є два робочих методи, і їх можна комбінувати. Перший — завантажити референсні зображення вашого героя. Це той самий механізм референсів, який забезпечує AI-заміну обличчя на платформі. Nano Banana 2 приймає до 4 референсів персонажа, Nano Banana Pro — до 5, а Veo 3.1 може перенести до 3 референсів у відео. Другий метод — написати детальний промпт-опис (character sheet), тобто фіксований вичерпний опис, який ви вставляєте в кожну генерацію. На BananaBanana створення стабільного персонажа коштує від $0.06 за 1K зображень на Nano Banana 2. Усі приклади в цій статті згенеровані на нашій платформі, тому тутешні промпти можна копіювати та використовувати без змін.
Буду чесним від самого початку: помилки та збої також трапляються. Стабільність у сучасних моделях хороша, але не ідеальна. Далі ви самі побачите, де саме вона дає слабину.
Чому один і той самий персонаж щоразу виглядає інакше?
Моделі генерації зображень не мають пам'яті між запитами. Кожна генерація починається з чистого шуму, і ваш промпт — єдиний місток. Якщо в промпті написано «a young woman with red hair» (молода жінка з рудим волоссям), модель вибирає одну з мільйонів рудоволосих дівчат, яких вона теоретично здатна намалювати. Запустіть генерацію п'ять разів — і отримаєте п'ять абсолютно різних людей. Вони можуть мати схожий вайб, але обличчя будуть різними.
Це явище називають «дрейфом персонажа» (character drift), і воно посилюється, якщо використовувати розмиті промпти. Фраза «The same woman as before» (та сама жінка, що й раніше) ніяк не допоможе, адже ніякого «раніше» для моделі не існує. Вона ніколи не бачила вашого попереднього зображення, якщо тільки ви прямо не додали його як референс.
Дрейф також з'являється всередині одного робочого процесу. Змініть ракурс камери — і лінія щелепи трохи зміститься. Змініть одяг — і раптом зникне ластовиння. За моїм досвідом, найбільш вразливими є саме ті деталі, за якими люди впізнають одне одного: розріз очей, форма носа та лінія росту волосся. Тло та одяг зберігаються чудово, а от обличчя «гуляють».
Тож усе завдання зводиться до того, щоб передавати ідентичність персонажа моделі з кожним новим запитом — або у вигляді пікселів (референсних зображень), або текстом (фіксованим описом). А краще поєднувати обидва варіанти.

Скільки референсних зображень приймає кожна модель?
Референсні зображення — це ефективніший метод із двох: ви завантажуєте фотографії персонажа, і модель сприймає їх як абсолютний орієнтир. Як зазначено в документації Gemini API від Google щодо генерації зображень, ліміти суттєво відрізняються залежно від моделі, і ці відмінності варто знати перед тим, як зробити вибір.
| Модель | Референси персонажа | Референси об'єктів | Референси стилю | Ціна за 1K зображень |
|---|---|---|---|---|
| Nano Banana 2 Lite | немає | до 14 | немає | $0.03 |
| Nano Banana 2 | до 4 | до 10 | до 3 | $0.06 |
| Nano Banana Pro | до 5 | до 6 | немає | $0.11 |
Найбільший сюрприз у цій таблиці — це версія Lite. Вона загалом приймає найбільше зображень (14), проте в документації чітко зазначено, що це референси виключно для об'єктів, без підтримки збереження стабільності персонажа. Ми перевірили це на практиці: Lite спокійно бере обличчя на вхід і ставиться до нього як до фотографії товару — копіює куртку, але повністю втрачає людину. Якщо ваш робочий процес орієнтований на персонажів, про Lite можна забути, незалежно від привабливої ціни. (Для всього іншого це дійсно хороша бюджетна модель; ми написали окремий посібник про те, коли моделі Lite цілком достатньо.)
З-поміж двох інших варіантів я б радив почати з Nano Banana 2 за $0.06. П'ятий слот для персонажа та надійніше збереження ідентичності у Pro важливі для сцен із кількома героями та фінальних ассетів. При ціні $0.11 за зображення це невелика переплата, якщо картинка дійсно йде в роботу.
Ракурс завантажених фото важить більше, ніж їхня кількість. Три референси з одного ракурсу навчать модель малювати лише цей ракурс. Фото в анфас, профіль та у три чверті дадуть моделі розуміння того, як виглядає вся голова.

Що таке метод character sheet?
Опис персонажа (character sheet) — це фіксований блок тексту, який вичерпно описує вашого героя, і який ви дослівно вставляєте в кожен промпт. Це суто текстова альтернатива, коли у вас ще немає референсних фото, і саме з цього ви починаєте їхнє створення. Такий метод також чудово працює з AI-агентами: якщо ви генеруєте зображення в Claude Code через наш MCP-сервер, опис персонажа передається безпосередньо всередині промпту без необхідності завантажувати файли.
Правило просте: описуйте персонажа так, ніби робите це для поліцейського фоторобота. Вік, статура, шкіра, колір та стрижка волосся, колір очей, особливі прикмети, один чи два яскраві аксесуари. Розмиті прикметники ведуть до дрейфу образу, тоді як конкретні іменники міцно його утримують.
Ось точний блок тексту, який використовувався для прикладів нижче:
a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt
Обидва зображення нижче були згенеровані за допомогою Nano Banana Pro на основі цього текстового блоку. Змінювався лише опис оточення навколо нього. Жодних референсних картинок ми не додавали — це чиста текстова стабільність:


Одна й та сама людина? Дуже близько. Обличчя зберігає схожість, куртка та сережка на місці, ластовиння пережило зміну обох локацій. Якщо придивлятися до пікселів, то можна помітити, що довжина волосся дещо відрізняється. Це чесна межа можливостей суто текстової стабільності. Саме тому професійний підхід поєднує методи: генеруйте найкраще зображення персонажа за допомогою опису (sheet), а потім додавайте це зображення як референс для всіх наступних кадрів. Текст задає образ, а пікселі його закріплюють.
Ще дві невеликі поради з реального досвіду. «Якірні» деталі (сережка, куртка) чудово працюють на впізнаваність при мінімальних витратах токенів — додайте таку деталь кожному герою. І намагайтеся тримати опис персонажа в межах 60 слів, бо інакше опис сцени почне конкурувати з описом героя за увагу моделі.
Сцени з кількома персонажами та AI-розкадровки
Два стабільних персонажі в одному кадрі — це момент, коли прості трюки перестають працювати. Спільний текстовий опис для обох героїв зазвичай призводить до взаємного змішування деталей: персонаж А запозичує зачіску персонажа Б, а Б отримує куртку персонажа А. Ймовірно, це можна виправити великою кількістю повторних генерацій, але кожна з них коштує грошей.
Референсні зображення вирішують цю проблему набагато краще. Nano Banana 2 приймає до 4 референсів персонажів, а Nano Banana Pro — до 5 (згідно з документацією Google), і ці слоти можна розподілити між різними людьми. Завантажте по два-три знімки для кожного героя, а потім опишіть сцену, називаючи їх за ролями («the red-haired woman hands a coffee to the gray-bearded man» — рудоволоса жінка передає каву сивобородому чоловіку). Образи прив'язуються до потрібних людей набагато надійніше, хоча взаємодія рук та передача предметів між двома людьми навіть у 2026 році все ще залишається лотереєю.
Розкадровки — це цілком логічний наступний крок, і є два способи їх створення. Покроково (кадр за кадром): одна генерація на панель із підключеними референсами персонажа. При ціні $0.06 за кадр на Nano Banana 2 розкадровка на шість кадрів коштуватиме вам $0.36. Або в одному зображенні: попросіть Nano Banana Pro створити макет із кількома кадрами за один раз. Панель нижче була створена саме так — за один запит вартістю $0.11 із тим самим текстовим описом героя:

Стабільність у межах однієї картинки ви отримуєте практично безкоштовно, оскільки модель малює всі панелі за один прохід і «бачить» власну роботу. Компроміс полягає в роздільній здатності: кожен окремий кадр займає лише чверть загального зображення. Для презентацій та чорнових аніматиків цього цілком достатньо. Якщо ж вам потрібні кадри високої якості для окремого використання — краще генерувати їх покроково, заплативши ті самі $0.36.
Чи можна перенести персонажа у відео?
Так, і саме тут робочий процес стає по-справжньому цікавим. Veo 3.1 підтримує те, що в документації Vertex AI від Google називається референсами об'єктів (asset reference images): ви завантажуєте до 3 фотографій людини, персонажа чи продукту, і модель зберігає зовнішній вигляд цього об'єкта у згенерованому відеокліпі. У нашому генераторі за це відповідає розділ «Subject Reference», а Gemini Omni Flash, яка завжди постачається зі звуком, є більш щедрою: до 10 референсних зображень на кліп, і їх можна поєднувати зі стартовим кадром ($0.10 за секунду, повний огляд Omni тут).
Опис персонажа (character sheet) усе ще приносить велику користь і у відеопромптах. Відео нижче згенеровано через Veo 3.1 Fast суто за текстом — з використанням того ж самого опису, що й для статичних зображень, з додаванням деталей руху та ракурсів камери:
Промпт виглядав так: спочатку наш опис персонажа, а потім «walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field» (йде назустріч камері міською вулицею під час золотої години, повільний від'їзд камери назад, середній план, мала глибина різкості). Результат: шість секунд беззвучного відео 720p за $0.52. Вона цілком впізнавана і схожа на героя зі статичних зображень, що для суто текстової передачі образу між двома різними моделями насправді перевершило мої сподівання.
Застереження з наших логів генерации: референси об'єктів іноді роблять міміку дещо пласкою. Обличчя відповідає оригіналу, але виглядає трохи «восковим», особливо на загальних планах, де воно займає мало пікселів. Крупні плани виходять набагато краще. Якщо ви отримуєте відео, де у головного героя скляний погляд — спробуйте змінити ракурс на більш крупний план замість повторної генерації того самого кадру.
Отже, повна зв'язка виглядає так: текстовий опис персонажа (character sheet) → створення еталонних зображень у Nano Banana Pro → використання цих картинок як референсів персонажа для всіх статичних кадрів та як референсів об'єкта для відео. Єдиний образ, єдиний робочий процес, статичні картинки від $0.06 та відеоролики від $0.10 на сторінці з тарифами.
FAQ
Яка AI-модель найкраще підходить для збереження персонажа?
Nano Banana Pro за всіма параметрами: до 5 референсів персонажа та найнадійніша фіксація образу в лінійці при ціні $0.11 за зображення роздільною здатністю 1K або 2K. Nano Banana 2 — це вигідний вибір за $0.06 із 4 слотами для персонажів та підтримкою референсів стилю, яких немає у Pro. Уникайте Nano Banana 2 Lite для цього завдання, оскільки вона взагалі не підтримує референси персонажів.
Як зберегти одинакове обличчя на AI-зображеннях без референсних фото?
Створіть опис персонажа (character sheet): фіксований опис обсягом 40–60 слів, який охоплює вік, волосся, очі, шкіру, особливі прикмети та один «якірний» аксесуар, і вставляйте його без змін у кожен промпт. Потім використовуйте найкращий згенерований результат як референсне зображення для подальшої роботи. Текст сам по собі допомагає наблизитися до бажаного результату, а поєднання тексту та картинок-референсів надійно його фіксує.
Чи можу я використовувати фото реальної людини як референс персонажа?
Технічно API приймає будь-які фотографії. Проте з юридичного та етичного погляду ви маєте використовувати лише ті знімки, на які володієте правами та отримали згоду людини. Генерація впізнаваних образів реальних людей без їхньої згоди порушує правила користування більшості платформ, включно з нашою.
Скільки референсних зображень слід завантажувати?
Менша кількість, але з більшою різноманітністю ракурсів працює краще, ніж багато схожих кадрів. Три фото, що показують анфас, профіль та ракурс у три чверті, зазвичай дають кращий результат, ніж п'ять майже ідентичних селфі. Жорсткі ліміти: 4 зображення персонажа для Nano Banana 2, 5 — для Nano Banana Pro та 3 — для відео у Veo 3.1.
Чи працює збереження стабільності для нелюдських персонажів?
Здебільшого так. Маскоти, роботи та стилізовані тварини часто зберігають стабільність навіть краще, ніж люди, адже їхня ідентичність тримається на чітких формах та яскравих кольорах, а не на тонких лініях геометрії обличчя. Тут діють ті самі правила: опис характерних фіксованих деталей у тексті та референсні зображення, щойно ви отримаєте фінальний канонічний дизайн.