Назад в блог
BananaBanana Teamtutorialimagesvideo

Генерация стабильных персонажей ИИ: практический гайд

Как сохранить одного персонажа ИИ на картинках и видео: лимиты референсов для Nano Banana 2 и Pro, метод текстового описания, раскадровки и Veo 3.1.

Генерация стабильных персонажей ИИ: практический гайд

Генерация стабильных персонажей ИИ — это набор техник, которые заставляют нейросеть рисовать одного и того же героя с одинаковым лицом, прической и одеждой на разных изображениях вместо того, чтобы каждый раз придумывать нового человека. В этом и разница: по запросу «рыжеволосая женщина в кафе» модель может каждый раз выдавать незнакомку, а может — именно вашу героиню, ту самую, с первого кадра вашего комикса, рекламной кампании или раскадровки.

Если коротко, рабочих методов всего два, и их можно комбинировать. Первый — загрузить референсные изображения вашего персонажа. Это тот же механизм, на котором работает ИИ-замена лиц у нас на платформе. Nano Banana 2 принимает до 4 референсов персонажа, Nano Banana Pro — до 5, а Veo 3.1 переносит до 3 референсов в видео. Второй метод — составить текстовое описание (character sheet), то есть подробный фиксированный промпт, который вы будете добавлять при каждой генерации. На BananaBanana создание стабильного персонажа стоит от $0.06 за 1K изображений на Nano Banana 2. Все примеры в этой статье сгенерированы на нашей платформе, так что промпты отсюда можно брать и копировать без изменений.

Будем честны с самого начала: идеальных результатов ждать не стоит. Современные модели справляются со стабильностью хорошо, но не безупречно. Дальше вы сами увидите, в каких моментах они могут ошибаться.

Почему один и тот же персонаж каждый раз выглядит иначе?

У генераторов картинок нет памяти: они не помнят предыдущие запросы. Каждый запуск начинается с чистого шума, и ваш промпт — единственный ориентир для нейросети. Если написать в запросе «молодая женщина с рыжими волосами», модель просто выберет одну из миллионов подходящих под описание женщин, которых она умеет рисовать. Запустите генерацию пять раз — получите пять разных лиц. У них может быть похожая атмосфера, но лица будут отличаться.

Этот эффект называют искажением персонажа (character drift), и размытые промпты только усугубляют ситуацию. Фразы в духе «та же женщина, что и раньше» бесполезны — никакого «раньше» для нейросети не существует. Модель не видит прошлую картинку, если вы сами её не прикрепите.

Искажения появляются даже в рамках одного рабочего процесса. Стоит сменить ракурс камеры — и линия челюсти поплывет. Поменяете одежду — и внезапно исчезнут веснушки. По моему опыту, сильнее всего страдают те детали, по которым мы узнаем людей: форма глаз, нос, линия роста волос. Задний план и одежда переносятся отлично, а вот лица начинают «гулять».

Так что вся задача сводится к тому, чтобы при каждом запросе напоминать модели образ персонажа — либо пикселями (через референсы), либо текстом (через закрепленное описание). А лучше и тем, и другим сразу.

Ряд портретов, сгенерированных ИИ, на которых один и тот же персонаж постепенно превращается в другого человека, иллюстрируя искажение персонажа при генерации

Сколько референсных изображений принимает каждая модель?

Использование референсов — более надежный метод: вы загружаете изображения героя, и нейросеть берет их за основу. Согласно документации Google Gemini API, лимиты у моделей сильно различаются, и эти нюансы стоит изучить заранее.

МодельРеференсы персонажаРеференсы объектовРеференсы стиляЦена за 1K изображений
Nano Banana 2 Liteнетдо 14нет$0.03
Nano Banana 2до 4до 10до 3$0.06
Nano Banana Proдо 5до 6нет$0.11

Самый неожиданный участник этой таблицы — Lite. Модель принимает больше всего референсов (14), но в документации прямо сказано, что это референсы объектов, а не персонажей. Мы проверили это на практике: Lite с удовольствием берет лицо на вход, но обрабатывает его как фото товара — пытается скопировать куртку, полностью теряя индивидуальность человека. Если ваша работа завязана на персонажах, Lite вам не подойдет, какая бы выгодная цена там ни была. (Для любых других задач это отличная бюджетная модель, о чем мы рассказали в отдельном руководстве о том, когда достаточно Lite.)

Выбирая между оставшимися двумя вариантами, я бы начал с Nano Banana 2 за $0.06. Пятый слот для персонажа и более жесткая фиксация внешности в Nano Banana Pro пригодятся для сцен с несколькими героями или финальных артов. Цена в $0.11 за генерацию — вполне адекватная доплата, если готовое изображение идет в дело.

Ракурс загружаемых картинок важнее их количества. Три референса с одного ракурса научат модель рисовать лицо только под этим углом. А вот фото анфас, профиль и три четверти дадут нейросети полное представление о форме головы.

Подборка референсных фотографий персонажа с разных ракурсов, загружаемая в модель ИИ и показывающая, как референсы помогают сохранять стабильный образ

Что такое метод текстового описания (character sheet)?

Character sheet — это фиксированное текстовое описание, которое вы дословно копируете в каждый свой промпт. Этот метод выручает, когда у вас еще нет готовых референсов, и именно с его помощью создаются первые опорные изображения. К тому же он отлично подходит для работы через ИИ-агентов: например, когда вы генерируете изображения в Claude Code через наш MCP-сервер, описание персонажа передается прямо в тексте запроса без необходимости загружать файлы.

Главное правило: описывайте героя так, словно составляете фоторобот для полиции. Укажите возраст, телосложение, тип кожи, цвет и длину волос, цвет глаз, особые приметы и одну-две ключевые детали гардероба. Абстрактные прилагательные размывают образ, а вот конкретные существительные удерживают его на месте.

Вот описание, которое использовалось для примеров ниже:

a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt

Оба кадра ниже сгенерированы в Nano Banana Pro по этому описанию. Менялся только контекст сцены вокруг него. Референсы не использовались — это чистая стабильность за счет текста:

Пример стабильного ИИ-персонажа: рыжеволосая женщина в горчичной вельветовой куртке читает у окна в кафе, сгенерировано в Nano Banana Pro

Тот же ИИ-персонаж, рыжеволосая женщина в горчичной вельветовой куртке, на крыше в лучах закатного солнца, демонстрирующий генерацию стабильного персонажа в Nano Banana Pro

Один и тот же человек? Очень близко. Лицо получилось похожим, куртка и сережка на месте, веснушки пережили обе генерации. Если вглядываться в пиксели, можно заметить, что длина волос слегка отличается. Это предел возможностей текстового метода, поэтому профессионалы совмещают оба подхода: сначала генерируют лучший портрет по текстовому описанию, а затем используют эту картинку как референс для последующих кадров. Текст задает характерные черты, а пиксели их фиксируют.

Еще два практических совета. Яркие детали (вроде сережки или куртки) отлично помогают удерживать образ и не тратят много токенов — добавьте хотя бы одну такую вещь каждому персонажу. Кроме того, старайтесь укладывать описание в 60 слов, иначе модель начнет путаться, пытаясь совместить детали внешности и контекст сцены.

Сцены с несколькими персонажами и ИИ-раскадровки

Разместить двух стабильных персонажей на одном кадре — задача посложнее простых трюков. Совмещенное текстовое описание для обоих героев часто приводит к смешению деталей: персонаж А может получить прическу персонажа Б, а Б — куртку от А. Наверное, это можно решить кучей повторных генераций, но каждая попытка стоит денег.

Использование референсов решает эту проблему. Согласно документации Google, Nano Banana 2 поддерживает до 4 референсов персонажей, а Nano Banana Pro — до 5. Эти слоты можно распределить между разными людьми. Загрузите по два-три снимка для каждого героя, а затем опишите сцену, обозначая их роли (например, «рыжеволосая женщина передает кофе седобородому мужчине»). Образы закрепятся за нужными персонажами гораздо надежнее, хотя передача предметов из рук в руки даже в 2026 году остается лотереей.

Раскадровки — логичный следующий шаг, и делать их можно двумя путями. По кадрам: одна генерация на каждую панель с подключением референсов персонажа. На Nano Banana 2 это обойдется в $0.06 за кадр, то есть раскадровка из шести панелей будет стоить $0.36. Второй вариант — сгенерировать все в один заход: попросить Nano Banana Pro сделать многопанельный макет в одной картинке. Изображение ниже создано именно так за один запрос стоимостью $0.11 с использованием того же текстового описания:

Четырехпанельная ИИ-раскадровка, созданная за один запрос в Nano Banana Pro: образ рыжеволосой героини стабилен на всех панелях (пробуждение, поездка на велосипеде, презентация и отдых на крыше)

Сохранять стабильность в пределах одного изображения можно практически бесплатно, так как модель рисует все панели за один проход и «видит» собственную работу. Минус тут в разрешении: каждый кадр занимает лишь четверть холста. Для черновых презентаций и аниматиков этого вполне достаточно. Но если кадры планируется использовать отдельно, лучше генерировать их по одному и заплатить те самые $0.36.

Можно ли перенести персонажа в видео?

Да, и на этом этапе рабочий процесс становится по-настоящему увлекательным. Veo 3.1 поддерживает функцию, которую в документации Google Vertex AI называют референсными изображениями ассетов (asset reference images). Вы можете загрузить до 3 фотографий человека, персонажа или продукта, и модель сохранит их облик в видеоролике. В нашем генераторе это раздел Subject Reference. Gemini Omni Flash, который всегда генерируется со звуком, более щедр: до 10 референсных изображений на клип, и их можно комбинировать со стартовым кадром ($0.10 за секунду, полный обзор Omni здесь).

Текстовое описание тоже отлично помогает при создании видео. Ролик ниже сгенерирован в Veo 3.1 Fast исключительно по тексту — использовалось то же описание героини плюс указания по движению и работе камеры:

Промпт состоял из описания персонажа (character sheet) и добавленной в конец фразы: "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field." Получился шестисекундный ролик без звука в разрешении 720p за $0.52. Героиня вполне узнаваема и совпадает со статичными кадрами, что для чисто текстового переноса образа между двумя разными моделями — результат даже лучше, чем я ожидал.

Небольшое замечание из логов генерации: использование референсов ассетов порой сглаживает мимику. Лицо сохраняет сходство, но может выглядеть слегка «восковым», особенно на общих планах, где оно занимает мало места в кадре. Крупные планы получаются удачнее. Если на готовом видео у героя получился «стеклянный» взгляд, лучше сделать ракурс покрупнее, чем генерировать ту же сцену заново.

Полный рабочий процесс выглядит так: текстовое описание (character sheet) → эталонные портреты в Nano Banana Pro → эти кадры как референсы персонажа для статичных картинок и референсы ассетов для видео. Один образ, один конвейер, генерация картинок от $0.06, а видео — от $0.10 на странице с тарифами.

FAQ

Какая модель ИИ лучше всего подходит для генерации стабильных персонажей?

Если судить по характеристикам, то Nano Banana Pro: она поддерживает до 5 референсных изображений и обеспечивает самую жесткую фиксацию внешности в линейке при цене $0.11 за картинку в разрешении 1K или 2K. Nano Banana 2 — отличный сбалансированный вариант за $0.06 с 4 слотами для персонажей и поддержкой референсов стиля, которых нет в Pro. Nano Banana 2 Lite для этих задач использовать не стоит — она вообще не поддерживает референсы персонажей.

Как сохранить одно лицо на картинках ИИ без использования референсных фотографий?

Составьте текстовое описание (character sheet): фиксированный текст на 40–60 слов с указанием возраста, прически, цвета глаз, типа кожи, особых примет и одной ключевой детали гардероба. Добавляйте его без изменений в каждый промпт. Затем возьмите самый удачный результат и используйте его как референс. Один только текст дает примерное сходство, а сочетание текста и картинок закрепит результат.

Можно ли использовать фотографию реального человека в качестве референса персонажа?

Технически API принимает любые фотографии. Но с этической и юридической точек зрения стоит использовать только те снимки, на которые у вас есть права и согласие человека. Генерация узнаваемых лиц реальных людей без их разрешения нарушает правила большинства платформ, включая нашу.

Сколько референсных изображений нужно загружать?

Небольшое количество разнообразных ракурсов работает лучше, чем множество похожих кадров. Три снимка (анфас, профиль и три четверти) обычно дают лучший результат, чем пять почти одинаковых селфи. Жесткие ограничения: до 4 изображений персонажа на Nano Banana 2, до 5 на Nano Banana Pro и до 3 на видео в Veo 3.1.

Работает ли стабильность образа для нечеловеческих персонажей?

В большинстве случаев — да. Талисманы (маскоты), роботы и стилизованные животные часто получаются даже более стабильными, чем люди. Их образ держится на простых ярких формах и цветах, а не на тонких пропорциях лица. Подходы те же: закрепите характерные черты в текстовом описании, а когда появится эталонный дизайн — используйте его как референс.

tutorialimagesvideo