返回博客
BananaBanana Teamtutorialimagesvideo

AI 绘图角色一致性:实用指南

在图像和视频中保持相同 AI 角色:Nano Banana 2 与 Pro 的参考图限制、角色卡方法、故事板以及 Veo 3.1 视频生成指南。

AI 绘图角色一致性:实用指南

角色一致性图像生成(Character Consistent Image Generation)是一套让 AI 模型在多张不同的图像中绘制同一个角色的技术。它能保证角色拥有相同的面部、发型和衣着,而不是每次生成都凭空创造一个全新的人。它的妙处在于,当输入“咖啡馆里的红发女子”时,你得到的不是每次都完全不同的陌生面孔,而是你专属的红发女子——那个出现在你的漫画第一格、你的广告宣传片或故事板中的角色。

简而言之:目前有两种行之有效的方法,而且它们可以叠加使用。第一种是上传角色的参考图——这也是平台内 AI 换脸功能所采用的参考机制。Nano Banana 2 最多支持 4 张角色参考图,Nano Banana Pro 最多支持 5 张,而 Veo 3.1 则可将最多 3 张参考图带入视频生成中。第二种是编写角色设定提示词(character sheet prompt),即在每次生成时都粘贴一段详尽且固定不变的描述。在 BananaBanana 上,使用 Nano Banana 2 生成一致性角色的成本低至每 1K 张图像 $0.06。本文中的所有示例均在平台上生成,因此这里的提示词可以直接复制使用。

在开始之前,我也必须诚实地说明一些失败情况。目前模型的角色一致性虽然表现不错,但并非完美无缺。你会在后文中看到它偶尔失效的地方。

为什么同一个角色每次看起来都不同?

图像模型在不同请求之间是没有记忆的。每一次生成都是从噪点开始,而你的提示词是唯一的桥梁。如果提示词只写着“红头发的年轻女子”,模型就会从它能绘制的数百万个红发女子中随机抽取一个。运行五次,你就会得到五个不同的人。她们也许气质相似,但绝对不会是同一张脸。

这被称为“角色漂移”(character drift),在提示词模糊时尤为严重。写“和之前一样的女人”是没有任何作用的,因为对模型来说根本没有“之前”。除非你明确附上上一张图片,否则模型从未见过它。

漂移也会悄悄侵入单个工作流中。改变摄像机角度,下巴线条就会发生变化;更换服装,脸上的雀斑可能突然就消失了。根据我的经验,最容易变形的特征恰恰是人类用来识别人的关键部分:眼睛形状、鼻子和发际线。背景和衣服通常能完好保留,但面部细节却很容易跑偏。

因此,这里的核心就在于在每一次请求中,都要将角色身份重新输入给模型——要么通过像素(参考图),要么通过文本(固定的描述),最好两者兼具。

一排 AI 生成的肖像,同一个角色逐渐演变成另一个人,展示了 AI 绘图中的角色漂移现象

每个模型支持多少张参考图?

参考图是这两种方法中更强大的一种:你上传角色的照片,模型会将其视为标准答案(ground truth)。根据 Google Gemini API 图像文档,不同模型的限制差异很大,在选择模型之前非常值得了解这些差异。

模型角色参考图物体参考图风格参考图每 1K 张图像价格
Nano Banana 2 Lite最多 14 张$0.03
Nano Banana 2最多 4 张最多 10 张最多 3 张$0.06
Nano Banana Pro最多 5 张最多 6 张$0.11

表格中最让人意外的是 Lite。它支持的参考图总数最多(14张),但文档中明确指出这些仅是物体参考,并不支持角色一致性。我们是通过实践得出这一结论的:Lite 会欣然接受一张人脸输入,然后把它当成产品照处理,不仅配对好了夹克,却把人脸给弄丢了。如果你的工作流是以角色为核心,那么无论价格多便宜,Lite 都不适用。(对于其他用途,它确实是一个性价比极高的机型;我们专门写了一篇关于何时 Lite 就足够用的独立指南。)

在另外两个模型之间:我会建议从价格为 $0.06 的 Nano Banana 2 开始。Pro 拥有的第五个角色槽位和更强的身份锁定能力,对于多角色场景和最终成片输出非常重要。而且在实际商用交付时,每张图像 $0.11 的价格并不算贵。

上传图片的角度比数量更重要。从同一个角度上传三张参考图,模型只能学会这一个角度。而一张正面照、一张侧面照和一张四分之三侧面照,就能让模型掌握整个头部特征。

一叠不同角度的角色参考照片输入至 AI 图像模型,展示参考图如何引导生成一致性角色

什么是角色设定表方法?

角色设定表(Character Sheet)是一段详尽描述角色的固定文本,你需要逐字将它粘贴到每一个提示词中。在还没有参考照片时,它是唯一的纯文本备用手段,同时也是你最初用来创建参考照片的方法。它同样适用于 AI 智能体(agent)的工作流:如果你通过我们的 MCP 服务端在 Claude Code 中生成图像,角色设定表会直接包含在提示词内部,无需上传任何图片。

规则是:像给警方模拟画像师描述那样去刻画角色。写明年龄、体型、皮肤、头发颜色与发型、眼睛颜色、特征性标记以及一两个标志性的配饰。模糊的形容词容易漂移,而具体的名词能稳定画面。

以下是下方示例所使用的完全相同的文本块:

a woman in her late 20s with shoulder-length copper-red wavy hair,
pale skin with faint freckles across the nose and cheekbones,
green eyes, a small silver hoop earring in her left ear,
wearing a mustard-yellow corduroy jacket over a white t-shirt

下方的两张图像都是使用 Nano Banana Pro 从这同一个文本块生成的。改变的只有角色周围的场景文本。在此过程中没有附加任何参考图,这属于纯粹由文本锚定的角色一致性:

AI 生成角色一致性示例:红发女子身穿芥末黄灯芯绒夹克在咖啡馆窗边看书,由 Nano Banana Pro 生成

同一个 AI 角色(身穿芥末黄灯芯绒夹克的红发女子)在黄金时段的屋顶上,展示由 Nano Banana Pro 实现的角色一致性生成效果

是同一个人吗?非常接近。面部特征保持得很好,夹克和耳环都被锁定了,而且在两个场景中雀斑都保留了下来。如果你去抠像素级别的细节,会发现头发长度有轻微变化。这就是纯文本一致性所能达到的真实上限,也是为什么专业工作流会结合使用这两种方法:先根据设定表生成效果最好的一张角色图,然后将那张图作为角色参考图喂回给模型,用于后续的所有生成。文本塑造身份,像素强化一致性。

在实际生产中运行此流程的两个小建议:标志性配饰(耳环、夹克)可以用极少的 Token 起到极其显著的识别作用,因此请为每个角色都设计一个。此外,建议将设定表控制在 60 个单词以内,因为超过这个长度,场景描述就会开始与角色设定争夺模型的注意力。

多角色场景与 AI 故事板

要在同一个画面中保持两个角色的各自一致性,投机取巧的方法就不灵了。如果将两个角色的设定合并到一段文本里,很容易发生特征交叉污染:角色 A 借用了角色 B 的发型,角色 B 却套上了角色 A 的夹克。这或许可以通过反复重试来解决,但重试是要花钱的。

参考图可以彻底解决这个问题。根据 Google 的文档,Nano Banana 2 最多可接收 4 张角色参考图,Nano Banana Pro 最多接收 5 张,这些槽位可以分给不同的人。为每个角色上传两到三张不同角度的照片,然后编写场景,通过角色身份指代他们(例如“红发女子递给灰胡子男子一杯咖啡”)。这样,身份就能更可靠地锁定在正确的人身上,尽管在 2026 年,两个人之间传递物体的双手依然像是在抽奖。

故事板是自然而然的下一步,主要有两种制作方式。第一种是单帧生成:每个画格生成一次,分别附加角色参考图。在 Nano Banana 2 上每个画格 $0.06,一个六格故事板的成本为 $0.36。第二种是单图生成:通过一次生成请求 Nano Banana Pro 输出多格布局。下方的画格就是这样制作的,仅需一次 $0.11 的请求,使用上面完全相同的角色设定表:

在单次 Nano Banana Pro 请求中生成的四格 AI 故事板,相同的红发角色在所有画格中保持高度一致:醒来、骑行、进行演示以及身处屋顶

在单张图像内保持一致性基本上是免费的,因为模型会一次性绘制所有画格,并能参考自己的绘制内容。代价则是分辨率:每个画格只占整张图片的四分之一。对于提案简报和动态分镜来说,这已经足够了。但如果要交付单独的高清画格,还是建议进行逐帧生成并支付那 $0.36 的费用。

能否将角色带入视频中?

可以,这正是整套流程开始变得有趣的地方。Veo 3.1 支持 Google Vertex AI 文档中所谓的“资产参考图”(asset reference images):提供最多 3 张人物、角色或产品的照片,模型即可在生成的视频片段中保留该主体的外观。在我们的生成器中,这就是“主体参考(Subject Reference)”部分。Gemini Omni Flash 总是自带声音,并且更为慷慨:它支持每段视频多达 10 张参考图像,并且可以与起始帧结合使用(每秒 $0.10,在此阅读 Omni 完整评测)。

在视频提示词中,角色设定表同样能发挥巨大作用。下方的视频片段由 Veo 3.1 Fast 纯文本生成,使用的是与上述图像完全相同的描述文本块,另外加上了动作和相机视角语言:

提示词:先写角色设定表,然后拼接 "walking toward the camera along a city street at golden hour, slow dolly back, medium shot, shallow depth of field"(在黄金时段沿着城市街道走向镜头,慢速拉远,中景,浅景深)。时长 6 秒,无声 720p,价格为 $0.52。她看起来明显与静态图是同一个角色,说实话,对于两个不同模型之间的纯文本交接,这种效果比我预期的还要好。

我们从生成日志中得出的一个注意事项:资产参考有时会使角色的表情变得扁平。面部虽然能匹配,但看起来略显僵硬(塑料感),尤其是在面部只占极少像素的远景中。特写镜头的效果会更好。如果生成的视频片段中主角眼神呆滞,建议改用更紧凑的构图重新生成,而不是在同一个镜头上反复重试。

所以,完整的工具链就是:角色设定表 → 在 Nano Banana Pro 上生成核心参考图 → 将这些图片作为后续静态图的角色参考图,以及作为视频的主体参考。同一个身份,同一条管线,价格页面上的图像低至 $0.06,视频片段低至 $0.10。

常见问题解答

哪款 AI 模型最适合进行角色一致性生成?

从参数上看是 Nano Banana Pro:支持最多 5 张角色参考图,并且在同系列模型中拥有最强的身份锁定能力,价格为每 1K 或 2K 张图像 $0.11。Nano Banana 2 是性价比之选,价格为 $0.06,拥有 4 个角色槽位并支持 Pro 所欠缺的风格参考。在此应用场景中,请避开 Nano Banana 2 Lite,因为它完全不支持角色参考。

在没有参考照片的情况下,如何保持 AI 图像中的人脸一致?

编写一份角色设定表:一段 40 到 60 个单词的固定描述,涵盖年龄、发型、眼睛、皮肤、特征性标记以及一个标志性配饰,并在每次编写提示词时原封不动地粘贴进去。然后将效果最好的一次输出作为后续的参考图。仅靠文本能让你大致接近目标,而“文本 + 图像参考”则能让你完美保持效果。

我可以使用真人的照片作为角色参考吗?

技术上来说,API 接受任何照片。但从法律和道德层面上看,请仅使用你拥有版权并获得当事人同意的照片。在未经同意的情况下生成具有辨识度的真人图像违反了大多数平台(包括我们)的服务条款。

我应该上传多少张参考图?

数量少但角度多样的图片,效果要优于大量雷同的图片。涵盖正面、侧面和四分之三侧面的三张照片,其效果通常优于五张近乎相同的自拍。硬性上限:Nano Banana 2 支持 4 张角色图像,Nano Banana Pro 支持 5 张,Veo 3.1 视频支持 3 张。

角色一致性是否适用于非人类角色?

绝大多数情况下是适用的。吉祥物、机器人和风格化的动物在一致性上的表现往往比人类更好,因为它们的身份特征存在于鲜明的形状和色彩中,而不是微妙的面部几何结构。使用的方法完全相同:在设定表中加入独特的固定特征,并在获得标准设计后使用参考图。

tutorialimagesvideo