返回博客
BananaBanana Teamtutorialmcpclaude

在 Claude Code 中生成图像:2 分钟搞定 MCP 配置

无需本地安装或 Google API Key,通过 BananaBanana 的远程 MCP 服务器在 Claude Code 或 Claude Desktop 中轻松生成图像,单张低至 $0.03。最真实的配置指南与费用分析。

在 Claude Code 中生成图像:2 分钟搞定 MCP 配置

图像生成 MCP 服务器是让 Claude 具备“画画”能力的关键拼图:Claude 负责撰写提示词并调用 generate_image 工具,服务器负责在真实模型(在我们的案例中是 Google 的 Nano Banana 系列模型)上渲染并返回图片 URL。Claude 本身并不会画画——Anthropic 至今未发布过任何图像生成模型,因此尽管 Claude Code 和 Claude Desktop 能够非常完美地识别图像,却无法直接生成图像。

如果你只是想快速找到解决方案,可以直接按照这一步操作:在你的 BananaBanana 个人中心创建一个 API Key,然后在终端运行以下命令:

claude mcp add --transport http bananabanana https://bananabanana.pro/api/mcp \
  --header "Authorization: Bearer bb_live_YOUR_KEY"

这就是全部安装流程。不需要部署本地服务器,也不需要 Google Cloud 账号,更没有任何订阅费。费用从预充值余额中扣除,图像单张 $0.03 起,视频单个 $0.10 起。为了让这篇指南更具说服力,我们说句大实话:本文中的所有配图和插画,都是 Claude Code 在撰写本文的过程中,通过我们这个 MCP 服务器直接生成的。全部媒体制作费用一共是 $1.29(包含一次重新生成),账单明细见文章末尾。

为什么 Claude 无法自行生成图像?

Anthropic 专注于构建文本 and 推理模型。它的视觉能力是单向的:Claude 可以识别分析你的屏幕截图和照片,但其模型家族中完全没有图像生成功能,目前也未曾公布过相关计划。ChatGPT 内置了图像模型,但 Claude 没有。

对此,开源社区给出的方案是本地 MCP 服务器——GitHub 上有一大堆这类项目,而且确实管用。但这里的“安装”意味着:你得在本地运行进程、配置 Node 或 Python 环境、在每台机器的配置文件中手动关联服务器。最关键的一点是,你必须提供自己的 Google API Key,所有费用都记在你的 Google 账户下,你还得自己管理配额和控制台。如果是一个开发者在自己电脑上折腾着玩,那无所谓。但对其他人来说,这无异于搞了一个小型基础设施项目。

而远程 MCP 服务器则彻底改变了这种局面。服务器已经在我们这边运行,后台架构与支持 BananaBanana 生成器 的完全一致。你只需用一个 API Key 进行身份验证,从余额中按次付费。无论是在笔记本上的 Claude Code、同事电脑上的 Claude Desktop,还是浏览器中的 claude.ai,配置方法完全相同,真正做到了免维护。

配图:一个作家机器人将便签递给画架前的画家机器人,隐喻 Claude 将图像生成工作委托给 MCP 服务器

如何将 Claude Code 连接到图像生成 MCP 服务器?

仅需 2 分钟、3 个步骤。首先,注册并打开 Profile(个人中心) → MCP API Keys。创建 API Key:它只会显示一次,以 bb_live_ 开头,我们在后台以哈希加密形式存储,所以请立即复制保存。新账户自带 $0.20 的初始体验余额,足够你在决定是否充值前,使用最便宜的模型生成 3 张测试图片。

Claude Code

运行前面提到过的那条命令即可:

claude mcp add --transport http bananabanana https://bananabanana.pro/api/mcp \
  --header "Authorization: Bearer bb_live_YOUR_KEY"

这些命令行参数可以在 Claude Code MCP 文档 中找到;对于远程服务器,官方推荐使用 HTTP 传输协议。在会话中运行 /mcp 即可确认连接是否处于活动状态:你应该能看到 7 个工具(从 list_modelsget_result)。从这一刻起,“为这篇帖子生成一张 16:9 的首图”就变成了一条 Claude Code 真正能够执行的指令。

Claude Desktop 与 claude.ai

在 Claude Desktop 或 claude.ai 中,操作路径为 Settings(设置) → Connectors(连接器) → Add custom connector(添加自定义连接器),然后将 https://bananabanana.pro/api/mcp 粘贴为服务器 URL。对于 API Key,请展开 Request headers(请求头)部分,添加一个 Authorization 头,其值为 Bearer bb_live_YOUR_KEY。请务必输入完整的值(包括 “Bearer” 单词和空格)。根据 Anthropic 的连接器文档,Claude 会原封不动地发送该请求头,不会自行添加任何前缀。

说个实在的温馨提示:连接器中的请求头验证(Request-header auth)目前仍处于 Beta 阶段,Anthropic 正在逐步推广,因此你的账户现在可能还没有显示该选项。不过,你也可以采用在任何运行 Claude Desktop 的环境都适用的备用方案:通过 claude_desktop_config.json(路径为 Settings → Developer → Edit Config)中的 mcp-remote 桥接器来添加服务器,这需要你的系统已安装 Node.js:

{
  "mcpServers": {
    "bananabanana": {
      "command": "npx",
      "args": [
        "-y", "mcp-remote", "https://bananabanana.pro/api/mcp",
        "--header", "Authorization: Bearer bb_live_YOUR_KEY"
      ]
    }
  }
}

这两种方法,以及针对其他客户端的原始 JSON-RPC 配置示例,都可以在 MCP 服务器页面 找到:

BananaBanana MCP 文档页面的快速上手部分,展示了 Claude Code 和 Claude Desktop 的配置代码片段

它能在 Claude 之外的客户端上使用吗?

当然可以。MCP 是一种开放协议,因此任何支持 Streamable HTTP 且能够添加 Authorization 请求头的客户端都可以连接到同一个端点:例如 Gemini CLI、Z.ai 的 ZCode、各种编辑器智能体。另外,由于 Codex 已经支持远程 MCP,因此你也可以通过同一个 config.toml 配置项(根据 Codex MCP 文档,即 url 加上 bearer_token_env_var),在 ChatGPT 桌面端应用、Codex CLI 和 IDE 插件中进行连接。xAI API 则允许通过 server_url 在每次请求中挂载 MCP 服务器。唯一落后的是那些基于 OAuth 构建、不支持直接粘贴 API Key 的 Web 网页端对话框——比如 ChatGPT 的网页版连接器,以及 grok.com 基于 URL 的自定义连接器。我们会在 MCP 服务器页面 上持续更新各个客户端的完整配置表格及代码片段;本文仍将重点放在 Claude 上。

场景一:为你正在撰写的文章生成首图

这是最日常的使用场景。你正在用 Claude Code 起草一篇博客文章,需要一张页眉首图。你只需对它说:“帮我生成一张 16:9 的社论风格首图,主题是数据库缓存,使用图书馆作为隐喻。” 接着,Claude 会自动构建提示词并进行调用:

→ generate_image {"prompt": "Editorial illustration for a developer blog post
   about database caching: a small librarian robot placing three glowing books
   onto a tiny fast bookshelf in the foreground, a huge dim archive hall
   stretching far behind it, soft pastel background, dark ink details, accents
   of violet and warm amber, clean minimal composition, generous negative
   space, no text", "model": "nano-banana-pro", "aspect_ratio": "16:9"}
← {"job_id": "cmxq…", "status": "processing", "cost_charged_usd": 0.11,
   "balance_remaining_usd": 4.89}
→ get_result {"job_id": "cmxq…"}
← {"status": "completed", "files": [{"url": "https://bananabanana.pro/api/files/…"}]}

以下就是该提示词直接生成的图片,一次成功,未经过任何重新生成:

AI 生成的首图:一个图书管理员机器人将闪烁的书籍放到小书架上,背景是宏伟的档案馆,由 Claude Code 通过 MCP 生成

费用:使用 Nano Banana Pro 模型生成 1K 分辨率图片,花费仅 $0.11。智能体(Agent)会自动从签名 URL 下载文件并放入代码仓库,然后撰写好图片的 alt 替代文本。下载链接的有效期为 24 小时;过期后,可以通过 get_result 重新获取新的有效链接。

场景二:省去摄影师,直接制作产品实拍图

在制作营销样机图时,摄影风格的提示词能发挥极大的威力。你可以像给摄影师写拍摄简报一样来描述画面:拍摄主体、垫板表面、光源、镜头。

→ generate_image {"prompt": "A photorealistic product photo of a matte
   sage-green ceramic pour-over coffee set on a pale linen tablecloth, soft
   diffused daylight from a window on the left, gentle shadows, shallow depth
   of field, eye-level shot with a 50mm lens, minimal warm styling, no text",
   "model": "nano-banana-pro", "aspect_ratio": "1:1"}

写实风格 AI 产品图:柔和窗光照射在亚麻桌布上的鼠尾草绿陶瓷手冲咖啡套装,通过 MCP 服务器生成

说句大实话:这张照片我们生成了两次。第一张图打眼一看挺好,但仔细观察就会发现杯子和托盘融在了一起,变成了一个盖子一样的怪异形状——物体的几何结构正是写实类 AI 模型目前最容易翻车的地方,所以在发布产品图之前,务必要放大仔细检查。使用相同的提示词重新生成一次后,问题迎刃而解:两次一共花费了 $0.22,而不是 $0.11。不过,我最喜欢的并不是这张图本身,而是接下来的操作:你可以调用 edit_image 工具,传入已完成图片的 job_id 以及诸如“将背景改为纯白并添加柔和阴影”的指令。无需重新描述整个场景即可进行多轮微调,且每次修改仅按单张图片计费。对于制作商品目录等工作来说,这种闭环流程式的操作正是“专业工具”与“玩具”之间的本质区别。

场景三:在多张图片中保持角色一致性

品牌吉祥物、漫画分镜、故事板等都要求在不同画面中保持角色形象的一致。通过 MCP,我们的工作方法是制作一个“角色卡(Character sheet)”:即让智能体在每次调用提示词时,都粘贴一段固定的角色描述。在这篇文章里,我们的角色卡是:“一个小型快递机器人,拥有圆形的哑光青色头部、一只友好的黄色大眼睛、乳白色的箱形身体(隐约可见黄铜螺丝),以及一个带有黄铜扣的帆布邮差包。” 以下展示两个不同场景,调用了两次,每次花费 $0.11:

AI 生成的快递机器人,拥有青色头部和帆布邮差包,正在阳光明媚的仓库分拣包裹,这是保持角色一致性系列的第一张图

相同的 AI 快递机器人角色,在黄昏下骑着货运自行车穿过下雨的街道,这是该系列的第二张图

关于生成效果,我不说虚的:整体算是不错,但并不完美。邮差包、黄色的眼睛、乳白色且带有螺丝的机身都很好地延续了下来,但机器人的头部形状从纯圆形变成偏向头盔的形状,而且黄昏那张图的画风也变得有些偏向美式插画风。这就是仅靠文本锚定的局限性。而使用参考图可以完美解决这个问题,我们的 网页版生成器 在 Nano Banana Pro 模型下最多支持上传 5 张角色参考图,但目前 MCP 的 generate_image 工具还不支持输入图片。我们的 角色一致性实用指南 详细介绍了这两种方法,并列出了哪些特征最容易发生偏差。

场景四:在同一个对话中生成视频片段

视频生成同样通过这台服务器运行,但我们增加了一项额外安全防护。视频片段的制作成本要高于静态图片(顶级 Veo 3.1 渲染最高可达 $4.40),因此调用 generate_video 时绝不会在第一次请求就直接扣费。它会先返回一个报价,智能体需要再次发起调用并明确接受该金额才能开始制作:

→ generate_video {"prompt": "Aerial drone shot rising slowly over terraced tea
   fields at sunrise, thin mist drifting in the valleys, golden light catching
   the ridges, smooth cinematic camera motion, wide shot",
   "model": "veo-3.1-fast", "duration": 6, "resolution": "720p"}
← {"status": "confirmation_required", "quoted_cost_usd": 0.52, …}
→ generate_video {…same arguments…, "confirm_cost": 0.52}
← {"job_id": "cmxr…", "status": "processing", "cost_charged_usd": 0.52}

以下就是由 Veo 3.1 Fast 生成的 6 秒无声 720p 视频,一次成功:

视频生成通常需要 1 到 10 分钟,因此智能体可以在继续处理其他工作的同时轮询 get_result。如果你需要声音,可以通过同一个工具调用 Omni Flash 模型,费用为每秒 $0.10,音频始终开启,你可以设置时长——从 3 到 10 秒不等。它也支持图像作为输入:你可以传入已生成图像的 job_id(或一个公开链接)作为首帧,并添加最多十张参考图像以保持角色一致性,然后智能体便能对其进行动画制作。但末尾帧和循环视频仍需要使用网页版生成器。

本文中的所有图片均通过此工作流生成

如果换做我是读者,我肯定也想要看到证据,所以这里还原一下具体的操作闭环:Claude Code 撰写了本文的一部分,根据我们的整体品牌风格构思了一个插画提示词,调用了生成工具,等待了大约二十几秒,检查返回的图片,然后在继续写作之前插入带有 alt 描述的 Markdown 代码。对于你在这里看到的全部媒体素材,我们一共进行了 8 次调用:6 张图像和 1 个视频是一次成功,而咖啡器具那张图则在仔细检查时发现杯碟融合,因此重新生成了一次。在 8 次调用中仅重新制作了 1 次,这已经超出了我的预期。唯一一个不是由 AI 生成的素材是文档页面的屏幕截图,它是通过浏览器工具截取的。

这些生成的图片谈不上完美(正如前面提到的,快递机器人的头部很有“它自己的想法”)。但关键在于,“插图配图”不再是一个独立的生产环节。写文章的同一个对话,顺手就把配图也给做好了,而这所有的花费加起来,大概也就相当于一张公交车票钱。

本文媒体素材的实际花费是多少?

以下所有费用均按照我们 定价页面 上的标准单次生成价格计费,这些价格与 list_models 向智能体报告的完全一致。绝无任何员工内部折扣。

素材名称使用模型实际价格
封面图 (Cover image)Nano Banana Pro, 1K$0.11
作家与画家插图 (Writer-and-painter illustration)Nano Banana Pro, 1K$0.11
缓存指南首图 (Caching-guide hero, 场景一)Nano Banana Pro, 1K$0.11
咖啡器具样机,生成 2 次含 1 次重做 (Coffee set mockup, 场景二)Nano Banana Pro, 1K$0.22
快递机器人系列,共 2 张图 (Courier robot series, 场景三)Nano Banana Pro, 1K$0.22
茶园视频片段,6秒无声 720p (Tea fields clip, 场景四)Veo 3.1 Fast$0.52
文档截图 (Docs screenshot)浏览器截图,非生成$0.00
总计 (Total)$1.29

由于这些图片要在公开网页上展示,所以我们全程使用了顶级的图像模型。如果退而求其次,在起草阶段使用单次仅需 $0.03 的 Nano Banana 2 Lite 模型,那么图像部分的账单费用将从 $0.77 骤降至 $0.21;我们的 Lite 版指南 详细介绍了在什么情况下这种高性价比的模型就足够满足需求。

准备好亲自尝试了吗?立即 连接 BananaBanana MCP 服务器 并让 Claude 为你生成第一张图片吧。

常见问题 (FAQ)

BananaBanana MCP 服务器能与 Claude 以外的其他客户端配合工作吗?

可以,它支持任何兼容 Streamable HTTP 且允许附加 Authorization 请求头的 MCP 客户端:包括 Claude Code、Claude Desktop、Gemini CLI、用于 GLM-5.2 的 Z.ai ZCode、诸如 Cursor 或 VS Code 等编辑器智能体。通过 Codex 的远程 MCP 支持,它还能在 ChatGPT 桌面端应用、Codex CLI 和 IDE 插件中使用,它们共享一个包含 urlbearer_token_env_varconfig.toml 配置项。xAI API 则允许通过 server_url 在单次请求中挂载 MCP 服务器。目前尚不确定的是:ChatGPT 的网页版连接器目前是通过 OAuth 验证身份,而非直接粘贴 API Key;而 grok.com 的自定义连接器对话框中只接受 URL,没有提供明确的 API Key 输入框。因此,这两者后续可能都需要我们计划支持 of OAuth 2.1 验证规范。我们在 MCP 服务器页面 上维护了实时更新的各客户端配置方法表格;另外,如果你是自己开发工具,也已经可以直接通过 JSON-RPC 进行直连。

我需要准备 Google API Key 或 Google Cloud 账号吗?

完全不需要,而这也是我们打造这款服务器的主要原因。GitHub 上那些本地图像生成 MCP 服务器需要直接调用 Gemini API,因此它们必须使用你自己的 Google AI Studio API Key,这意味着你必须自己管理配额和账单。但在我们这里,生成任务运行在 BananaBanana 托管的 Vertex AI 密钥池中,你唯一需要用到的凭证就是你个人中心里的 bb_live_ 密钥。你完全不需要接触 Google 控制台,Google 也绝对不会向你收费。这也是一个公平透明的权衡:你虽然无法直接享受到 Google 的原始 API 批发价和底层的参数控制权,但换来的是无需最低消费的按次付费、自动化的密钥轮换,以及可在 MCP 服务器、网页版生成器和 Telegram 应用之间共用的统一余额。如果你的密钥不小心泄露了,只需一键注销并重新生成即可,不会对其他任何服务产生影响。

MCP 服务器是如何计费的?

我们采用预充值余额按次扣费的模式,没有任何订阅费。你充值余额后,每次生成都会从余额中扣除对应的单价:图像生成单次在 $0.03 到 $0.20 之间(具体取决于选用的模型和分辨率);视频单次在 $0.10 到 $4.40 之间(取决于模型、时长、分辨率以及是否有声音)。智能体会提前预知所有价格:list_models 会返回实时价格,且每次调用视频生成(以及任何多图批量生成)都必须先获取报价,并在实际扣款前通过 confirm_cost 予以确认。每次调用返回的结果中都会报告 cost_charged_usd(本次产生费用)和 balance_remaining_usd(当前剩余余额),因此费用明细是直接呈现在对话日志中的。如果生成失败,费用将自动退回。如果你担心智能体在后台“刷单”跑飞,可以在 Profile → MCP API Keys 中为每个密钥设置每日消费限额(USD Cap),并随时审计详细的密钥使用日志(记录了调用的工具、模型、花费及提示词预览)。

如果在执行任务的过程中余额归零了,会发生什么?

下一个收费的工具调用会报错,抛出包含充值链接的 INSUFFICIENT_BALANCE 错误,智能体会将该信息原封不动地反馈给你。系统不会允许账户余额透支出现负数,绝对没有自动扣款或意外账单。所有免费工具(list_modelsget_accountget_resultlist_generations)仍会继续保持工作,因此已经生成的素材依然可以正常下载访问,且在余额耗尽前就已经开始渲染的任务也会正常完成(因为扣费只在任务开始时一次性收取)。在实际操作中,Claude 只会向你报告调用失败并附带充值链接,然后继续处理任务中的其他免付费部分。为了防患于未然,你可以关注每次结果返回的 balance_remaining_usd,或者让智能体在执行大批量任务前调用 get_account 检查一下账户余额。

内容过滤器会拦截什么?被拦截的提示词会扣费吗?

上游的 Google 模型会应用其自身的安全过滤机制。当生成请求被拒时,我们的服务器会统一返回 SAFETY_FILTERED 状态码,而不是返回 Google 内部各种细分的拦截原因。拦截的类别完全符合 Gemini 和 Veo 的标准规范:如涉及未成年人的色情内容、露骨暴力、真人深度伪造(Deepfakes)等。此外,过滤器偶尔也会对一些完全无辜的提示词产生误报,这是上游大厂的设定,我们也不用避讳。计费原则非常简单:被完全过滤的生成任务会自动全额退款;对于视频生成,由于 Google 有时仅过滤输出的部分帧,退款将按比例计算。总之,你只需为你实际接收到的媒体内容付费。如果你的提示词频繁触发拦截,建议修改其中可能引起歧义的词汇细节,而不是机械性地反复提交相同文本。

我通过 MCP 服务器生成的图像所有权归谁?

归你所有。根据我们的 条款,生成的图像和视频版权完全属于你,你可自由用于个人和商业用途(具体需遵守底层模型提供商的相关条款)。我们不会对你生成的任何内容主张所有权,你提交的提示词同样完全归你所有。在实际使用中有两点存储细节需要特别注意:首先,get_result 返回的 URL 是有效期为 24 小时的签名链接,所以请及时下载你需要长期保存的素材,或者通过再次调用 get_result 刷新获取新的下载链接。其次,生成的媒体文件会在服务器端保留 30 天,之后会被永久删除——我们的 MCP 服务器只是一个生成管道,而不是一个永久性的存储档案馆。此外,通过 MCP 生成的所有内容也会同步显示在网页版账户的生成历史记录中,你可以在 30 天的保留期内直接登录网站进行浏览和重新下载。

tutorialmcpclaude