Generar imágenes en Claude Code: MCP en 2 minutos
Generar imágenes en Claude Code o Claude Desktop con un servidor MCP remoto: sin instalación local ni clave API de Google, desde $0.03. Costos reales.

Un servidor MCP de generación de imágenes es la pieza que falta para que Claude cree imágenes: Claude escribe el prompt y llama a la herramienta generate_image, el servidor renderiza el resultado en un modelo real (la familia Nano Banana de Google en nuestro caso) y devuelve una URL. Claude por sí mismo no puede dibujar. Anthropic nunca ha lanzado un modelo de imagen, por lo que Claude Code y Claude Desktop leen imágenes perfectamente bien, pero no producen ninguna.
La respuesta rápida, si es a lo único que has venido: crea una clave API en tu perfil de BananaBanana y luego ejecuta un comando en tu terminal:
claude mcp add --transport http bananabanana https://bananabanana.pro/api/mcp \
--header "Authorization: Bearer bb_live_YOUR_KEY"
Esa es toda la instalación. Sin servidor local, sin cuenta de Google Cloud, sin suscripción. Las imágenes se facturan desde $0.03 por unidad de un saldo prepago, los videos desde $0.10. Y para mantener esta guía honesta: cada ilustración de este artículo fue generada por Claude Code a través de este servidor exacto mientras escribía el texto. La factura total de medios fue de $1.29, incluyendo un reintento, con los recibos al final.
¿Por qué Claude no puede generar imágenes por sí solo?
Anthropic crea modelos de texto y razonamiento. La visión va en un solo sentido: Claude puede analizar tus capturas de pantalla y fotos, pero no hay ningún generador de imágenes en toda la familia de modelos, y no se ha anunciado ninguno. ChatGPT incluye un modelo de imagen integrado. Claude no.
La respuesta de la comunidad han sido los servidores MCP locales; GitHub tiene un montón de ellos y funcionan. Pero ahí "instalación" significa: ejecutar tu propio proceso local, mantener Node o Python a la mano, configurar el servidor en un archivo de configuración en cada máquina y, el verdadero inconveniente, aportar tu propia clave API de Google. La facturación llega a tu cuenta de Google con sus propios límites y panel de control. Para un desarrollador que experimenta en su laptop, está bien. Para cualquier otra persona, es un pequeño proyecto de infraestructura.
Un servidor MCP remoto le da la vuelta a eso. El servidor ya se ejecuta de nuestro lado; el backend detrás de él es el mismo que alimenta al generador de BananaBanana. Te autenticas con una sola clave, pagas por generación desde un saldo prepago y la configuración es idéntica en Claude Code en una laptop, en Claude Desktop en la máquina de un colega y en claude.ai en el navegador. Realmente no hay nada que mantener.

¿Cómo conectar Claude Code a un servidor MCP de generación de imágenes?
Dos minutos, tres pasos. Primero, regístrate y abre Perfil → MCP API Keys. Crea una clave: se muestra solo una vez, comienza con bb_live_ y se almacena encriptada de nuestro lado, así que cópiala de inmediato. Las cuentas nuevas vienen con un saldo inicial de $0.20, suficiente para seis imágenes de prueba en el modelo más económico antes de decidir si quieres recargar.
Claude Code
Un comando, como se muestra arriba:
claude mcp add --transport http bananabanana https://bananabanana.pro/api/mcp \
--header "Authorization: Bearer bb_live_YOUR_KEY"
Las opciones están documentadas en las instrucciones de MCP de Claude Code; HTTP es el protocolo de transporte recomendado para servidores remotos. Ejecuta /mcp dentro de una sesión para confirmar que la conexión está activa: deberías ver siete herramientas, desde list_models hasta get_result. A partir de ese momento, "genera una imagen de portada de 16:9 para esta publicación" es una instrucción que Claude Code realmente puede llevar a cabo.
Claude Desktop y claude.ai
En Claude Desktop y claude.ai, la ruta es Settings → Connectors → Add custom connector, luego pega https://bananabanana.pro/api/mcp como la URL del servidor. Para la clave, abre la sección Request headers y añade un encabezado Authorization con el valor Bearer bb_live_YOUR_KEY. Introduce el valor completo incluyendo la palabra Bearer y el espacio; de acuerdo con las instrucciones de conectores de Anthropic, Claude envía el encabezado exactamente como se escribió y no añade ningún prefijo propio.
Una advertencia sincera: la autenticación por encabezado de solicitud en conectores está en fase beta y Anthropic la está implementando gradualmente, por lo que es posible que tu cuenta aún no muestre esa sección. La alternativa funciona en cualquier lugar donde se ejecute Claude Desktop: añade el servidor a través del puente mcp-remote en claude_desktop_config.json (Settings → Developer → Edit Config), el cual requiere tener Node.js instalado:
{
"mcpServers": {
"bananabanana": {
"command": "npx",
"args": [
"-y", "mcp-remote", "https://bananabanana.pro/api/mcp",
"--header", "Authorization: Bearer bb_live_YOUR_KEY"
]
}
}
}
Ambas variantes, además de un ejemplo de JSON-RPC sin procesar para cualquier otra cosa, se encuentran en la página del servidor MCP:

¿Funciona fuera de Claude?
Sí. MCP es un protocolo abierto, por lo que cualquier cliente que soporte Streamable HTTP y pueda adjuntar un encabezado Authorization se conecta al mismo endpoint: Gemini CLI, ZCode de Z.ai para GLM-5.2, agentes de edición y, dado que Codex lanzó soporte para MCP remoto, también la aplicación de escritorio de ChatGPT, Codex CLI y la extensión de IDE, a través de una entrada config.toml compartida (url más bearer_token_env_var, según las instrucciones de MCP de Codex). La API de xAI adjunta servidores MCP por solicitud con server_url. Los más rezagados son los cuadros de diálogo web creados en torno a OAuth en lugar de claves pegadas: los conectores web de ChatGPT y, posiblemente, los conectores personalizados basados en URL de grok.com. Mantenemos la tabla canónica actualizada por cliente con fragmentos de configuración en la página del servidor MCP; este artículo se centra en Claude.
Caso de uso 1: una imagen de portada para la publicación que estás escribiendo
El caso más común. Estás redactando una publicación de blog en Claude Code y necesitas una imagen de portada. Dices: "generate a 16:9 editorial hero about database caching, library metaphor." Claude escribe el prompt y realiza la llamada:
→ generate_image {"prompt": "Editorial illustration for a developer blog post
about database caching: a small librarian robot placing three glowing books
onto a tiny fast bookshelf in the foreground, a huge dim archive hall
stretching far behind it, soft pastel background, dark ink details, accents
of violet and warm amber, clean minimal composition, generous negative
space, no text", "model": "nano-banana-pro", "aspect_ratio": "16:9"}
← {"job_id": "cmxq…", "status": "processing", "cost_charged_usd": 0.11,
"balance_remaining_usd": 4.89}
→ get_result {"job_id": "cmxq…"}
← {"status": "completed", "files": [{"url": "https://bananabanana.pro/api/files/…"}]}
Aquí está el resultado de ese prompt exacto, al primer intento, sin repeticiones:

Costo: $0.11 en Nano Banana Pro a 1K. El agente descarga el archivo desde la URL firmada, lo guarda en el repositorio y escribe el texto alt. Los enlaces siguen siendo válidos durante 24 horas; después de eso, get_result genera nuevos enlaces.
Caso de uso 2: fotos de productos sin fotógrafo
Las maquetas de marketing es donde la redacción de prompts de estilo fotográfico da mejores resultados. Describe la toma de la misma manera que lo haría un fotógrafo: sujeto, superficie, fuente de luz, lente.
→ generate_image {"prompt": "A photorealistic product photo of a matte
sage-green ceramic pour-over coffee set on a pale linen tablecloth, soft
diffused daylight from a window on the left, gentle shadows, shallow depth
of field, eye-level shot with a 50mm lens, minimal warm styling, no text",
"model": "nano-banana-pro", "aspect_ratio": "1:1"}

Sinceridad total: esta toma requirió dos intentos. El primer renderizado se veía bien a simple vista, pero al inspeccionarlo de cerca, la taza se había fusionado con su plato en una sola pieza con forma de tapa; la geometría de los objetos es precisamente donde los modelos fotorrealistas todavía fallan, y el trabajo de producto es donde debes hacer zoom antes de publicar. Un reintento del mismo prompt lo solucionó: $0.22 por el par en lugar de $0.11. La parte que más me gusta no es la foto en sí, sino lo que sucede después: una herramienta edit_image toma el job_id de una imagen finalizada junto con una instrucción como "make the background pure white and add a soft shadow". Refinamiento en múltiples turnos sin volver a describir la escena, cobrando cada paso como una imagen. Para el trabajo de catálogo, ese bucle es la diferencia entre una herramienta útil y un juguete.
Caso de uso 3: un personaje recurrente en varias imágenes
Las mascotas de marca, los paneles de cómics y los guiones gráficos necesitan que el mismo personaje se mantenga de una imagen a otra. A través de MCP, el método de trabajo es una hoja de personaje: un bloque de descripción fijo que el agente pega en cada prompt. El nuestro fue "a small courier robot with a round matte-teal head, one large friendly amber eye, boxy cream-white body with visible brass screws, and a canvas messenger bag with a brass buckle". Dos escenas, dos llamadas, $0.11 cada una:


Seré directo con el resultado: es bueno, no perfecto. El bolso, el ojo de color ámbar y el cuerpo de color crema con tornillos de latón se mantuvieron. Sin embargo, la cabeza varió de una esfera hacia un casco, y la escena del atardecer regresó en un estilo de línea más gráfico. Ese es el límite conocido del anclaje solo por texto. Las imágenes de referencia lo solucionan correctamente, y el generador web acepta hasta 5 referencias de personaje en Nano Banana Pro; la herramienta MCP generate_image aún no acepta imágenes como entrada. Nuestra guía práctica de consistencia de personajes cubre ambos métodos, incluyendo qué características tienden a variar primero.
Caso de uso 4: un videoclip desde el mismo chat
El video se ejecuta a través del mismo servidor, con una medida de seguridad adicional. Los clips cuestan más que las imágenes (hasta $4.40 para un renderizado de gama alta con Veo 3.1), por lo que generate_video nunca cobra en la primera llamada. Devuelve una cotización y el agente tiene que repetir la llamada aceptando el monto exacto:
→ generate_video {"prompt": "Aerial drone shot rising slowly over terraced tea
fields at sunrise, thin mist drifting in the valleys, golden light catching
the ridges, smooth cinematic camera motion, wide shot",
"model": "veo-3.1-fast", "duration": 6, "resolution": "720p"}
← {"status": "confirmation_required", "quoted_cost_usd": 0.52, …}
→ generate_video {…same arguments…, "confirm_cost": 0.52}
← {"job_id": "cmxr…", "status": "processing", "cost_charged_usd": 0.52}
El resultado, seis segundos silenciosos a 720p desde Veo 3.1 Fast, al primer intento:
Los videos tardan de uno a diez minutos, por lo que el agente consulta get_result mientras realiza otro trabajo. Si deseas sonido, Omni Flash funciona a través de la misma herramienta a $0.10 por segundo con audio siempre activado, y tú estableces la duración, desde 3 hasta 10 segundos. También admite imágenes como entrada: pasa el job_id de una imagen que ya generaste (o un enlace público) como el primer cuadro, añade hasta diez imágenes de referencia para mantener la coherencia de un personaje, y el agente las animará. Los últimos cuadros y los bucles aún requieren el generador web.
Cada imagen de esta publicación provino de este flujo de trabajo
Esta es la parte de la que querría pruebas si estuviera leyendo, así que aquí está el bucle concreto. Claude Code escribió una sección de este artículo, compuso un prompt de ilustración en nuestro estilo interno, llamó a la herramienta de generación, esperó unos veinte segundos, revisó la imagen devuelta e insertó el markdown con el texto alt antes de continuar. Ocho llamadas de generación para los medios que ves aquí: seis imágenes y el video se obtuvieron al primer intento, y el juego de café requirió un reintento después de que una mirada más cercana detectó la taza y el plato fusionados. Un reintento en ocho llamadas aún superó mis expectativas. El único recurso que no es una generación es la captura de pantalla de la página de documentación, tomada con una herramienta del navegador.
Las imágenes no son perfectas (la cabeza del robot mensajero, como se señaló, tiene su propia personalidad). El punto es que "ilustrar" dejó de ser un paso de producción independiente. La misma sesión que escribe el texto genera los recursos visuales, y todo el proceso costó casi lo mismo que un boleto de autobús.
¿Cuánto costaron realmente los medios de este artículo?
Todo lo que se muestra a continuación se facturó a los precios estándar por generación de nuestra página de precios, los mismos números que list_models reporta al agente. Sin descuentos para empleados.
| Recurso | Modelo | Precio |
|---|---|---|
| Imagen de portada | Nano Banana Pro, 1K | $0.11 |
| Ilustración del escritor y pintor | Nano Banana Pro, 1K | $0.11 |
| Imagen de portada de guía de caché (caso de uso 1) | Nano Banana Pro, 1K | $0.11 |
| Maqueta del juego de café, 2 tomas incl. un reintento (caso de uso 2) | Nano Banana Pro, 1K | $0.22 |
| Serie del robot mensajero, 2 imágenes (caso de uso 3) | Nano Banana Pro, 1K | $0.22 |
| Clip de campos de té, 6 s en silencio, 720p (caso de uso 4) | Veo 3.1 Fast | $0.52 |
| Captura de pantalla de documentación | navegador, no es una generación | $0.00 |
| Total | $1.29 |
Utilizamos el modelo de imagen superior en todas partes porque estas imágenes se publican en una página pública. Redactar con Nano Banana 2 Lite a $0.03 habría reducido la parte de imágenes de la factura de $0.77 a $0.21; nuestra guía sobre el modelo Lite detalla cuándo el modelo económico es suficiente.
¿Listo para probarlo? Conecta el servidor MCP de BananaBanana y pídele a Claude tu primera imagen.
Preguntas frecuentes
¿El servidor MCP de BananaBanana funciona con otros clientes además de Claude?
Sí, con cualquier cliente MCP que admita Streamable HTTP y te permita adjuntar un encabezado Authorization: Claude Code, Claude Desktop, Gemini CLI, ZCode de Z.ai para GLM-5.2, agentes de edición como Cursor o VS Code y, a través del soporte de MCP remoto de Codex, la aplicación de escritorio de ChatGPT, Codex CLI y la extensión de IDE, los cuales comparten una entrada config.toml con url y bearer_token_env_var. La API de xAI adjunta servidores MCP por solicitud a través de server_url. Lo que aún no es seguro: los conectores web de ChatGPT se autentican mediante OAuth en lugar de claves pegadas, y el cuadro de diálogo de conectores personalizados de grok.com solicita una URL sin un campo de clave documentado, por lo que ambos podrían necesitar el soporte de OAuth 2.1 planificado de nuestro lado. La tabla actualizada por cliente con fragmentos de configuración se encuentra en la página del servidor MCP; cualquier cosa que compiles tú mismo ya puede conectarse directamente a través de JSON-RPC.
¿Necesito una clave API de Google o una cuenta de Google Cloud?
No, y esa es la razón principal por la que existe este servidor. Los servidores MCP locales de generación de imágenes de GitHub llaman directamente a la Gemini API, por lo que necesitan tu propia clave de Google AI Studio; tú mismo administras sus límites y facturación. Aquí, la generación se ejecuta en el grupo administrado de claves de Vertex AI de BananaBanana, y tu única credencial es la clave bb_live_ de tu perfil. Nunca tocas la consola de Google y Google nunca te factura. El intercambio es justo: renuncias a los precios de API puros de Google y al acceso directo a los parámetros, y obtienes precios por generación sin gasto mínimo, rotación automática de claves y un único saldo compartido entre el servidor MCP, el generador web y la aplicación de Telegram. Revocar una clave filtrada requiere un solo clic y no afecta a nada más.
¿Cómo funciona la facturación en el servidor MCP?
Saldo prepago, precios por generación, sin suscripción. Recargas tu saldo y cada generación deduce su precio indicado: de $0.03 a $0.20 para imágenes según el modelo y la resolución, de $0.10 a $4.40 para video según el modelo, la duración, la resolución y el audio. El agente conoce cada precio de antemano: list_models proporciona cifras en tiempo real, y cada llamada de video (además de cualquier lote de múltiples imágenes) debe recibir primero una cotización y confirmarla con confirm_cost antes de que se mueva un solo centavo. Cada resultado reporta cost_charged_usd y balance_remaining_usd, por lo que el seguimiento de costos está integrado en la conversación. Las generaciones fallidas se reembolsan automáticamente. Si te preocupa que un agente actúe sin control, define un límite diario en USD por clave en Perfil → MCP API Keys y audita el registro de uso de cada clave, que registra la herramienta, el modelo, el costo y una vista previa del prompt.
¿Qué sucede si mi saldo llega a cero a mitad de una tarea?
La siguiente llamada a una herramienta de pago fallará de manera limpia con un error INSUFFICIENT_BALANCE que incluye un enlace de recarga, y el agente te lo transmitirá. Nada se vuelve negativo; no hay sobregiros ni facturas sorpresa. Las herramientas gratuitas (list_models, get_account, get_result, list_generations) siguen funcionando, por lo que todo lo que ya se generó sigue siendo accesible, y una generación que comenzó antes de que se agotara el saldo finaliza normalmente, porque el cobro se realiza una sola vez, al inicio. En la práctica, Claude simplemente informa de la llamada fallida con la URL de recarga y continúa con el resto de la tarea. Para tener un margen en lugar de una parada repentina, monitorea balance_remaining_usd en cada resultado o haz que el agente verifique get_account antes de los trabajos por lotes.
¿Qué bloquea el filtro de contenido y se paga por los prompts filtrados?
Los modelos de Google en origen aplican sus propios filtros de seguridad; cuando se rechaza una generación, el servidor devuelve un código SAFETY_FILTERED unificado en lugar de la media docena de variantes internas de Google. Las categorías bloqueadas son las que cabría esperar de las políticas de Gemini y Veo: contenido sexual que involucre a menores, violencia explícita, deepfakes de personas reales y similares. Los filtros también generan falsos positivos ocasionales con prompts inocentes, lo cual no depende de nosotros y no pretendemos decir lo contrario. La facturación es simple: una generación completamente filtrada se reembolsa automáticamente y, para video, donde Google a veces filtra solo una parte del resultado, el reembolso es proporcional. Solo pagas por los medios que recibes. Si un prompt sigue activando el filtro, redefine el detalle concreto que lo provoca en lugar de volver a intentar con el mismo texto.
¿A quién pertenecen las imágenes que genero a través del servidor MCP?
A ti. Según nuestros términos, las imágenes y los videos generados son tuyos para uso personal y comercial, sujetos a las condiciones del proveedor del modelo subyacente; nosotros no reclamamos ninguna propiedad sobre tu contenido, y los prompts que envíes siguen siendo tuyos. Dos detalles de almacenamiento son importantes en la práctica. Las URL que devuelve get_result son enlaces firmados válidos por 24 horas, así que descarga lo que te interese o vuelve a llamar a get_result para obtener enlaces nuevos. Y los medios generados se almacenan durante 30 dias, luego se eliminan de forma permanente: el servidor MCP es un flujo de generación, no un archivo. Todo lo generado a través de MCP también aparece en el historial de generación de tu cuenta web, de modo que puedes explorarlo y volver a descargarlo desde el sitio dentro de ese plazo de retención.