Generación de vídeo con Claude Code y MCP: configuración paso a paso
Conecta un servidor MCP alojado a Claude Code, pide imágenes, clips y voz con palabras normales y recibe archivos con su coste. Configuración y cuentas.
Generación de vídeo con Claude Code y MCP: configuración paso a paso
Estás en una terminal, a mitad de una landing page, y necesitas tres clips de producto de 5 segundos, una imagen hero y una locución de 20 segundos. El camino habitual son cuatro pestañas del navegador, tres inicios de sesión, una carpeta de descargas llena de archivos llamados output(7).mp4 y ninguna idea clara de lo que ha costado la tarde. El otro camino es una frase escrita en Claude Code, con los archivos aterrizando en tu proyecto, cada uno etiquetado con el modelo que lo generó y su coste.
El segundo camino funciona con el Model Context Protocol. Claude Code habla MCP de forma nativa, así que cualquier servicio de generación que exponga un servidor MCP alojado se convierte en un conjunto de herramientas que el agente puede llamar. A continuación se explica la configuración, los ajustes de permisos que conviene cambiar el primer día, cómo redactar las peticiones para que el agente elija el modelo y la duración correctos, y las cuentas de lo que cuestan lotes reales.
Qué pasa cuando Claude Code llama a una herramienta de vídeo
El transporte
Un servidor MCP alojado usa el transporte Streamable HTTP. La especificación de MCP (2025-06-18) define dos transportes estándar, stdio y Streamable HTTP, y exige que el servidor exponga una única ruta de endpoint que acepte POST y GET, por ejemplo https://example.com/mcp. El cliente envía cada mensaje JSON-RPC como un POST, y el servidor responde con JSON simple o con un flujo de eventos.
En la práctica, un servidor alojado es una URL más una credencial, sin nada que ejecutar en local, y funciona desde Claude Code, Cursor o cualquier otro cliente MCP.
Descubrimiento y llamadas
Según la especificación de herramientas de MCP, el cliente lista lo que ofrece un servidor con tools/list e invoca una herramienta con tools/call. Cada herramienta lleva un nombre, una descripción y un esquema de entrada. Cuando pides "un clip de 5 segundos de una taza de cerámica girando sobre una mesa de nogal", Claude lee las descripciones de las herramientas, rellena los argumentos y hace la llamada. Anthropic describe la regla de activación en su documentación del conector MCP: Claude llama a una herramienta MCP cuando la petición encaja con la capacidad descrita de esa herramienta, la nombres o no, y no llama a herramientas para responder preguntas de cultura general.
Qué devuelve
El resultado de una herramienta puede llevar texto, una imagen (datos en base64 más un tipo MIME), audio, un resource_link o un recurso incrustado, y opcionalmente un objeto structuredContent que siga un esquema de salida. La especificación pide a los servidores que devuelven contenido estructurado que incluyan también los mismos datos como JSON serializado en un bloque de texto. En generación, esta es la parte que importa. Un servidor bien hecho devuelve un enlace al archivo y un pequeño registro estructurado del trabajo (modelo, duración, resolución, coste), y deja el vídeo fuera de la conversación.
Paso a paso: conectar un servidor MCP alojado
La documentación de MCP de Claude Code da la forma general para un servidor remoto: claude mcp add --transport http <name> <url>, con un --header "Authorization: Bearer your-token" opcional para los servidores que se autentican con una clave estática.
- Crea una clave. Una clave por proyecto o por agente, para poder revocar una sin romper las demás.
- Elige un ámbito. Local es el valor por defecto y vive en ~/.claude.json solo para el proyecto actual. Project escribe el servidor en un archivo .mcp.json pensado para compartirse a través del repositorio. User lo deja disponible en todos los proyectos de tu máquina. Se define con -s o --scope.
- Añade el servidor. Para Aitachyon: claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."
- Verifica. claude mcp list muestra todos los servidores configurados y claude mcp get aitachyon inspecciona este. Dentro de una sesión, /mcp muestra el estado de la conexión y las herramientas expuestas.
- Haz una primera llamada barata. Pide una imagen antes que cualquier vídeo. Prueba la clave y tus ajustes de permisos por unos céntimos.
Los servidores que usan OAuth siguen un camino algo distinto: añade el servidor sin cabecera y luego inicia sesión con claude mcp login <name> o desde /mcp dentro de Claude Code. Por debajo, la especificación de autorización de MCP se apoya en OAuth 2.1 con PKCE, registro dinámico de clientes (RFC 7591), metadatos de recurso protegido (RFC 9728) e indicadores de recurso RFC 8707. Ambos caminos terminan con un token bearer en cada petición.
Tres trampas de configuración
- El ámbito project y las claves en texto plano no se llevan bien. Un archivo .mcp.json está diseñado para subirse al repositorio. Si metes un token bearer, haces push y la clave queda en tu historial de git. Mantén los servidores con clave en el ámbito local o user.
- Las variables de entorno con nombre de secreto se leen vacías. La documentación de Claude Code indica que las variables cuyo nombre contiene TOKEN, SECRET, PASSWORD, KEY o AUTH se leen vacías cuando se usan en la URL o las cabeceras de un servidor remoto. Una cabecera construida con AITACHYON_API_KEY sale en blanco y el servidor rechaza la llamada. Pasa la clave en el propio comando add.
- Las claves se quedan fuera de la URL. La especificación de autorización exige los tokens de acceso en la cabecera Authorization en cada petición y los prohíbe en la query string, donde acabarían en los logs de proxies y servidores.
Permisos: decide qué puede gastar el agente sin preguntar
Una herramienta de generación gasta dinero en cada llamada, así que merece más atención que una de lectura de archivos. La especificación de herramientas de MCP dice que siempre debería haber una persona en el circuito capaz de denegar invocaciones, y que los clientes deberían mostrar los datos de entrada antes de llamar. Claude Code lo implementa con reglas de permisos que apuntan a herramientas MCP mediante el prefijo mcp__.
- mcp__aitachyon en una regla allow deja que todo el servidor funcione sin avisos.
- mcp__aitachyon en una regla deny lo bloquea en un proyecto, útil en repositorios donde nadie debería generar medios.
- mcp__* como regla deny bloquea todas las herramientas MCP de golpe.
Dos detalles ahorran tiempo de depuración. Claude Code ignora cualquier regla mcp__ escrita con paréntesis y la lista en el diálogo de ajustes no válidos y en claude doctor. Para acotar el valor de un parámetro concreto en una herramienta MCP, pasa una regla deny mediante --disallowedTools.
Una regla de decisión para las aprobaciones
- Primera semana con un servidor nuevo: aprueba cada llamada a mano y lee el modelo, la duración y la resolución que Claude ha rellenado, porque ellos fijan el precio.
- Tras diez llamadas seguidas con argumentos razonables: permite las herramientas de imagen y deja las de vídeo con aprobación. Las imágenes cuestan céntimos; un lote de vídeo cuesta dólares.
- Ejecuciones desatendidas: permite todo, pero solo con una clave dedicada que tenga su propia alerta de gasto y se pueda revocar con un clic.
Pedir medios con palabras normales
Claude elige valores por defecto razonables, y esos valores suelen ser más largos, más nítidos o más ruidosos de lo que la toma necesita. Cada petición de vídeo debería fijar cuatro cosas: el modelo (o el equilibrio que te importa), la duración, la resolución o relación de aspecto, y si necesitas audio.
Antes y después
Antes: "Haz un vídeo de nuestra taza para la página de inicio."
Modelo, duración, formato y audio quedan a criterio del agente, que puede activar un audio nativo que vas a silenciar de todos modos.
Después: "Genera un clip de 5 segundos en 16:9 con Kling v3, sin audio: una taza de cerámica blanco mate girando despacio sobre una mesa de nogal, luz suave de ventana desde la izquierda, poca profundidad de campo. Guárdalo en public/media/hero-mug.mp4 e infórmame de la ref y el coste."
El segundo prompt fija el precio antes de la llamada. En el momento de escribir esto, Kling v3 en Aitachyon cuesta 0,16 $ por segundo sin audio y 0,32 $ por segundo con audio nativo, así que este clip sale a 5 × 0,16 $ = 0,80 $. Añadir "con audio" lo sube a 1,60 $ por un sonido que se reproducirá en silencio en la mayoría de las páginas de inicio.
Una plantilla de petición reutilizable
Pega esto en el CLAUDE.md de tu proyecto para que cada petición lleve las mismas restricciones:
- Recurso: imagen, clip o locución, y cuántos
- Modelo: un modelo con nombre, o "el más barato que admita X"
- Especificaciones: duración en segundos, resolución, relación de aspecto (9:16, 16:9, 1:1)
- Audio: ninguno, nativo o una locución aparte
- Contenido: sujeto, acción, escenario, luz, cámara
- Salida: ruta de destino y patrón de nombre de archivo
- Presupuesto: "detente y pregunta si el lote supera X $"
- Informe: "lista cada archivo con su ref, modelo y coste, y después el total"
Las dos últimas líneas son las que la gente se salta, y son las que dejan las cifras en el historial de la terminal junto a los archivos.
Elegir modelo por toma, con las contrapartidas a la vista
Con una cuenta detrás de un servidor MCP, el modelo pasa a ser un argumento por toma en lugar de un compromiso por suscripción. Los precios de abajo son los precios por llamada de Aitachyon en el momento de escribir esto; la tabla completa está en aitachyon.com/models y en JSON en https://aitachyon.com/api/pricing.
Vídeo
- Hailuo 02, 0,085 $/s. La opción de vídeo más barata de la lista. Úsala para borradores, pruebas de gancho y todo lo que pida volumen antes que acabado.
- Kling v3, 0,16 $/s sin audio, 0,32 $/s con audio nativo. El audio duplica el precio, así que decídelo clip a clip. Las contrapartidas frente a Seedance están en la comparativa Kling v3 contra Seedance 2.5.
- Veo 3.1 Fast, desde 0,19 $/s. Como referencia, la página de precios de la API de Gemini de Google lista Veo 3.1 Fast a 0,10 $ por segundo en 720p, 0,12 $ en 1080p y 0,30 $ en 4K, Veo 3.1 Standard a 0,40 $ por segundo, y un nivel Lite desde 0,05 $. Si Veo es el único modelo que vas a llamar, ir directo a Google sale más barato por segundo. Un agregador se gana su margen con los demás modelos en la misma clave y con el registro de coste por trabajo. Más en la guía de la API de Veo 3.1 Fast.
- Wan 2.7, 0,19 $/s. Un segundo intento útil para una toma que otro modelo sigue haciendo mal.
- Seedance 2.5, 0,20 $/s en 480p, 0,44 $/s en 720p. La resolución más que duplica el precio, así que haz borradores en 480p y vuelve a renderizar en 720p solo los que te quedes.
Imágenes
- Seedream 4.0 a 0,057 $ por imagen y FLUX.2 [pro] de 0,057 $ a 0,086 $: el extremo bajo, suficiente para fotos de producto y fondos.
- Nano Banana, 0,13 $ por imagen. Nano Banana contra FLUX.2 Pro para imágenes de producto explica cuándo compensa el precio más alto.
- gpt-image-2, de 0,10 $ a 0,40 $ por imagen. El rango de precios más amplio, así que fija el tamaño en el prompt.
Voz
La locución de ElevenLabs cuesta de 0,043 $ a 0,086 $ por cada 450 caracteres en el momento de escribir esto. Los modelos de base difieren en límites y cobertura de idiomas: ElevenLabs documenta eleven_v3 con 5.000 caracteres y más de 70 idiomas, eleven_multilingual_v2 con 10.000 caracteres y 29 idiomas, y eleven_flash_v2_5 con 40.000 caracteres y 32 idiomas. Para guiones de la longitud de un anuncio el límite de caracteres rara vez importa, pero la lista de idiomas sí en cuanto localizas. Las cuentas por minuto están en el desglose del coste de una locución con la API de ElevenLabs.
Las cuentas de tres lotes reales
Con precios por segundo y por imagen, un lote es predecible siempre que multipliques antes de pulsar enter. Todas las cifras usan los precios de Aitachyon en el momento de escribir esto.
Lote 1: 20 clips de gancho para probar creatividades
Veinte arranques de 5 segundos, cada uno con una primera frase distinta sacada de una lista como estas fórmulas de gancho.
- Hailuo 02: 20 × 5 s × 0,085 $ = 8,50 $
- Kling v3, sin audio: 20 × 5 s × 0,16 $ = 16,00 $
- Seedance 2.5 en 720p: 20 × 5 s × 0,44 $ = 44,00 $
La secuencia sensata: borrador de los veinte en el modelo más barato, quédate con los tres que mejor funcionen y renderiza solo esos en el modelo que publicarías. Tres ganadores en Seedance a 720p suman 3 × 2,20 $ = 6,60 $, para un total de 15,10 $ frente a 44,00 $ por renderizarlo todo en el nivel más alto.
Lote 2: 50 fotos de producto
- Seedream 4.0: 50 × 0,057 $ = 2,85 $
- FLUX.2 [pro]: 50 × 0,057 $ a 0,086 $ = 2,85 $ a 4,30 $
- Nano Banana: 50 × 0,13 $ = 6,50 $
Lote 3: una semana de shorts
Siete shorts, cada uno con tres clips de Kling v3 de 5 segundos (sin audio), tres fotogramas clave de Seedream y una locución de 900 caracteres.
- Clips: 15 s × 0,16 $ = 2,40 $ por short
- Fotogramas clave: 3 × 0,057 $ = 0,171 $ por short
- Locución: 2 × 450 caracteres a un máximo de 0,086 $ = hasta 0,172 $ por short
- Por short: unos 2,74 $. Para la semana: unos 19,20 $
Las mismas cuentas para todos los modelos están en precios de las API de generación de vídeo con IA en 2026.
Renders largos, límites de salida y cómo recuperar los archivos
Tamaño de salida
Claude Code tiene un presupuesto estricto para lo que una herramienta puede devolver. Según la documentación de MCP de Claude Code, avisa cuando la salida de una herramienta MCP supera los 10.000 tokens y la limita a 25.000 tokens por defecto, ajustable con la variable de entorno MAX_MCP_OUTPUT_TOKENS (por ejemplo 50000). Un servidor que devolviera vídeo en base64 en bruto chocaría con ese techo en el primer clip. Un enlace y un registro estructurado breve mantienen cada resultado pequeño y dejan la ventana de contexto para tu trabajo de verdad.
Tiempos de espera
El vídeo tarda más que una llamada a herramienta típica. La misma documentación permite fijar un timeout de herramienta por servidor en .mcp.json, en milisegundos con un mínimo de 1000, y señala que las conexiones HTTP y SSE caducan por inactividad a los 5 minutos por defecto. Si un lote largo se cae a medias, revisa esto antes de culpar al modelo. Pide los renders en grupos pequeños y haz que el agente informe tras cada grupo, de modo que una conexión caída solo pierda el estado del grupo en curso.
Refs estables como traspaso
En Aitachyon cada archivo generado recibe una ref estable (img_, scn_, vo_ y así) que el código puede recuperar con GET /api/generations/{ref}. Eso traza una frontera limpia entre el agente y tu build:
- En Claude Code, genera el recurso y pide la ref en el informe.
- Anota la ref en un archivo manifiesto del repositorio, junto al prompt que la produjo y su coste.
- Un script de build o un paso de CI recupera cada ref por la API HTTP normal con la misma clave bearer.
- Cuando regeneres una toma, cambia una sola ref en el manifiesto y el pipeline la recoge.
El manifiesto sirve además de libro de costes por toma. La versión larga de este pipeline, con guionización encima, está en automatizar la producción de vídeo con agentes de IA.
Usarlo sin Claude Code
El mismo servidor alojado se puede llamar desde tu propio backend. El conector MCP de Anthropic permite que la API de Messages llegue a servidores MCP remotos sin un cliente MCP aparte. Está en beta bajo la cabecera mcp-client-2025-11-20, admite listas de permitidos y bloqueados de herramientas, acepta tokens bearer de OAuth y varios servidores por petición, y no es apto para retención cero de datos. La lista de herramientas permitidas es lo útil aquí: expón las herramientas de imagen a una función de cara al cliente y deja las de vídeo apagadas hasta que hayas calculado su coste.
Control del gasto cuando un agente tiene la clave
Un agente que puede llamar a una herramienta de pago en bucle también puede gastar dinero en bucle. Una instrucción mal leída, "haz variaciones" entendido como cincuenta en lugar de cinco, es un fallo realista. Los controles que ayudan, ordenados por lo pronto que lo detectan:
- Presupuesto en el prompt. "Detente y pregunta si el lote va a costar más de 10 $" es una regla que el agente puede comprobar con los precios por segundo.
- Aprobación en las herramientas de vídeo, como se indica en la sección de permisos.
- Una clave por agente o proyecto. Aitachyon registra el gasto por clave de API, lanza una alerta cuando una clave gasta de forma inusualmente rápida y revoca una clave con un clic.
- Saldo prepagado. Cuando se acaba, las llamadas se detienen. Es un techo que un bucle descontrolado no puede cruzar.
- Reembolsos automáticos en caso de fallo. Un render fallido se reembolsa al céntimo, así que los reintentos no te cobran el doble en silencio.
Anthropic añade la base en su nota sobre los servidores MCP remotos: son servicios de terceros, así que conéctate solo a servidores de confianza y revisa las prácticas de seguridad y los términos de cada uno.
Preguntas frecuentes
¿Cómo añado un servidor MCP a Claude Code?
Ejecuta claude mcp add --transport http <name> <url>, añadiendo --header "Authorization: Bearer <key>" para servidores con clave. Usa -s para elegir el ámbito local, project o user, y confirma con claude mcp list o /mcp dentro de una sesión. Para servidores OAuth, añádelo sin la cabecera e inicia sesión con claude mcp login <name>.
¿Puede Claude Code generar vídeo por sí solo?
Claude Code delega el renderizado en una herramienta de un servidor MCP conectado, que ejecuta el modelo de vídeo. Una vez conectado ese servidor, pides con palabras normales y Claude rellena los argumentos de la herramienta, hace la llamada y te devuelve el resultado.
¿Por qué mi servidor MCP rechaza la clave que puse en una variable de entorno?
Claude Code lee como vacías las variables de entorno cuyo nombre contiene TOKEN, SECRET, PASSWORD, KEY o AUTH cuando aparecen en la URL o las cabeceras de un servidor remoto, así que la cabecera sale en blanco. Pasa la clave directamente en el comando claude mcp add y mantén el servidor en el ámbito local o user.
¿Cuánto cuesta un clip de vídeo con IA de 5 segundos?
Depende del modelo y de los ajustes. Con los precios de Aitachyon en el momento de escribir esto, 5 segundos cuestan unos 0,43 $ en Hailuo 02, 0,80 $ en Kling v3 sin audio, 1,60 $ con audio nativo, y 1,00 $ o 2,20 $ en Seedance 2.5 a 480p o 720p.
Fuentes
- Anthropic (docs de Claude Code): Conectar Claude Code a herramientas mediante MCP
- Anthropic (docs de Claude Code): Configurar permisos
- Model Context Protocol: Especificación 2025-06-18, Transportes
- Model Context Protocol: Especificación 2025-06-18, Herramientas
- Model Context Protocol: Especificación 2025-06-18, Autorización
- Anthropic (docs de Claude Platform): Conector MCP
- Anthropic (docs de Claude Platform): Servidores MCP remotos
- Google AI for Developers: Precios de la API de Gemini
- ElevenLabs: Modelos de texto a voz
Si quieres esta configuración sin cinco cuentas distintas, Aitachyon reúne los modelos de vídeo, imagen y voz de arriba detrás de una clave, un servidor MCP alojado y un saldo prepagado, con cada trabajo desglosado por modelo y coste. El comando de una línea para Claude Code y la API HTTP están en la página de desarrolladores.
Artículos relacionados
Cómo conseguir que aprueben tus anuncios de vídeo: las trampas de las políticas de Meta y TikTok
Las frases, visuales y categorías que provocan rechazos en Meta y TikTok — y cómo reformular el creative para que pase la revisión a la primera.
TutorialesCómo crear anuncios con IA que no parezcan generados por IA
Las señales que delatan la creatividad IA — piel plástica, ritmo muerto, luces inconsistentes — y las correcciones concretas para que tus anuncios pasen por humanos.
TutorialesAnuncios UGC con IA: cómo hacer que parezcan contenido real
Guía práctica sobre decisiones de guion, avatar y postproducción para que tus anuncios UGC generados por IA pasen como contenido orgánico de creadores.
TutorialesAnuncios de vídeo con testimonios cuando aún no tienes clientes
Cómo producir anuncios en formato testimonio desde el lanzamiento usando citas beta, narración del fundador y prueba social honesta — sin falsificar clientes.
TutorialesA/B Testing de anuncios de video: qué cambiar y cómo interpretar los resultados
Guía práctica para hacer A/B testing de anuncios de video con presupuestos pequeños: aísla una variable, alcanza los umbrales mínimos de muestra y lee los resultados sin engañarte.
TutorialesConvertir contenido de formato largo en creatividades para anuncios de pago
Cómo extraer ganchos de 30 segundos desde webinars, podcasts y vídeos de YouTube y reestructurarlos como anuncios en redes sociales, con un checklist reutilizable.
Herramientas gratis para probar
Free AI image generator
Describe what you want and get a high-quality AI image in seconds. A free AI image generator, no account needed to preview, keep your first image when you sign up.
Probar gratisFree toolFree AI product photo generator
Generate clean, studio-style product photos for your store and listings in seconds. Crisp lighting and tidy backgrounds, free to try with no account, keep your first shot on signup.
Probar gratisFree toolFree background remover
Remove the background from any image in seconds and get a clean, transparent cutout. A free background remover, no account needed to preview, keep your first cutout when you sign up.
Probar gratisDeja de describir tu marca. Pega tu URL.
Aitachyon lee toda tu marca desde tu sitio web y crea vídeos, imágenes, carruseles, publicaciones y banners, fieles a tu marca, en cada formato y cada feed.