API de vídeo con avatar IA: caras que hablan a partir de una foto y una voz
Cómo funcionan las API de avatar con foto y audio, cuánto cuestan por segundo, dónde fallan y cómo llamarlas desde código o desde un agente de IA.
API de vídeo con avatar IA: caras que hablan a partir de una foto y una voz
Un clip de 30 segundos de una cara que habla, a partir de un retrato y una pista de voz, cuesta entre 0,75 $ y 6,40 $ a través de una API, según el proveedor y la resolución. La diferencia es mayor de lo que la mayoría espera y viene de una sola variable: la tarifa por segundo. El modelo, las entradas y la forma de la petición son casi idénticos entre proveedores.
Esta guía explica cómo estos modelos convierten una foto fija en una cara que habla, qué cobra cada proveedor por segundo de salida, dónde se deterioran los resultados y cómo conectar todo a un script o a un agente para que entre un brief y salgan MP4 terminados con su coste adjunto.
Cómo funciona un modelo de avatar con foto más audio
Todos los proveedores de esta categoría siguen el mismo contrato. Envías un retrato y una pista de habla, el modelo anima la cara para que coincida con el audio y recibes un vídeo cuya duración es la del audio. La página de Kling Avatar V2 en Replicate lo dice sin rodeos: la duración se ajusta automáticamente a la del audio. Nunca eliges una duración. Eliges una pista de voz, y esa pista fija la factura.
La guía de APIframe sobre API de avatar divide el proceso en tres etapas:
- Extracción de identidad. El modelo lee la cara del retrato y la fija, de modo que la persona del primer fotograma sea la del último.
- Mapeo de audio. El audio se asocia fotograma a fotograma con las formas de la boca y las expresiones faciales. Aquí se gana o se pierde la calidad del lip sync.
- Renderizado asíncrono. El vídeo se genera como una tarea en segundo plano. Envías, esperas y descargas.
La mayoría de los modelos aceptan además un prompt de texto opcional para orientar la expresión o el movimiento. En la página de Kling AI Avatar 2.0 de Kie.ai, el campo de prompt admite de 0 a 5.000 caracteres y es opcional para un uso básico. En la práctica, el retrato y el audio hacen casi todo el trabajo.
El sujeto no tiene por qué ser una persona real. La ficha de Kling Avatar v2 Pro en fal indica que admite humanos realistas, animales, dibujos animados y personajes estilizados, y VEED describe su modelo Fabric como compatible con fotos, ilustraciones, mascotas, renders 3D y anime. Esto importa a las marcas que quieren una mascota o un presentador generado en lugar de un fundador grabado. Si todavía dudas de que una cabeza parlante sea el formato adecuado, nuestro análisis de cuándo funcionan los anuncios con avatar y cuándo no cubre la parte creativa.
Cuánto cuesta por segundo una API de vídeo con avatar
Casi todos los proveedores cobran por segundo de vídeo generado. APIframe sitúa el rango habitual en de 0,02 $ a 0,07 $ por segundo en resoluciones estándar. Estas son las tarifas publicadas en el momento de escribir esto, tomadas de páginas de proveedores y guías de terceros:
- P-Video-Avatar: 0,025 $/s en 720p y 0,045 $/s en 1080p (inference.sh, 2026).
- Kling Avatar v2 Standard en WaveSpeed: 0,056 $ por segundo de audio, o sea 0,28 $ por 5 segundos.
- VEED Fabric 1.0: 0,08 $/s en 480p y 0,15 $/s en 720p, servido a través de fal.ai.
- Kling Avatar v2 Pro en fal: 0,115 $ por segundo de salida, unos 6,90 $ por minuto.
- Pixverse Avatar: 0,053333 $/s en 360p, 0,106667 $/s en 540p, 0,16 $/s en 720p y 0,213333 $/s en 1080p (catálogo de Empirio Labs).
Dos salvedades. Estas cifras proceden de páginas de proveedores y guías, y no se han contrastado con facturas reales, así que haz unas pocas pruebas de renderizado antes de fijar un presupuesto. Además, el mismo modelo puede costar cantidades muy distintas según quién lo sirva: Kling Avatar v2 aparece a 0,056 $/s (Standard, WaveSpeed) y a 0,115 $/s (Pro, fal), mientras que Kie.ai usa facturación por créditos sin tarifa por segundo en la página y la página del modelo en Replicate no mostraba precio cuando la consultamos.
La fórmula de coste
Como la duración de salida sigue al audio, la cuenta de un clip es corta:
coste del clip = segundos de audio x tarifa del avatar + coste de la voz + coste del retrato
El retrato es un coste único si reutilizas la misma cara. La voz es barata al lado del avatar. En Aitachyon, la locución de ElevenLabs cuesta de 0,043 $ a 0,086 $ por cada 450 caracteres en el momento de escribir esto, y un retrato generado con Nano Banana cuesta 0,13 $ por imagen. Los segundos de avatar dominan cada línea del presupuesto.
Tres lotes, calculados
Con las tarifas publicadas arriba:
- 20 ganchos con avatar de 10 segundos cada uno (200 segundos de vídeo). En Kling Avatar Standard a 0,056 $/s: 11,20 $. En Kling Avatar Pro a 0,115 $/s: 23,00 $. Suma 20 frases de voz cortas de menos de 450 caracteres cada una (0,86 $ a 1,72 $) y un retrato reutilizado (0,13 $), y el lote queda entre unos 12,19 $ y 24,85 $.
- Una semana de shorts, siete cabezas parlantes de 45 segundos (315 segundos). Standard: 17,64 $. Pro: 36,23 $. P-Video-Avatar en 720p: 7,88 $. Supón que cada guion ocupa dos bloques de voz de 450 caracteres, lo que añade 14 bloques a entre 0,60 $ y 1,20 $.
- Un explicativo de 60 segundos en 1080p. P-Video-Avatar: 2,70 $. Kling Pro: 6,90 $. Pixverse: 12,80 $.
La misma semana de contenido puede costar 8 $ o 37 $ antes de tomar una sola decisión creativa. Si estás comparando precios de modelos de vídeo en general, nuestro desglose de precios de API de vídeo modelo por modelo usa el mismo método por segundo.
Dónde fallan los modelos de avatar
Duración
Los límites técnicos son generosos. WaveSpeed factura Kling Avatar Standard hasta un máximo de 300 segundos por tarea, Kie.ai indica que el audio no puede superar los 5 minutos y VEED sitúa Fabric en 5 minutos por generación.
El techo de calidad llega mucho antes. APIframe advierte de que algunos modelos muestran deriva de identidad y deformaciones pasados los 30 segundos. La guía de P-Video-Avatar recomienda mantener los clips por debajo de tres minutos y dividir el contenido más largo. Un límite de cinco minutos te dice lo que la API aceptará. Dice poco sobre lo que seguirá pareciendo la misma persona en el minuto cuatro.
Lip sync y expresión
El lip sync solo es tan bueno como la etapa de mapeo de audio, y esa etapa solo es tan buena como el audio. WaveSpeed pide una pista de voz limpia, grabada o sintética, sin silencios largos. En un modelo que cobra por segundo, el silencio cuesta dinero y no le da nada que hacer a la cara, que es donde suelen aparecer esos fotogramas en reposo inquietantes.
Gestos y cuerpo
La mayoría de estos modelos animan la cara y la cabeza a partir de una sola imagen. VEED describe Fabric como un modelo que produce gestos naturales de cabeza y un lenguaje corporal expresivo, pero es una descripción del propio proveedor. Planifica un plano de cabeza y hombros y trata los gestos de las manos como un extra.
Encuadre y resolución
La guía de P-Video-Avatar señala que la relación de aspecto sigue a la de la imagen de entrada. Si quieres un short en 9:16, genera o recorta primero un retrato en 9:16. La resolución depende del nivel: Kie.ai indica hasta 720p en Standard y hasta 1080p a 48 fps en Pro.
Tareas rechazadas
APIframe enumera las causas habituales de fallo: imágenes de origen deficientes, formatos de audio no admitidos y rechazos por política de contenido. Las tres se pueden evitar antes de gastar un céntimo, y para eso sirve la lista de comprobación de abajo.
La lista de comprobación de entradas: pásala antes de cada tarea
La calidad de las entradas influye más en el resultado que la elección del modelo. Copia esta lista y ejecútala como paso de validación en tu script:
- Ángulo del retrato. De frente o ligeramente en tres cuartos, como recomienda WaveSpeed. Nada de perfiles ni de caras parcialmente fuera de plano.
- Iluminación del retrato. Cara bien iluminada y uniforme. Las sombras duras sobre la boca dan menos que mapear al modelo.
- Relación de aspecto del retrato. Ajústala al destino final (9:16 para shorts, 1:1 o 16:9 en otros casos), porque el encuadre de salida sigue a la imagen.
- Archivo de imagen. JPEG o PNG de menos de 10 MB para Kie.ai; PNG, JPEG o WebP de menos de 20 MB y de menos de 10.000 px en el lado largo para Pixverse. fal acepta JPG, JPEG, PNG, WebP, GIF y AVIF.
- Formato de audio. MP3, OGG, WAV, M4A o AAC funcionan en fal y Pixverse. Kie.ai acepta MPEG, WAV, AAC, MP4 y OGG de hasta 100 MB.
- Limpieza del audio. Un solo hablante, sin música de fondo, sin eco de sala. Añade la música después del renderizado.
- Silencios recortados. Corta el silencio inicial y final y las pausas largas. Cada segundo se factura.
- Duración. Mantén cada segmento por debajo de 30 segundos salvo que hayas probado tu modelo más allá. Divide los guiones largos en los finales de frase y renderiza los segmentos por separado.
- Política de contenido. Ningún parecido con una persona real sin su consentimiento, y nada que la política del proveedor rechazaría. Una tarea rechazada hace perder tiempo de espera aunque no cueste nada.
Si generas el retrato en lugar de fotografiarlo, elige el modelo de imagen por la textura de la piel y la consistencia. Nuestra comparativa de Nano Banana y FLUX.2 Pro explica ese equilibrio para fotos de producto y de personas.
Elegir proveedor: una regla de decisión
Decide con tres preguntas, en este orden:
- ¿Cuánto dura el segmento final? Por debajo de 30 segundos, todas las opciones están abiertas. Si es más largo, divídelo o prueba ese modelo concreto en busca de deriva antes de lanzar un lote.
- ¿Qué resolución necesita el destino? Los formatos de feed que se ven en el móvil rara vez necesitan 1080p. Si la necesitas, la tarifa publicada más baja en 1080p de nuestra investigación es la de P-Video-Avatar, 0,045 $/s, y la más alta la de Pixverse, 0,213333 $/s.
- ¿Cuánto tiempo puedes esperar? WaveSpeed indica un tiempo de generación típico de unos 177 segundos para Kling Avatar Standard. inference.sh afirma que P-Video-Avatar procesa unos 1,83 segundos por segundo de salida, frente a 26 s/s de HeyGen y 34 s/s de Veed Fabric. Es una afirmación del proveedor sobre su propio producto, así que mídelo tú mismo.
Un enfoque razonable: prototipa en el nivel más barato que alcance tu resolución, renderiza cinco clips con tu retrato y tu voz reales, compáralos uno al lado del otro y sube de nivel solo si la salida más barata falla por un problema concreto y nombrable (artefactos en la boca, deriva, cabeza rígida).
API o herramienta con suscripción
Las herramientas de avatar por puesto cobran por mes y no por segundo. Según el resumen de 2026 de VEED: HeyGen empieza en 29 $/mes con créditos y lip sync en más de 40 idiomas, D-ID Lite empieza en 5,90 $/mes con un nivel de API desde 18 $/mes que incluye 16 minutos de vídeo normal, Synthesia empieza en 18 $/mes por 120 minutos al año, y Tavus usa precios a medida para empresas con un gemelo digital creado a partir de unos 2 minutos de metraje. Si consumes los 16 minutos de D-ID, 18 $ salen a unos 1,13 $ por minuto. La contrapartida es que los minutos sin usar se pierden y el exceso tiene sus propias reglas. Las API por segundo cuestan más por unidad en el extremo alto y nada en un mes en que no renderizas.
Llamar a una API de avatar desde código
El flujo de peticiones es el mismo en todos los proveedores. APIframe lo describe como un POST que devuelve un ID de tarea, luego polling o un webhook, y después la descarga del vídeo. En concreto, para Kling Avatar Standard en WaveSpeed:
- Enviar. Un POST a https://api.wavespeed.ai/api/v3/kwaivgi/kling-v2-ai-avatar-standard con un token Bearer, una URL de imagen y una URL de audio. La respuesta incluye un ID de predicción para consultar.
- Consultar. La documentación de WaveSpeed empieza con un polling cada 2 segundos. Espacia las consultas después del primer minuto, ya que las tareas típicas tardan unos minutos.
- Descargar. En fal, el resultado es un JSON con un campo video.url que apunta a un MP4 con audio sincronizado. Copia el archivo a tu propio almacenamiento de inmediato: las URL de los proveedores no son un sitio donde guardar archivos.
- Registrar el coste. Multiplica los segundos de audio por la tarifa y guarda el resultado junto al archivo. Querrás ese número cuando vuelva un lote de 200 clips.
Fabric se sirve por REST a través de fal.ai con clientes de Python y JavaScript, así que valen los mismos cuatro pasos con otro nombre de endpoint.
Pasos previos: retrato y voz
La llamada al avatar necesita dos URL, y en un flujo automatizado suelen generarse ambas. En Aitachyon, una sola clave de API (Authorization: Bearer ait_...) cubre los modelos de imagen y de voz, cada archivo generado recibe una ref estable (img_ para imágenes, vo_ para locuciones) que puedes recuperar con GET /api/generations/{ref}, y cada tarea se detalla con el modelo que la ejecutó y lo que costó. La guía rápida de API y MCP tiene la forma de las peticiones. Para el detalle de precios y ritmo de la voz, consulta nuestro desglose del coste de la API de ElevenLabs.
Ejecutarlo desde un agente
Para desarrolladores que ya trabajan en Claude Code o Cursor, el ciclo más rápido es dejar que el agente se encargue de los recursos previos y de la contabilidad mientras un script pequeño gestiona el proveedor de avatar. Conectar el servidor MCP alojado de Aitachyon a Claude Code es un solo comando:
claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."
Una sesión de trabajo se ve así:
- Le das un brief al agente: «Veinte ganchos de 10 segundos para la página de precios, mismo presentador, 9:16.»
- El agente escribe veinte guiones, recorta cada uno a un bloque de voz de 450 caracteres y genera un retrato 9:16 y veinte pistas de voz a través del servidor MCP. Cada una vuelve con una ref y un coste.
- El agente ejecuta tu script de avatar contra el proveedor que elijas, pasándole las URL del retrato y del audio, consultando el estado y guardando los MP4.
- Escribe un manifiesto: guion, ref de la voz, ref del retrato, archivo del avatar, segundos, coste por línea y total del lote.
La configuración se explica paso a paso en nuestra guía para generar vídeo desde Claude Code con un servidor MCP. Dos salvaguardas importan cuando un agente gasta dinero en bucle: limitar el tamaño del lote en el brief y darle al agente su propia clave para aislar su gasto. En Aitachyon cada clave tiene su propio gasto, una alerta cuando gasta de forma inusualmente rápida y una revocación con un clic. Para límites de concurrencia, reintentos y manejo de archivos a mayor volumen, nuestra guía de generación masiva de vídeo con IA va más a fondo.
El patrón híbrido: avatar corto y luego B-roll
La palanca más eficaz para el coste y la calidad es mantener corta la cabeza parlante. Un gancho con avatar de 5 a 10 segundos, seguido de B-roll bajo la misma locución, queda bien dentro de la zona de 30 segundos donde la deriva es menos probable y traslada la mayor parte de la duración a metraje más barato.
Ejemplo calculado, 30 segundos en total en el momento de escribir esto:
- Avatar completo, 30 s en Kling Avatar Standard a 0,056 $/s: 1,68 $. En Kling Pro a 0,115 $/s: 3,45 $.
- Híbrido: 8 s de avatar en Kling Standard (0,45 $) más 22 s de B-roll en Hailuo 02 a 0,085 $/s (1,87 $). Total, unos 2,32 $.
En el nivel de avatar más barato, el híbrido cuesta más que un avatar completo. Frente al nivel Pro cuesta menos, y en ambos casos el espectador ve la cara solo durante el gancho, donde gana atención, mientras el producto ocupa la pantalla el resto del tiempo. Un B-roll que siga pareciendo metraje real requiere cuidado, y nuestra guía de B-roll con IA que no parece falso lo repasa plano a plano.
Preguntas frecuentes
¿Cuánto cuesta por minuto una API de vídeo con avatar IA?
Con las tarifas publicadas en el momento de escribir esto: unos 1,50 $ por minuto en P-Video-Avatar a 720p, 3,36 $ en Kling Avatar Standard vía WaveSpeed, 6,90 $ en Kling Avatar Pro vía fal, 9,00 $ en VEED Fabric a 720p y 12,80 $ en Pixverse a 1080p. Suma los costes de voz y de retrato, que son pequeños en comparación.
¿Cuál es la duración máxima de un vídeo con avatar IA?
Kling Avatar y VEED Fabric aceptan hasta 5 minutos por tarea. La calidad es el límite más estrecho: algunos modelos derivan o se deforman pasados los 30 segundos, y la guía de P-Video-Avatar recomienda no pasar de tres minutos. Divide los guiones largos en segmentos y renderiza cada uno por separado.
¿Puedo crear un avatar que hable a partir de una sola foto?
Sí. Un único retrato de frente o ligeramente en tres cuartos más un archivo de audio es todo lo que necesitan estas API. Las ilustraciones, mascotas, animales y personajes estilizados también funcionan en Kling Avatar v2 y VEED Fabric.
¿Necesito grabar mi propia voz?
No. Todos los proveedores de esta guía aceptan una pista de texto a voz, y P-Video-Avatar y Pixverse pueden recibir directamente un guion de texto. Un audio limpio y sin silencios da el mejor lip sync, sea cual sea el origen.
¿Es una API de avatar más barata que HeyGen o Synthesia?
Depende del volumen. Los planes por puesto cobran cada mes, renderices o no. Las API por segundo cobran solo lo que produces, así que ganan con volúmenes irregulares o a ráfagas y con todo lo que se automatice desde código.
Fuentes
- WaveSpeedAI: Kling V2 AI Avatar Standard API
- fal.ai: Kling AI Avatar v2 Pro
- Kie.ai: Kling AI Avatar 2.0 API
- Replicate: Kling Avatar V2
- VEED: Best Avatar APIs (2026), Build Talking Videos at Scale
- APIframe: AI Avatar API Guide
- inference.sh: P-Video-Avatar, the Fastest AI Talking Head Generator
- Empirio Labs: Pixverse Avatar API
Aitachyon cubre las entradas que rodean la llamada al avatar: retratos en Nano Banana o FLUX.2 [pro], voz en ElevenLabs y B-roll en Seedance, Kling, Veo, Wan o Hailuo, todo desde un único saldo prepago que nunca caduca, facturado por llamada, con reembolso automático de los renderizados fallidos y cada archivo detallado con su coste. Puedes manejarlo desde el estudio web, la API HTTP o el servidor MCP en Claude Code, y la tabla de precios completa es pública en /api/pricing.
Artículos relacionados
Precios de la API de Seedance 2.5: lo que cuesta de verdad un clip
Precios de la API de Seedance 2.5 por segundo en 480p, 720p y 1080p, costes reales de clips de 5, 10 y 30 s y de lotes, y dónde acceder sin suscripción.
GuíasPrecios de las API de generación de vídeo con IA en 2026, modelo por modelo
Cómo facturan las API de vídeo con IA (por segundo, por clip, con créditos), qué mueve el precio, tarifas por modelo y presupuestos de lotes con reintentos.
GuíasAPI de Veo 3.1 Fast: precio, límites y cómo llamarla
Precio por segundo de la API de Veo 3.1 Fast, duraciones, resoluciones, latencia y cuotas según Google, y cómo llamarla desde código o desde Claude Code.
GuíasPrecios de la API de ElevenLabs: cuánto cuesta realmente una locución (2026)
Precio de la API de ElevenLabs por 1000 caracteres y modelo, coste de una locución de 30 o 60 s y cómo generarlas en lote desde código sin errores 429.
GuíasCómo llevar un canal de YouTube sin cara con IA en 2026
El pipeline real de un canal de YouTube sin cara con IA: guion, voz, visuales, edición, coste por etapa y cómo afectan las reglas de IA a la monetización.
GuíasCoste de un canal faceless: lo que cuesta cada vídeo con IA
Modelo de costes línea a línea para vídeos faceless con IA de 30, 60 y 600 segundos, con precios de modelos, cuentas a la vista y tarifas de editores y voces
Herramientas gratis para probar
Free AI art generator
Turn a prompt into striking AI art across any style, from oil painting to anime to digital concept work. Free to try, no account needed, keep your first artwork on signup.
Probar gratisFree toolFree AI avatar generator
Create a unique AI avatar for your profile in seconds, from realistic portraits to stylized and anime looks. Free to try with no account, keep your first avatar when you sign up.
Probar gratisFree toolFree AI image generator
Describe what you want and get a high-quality AI image in seconds. A free AI image generator, no account needed to preview, keep your first image when you sign up.
Probar gratisDeja de describir tu marca. Pega tu URL.
Aitachyon lee toda tu marca desde tu sitio web y crea vídeos, imágenes, carruseles, publicaciones y banners, fieles a tu marca, en cada formato y cada feed.