Precios de la API de ElevenLabs: cuánto cuesta realmente una locución (2026)
Precio de la API de ElevenLabs por 1000 caracteres y modelo, coste de una locución de 30 o 60 s y cómo generarlas en lote desde código sin errores 429.
Precios de la API de ElevenLabs: cuánto cuesta realmente una locución (2026)
Una locución de 30 segundos son unos 600 caracteres de guion. Con la tarifa estándar más barata de la API de ElevenLabs en el momento de escribir esto, eso supone alrededor de dos centavos y medio de audio. Lo que de verdad decide tu factura es cuántas tomas, idiomas y variantes generas, y qué modelo elegiste sin pensarlo.
Esta guía repasa las tarifas por carácter modelo a modelo, las convierte en las duraciones que realmente entregas (30 y 60 segundos), pone precio a lotes realistas y después cubre lo que casi todas las páginas de precios omiten: generar cientos de locuciones desde código sin chocar con el límite de concurrencia. Todas las cifras se comprobaron el 30 de septiembre de 2026. ElevenLabs cambia sus tarifas, a veces con promociones temporales, así que la página de precios en vivo tiene la última palabra.
Precios de la API de ElevenLabs por modelo, a septiembre de 2026
ElevenLabs cobra la síntesis de voz por carácter. Su página de precios de la API lista estas tarifas por cada 1000 caracteres en el momento de escribir esto:
- Eleven v4: $0.022 por 1K caracteres, un 72 % de descuento promocional sobre el precio de lista de $0.08, hasta el 12 de octubre.
- Eleven v4 Turbo: $0.011 por 1K caracteres, también con un 72 % de descuento, desde un precio de lista de $0.04, con la misma fecha de fin.
- Eleven v3: $0.08 por 1K caracteres.
- Eleven v3 Conversational: $0.04 por 1K caracteres.
- Multilingual v2: $0.08 por 1K caracteres.
- Flash y Turbo: $0.04 por 1K caracteres.
Dos cosas antes de construir un presupuesto con esos números. Primero, los precios de v4 son promocionales. Cualquier modelo de costes que pase de mediados de octubre debe usar los precios de lista de $0.08 y $0.04, o subestimará el gasto casi cuatro veces. Segundo, artículos de terceros más antiguos citan cifras distintas. Un tutorial de Puter de junio de 2026 indica $0.05 por 1K para Flash y Turbo y $0.10 por 1K para Multilingual v2 y v3. Las tarifas se han movido en un solo trimestre, y ese es el principal argumento para leer los precios de la fuente en tiempo de ejecución en lugar de fijarlos en el código.
Cómo se convierten los créditos en caracteres
La página de precios para consumidores mide la síntesis de voz a 1 crédito por carácter. Los modelos Flash salen más baratos en créditos: el desglose de Smallest.ai los sitúa entre 0,5 y 1 crédito por carácter según el plan. Esa segunda cifra viene de un tercero, así que confírmala en tu propio panel de uso antes de apoyarte en ella.
Cuánto cuesta una locución de 30 segundos y una de 60
Las tarifas se cotizan por cada 1000 caracteres, mientras que los guiones se planifican en segundos, así que hace falta una conversión. La habitual es de unos 1200 caracteres por minuto de habla, que Smallest.ai deriva de una narración de dos minutos que ronda los 2400 caracteres. Eso da unos 600 caracteres para una lectura de 30 segundos y 1200 para 60. Un guion de 500 palabras queda cerca de 3000 caracteres según la misma fuente.
Aplica las tarifas de la API de septiembre de 2026:
- Flash / Turbo ($0.04 por 1K): 30 s = 0.6 x $0.04 = $0.024. 60 s = 1.2 x $0.04 = $0.048.
- Multilingual v2 o v3 ($0.08 por 1K): 30 s = $0.048. 60 s = $0.096.
- v4 en promoción ($0.022 por 1K): 30 s = unos $0.013. 60 s = unos $0.026.
- v4 Turbo en promoción ($0.011 por 1K): 30 s = unos $0.007. 60 s = unos $0.013.
Una fórmula de coste que puedes pegar en una hoja de cálculo
A unos 1200 caracteres por minuto, el habla ronda los 20 caracteres por segundo. Eso da una estimación de una línea:
- Caracteres = segundos x 20
- Coste por locución = caracteres x tarifa por 1K / 1000
- Coste por lote = coste por locución x variantes x idiomas x tomas
La última línea es la que todos olvidan. Tres tomas por guion en dos idiomas multiplican por seis la partida de voz antes de que nadie escuche un solo archivo.
El ritmo mueve estas cifras. Un explicativo de producto pausado se lee más despacio que un gancho rápido al estilo UGC, así que los mismos 30 segundos pueden contener bastantes más o menos caracteres. Si aún estás decidiendo tono y velocidad, los pros y contras se tratan en cómo elegir la voz y el ritmo de las locuciones para anuncios. Para presupuestar, cuenta los caracteres del guion real y usa la regla por minuto solo como comprobación.
Créditos de suscripción frente a la tarifa por carácter de la API
ElevenLabs también vende planes mensuales que incluyen créditos. La página de precios lista, en el momento de escribir esto:
- Free: 10.000 créditos, sin uso comercial.
- Starter: 30.000 créditos por $6.
- Creator: 121.000 créditos por $22 ($11 el primer mes).
- Pro: 600.000 créditos por $99.
- Scale: 1.800.000 créditos por $299.
- Business: 6.000.000 de créditos por $990.
Divide el precio entre los créditos y obtienes el coste implícito por cada 1000 créditos: $0.20 en Starter, unos $0.18 en Creator (unos $0.09 en el primer mes con descuento) y unos $0.165 en Pro, Scale y Business. A 1 crédito por carácter, esas tarifas implícitas quedan por encima de los precios de lista de la API por carácter citados antes. El tutorial de Puter describe el modelo como la misma tarifa por unidad en todos los niveles, con las suscripciones agrupando el consumo. Las dos páginas oficiales no cuadran del todo vistas desde fuera, así que antes de comprometerte con un plan, deja correr una semana de tráfico real y compara la factura con la aritmética.
Lo que los planes te dan, además de créditos, es margen. El nivel del plan fija tu techo de concurrencia (siguientes secciones) y la licencia comercial. ElevenLabs indica que el uso comercial empieza en Starter, y la documentación de text-to-speech repite que el uso comercial requiere un plan de pago. Cualquier cosa que se emita en publicidad de pago necesita como mínimo Starter.
Si estás comparando en general créditos incluidos con pago por llamada, el razonamiento se aplica igual a vídeo e imagen, y está desarrollado en precios por créditos frente a pago por llamada.
Presupuestos de lotes: la aritmética para cargas de trabajo reales
Una sola locución cuesta demasiado poco para importar, así que la elección de modelo solo se nota cuando generas en lote. Aquí van cuatro cargas habituales, calculadas con las tarifas de lista de la API de septiembre de 2026 para Flash ($0.04 por 1K) y Multilingual v2 ($0.08 por 1K), con 600 caracteres por cada 30 segundos.
20 variantes de gancho para un anuncio
Los ganchos son cortos. Supongamos que cada gancho más cuerpo es una lectura de 30 segundos: 20 variantes x 600 caracteres = 12.000 caracteres. Flash: $0.48. Multilingual v2: $0.96. Si estás escribiendo esas variantes, estas plantillas de ganchos te dan 18 arranques para ir rotando.
Una semana de shorts diarios de 60 segundos
7 x 1200 = 8400 caracteres. Flash: unos $0.34. Multilingual v2: unos $0.67.
50 explicativos de producto de 60 segundos
50 x 1200 = 60.000 caracteres. Flash: $2.40. Multilingual v2: $4.80.
Un anuncio de 60 segundos localizado en seis idiomas
6 x 1200 = 7200 caracteres. Multilingual v2: unos $0.58. Los guiones traducidos rara vez mantienen la longitud exacta del inglés, así que presupuesta cada idioma a partir del texto traducido. La parte de producción se cubre en cómo lanzar anuncios en vídeo en varios idiomas.
A gran volumen, la diferencia entre modelos es real pero pequeña en términos absolutos. El ejemplo de Puter de 3 millones de caracteres salía a $150 en Flash frente a $300 en Multilingual, con sus tarifas anteriores. Para la mayoría de los equipos de publicidad y contenido, la voz es la partida más barata de la pila. El error caro es regenerar guiones enteros para arreglar una sola frase, algo que los parámetros de continuidad de más abajo ayudan a evitar.
Elegir modelo: precio, idiomas, límites y latencia
El precio es un eje de cuatro. La documentación de modelos de ElevenLabs lista los otros:
- Idiomas: v4 cubre más de 90, v3 más de 70, Flash v2.5 cubre 32, Multilingual v2 cubre 29 y Flash v2 es solo inglés.
- Caracteres por petición: Flash v2.5 acepta 40.000, Flash v2 30.000, v4 y Multilingual v2 10.000 cada uno, y v3 5000.
- Latencia: Flash v2.5 en torno a 75 ms, v4 Turbo en torno a 100 ms, v3 Conversational en torno a 280 ms.
Una regla de decisión reutilizable
- Solo inglés, mucho volumen, la latencia importa (agentes en vivo, previsualizaciones, borradores internos): Flash. Precio de lista más bajo, mayor tamaño de petición y el más rápido.
- Locución final de un anuncio en uno de los idiomas principales: Multilingual v2 o v3 a precio de lista, o v4 mientras dure la promoción. Genera algunas tomas y quédate con la mejor.
- Idioma fuera de los 29 de Multilingual v2: comprueba antes la cobertura de v4 (más de 90) o v3 (más de 70).
- Narración larga en una sola llamada: el límite de 40.000 caracteres de Flash v2.5 admite un guion que habría que dividir con los 5000 de v3.
- Presupuesto más allá del 12 de octubre: calcula v4 a $0.08 y v4 Turbo a $0.04, sea lo que sea que muestre hoy la página.
Los juicios de calidad entre modelos son subjetivos y cambian con cada versión. La prueba práctica es barata: a unos pocos centavos por 60 segundos, genera el mismo guion con dos modelos y escucha.
Generar locuciones en lote desde código
El endpoint es sencillo. La referencia de la API lo documenta así:
- Petición: POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}, con tu clave en la cabecera xi-api-key.
- Cuerpo: text es obligatorio. model_id es eleven_multilingual_v2 por defecto, y output_format es mp3_44100_128 por defecto.
- Consistencia: seed acepta un entero de 0 a 4.294.967.295, y previous_text y next_text dan al modelo contexto alrededor de un fragmento.
- Normalización: apply_text_normalization acepta auto, on u off.
- Respuesta: audio binario con un 200, y un 422 ante un error de validación.
Ojo con el modelo por defecto. Si tu script omite model_id, cada llamada corre en Multilingual v2 a $0.08 por 1K, el doble de la tarifa de Flash. Indícalo siempre de forma explícita.
El formato de salida no cuesta nada, pero conviene decidirlo
La documentación de text-to-speech lista MP3 de 22,05 a 44,1 kHz y de 32 a 192 kbps, PCM de 16 a 44,1 kHz, mu-law y A-law a 8 kHz para telefonía, y Opus a 48 kHz. Para audio que va a un editor de vídeo, PCM evita una segunda codificación con pérdida. Para previsualizaciones web, el MP3 por defecto basta.
Un trabajo por lotes, paso a paso
- Prepara un manifiesto. Una fila por salida: id, voice_id, model_id, text, seed, ruta de salida. Una fila se ve así: hook-07-en, tu voice id, el id del modelo Flash, "Tu primer borrador tardó tres horas...", 42, out/hook-07-en.mp3. Cuenta los caracteres de cada fila y súmalos. Esa suma por la tarifa por 1K es tu techo de coste antes de enviar nada.
- Divide el texto largo en límites de frase por debajo del límite por petición del modelo, y pasa los fragmentos vecinos como previous_text y next_text para que las uniones suenen continuas, como recomienda la documentación.
- Fija la seed por voz. Regenerar una línea con la misma seed y los mismos ajustes la mantiene más cerca del resto de la toma, de modo que corriges una frase en lugar de pagar otra vez el guion entero.
- Ejecuta un pool de workers acotado dimensionado según la concurrencia de tu plan (siguiente sección), para que las peticiones nunca superen el techo.
- Escribe cada archivo y una línea de registro con id, modelo, número de caracteres y coste calculado. Ese registro es lo que usas para conciliar con la factura.
- Reintenta solo lo que falló, por id, para que un fallo a mitad de trabajo nunca vuelva a facturar las filas terminadas.
La concurrencia es el límite que muerde
ElevenLabs mide las peticiones concurrentes, no las peticiones por minuto, según su artículo sobre limitación de tasa. Los techos por plan, según la página de ayuda del error 429:
- Free: 2
- Starter: 3
- Creator: 5
- Pro: 10
- Scale y Business: 15
Los modelos Flash tienen límites más altos, entre 4 y 30 según el plan. Las peticiones por encima del techo se ponen en cola según la prioridad del plan, lo que según ElevenLabs añade unos 50 ms, y pasado eso recibes un 429.
Cómo manejar bien los 429
La página de ayuda distingue dos causas de 429, y cada una necesita un tratamiento distinto:
- too_many_concurrent_requests: superaste la concurrencia de tu plan. Reintentar de inmediato empeora las cosas. Reduce el pool.
- system_busy: carga en el lado de ElevenLabs. Suele funcionar al reintentar.
El patrón recomendado es un pool de concurrencia acotado, un token bucket y backoff exponencial con jitter. Las respuestas incluyen las cabeceras current-concurrent-requests y maximum-concurrent-requests, de modo que tu pool puede leer su techo real en lugar de fiarse de un valor de configuración.
Lista de comprobación del ejecutor de lotes
- Tamaño del pool tomado de maximum-concurrent-requests, menos uno si algo más comparte la clave.
- model_id indicado explícitamente en cada llamada.
- Backoff con jitter ante system_busy; reducción del pool ante too_many_concurrent_requests.
- Sin reintento ante un 422: corrige la carga útil.
- Número de caracteres y coste registrados por archivo.
- Ids idempotentes para que una nueva ejecución salte las filas completadas.
- Precios del periodo promocional marcados en el registro de costes, para que las cifras del mes que viene no sorprendan a nadie.
Con un pool de 5 en Creator, 50 explicativos terminan en unas diez rondas de peticiones. El tiempo real lo domina la generación, y el trabajo es lo bastante pequeño para correr desde un portátil.
La locución dentro de un flujo más grande
Rara vez la locución es el entregable. Va junto a un clip de vídeo, un plano de producto y subtítulos, y cada uno sale de un modelo distinto con su propia clave, su factura y su límite de tasa. Los equipos que producen a volumen suelen acabar manejando toda la cadena desde un script o un agente: un manifiesto de entrada, archivos y sus costes de salida. Una versión funcional de ese montaje, con un agente orquestando los pasos, se describe en automatizar la producción de vídeo con agentes de IA, y la parte de Claude Code en concreto en generar vídeo desde Claude Code a través de un servidor MCP.
La lógica de costes es la misma en cada paso. Cuenta unidades (caracteres, segundos, imágenes), multiplica por el precio unitario actual, regístralo junto al archivo y concilia. La voz es la partida más fácil de acertar, porque los caracteres se conocen antes de enviar la petición.
FAQ
¿Cuánto cuesta por carácter la API de ElevenLabs?
En el momento de escribir esto, la página de precios de la API lista $0.04 por 1000 caracteres para Flash y Turbo, $0.08 para Multilingual v2 y v3, y tarifas promocionales de $0.022 para v4 y $0.011 para v4 Turbo hasta el 12 de octubre. Eso son entre $0.00004 y $0.00008 por carácter a precio de lista.
¿Cuánto cuesta una locución de IA de 1 minuto con ElevenLabs?
Unos 1200 caracteres, es decir, aproximadamente $0.048 en Flash y $0.096 en Multilingual v2 con las tarifas de la API de septiembre de 2026. El dato preciso es el número real de caracteres de tu guion.
¿Hay un nivel gratuito de la API de ElevenLabs?
El plan Free incluye 10.000 créditos al mes y 2 peticiones concurrentes, pero no permite el uso comercial. Las locuciones para campañas de pago o trabajo para clientes requieren Starter o superior.
¿Por qué recibo errores 429 de la API de ElevenLabs?
O superas el límite de peticiones concurrentes de tu plan (too_many_concurrent_requests) o ElevenLabs está bajo carga (system_busy). Reduce tu pool de workers en el primer caso y reintenta con backoff en el segundo, como explica la página de ayuda.
¿Cuál es la longitud máxima de texto por petición de la API de ElevenLabs?
Depende del modelo: 40.000 caracteres en Flash v2.5, 30.000 en Flash v2, 10.000 en v4 y Multilingual v2, y 5000 en v3, según la documentación de modelos.
Fuentes
- ElevenLabs: precios de la API
- ElevenLabs: precios
- ElevenLabs: documentación de modelos
- ElevenLabs: resumen de la capacidad Text to Speech
- ElevenLabs: referencia de la API Text to Speech convert
- ElevenLabs: código de error de API 429
- ElevenLabs: limitación de tasa para voz con IA
- Puter: precios de la API de ElevenLabs, desglose completo de costes (jun 2026)
- Smallest.ai: los precios de ElevenLabs explicados
Si prefieres no mantener una suscripción aparte de ElevenLabs junto a tus claves de vídeo e imagen, Aitachyon ejecuta la locución de ElevenLabs con el mismo saldo prepago que Seedance, Kling, Veo y los modelos de imagen, a entre $0.043 y $0.086 por cada 450 caracteres en el momento de escribir esto (mira la página del modelo ElevenLabs). Esa tarifa por carácter queda por encima del precio de lista directo de la API de ElevenLabs. A cambio tienes una sola clave para el estudio web, la API HTTP y el servidor MCP alojado, cada trabajo desglosado con el modelo que lo ejecutó y su coste, reembolsos automáticos en renders fallidos, una alerta de gasto por clave y un saldo que nunca caduca. Cada locución recibe una referencia vo_ estable que tu código puede consultar con GET /api/generations/{ref}. La guía rápida de API y MCP incluye la configuración de Claude Code en una línea.
Artículos relacionados
Precios de la API de Seedance 2.5: lo que cuesta de verdad un clip
Precios de la API de Seedance 2.5 por segundo en 480p, 720p y 1080p, costes reales de clips de 5, 10 y 30 s y de lotes, y dónde acceder sin suscripción.
GuíasPrecios de las API de generación de vídeo con IA en 2026, modelo por modelo
Cómo facturan las API de vídeo con IA (por segundo, por clip, con créditos), qué mueve el precio, tarifas por modelo y presupuestos de lotes con reintentos.
GuíasAPI de Veo 3.1 Fast: precio, límites y cómo llamarla
Precio por segundo de la API de Veo 3.1 Fast, duraciones, resoluciones, latencia y cuotas según Google, y cómo llamarla desde código o desde Claude Code.
GuíasAnuncios de video inmobiliario que generan visitas
Cómo agentes y promotores convierten reels de propiedades, ángulos de barrio y CTAs precisos en visitas confirmadas — specs, lógica de embudo y guion de rodaje reutilizable.
GuíasAnuncios de vídeo para gimnasios y estudios de fitness: guía 2026
Cómo gimnasios, estudios y entrenadores crean anuncios de vídeo que llenan clases: encuadres de transformación, ofertas de prueba de pago, segmentación local y cadencia de renovación creativa.
GuíasAnuncios de vídeo para el Black Friday: un plan de producción de dos semanas
Un calendario creativo BFCM día a día para que tus vídeos de oferta estén probados y validados antes de que los CPM de Meta suban hasta un 16 % — con specs verificadas y checklist.
Herramientas gratis para probar
Free AI image generator
Describe what you want and get a high-quality AI image in seconds. A free AI image generator, no account needed to preview, keep your first image when you sign up.
Probar gratisFree toolFree AI product photo generator
Generate clean, studio-style product photos for your store and listings in seconds. Crisp lighting and tidy backgrounds, free to try with no account, keep your first shot on signup.
Probar gratisFree toolFree background remover
Remove the background from any image in seconds and get a clean, transparent cutout. A free background remover, no account needed to preview, keep your first cutout when you sign up.
Probar gratisDeja de describir tu marca. Pega tu URL.
Aitachyon lee toda tu marca desde tu sitio web y crea vídeos, imágenes, carruseles, publicaciones y banners, fieles a tu marca, en cada formato y cada feed.