Skip to content
Guias30 de setembro de 2026· 8 min de leitura

Preços da API da ElevenLabs: quanto custa de verdade uma locução (2026)

Preços da API da ElevenLabs por 1.000 caracteres e por modelo, quanto custa uma locução de 30 ou 60 segundos e como gerar em lote via código sem erros 429.

elevenlabsvoiceoverttspricing
Guias

Preços da API da ElevenLabs: quanto custa de verdade uma locução (2026)

Uma locução de 30 segundos equivale a cerca de 600 caracteres de roteiro. Na tarifa padrão mais barata da API da ElevenLabs no momento da escrita, isso dá algo como dois centavos e meio de áudio. O que decide de fato a sua fatura é quantas takes, idiomas e variantes você gera, e qual modelo escolheu sem pensar muito.

Este guia percorre as tarifas por caractere modelo a modelo, converte-as nas durações que você realmente entrega (30 e 60 segundos), calcula lotes realistas e depois trata da parte que a maioria das páginas de preços ignora: gerar centenas de locuções por código sem estourar o limite de concorrência. Todos os números foram conferidos em 30 de setembro de 2026. A ElevenLabs muda suas tarifas, às vezes com promoções por tempo limitado, então a página de preços ao vivo tem a palavra final.

Preços da API da ElevenLabs por modelo, em setembro de 2026

A ElevenLabs cobra a síntese de voz por caractere. A página de preços da API lista estas tarifas por 1.000 caracteres no momento da escrita:

  • Eleven v4: $0.022 por 1K caracteres, um desconto promocional de 72% sobre o preço de tabela de $0.08, válido até 12 de outubro.
  • Eleven v4 Turbo: $0.011 por 1K caracteres, também com 72% de desconto, sobre um preço de tabela de $0.04, com a mesma data de término.
  • Eleven v3: $0.08 por 1K caracteres.
  • Eleven v3 Conversational: $0.04 por 1K caracteres.
  • Multilingual v2: $0.08 por 1K caracteres.
  • Flash e Turbo: $0.04 por 1K caracteres.

Duas ressalvas antes de montar um orçamento com esses números. Primeiro, os preços da v4 são promocionais. Qualquer modelo de custos que passe de meados de outubro deve usar os preços de tabela de $0.08 e $0.04, ou vai subestimar o gasto em quase quatro vezes. Segundo, textos mais antigos de terceiros citam valores diferentes. Um tutorial da Puter de junho de 2026 lista $0.05 por 1K para Flash e Turbo e $0.10 por 1K para Multilingual v2 e v3. As tarifas mudaram em um único trimestre, e esse é o principal argumento para buscar os preços na fonte em tempo de execução em vez de fixá-los no código.

Como os créditos se convertem em caracteres

A página de preços para o consumidor mede a síntese de voz a 1 crédito por caractere. Os modelos Flash saem mais baratos em créditos: a análise da Smallest.ai os coloca entre 0,5 e 1 crédito por caractere, dependendo do plano. Esse segundo número vem de um terceiro, então confirme no seu próprio painel de uso antes de contar com ele.

Quanto custam uma locução de 30 segundos e uma de 60

As tarifas são cotadas por 1.000 caracteres, enquanto os roteiros são planejados em segundos, então é preciso converter. A conversão habitual é cerca de 1.200 caracteres por minuto de fala, que a Smallest.ai deriva de uma narração de dois minutos que chega perto de 2.400 caracteres. Isso dá cerca de 600 caracteres para uma leitura de 30 segundos e 1.200 para 60. Um roteiro de 500 palavras fica perto de 3.000 caracteres, segundo a mesma fonte.

Aplique as tarifas da API de setembro de 2026:

  • Flash / Turbo ($0.04 por 1K): 30 s = 0.6 x $0.04 = $0.024. 60 s = 1.2 x $0.04 = $0.048.
  • Multilingual v2 ou v3 ($0.08 por 1K): 30 s = $0.048. 60 s = $0.096.
  • v4 em promoção ($0.022 por 1K): 30 s = cerca de $0.013. 60 s = cerca de $0.026.
  • v4 Turbo em promoção ($0.011 por 1K): 30 s = cerca de $0.007. 60 s = cerca de $0.013.

Uma fórmula de custo para colar numa planilha

A cerca de 1.200 caracteres por minuto, a fala roda perto de 20 caracteres por segundo. Daí sai uma estimativa de uma linha:

  • Caracteres = segundos x 20
  • Custo por locução = caracteres x tarifa por 1K / 1.000
  • Custo por lote = custo por locução x variantes x idiomas x takes

A última linha é a que todo mundo esquece. Três takes por roteiro em dois idiomas multiplicam por seis a linha de voz antes que alguém ouça um único arquivo.

O ritmo mexe nesses números. Um vídeo explicativo de produto, calmo, é lido mais devagar que um gancho rápido no estilo UGC, então os mesmos 30 segundos podem caber bem mais ou bem menos caracteres. Se você ainda está decidindo tom e velocidade, as vantagens e desvantagens estão em como escolher a voz e o ritmo das locuções de anúncios. Para orçar, conte os caracteres do roteiro real e use a regra por minuto só como verificação de sanidade.

Créditos de assinatura versus a tarifa da API por caractere

A ElevenLabs também vende planos mensais com créditos incluídos. A página de preços lista, no momento da escrita:

  1. Free: 10.000 créditos, sem uso comercial.
  2. Starter: 30.000 créditos por $6.
  3. Creator: 121.000 créditos por $22 ($11 no primeiro mês).
  4. Pro: 600.000 créditos por $99.
  5. Scale: 1.800.000 créditos por $299.
  6. Business: 6.000.000 de créditos por $990.

Divida o preço pelos créditos e você obtém o custo implícito por 1.000 créditos: $0.20 no Starter, cerca de $0.18 no Creator (cerca de $0.09 no primeiro mês com desconto) e cerca de $0.165 no Pro, Scale e Business. A 1 crédito por caractere, essas tarifas implícitas ficam acima dos preços de tabela da API por caractere citados antes. O tutorial da Puter descreve o modelo como a mesma tarifa por unidade em todos os níveis, com as assinaturas agrupando o consumo. As duas páginas oficiais não fecham direito vistas de fora, então, antes de assumir um plano, rode uma semana de tráfego real e compare a fatura com a conta.

O que os planos dão além de créditos é folga. O nível do plano define o seu teto de concorrência (próximas seções) e a licença comercial. A ElevenLabs afirma que o uso comercial começa no Starter, e a documentação de text-to-speech repete que o uso comercial exige um plano pago. Qualquer coisa que rode em mídia paga precisa de pelo menos o Starter.

Se você está comparando, de forma geral, créditos incluídos com pagamento por chamada, o raciocínio vale também para vídeo e imagem, e está desenvolvido em preços por créditos versus pagamento por chamada.

Orçamentos de lote: a aritmética para cargas reais

Uma única locução custa pouco demais para importar, então a escolha do modelo só aparece quando você gera em lote. Aqui estão quatro cargas comuns, calculadas às tarifas de tabela da API de setembro de 2026 para Flash ($0.04 por 1K) e Multilingual v2 ($0.08 por 1K), com 600 caracteres a cada 30 segundos.

20 variantes de gancho para um anúncio

Ganchos são curtos. Suponha que cada gancho mais o corpo seja uma leitura de 30 segundos: 20 variantes x 600 caracteres = 12.000 caracteres. Flash: $0.48. Multilingual v2: $0.96. Se você está escrevendo essas variantes, estes modelos de gancho dão 18 aberturas para alternar.

Uma semana de shorts diários de 60 segundos

7 x 1.200 = 8.400 caracteres. Flash: cerca de $0.34. Multilingual v2: cerca de $0.67.

50 vídeos explicativos de produto de 60 segundos

50 x 1.200 = 60.000 caracteres. Flash: $2.40. Multilingual v2: $4.80.

Um anúncio de 60 segundos localizado em seis idiomas

6 x 1.200 = 7.200 caracteres. Multilingual v2: cerca de $0.58. Roteiros traduzidos raramente mantêm o tamanho exato do inglês, então oriente o orçamento de cada idioma pelo texto traduzido. O lado da produção está em como veicular anúncios em vídeo em vários idiomas.

Em grande volume, a diferença entre os modelos é real, mas pequena em termos absolutos. O exemplo da Puter com 3 milhões de caracteres saía a $150 no Flash contra $300 no Multilingual, com as tarifas antigas dela. Para a maioria das equipes de anúncios e conteúdo, a voz é a linha mais barata da pilha. O erro caro é regerar roteiros inteiros para corrigir uma frase, coisa que os parâmetros de continuidade mais abaixo ajudam a evitar.

Escolhendo um modelo: preço, idiomas, limites e latência

O preço é um eixo entre quatro. A documentação de modelos da ElevenLabs lista os outros:

  • Idiomas: a v4 cobre mais de 90, a v3 mais de 70, o Flash v2.5 cobre 32, o Multilingual v2 cobre 29 e o Flash v2 é só inglês.
  • Caracteres por requisição: o Flash v2.5 aceita 40.000, o Flash v2 30.000, a v4 e o Multilingual v2 10.000 cada, e a v3 5.000.
  • Latência: Flash v2.5 em torno de 75 ms, v4 Turbo em torno de 100 ms, v3 Conversational em torno de 280 ms.

Uma regra de decisão reutilizável

  1. Só inglês, alto volume, latência importa (agentes ao vivo, prévias, rascunhos internos): Flash. Menor preço de tabela, maior tamanho de requisição, o mais rápido.
  2. Locução final de anúncio em um dos idiomas principais: Multilingual v2 ou v3 a preço de tabela, ou v4 enquanto a promoção durar. Gere algumas takes e fique com a melhor.
  3. Idioma fora dos 29 do Multilingual v2: confira antes a cobertura da v4 (mais de 90) ou da v3 (mais de 70).
  4. Narração longa em uma só chamada: o limite de 40.000 caracteres do Flash v2.5 comporta um roteiro que precisaria ser dividido com os 5.000 da v3.
  5. Orçamento além de 12 de outubro: calcule a v4 a $0.08 e a v4 Turbo a $0.04, seja o que for que a página mostre hoje.

Julgamentos de qualidade entre modelos são subjetivos e mudam a cada versão. O teste prático é barato: por poucos centavos a cada 60 segundos, gere o mesmo roteiro em dois modelos e escute.

Gerando locuções em lote por código

O endpoint é simples. A referência da API o documenta assim:

  • Requisição: POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}, com a sua chave no header xi-api-key.
  • Corpo: text é obrigatório. model_id tem como padrão eleven_multilingual_v2, e output_format tem como padrão mp3_44100_128.
  • Consistência: seed aceita um inteiro de 0 a 4.294.967.295, e previous_text e next_text dão ao modelo contexto em volta de um trecho.
  • Normalização: apply_text_normalization aceita auto, on ou off.
  • Resposta: áudio binário com 200, e 422 em caso de erro de validação.

Atenção ao modelo padrão. Se o seu script omitir model_id, toda chamada roda no Multilingual v2 a $0.08 por 1K, o dobro da tarifa do Flash. Defina-o explicitamente.

O formato de saída não custa nada, mas vale decidir

A documentação de text-to-speech lista MP3 de 22,05 a 44,1 kHz e de 32 a 192 kbps, PCM de 16 a 44,1 kHz, mu-law e A-law a 8 kHz para telefonia e Opus a 48 kHz. Para áudio que vai para um editor de vídeo, o PCM evita uma segunda codificação com perdas. Para prévias na web, o MP3 padrão serve.

Um job em lote, passo a passo

  1. Prepare um manifesto. Uma linha por saída: id, voice_id, model_id, text, seed, caminho de saída. Uma linha fica assim: hook-07-en, seu voice id, o id do modelo Flash, "Seu primeiro rascunho levou três horas...", 42, out/hook-07-en.mp3. Conte os caracteres por linha e some. Essa soma vezes a tarifa por 1K é o seu teto de custo antes de enviar qualquer coisa.
  2. Divida textos longos nos limites de frase, abaixo do limite por requisição do modelo, e passe os trechos vizinhos como previous_text e next_text para que as emendas soem contínuas, como a documentação recomenda.
  3. Fixe a seed por voz. Regerar uma linha com a mesma seed e as mesmas configurações a mantém mais próxima do restante da take, de modo que você corrige uma frase em vez de pagar o roteiro inteiro de novo.
  4. Rode um pool de workers limitado, dimensionado pela concorrência do seu plano (próxima seção), para que as requisições nunca passem do teto.
  5. Grave cada arquivo e uma linha de log com id, modelo, contagem de caracteres e custo calculado. Esse log é como você concilia com a fatura.
  6. Repita só o que falhou, por id, para que uma queda no meio do caminho nunca cobre de novo as linhas já concluídas.

A concorrência é o limite que pega

A ElevenLabs mede requisições simultâneas, e não requisições por minuto, segundo o seu texto sobre limitação de taxa. Os tetos por plano, da página de ajuda do erro 429:

  • Free: 2
  • Starter: 3
  • Creator: 5
  • Pro: 10
  • Scale e Business: 15

Os modelos Flash têm limites maiores, entre 4 e 30, dependendo do plano. As requisições acima do teto entram em fila conforme a prioridade do plano, o que, segundo a ElevenLabs, acrescenta cerca de 50 ms, e além disso você recebe um 429.

Tratando os 429 corretamente

A página de ajuda distingue duas causas de 429, que pedem tratamentos diferentes:

  • too_many_concurrent_requests: você passou da concorrência do seu plano. Tentar de novo na hora piora. Reduza o pool.
  • system_busy: carga do lado da ElevenLabs. Costuma funcionar ao tentar de novo.

O padrão recomendado é um pool de concorrência limitado, um token bucket e backoff exponencial com jitter. As respostas trazem os headers current-concurrent-requests e maximum-concurrent-requests, de modo que o seu pool pode ler o teto real em vez de confiar num valor de configuração.

Checklist do executor de lotes

  • Tamanho do pool definido a partir de maximum-concurrent-requests, menos um se algo mais compartilha a chave.
  • model_id definido explicitamente em cada chamada.
  • Backoff com jitter em system_busy; redução do pool em too_many_concurrent_requests.
  • Sem retry em 422: corrija o payload.
  • Contagem de caracteres e custo registrados por arquivo.
  • Ids idempotentes para que uma nova execução pule as linhas concluídas.
  • Preços do período promocional sinalizados no log de custos, para que os números do mês que vem não surpreendam ninguém.

Com um pool de 5 no Creator, 50 vídeos explicativos terminam em umas dez rodadas de requisições. O tempo real é dominado pela geração, e o job é pequeno o bastante para rodar de um notebook.

A locução dentro de um pipeline maior

A locução raramente é a entrega final. Ela fica ao lado de um clipe de vídeo, uma imagem de produto e legendas, e cada um vem de um modelo diferente, com chave, fatura e limite de taxa próprios. Equipes que produzem em volume costumam acabar conduzindo toda a cadeia a partir de um script ou de um agente: um manifesto na entrada, arquivos e seus custos na saída. Uma versão funcional dessa montagem, com um agente orquestrando as etapas, está descrita em automatizar a produção de vídeo com agentes de IA, e o lado do Claude Code em particular em gerar vídeo a partir do Claude Code por meio de um servidor MCP.

A lógica de custo é a mesma em cada etapa. Conte as unidades (caracteres, segundos, imagens), multiplique pelo preço unitário atual, registre ao lado do arquivo e concilie. A voz é a linha mais fácil de acertar, porque os caracteres são conhecidos antes de você enviar a requisição.

FAQ

Quanto custa a API da ElevenLabs por caractere?

No momento da escrita, a página de preços da API lista $0.04 por 1.000 caracteres para Flash e Turbo, $0.08 para Multilingual v2 e v3, e tarifas promocionais de $0.022 para a v4 e $0.011 para a v4 Turbo até 12 de outubro. São de $0.00004 a $0.00008 por caractere a preço de tabela.

Quanto custa uma locução de IA de 1 minuto com a ElevenLabs?

Cerca de 1.200 caracteres, ou seja, aproximadamente $0.048 no Flash e $0.096 no Multilingual v2 pelas tarifas da API de setembro de 2026. A contagem real de caracteres do seu roteiro é a entrada precisa.

Existe um nível gratuito da API da ElevenLabs?

O plano Free inclui 10.000 créditos por mês e 2 requisições simultâneas, mas não permite uso comercial. Locuções para campanhas pagas ou trabalho de clientes exigem Starter ou superior.

Por que recebo erros 429 da API da ElevenLabs?

Ou você passou do limite de requisições simultâneas do seu plano (too_many_concurrent_requests), ou a ElevenLabs está sob carga (system_busy). Reduza o seu pool de workers no primeiro caso e tente de novo com backoff no segundo, como explica a página de ajuda.

Qual é o tamanho máximo de texto por requisição na API da ElevenLabs?

Depende do modelo: 40.000 caracteres no Flash v2.5, 30.000 no Flash v2, 10.000 na v4 e no Multilingual v2, e 5.000 na v3, segundo a documentação de modelos.

Fontes

  1. ElevenLabs: preços da API
  2. ElevenLabs: preços
  3. ElevenLabs: documentação de modelos
  4. ElevenLabs: visão geral do Text to Speech
  5. ElevenLabs: referência da API Text to Speech convert
  6. ElevenLabs: código de erro de API 429
  7. ElevenLabs: limitação de taxa para voz com IA
  8. Puter: preços da API da ElevenLabs, detalhamento completo de custos (jun 2026)
  9. Smallest.ai: os preços da ElevenLabs explicados

Se você prefere não manter uma assinatura separada da ElevenLabs ao lado das suas chaves de vídeo e imagem, a Aitachyon executa a locução da ElevenLabs a partir do mesmo saldo pré-pago de Seedance, Kling, Veo e dos modelos de imagem, a $0.043 a $0.086 por 450 caracteres no momento da escrita (veja a página do modelo ElevenLabs). Essa tarifa por caractere fica acima do preço de tabela direto da API da ElevenLabs. Em troca, você recebe uma única chave para o estúdio web, a API HTTP e o servidor MCP hospedado, cada job detalhado com o modelo em que rodou e o custo, reembolsos automáticos em renders que falham, um alerta de gasto por chave e um saldo que nunca expira. Cada locução ganha uma referência vo_ estável que o seu código pode buscar com GET /api/generations/{ref}. O guia rápido de API e MCP traz a configuração do Claude Code em uma linha.

Artigos relacionados

Ferramentas grátis para experimentar

Pare de descrever a sua marca. Cole o seu URL.

A Aitachyon lê toda a sua marca a partir do seu site e cria vídeos, imagens, carrosséis, publicações e banners, fiéis à marca, em cada formato e cada feed.