Tarifs de l'API ElevenLabs : ce que coûte vraiment une voix off (2026)
Tarifs de l'API ElevenLabs pour 1 000 caractères par modèle, coût d'une voix off de 30 ou 60 s, et génération en lot depuis le code sans erreurs 429.
Tarifs de l'API ElevenLabs : ce que coûte vraiment une voix off (2026)
Une voix off de 30 secondes représente environ 600 caractères de script. Au tarif API standard le moins cher d'ElevenLabs à la date de rédaction, cela fait à peu près deux centimes et demi d'audio. Ce qui décide vraiment de votre facture, c'est le nombre de prises, de langues et de variantes que vous générez, et le modèle que vous avez choisi sans y réfléchir.
Ce guide détaille les tarifs par caractère modèle par modèle, les convertit en durées que vous livrez réellement (30 et 60 secondes), chiffre des lots réalistes, puis traite ce que la plupart des pages tarifaires ignorent : générer des centaines de voix off depuis le code sans dépasser la limite de concurrence. Tous les chiffres ont été vérifiés le 30 septembre 2026. ElevenLabs modifie ses tarifs, parfois avec des promotions limitées dans le temps, donc la page tarifaire en ligne fait foi.
Tarifs de l'API ElevenLabs par modèle, en septembre 2026
ElevenLabs facture la synthèse vocale au caractère. Sa page des tarifs API affiche ces prix pour 1 000 caractères à la date de rédaction :
- Eleven v4 : $0.022 pour 1 000 caractères, soit 72 % de remise promotionnelle sur le tarif public de $0.08, valable jusqu'au 12 octobre.
- Eleven v4 Turbo : $0.011 pour 1 000 caractères, également 72 % de remise, depuis un tarif public de $0.04, même date de fin.
- Eleven v3 : $0.08 pour 1 000 caractères.
- Eleven v3 Conversational : $0.04 pour 1 000 caractères.
- Multilingual v2 : $0.08 pour 1 000 caractères.
- Flash et Turbo : $0.04 pour 1 000 caractères.
Deux points avant de bâtir un budget sur ces chiffres. D'abord, les prix de la v4 sont promotionnels. Tout modèle de coûts qui dépasse la mi-octobre doit utiliser les tarifs publics de $0.08 et $0.04, sinon la dépense sera sous-estimée d'un facteur proche de quatre. Ensuite, des articles tiers plus anciens citent d'autres chiffres. Un tutoriel de Puter de juin 2026 indique $0.05 pour 1 000 caractères sur Flash et Turbo et $0.10 sur Multilingual v2 et v3. Les tarifs ont bougé en un seul trimestre, ce qui plaide pour récupérer les prix à la source à l'exécution plutôt que de les figer dans le code.
Comment les crédits se convertissent en caractères
La page tarifaire grand public compte la synthèse vocale à raison de 1 crédit par caractère. Les modèles Flash sont moins chers en crédits : l'analyse de Smallest.ai les situe entre 0,5 et 1 crédit par caractère selon le forfait. Ce second chiffre vient d'un tiers, alors vérifiez-le sur votre propre tableau de bord de consommation avant de vous y fier.
Ce que coûtent une voix off de 30 secondes et une de 60 secondes
Les tarifs sont donnés pour 1 000 caractères, alors que les scripts se planifient en secondes : il faut donc une conversion. La règle habituelle est d'environ 1 200 caractères par minute de parole, que Smallest.ai déduit d'une narration de deux minutes qui tombe autour de 2 400 caractères. Cela donne environ 600 caractères pour 30 secondes et 1 200 pour 60 secondes. Un script de 500 mots atteint près de 3 000 caractères selon la même source.
Appliquez les tarifs API de septembre 2026 :
- Flash / Turbo ($0.04 pour 1 000) : 30 s = 0,6 x $0.04 = $0.024. 60 s = 1,2 x $0.04 = $0.048.
- Multilingual v2 ou v3 ($0.08 pour 1 000) : 30 s = $0.048. 60 s = $0.096.
- v4 en promo ($0.022 pour 1 000) : 30 s = environ $0.013. 60 s = environ $0.026.
- v4 Turbo en promo ($0.011 pour 1 000) : 30 s = environ $0.007. 60 s = environ $0.013.
Une formule de coût à coller dans un tableur
À environ 1 200 caractères par minute, la parole tourne autour de 20 caractères par seconde. On en tire une estimation en une ligne :
- Caractères = secondes x 20
- Coût par voix off = caractères x tarif pour 1 000 / 1 000
- Coût par lot = coût par voix off x variantes x langues x prises
La dernière ligne est celle que l'on oublie. Trois prises par script dans deux langues multiplient la ligne voix par six avant même que quelqu'un n'écoute un fichier.
Le rythme fait bouger ces chiffres. Une vidéo explicative calme se lit plus lentement qu'une accroche rapide façon UGC, donc les mêmes 30 secondes peuvent contenir nettement plus ou moins de caractères. Si vous hésitez encore sur le ton et le débit, les compromis sont détaillés dans choisir la bonne voix et le bon rythme pour les voix off publicitaires. Pour le budget, comptez les caractères du script réel et gardez la règle à la minute comme simple vérification.
Crédits d'abonnement ou tarif API au caractère
ElevenLabs vend aussi des forfaits mensuels qui incluent des crédits. La page tarifaire affiche, à la date de rédaction :
- Free : 10 000 crédits, sans usage commercial.
- Starter : 30 000 crédits pour $6.
- Creator : 121 000 crédits pour $22 ($11 le premier mois).
- Pro : 600 000 crédits pour $99.
- Scale : 1 800 000 crédits pour $299.
- Business : 6 000 000 crédits pour $990.
Divisez le prix par les crédits et vous obtenez le coût implicite pour 1 000 crédits : $0.20 sur Starter, environ $0.18 sur Creator (environ $0.09 le premier mois remisé), et environ $0.165 sur Pro, Scale et Business. À 1 crédit par caractère, ces tarifs implicites se situent au-dessus des prix publics de l'API au caractère cités plus haut. Le tutoriel de Puter décrit le modèle comme le même tarif unitaire à tous les niveaux, les abonnements regroupant la consommation. Les deux pages officielles ne se rapprochent pas proprement vues de l'extérieur, donc avant de vous engager sur un forfait, faites tourner une semaine de trafic réel et comparez la facture au calcul.
Ce que les forfaits apportent en plus des crédits, c'est de la marge. Le niveau du forfait fixe votre plafond de concurrence (sections suivantes) et la licence commerciale. ElevenLabs indique que l'usage commercial commence à Starter, et la documentation de la synthèse vocale répète que l'usage commercial exige un forfait payant. Tout ce qui passe en publicité payante demande au moins Starter.
Si vous hésitez de façon générale entre des crédits groupés et un paiement à l'appel, le raisonnement vaut aussi pour la vidéo et l'image, et il est détaillé dans crédits contre paiement à l'appel.
Budgets de lots : le calcul pour des charges réelles
Une seule voix off coûte trop peu pour compter, si bien que le choix du modèle n'apparaît qu'en rendant par lots. Voici quatre charges courantes, chiffrées aux tarifs publics de l'API de septembre 2026 pour Flash ($0.04 pour 1 000) et Multilingual v2 ($0.08 pour 1 000), à raison de 600 caractères pour 30 secondes.
20 variantes d'accroche pour une publicité
Les accroches sont courtes. Supposons qu'accroche et corps forment une lecture de 30 secondes : 20 variantes x 600 caractères = 12 000 caractères. Flash : $0.48. Multilingual v2 : $0.96. Si vous écrivez ces variantes, ces modèles d'accroche vous donnent 18 ouvertures à faire tourner.
Une semaine de shorts quotidiens de 60 secondes
7 x 1 200 = 8 400 caractères. Flash : environ $0.34. Multilingual v2 : environ $0.67.
50 vidéos explicatives produit de 60 secondes
50 x 1 200 = 60 000 caractères. Flash : $2.40. Multilingual v2 : $4.80.
Une publicité de 60 secondes localisée en six langues
6 x 1 200 = 7 200 caractères. Multilingual v2 : environ $0.58. Les scripts traduits gardent rarement la longueur exacte de l'anglais, donc budgétez chaque langue à partir du texte traduit. Le versant production est traité dans diffuser des publicités vidéo en plusieurs langues.
À grande échelle, l'écart entre les modèles est réel mais modeste en valeur absolue. L'exemple de Puter de 3 millions de caractères revenait à $150 sur Flash contre $300 sur Multilingual, avec ses anciens tarifs. Pour la plupart des équipes publicité et contenu, la voix est la ligne la moins chère de la chaîne. L'erreur coûteuse consiste à régénérer un script entier pour corriger une seule phrase, ce que les paramètres de continuité ci-dessous aident à éviter.
Choisir un modèle : prix, langues, limites et latence
Le prix n'est qu'un axe sur quatre. La documentation des modèles ElevenLabs détaille les autres :
- Langues : la v4 en couvre plus de 90, la v3 plus de 70, Flash v2.5 en couvre 32, Multilingual v2 en couvre 29, et Flash v2 ne gère que l'anglais.
- Caractères par requête : Flash v2.5 en accepte 40 000, Flash v2 30 000, v4 et Multilingual v2 10 000 chacun, et v3 5 000.
- Latence : Flash v2.5 autour de 75 ms, v4 Turbo autour de 100 ms, v3 Conversational autour de 280 ms.
Une règle de décision réutilisable
- Anglais uniquement, gros volume, latence importante (agents en direct, aperçus, brouillons internes) : Flash. Prix public le plus bas, plus grande taille de requête, le plus rapide.
- Voix off publicitaire finale dans une langue majeure : Multilingual v2 ou v3 au tarif public, ou v4 tant que la promotion dure. Générez quelques prises et gardez la meilleure.
- Langue hors des 29 de Multilingual v2 : vérifiez d'abord la couverture de la v4 (plus de 90) ou de la v3 (plus de 70).
- Narration longue en un seul appel : la limite de 40 000 caractères de Flash v2.5 accepte un script qu'il faudrait découper avec les 5 000 de la v3.
- Budget au-delà du 12 octobre : chiffrez la v4 à $0.08 et la v4 Turbo à $0.04, quoi qu'affiche la page aujourd'hui.
Les jugements de qualité entre modèles sont subjectifs et changent à chaque version. Le test pratique coûte peu : à quelques centimes les 60 secondes, générez le même script sur deux modèles et écoutez.
Générer des voix off en lot depuis le code
Le point d'accès est simple. La référence de l'API le documente ainsi :
- Requête : POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}, avec votre clé dans l'en-tête xi-api-key.
- Corps : text est obligatoire. model_id vaut par défaut eleven_multilingual_v2, et output_format vaut par défaut mp3_44100_128.
- Cohérence : seed prend un entier de 0 à 4 294 967 295, et previous_text et next_text donnent au modèle le contexte autour d'un fragment.
- Normalisation : apply_text_normalization accepte auto, on ou off.
- Réponse : de l'audio binaire avec un 200, et un 422 en cas d'erreur de validation.
Attention au modèle par défaut. Si votre script omet model_id, chaque appel tourne sur Multilingual v2 à $0.08 pour 1 000, soit le double du tarif Flash. Renseignez-le explicitement.
Le format de sortie ne coûte rien, mais mérite un choix
La documentation de la synthèse vocale liste le MP3 de 22,05 à 44,1 kHz et de 32 à 192 kbit/s, le PCM de 16 à 44,1 kHz, le mu-law et l'A-law à 8 kHz pour la téléphonie, et l'Opus à 48 kHz. Pour de l'audio destiné à un logiciel de montage, le PCM évite un second encodage avec perte. Pour des aperçus web, le MP3 par défaut convient.
Un traitement par lot, étape par étape
- Préparez un manifeste. Une ligne par sortie : id, voice_id, model_id, text, seed, chemin de sortie. Une ligne ressemble à hook-07-en, votre voice id, l'id du modèle Flash, "Votre premier brouillon a pris trois heures...", 42, out/hook-07-en.mp3. Comptez les caractères de chaque ligne et additionnez. Cette somme multipliée par le tarif pour 1 000 est votre plafond de coût avant tout envoi.
- Découpez les textes longs aux limites de phrase sous la limite de requête du modèle, et transmettez les fragments voisins en previous_text et next_text pour que les raccords sonnent en continu, comme le recommande la documentation.
- Fixez la seed par voix. Régénérer une ligne avec la même seed et les mêmes réglages la garde plus proche du reste de la prise, si bien que vous corrigez une phrase au lieu de repayer tout le script.
- Lancez un pool de workers borné, dimensionné sur la concurrence de votre forfait (section suivante), pour que les requêtes ne dépassent jamais le plafond.
- Écrivez chaque fichier et une ligne de journal avec l'id, le modèle, le nombre de caractères et le coût calculé. Ce journal sert à rapprocher la facture.
- Ne relancez que ce qui a échoué, par id, pour qu'un plantage à mi-parcours ne refacture jamais les lignes terminées.
La concurrence est la limite qui bloque
ElevenLabs mesure les requêtes simultanées, pas les requêtes par minute, d'après son article sur la limitation de débit. Les plafonds par forfait, tirés de la page d'aide sur l'erreur 429 :
- Free : 2
- Starter : 3
- Creator : 5
- Pro : 10
- Scale et Business : 15
Les modèles Flash ont des limites plus hautes, entre 4 et 30 selon le forfait. Les requêtes au-delà du plafond sont mises en file selon la priorité du forfait, ce qui ajoute environ 50 ms d'après ElevenLabs, et au-delà vous recevez un 429.
Traiter correctement les 429
La page d'aide distingue deux causes de 429, qui demandent un traitement différent :
- too_many_concurrent_requests : vous avez dépassé la concurrence de votre forfait. Réessayer immédiatement aggrave la situation. Réduisez le pool.
- system_busy : charge côté ElevenLabs. Une nouvelle tentative réussit en général.
Le schéma recommandé combine un pool de concurrence borné, un token bucket et un backoff exponentiel avec jitter. Les réponses portent les en-têtes current-concurrent-requests et maximum-concurrent-requests, de sorte que votre pool peut lire son vrai plafond au lieu de se fier à une valeur de configuration.
Liste de contrôle pour un traitement par lot
- Taille du pool déduite de maximum-concurrent-requests, moins un si autre chose partage la clé.
- model_id renseigné explicitement à chaque appel.
- Backoff avec jitter sur system_busy ; réduction du pool sur too_many_concurrent_requests.
- Pas de nouvelle tentative sur un 422 : corrigez la requête.
- Nombre de caractères et coût journalisés pour chaque fichier.
- Ids idempotents pour qu'une relance saute les lignes terminées.
- Prix de la période promotionnelle signalés dans le journal des coûts, pour que les chiffres du mois prochain ne surprennent personne.
Avec un pool de 5 sur Creator, 50 vidéos explicatives se terminent en une dizaine de tours de requêtes. Le temps réel est dominé par la génération, et le travail est assez léger pour tourner depuis un portable.
La voix off au sein d'une chaîne plus large
Une voix off est rarement le livrable. Elle accompagne un clip vidéo, un plan produit et des sous-titres, et chacun vient d'un modèle différent avec sa propre clé, sa facture et sa limite de débit. Les équipes qui produisent en volume finissent en général par piloter toute la chaîne depuis un script ou un agent : un manifeste en entrée, des fichiers et leurs coûts en sortie. Une version fonctionnelle de ce montage, avec un agent qui orchestre les étapes, est décrite dans automatiser la production vidéo avec des agents IA, et le côté Claude Code en particulier dans générer de la vidéo depuis Claude Code via un serveur MCP.
La logique de coût est la même à chaque étape. Comptez les unités (caractères, secondes, images), multipliez par le prix unitaire actuel, journalisez à côté du fichier, puis rapprochez. La voix est la ligne la plus simple à maîtriser, car les caractères sont connus avant l'envoi de la requête.
FAQ
Combien coûte l'API ElevenLabs par caractère ?
À la date de rédaction, la page des tarifs API affiche $0.04 pour 1 000 caractères sur Flash et Turbo, $0.08 sur Multilingual v2 et v3, et des tarifs promotionnels de $0.022 pour la v4 et $0.011 pour la v4 Turbo jusqu'au 12 octobre. Cela fait de $0.00004 à $0.00008 par caractère au tarif public.
Combien coûte une voix off IA d'une minute avec ElevenLabs ?
Environ 1 200 caractères, donc à peu près $0.048 sur Flash et $0.096 sur Multilingual v2 aux tarifs API de septembre 2026. Le nombre réel de caractères de votre script est la donnée précise.
Existe-t-il une offre gratuite de l'API ElevenLabs ?
Le forfait Free comprend 10 000 crédits par mois et 2 requêtes simultanées, mais il n'autorise pas l'usage commercial. Les voix off pour des campagnes payantes ou du travail client demandent Starter ou supérieur.
Pourquoi je reçois des erreurs 429 de l'API ElevenLabs ?
Soit vous dépassez la limite de requêtes simultanées de votre forfait (too_many_concurrent_requests), soit ElevenLabs est en surcharge (system_busy). Réduisez votre pool de workers dans le premier cas, réessayez avec un backoff dans le second, comme l'explique la page d'aide.
Quelle est la longueur de texte maximale par requête de l'API ElevenLabs ?
Elle dépend du modèle : 40 000 caractères sur Flash v2.5, 30 000 sur Flash v2, 10 000 sur v4 et Multilingual v2, et 5 000 sur v3, d'après la documentation des modèles.
Sources
- ElevenLabs : tarifs de l'API
- ElevenLabs : tarifs
- ElevenLabs : documentation des modèles
- ElevenLabs : présentation de la synthèse vocale
- ElevenLabs : référence de l'API Text to Speech convert
- ElevenLabs : code d'erreur API 429
- ElevenLabs : limitation de débit pour la voix IA
- Puter : tarifs de l'API ElevenLabs, détail complet des coûts (juin 2026)
- Smallest.ai : les tarifs ElevenLabs expliqués
Si vous préférez ne pas garder un abonnement ElevenLabs séparé à côté de vos clés vidéo et image, Aitachyon fait tourner la voix off ElevenLabs sur le même solde prépayé que Seedance, Kling, Veo et les modèles d'image, à $0.043 à $0.086 pour 450 caractères à la date de rédaction (voir la page du modèle ElevenLabs). Ce tarif au caractère est supérieur au prix public direct de l'API ElevenLabs. En échange, vous avez une seule clé pour le studio web, l'API HTTP et le serveur MCP hébergé, chaque job détaillé avec le modèle utilisé et son coût, des remboursements automatiques sur les rendus échoués, une alerte de dépense par clé, et un solde qui n'expire jamais. Chaque voix off reçoit une référence vo_ stable que votre code peut récupérer avec GET /api/generations/{ref}. Le démarrage rapide API et MCP contient la configuration Claude Code en une ligne.
Articles similaires
Tarifs de l'API Seedance 2.5 : ce que coûte vraiment un clip
Tarifs de l'API Seedance 2.5 par seconde en 480p, 720p et 1080p, coûts réels de clips de 5, 10 et 30 s et de lots, et où y accéder sans abonnement.
GuidesPrix des API de génération vidéo IA en 2026, modèle par modèle
Comment les API vidéo IA facturent (seconde, clip, crédits), ce qui fait varier le prix, les tarifs par modèle et des budgets de batch avec relances.
GuidesAPI Veo 3.1 Fast : prix, limites et mode d'appel
Prix par seconde de l'API Veo 3.1 Fast, durées, résolutions, latence et quotas d'après la doc de Google, et comment l'appeler depuis le code ou Claude Code.
GuidesVidéos publicitaires immobilières qui génèrent des visites
Comment les agents et promoteurs transforment leurs reels de biens, angles quartier et CTA percutants en visites confirmées — specs, logique d'entonnoir et plan de tournage réutilisable.
GuidesPublicités vidéo pour salles de sport et studios fitness : le guide 2026
Comment les salles de sport, studios et coachs diffusent des vidéos publicitaires qui remplissent les cours — transformation, offres d'essai payant, ciblage géographique local et cadence de renouvellement créatif.
GuidesPublicités vidéo Black Friday : un plan de production sur deux semaines
Un calendrier créatif BFCM jour par jour pour que vos vidéos d'offre soient testées et validées avant que les CPM Meta grimpent jusqu'à 16 % — avec specs sourcées et checklist.
Outils gratuits à essayer
Free AI image generator
Describe what you want and get a high-quality AI image in seconds. A free AI image generator, no account needed to preview, keep your first image when you sign up.
Essayer gratuitementFree toolFree AI product photo generator
Generate clean, studio-style product photos for your store and listings in seconds. Crisp lighting and tidy backgrounds, free to try with no account, keep your first shot on signup.
Essayer gratuitementFree toolFree background remover
Remove the background from any image in seconds and get a clean, transparent cutout. A free background remover, no account needed to preview, keep your first cutout when you sign up.
Essayer gratuitementArrêtez de décrire votre marque. Collez votre URL.
Aitachyon lit toute votre marque depuis votre site, puis crée vidéos, images, carrousels, posts et bannières, fidèles à votre marque, pour chaque format et chaque réseau.