Prezzi dell'API di ElevenLabs: quanto costa davvero un voiceover (2026)
Prezzi dell'API di ElevenLabs per 1.000 caratteri e per modello, costo di un voiceover da 30 o 60 secondi e come generarli in batch da codice senza errori 429.
Prezzi dell'API di ElevenLabs: quanto costa davvero un voiceover (2026)
Un voiceover di 30 secondi corrisponde a circa 600 caratteri di copione. Con la tariffa API standard più economica di ElevenLabs, al momento della stesura, sono più o meno due centesimi e mezzo di audio. Ciò che decide davvero la fattura è quante take, lingue e varianti generi, e quale modello hai scelto senza pensarci.
Questa guida esamina le tariffe per carattere modello per modello, le converte nelle durate che consegni davvero (30 e 60 secondi), prezza batch realistici e poi affronta la parte che la maggior parte delle pagine dei prezzi salta: generare centinaia di voiceover da codice senza sforare il limite di concorrenza. Tutte le cifre sono state verificate il 30 settembre 2026. ElevenLabs cambia le tariffe, a volte con promozioni a tempo, quindi la pagina dei prezzi aggiornata ha l'ultima parola.
Prezzi dell'API di ElevenLabs per modello, a settembre 2026
ElevenLabs fattura la sintesi vocale a carattere. La sua pagina dei prezzi API riporta queste tariffe per 1.000 caratteri al momento della stesura:
- Eleven v4: $0.022 per 1K caratteri, uno sconto promozionale del 72% sul prezzo di listino di $0.08, valido fino al 12 ottobre.
- Eleven v4 Turbo: $0.011 per 1K caratteri, anch'esso con sconto del 72%, da un prezzo di listino di $0.04, stessa data di fine.
- Eleven v3: $0.08 per 1K caratteri.
- Eleven v3 Conversational: $0.04 per 1K caratteri.
- Multilingual v2: $0.08 per 1K caratteri.
- Flash e Turbo: $0.04 per 1K caratteri.
Due avvertenze prima di costruire un budget su questi numeri. Primo, i prezzi della v4 sono promozionali. Qualsiasi modello di costo che vada oltre metà ottobre deve usare i prezzi di listino di $0.08 e $0.04, altrimenti sottostimerà la spesa di quasi quattro volte. Secondo, articoli di terzi più vecchi riportano cifre diverse. Un tutorial di Puter di giugno 2026 indica $0.05 per 1K per Flash e Turbo e $0.10 per 1K per Multilingual v2 e v3. Le tariffe si sono mosse nell'arco di un solo trimestre, ed è il motivo principale per leggere i prezzi dalla fonte a runtime invece di scriverli fissi nel codice.
Come i crediti si traducono in caratteri
La pagina dei prezzi per il pubblico misura la sintesi vocale a 1 credito per carattere. I modelli Flash costano meno in crediti: l'analisi di Smallest.ai li colloca tra 0,5 e 1 credito per carattere a seconda del piano. Quest'ultima cifra viene da una terza parte, quindi confermala sulla tua dashboard di utilizzo prima di farci affidamento.
Quanto costano un voiceover da 30 secondi e uno da 60
Le tariffe sono espresse per 1.000 caratteri, mentre i copioni si pianificano in secondi, quindi serve una conversione. Quella abituale è circa 1.200 caratteri per minuto di parlato, che Smallest.ai ricava da una narrazione di due minuti che si assesta intorno ai 2.400 caratteri. Ne vengono circa 600 caratteri per una lettura da 30 secondi e 1.200 per 60. Un copione di 500 parole arriva vicino ai 3.000 caratteri secondo la stessa fonte.
Applica le tariffe API di settembre 2026:
- Flash / Turbo ($0.04 per 1K): 30 s = 0.6 x $0.04 = $0.024. 60 s = 1.2 x $0.04 = $0.048.
- Multilingual v2 o v3 ($0.08 per 1K): 30 s = $0.048. 60 s = $0.096.
- v4 in promo ($0.022 per 1K): 30 s = circa $0.013. 60 s = circa $0.026.
- v4 Turbo in promo ($0.011 per 1K): 30 s = circa $0.007. 60 s = circa $0.013.
Una formula di costo da incollare in un foglio di calcolo
A circa 1.200 caratteri al minuto, il parlato viaggia intorno ai 20 caratteri al secondo. Ne esce una stima in una riga:
- Caratteri = secondi x 20
- Costo per voiceover = caratteri x tariffa per 1K / 1.000
- Costo per batch = costo per voiceover x varianti x lingue x take
L'ultima riga è quella che tutti dimenticano. Tre take per copione in due lingue moltiplicano per sei la voce di costo del parlato prima che qualcuno ascolti un solo file.
Il ritmo sposta questi numeri. Un video esplicativo di prodotto, pacato, si legge più lentamente di un hook veloce in stile UGC, quindi gli stessi 30 secondi possono contenere sensibilmente più o meno caratteri. Se stai ancora decidendo tono e velocità, i compromessi sono trattati in come scegliere voce e ritmo per i voiceover degli annunci. Per il budget, conta i caratteri del copione reale e usa la regola al minuto solo come controllo di plausibilità.
Crediti in abbonamento contro la tariffa API a carattere
ElevenLabs vende anche piani mensili che includono crediti. La pagina dei prezzi riporta, al momento della stesura:
- Free: 10.000 crediti, senza uso commerciale.
- Starter: 30.000 crediti a $6.
- Creator: 121.000 crediti a $22 ($11 il primo mese).
- Pro: 600.000 crediti a $99.
- Scale: 1.800.000 crediti a $299.
- Business: 6.000.000 di crediti a $990.
Dividendo il prezzo per i crediti si ottiene il costo implicito per 1.000 crediti: $0.20 su Starter, circa $0.18 su Creator (circa $0.09 nel primo mese scontato) e circa $0.165 su Pro, Scale e Business. A 1 credito per carattere, queste tariffe implicite stanno sopra i prezzi di listino dell'API a carattere citati prima. Il tutorial di Puter descrive il modello come la stessa tariffa per unità a ogni livello, con gli abbonamenti che raggruppano i consumi. Le due pagine ufficiali non tornano del tutto viste da fuori, quindi prima di impegnarti su un piano fai girare una settimana di traffico reale e confronta la fattura con l'aritmetica.
Ciò che i piani danno oltre ai crediti è margine. Il livello del piano fissa il tuo tetto di concorrenza (sezioni successive) e la licenza commerciale. ElevenLabs dichiara che l'uso commerciale parte da Starter e la documentazione text-to-speech ribadisce che l'uso commerciale richiede un piano a pagamento. Tutto ciò che va in pubblicità a pagamento richiede almeno Starter.
Se stai valutando in generale crediti inclusi contro pagamento a chiamata, il ragionamento vale anche per video e immagini ed è sviluppato in prezzi a crediti contro pagamento a chiamata.
Budget dei batch: l'aritmetica per carichi di lavoro reali
Un singolo voiceover costa troppo poco per contare, quindi la scelta del modello si vede solo quando generi in batch. Ecco quattro carichi comuni, calcolati alle tariffe di listino API di settembre 2026 per Flash ($0.04 per 1K) e Multilingual v2 ($0.08 per 1K), con 600 caratteri ogni 30 secondi.
20 varianti di hook per un annuncio
Gli hook sono brevi. Supponiamo che hook più corpo facciano una lettura da 30 secondi: 20 varianti x 600 caratteri = 12.000 caratteri. Flash: $0.48. Multilingual v2: $0.96. Se stai scrivendo queste varianti, questi modelli di hook ti danno 18 aperture da far ruotare.
Una settimana di short quotidiani da 60 secondi
7 x 1.200 = 8.400 caratteri. Flash: circa $0.34. Multilingual v2: circa $0.67.
50 video esplicativi di prodotto da 60 secondi
50 x 1.200 = 60.000 caratteri. Flash: $2.40. Multilingual v2: $4.80.
Un annuncio da 60 secondi localizzato in sei lingue
6 x 1.200 = 7.200 caratteri. Multilingual v2: circa $0.58. I copioni tradotti raramente mantengono la lunghezza esatta dell'inglese, quindi fai il budget per ogni lingua partendo dal testo tradotto. Il lato produzione è trattato in come portare annunci video in più lingue.
A grandi volumi il divario tra i modelli è reale ma piccolo in termini assoluti. L'esempio di Puter con 3 milioni di caratteri arrivava a $150 su Flash contro $300 su Multilingual, alle sue tariffe precedenti. Per la maggior parte dei team di advertising e contenuti, la voce è la voce più economica dello stack. L'errore costoso è rigenerare interi copioni per correggere una sola frase, cosa che i parametri di continuità più sotto aiutano a evitare.
Scegliere un modello: prezzo, lingue, limiti e latenza
Il prezzo è uno dei quattro assi. La documentazione dei modelli ElevenLabs elenca gli altri:
- Lingue: v4 ne copre oltre 90, v3 oltre 70, Flash v2.5 ne copre 32, Multilingual v2 ne copre 29 e Flash v2 è solo inglese.
- Caratteri per richiesta: Flash v2.5 ne accetta 40.000, Flash v2 30.000, v4 e Multilingual v2 10.000 ciascuno, e v3 5.000.
- Latenza: Flash v2.5 intorno ai 75 ms, v4 Turbo intorno ai 100 ms, v3 Conversational intorno ai 280 ms.
Una regola di decisione riutilizzabile
- Solo inglese, volume alto, la latenza conta (agenti live, anteprime, bozze interne): Flash. Prezzo di listino più basso, richiesta più grande, il più veloce.
- Voiceover finale di un annuncio in una delle lingue principali: Multilingual v2 o v3 a prezzo di listino, oppure v4 finché dura la promozione. Genera alcune take e tieni la migliore.
- Lingua fuori dalle 29 di Multilingual v2: controlla prima la copertura di v4 (oltre 90) o v3 (oltre 70).
- Narrazione lunga in una sola chiamata: il limite di 40.000 caratteri di Flash v2.5 contiene un copione che con i 5.000 di v3 andrebbe spezzato.
- Budget oltre il 12 ottobre: calcola v4 a $0.08 e v4 Turbo a $0.04, qualunque cosa mostri la pagina oggi.
I giudizi di qualità tra modelli sono soggettivi e cambiano a ogni rilascio. Il test pratico costa poco: a pochi centesimi ogni 60 secondi, genera lo stesso copione su due modelli e ascolta.
Generare voiceover in batch da codice
L'endpoint è semplice. Il riferimento API lo documenta così:
- Richiesta: POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}, con la tua chiave nell'header xi-api-key.
- Body: text è obbligatorio. model_id vale per default eleven_multilingual_v2, e output_format vale per default mp3_44100_128.
- Coerenza: seed accetta un intero da 0 a 4.294.967.295, e previous_text e next_text danno al modello il contesto intorno a un frammento.
- Normalizzazione: apply_text_normalization accetta auto, on oppure off.
- Risposta: audio binario con 200, e 422 in caso di errore di validazione.
Attenzione al modello predefinito. Se il tuo script omette model_id, ogni chiamata gira su Multilingual v2 a $0.08 per 1K, il doppio della tariffa Flash. Impostalo in modo esplicito.
Il formato di output non costa nulla, ma va comunque scelto
La documentazione text-to-speech elenca MP3 da 22,05 a 44,1 kHz e da 32 a 192 kbps, PCM da 16 a 44,1 kHz, mu-law e A-law a 8 kHz per la telefonia e Opus a 48 kHz. Per l'audio che finisce in un editor video, il PCM evita una seconda codifica con perdita. Per le anteprime web va bene l'MP3 predefinito.
Un job batch, passo dopo passo
- Prepara un manifest. Una riga per output: id, voice_id, model_id, text, seed, percorso di output. Una riga si presenta così: hook-07-en, il tuo voice id, l'id del modello Flash, "La tua prima bozza ha richiesto tre ore...", 42, out/hook-07-en.mp3. Conta i caratteri per riga e sommali. Quella somma per la tariffa per 1K è il tuo tetto di costo prima di inviare qualsiasi cosa.
- Spezza i testi lunghi ai confini di frase sotto il limite per richiesta del modello, e passa i frammenti adiacenti come previous_text e next_text perché le giunzioni suonino continue, come raccomanda la documentazione.
- Fissa il seed per voce. Rigenerare una riga con lo stesso seed e le stesse impostazioni la mantiene più vicina al resto della take, così correggi una frase invece di pagare di nuovo l'intero copione.
- Esegui un pool di worker limitato, dimensionato sulla concorrenza del tuo piano (sezione successiva), in modo che le richieste non superino mai il tetto.
- Scrivi ogni file e una riga di log con id, modello, numero di caratteri e costo calcolato. Quel log serve per riconciliare con la fattura.
- Ritenta solo ciò che è fallito, per id, così un crash a metà non riaddebita mai le righe già completate.
La concorrenza è il limite che morde
ElevenLabs misura le richieste concorrenti, non le richieste al minuto, secondo il suo articolo sul rate limiting. I tetti per piano, dalla pagina di aiuto sull'errore 429:
- Free: 2
- Starter: 3
- Creator: 5
- Pro: 10
- Scale e Business: 15
I modelli Flash hanno limiti più alti, tra 4 e 30 a seconda del piano. Le richieste oltre il tetto vanno in coda in base alla priorità del piano, cosa che secondo ElevenLabs aggiunge circa 50 ms, e oltre quel punto ricevi un 429.
Gestire correttamente i 429
La pagina di aiuto distingue due cause di 429, che richiedono una gestione diversa:
- too_many_concurrent_requests: hai superato la concorrenza del tuo piano. Riprovare subito peggiora le cose. Riduci il pool.
- system_busy: carico dal lato ElevenLabs. Di solito riesce al nuovo tentativo.
Il pattern consigliato è un pool di concorrenza limitato, un token bucket e un backoff esponenziale con jitter. Le risposte portano gli header current-concurrent-requests e maximum-concurrent-requests, così il tuo pool può leggere il tetto reale invece di fidarsi di un valore di configurazione.
Checklist del runner batch
- Dimensione del pool ricavata da maximum-concurrent-requests, meno uno se qualcos'altro condivide la chiave.
- model_id impostato esplicitamente a ogni chiamata.
- Backoff con jitter su system_busy; riduzione del pool su too_many_concurrent_requests.
- Nessun retry su 422: correggi invece il payload.
- Numero di caratteri e costo registrati per ogni file.
- Id idempotenti, così una riesecuzione salta le righe completate.
- Prezzi del periodo promozionale segnalati nel log dei costi, perché i numeri del mese prossimo non sorprendano nessuno.
Con un pool di 5 su Creator, 50 video esplicativi finiscono in circa dieci giri di richieste. Il tempo reale è dominato dalla generazione, e il job è abbastanza piccolo da girare da un portatile.
Il voiceover dentro una pipeline più grande
Il voiceover è raramente il prodotto finale. Sta accanto a una clip video, a uno scatto di prodotto e ai sottotitoli, e ciascuno arriva da un modello diverso con la propria chiave, la propria fattura e il proprio rate limit. I team che producono in volume di solito finiscono per guidare l'intera catena da uno script o da un agente: un manifest in ingresso, file e relativi costi in uscita. Una versione funzionante di questa configurazione, con un agente che orchestra i passaggi, è descritta in automatizzare la produzione video con agenti IA, e il lato Claude Code in particolare in generare video da Claude Code tramite un server MCP.
La logica dei costi è la stessa a ogni passaggio. Conta le unità (caratteri, secondi, immagini), moltiplica per il prezzo unitario corrente, registralo accanto al file e riconcilia. La voce è la riga più facile da azzeccare, perché i caratteri si conoscono prima di inviare la richiesta.
FAQ
Quanto costa l'API di ElevenLabs per carattere?
Al momento della stesura, la pagina dei prezzi API riporta $0.04 per 1.000 caratteri per Flash e Turbo, $0.08 per Multilingual v2 e v3, e tariffe promozionali di $0.022 per v4 e $0.011 per v4 Turbo fino al 12 ottobre. Sono da $0.00004 a $0.00008 per carattere a prezzo di listino.
Quanto costa un voiceover IA di 1 minuto con ElevenLabs?
Circa 1.200 caratteri, quindi grosso modo $0.048 su Flash e $0.096 su Multilingual v2 alle tariffe API di settembre 2026. Il dato preciso è il numero effettivo di caratteri del tuo copione.
Esiste un livello gratuito dell'API di ElevenLabs?
Il piano Free include 10.000 crediti al mese e 2 richieste concorrenti, ma non consente l'uso commerciale. I voiceover per campagne a pagamento o lavori per clienti richiedono Starter o superiore.
Perché ricevo errori 429 dall'API di ElevenLabs?
O hai superato il limite di richieste concorrenti del tuo piano (too_many_concurrent_requests) oppure ElevenLabs è sotto carico (system_busy). Riduci il pool di worker nel primo caso, ritenta con backoff nel secondo, come spiega la pagina di aiuto.
Qual è la lunghezza massima del testo per richiesta all'API di ElevenLabs?
Dipende dal modello: 40.000 caratteri su Flash v2.5, 30.000 su Flash v2, 10.000 su v4 e Multilingual v2, e 5.000 su v3, secondo la documentazione dei modelli.
Fonti
- ElevenLabs: prezzi dell'API
- ElevenLabs: prezzi
- ElevenLabs: documentazione dei modelli
- ElevenLabs: panoramica di Text to Speech
- ElevenLabs: riferimento API Text to Speech convert
- ElevenLabs: codice di errore API 429
- ElevenLabs: rate limiting per la voce IA
- Puter: prezzi dell'API ElevenLabs, dettaglio completo dei costi (giu 2026)
- Smallest.ai: i prezzi di ElevenLabs spiegati
Se preferisci non tenere un abbonamento ElevenLabs separato accanto alle tue chiavi video e immagini, Aitachyon esegue il voiceover ElevenLabs dallo stesso saldo prepagato di Seedance, Kling, Veo e dei modelli di immagine, a $0.043-$0.086 ogni 450 caratteri al momento della stesura (vedi la pagina del modello ElevenLabs). Questa tariffa per carattere è sopra il prezzo di listino diretto dell'API di ElevenLabs. In cambio ottieni una sola chiave per lo studio web, l'API HTTP e il server MCP ospitato, ogni job dettagliato con il modello usato e il suo costo, rimborsi automatici sui render falliti, un avviso di spesa per chiave e un saldo che non scade mai. Ogni voiceover riceve un riferimento vo_ stabile che il tuo codice può recuperare con GET /api/generations/{ref}. La guida rapida ad API e MCP contiene la configurazione di Claude Code in una riga.
Articoli correlati
Prezzi API Seedance 2.5: quanto costa davvero una clip
Prezzi API di Seedance 2.5 al secondo in 480p, 720p e 1080p, costi reali di clip da 5, 10 e 30 s e di lotti, e dove ottenere l'accesso senza abbonamento.
GuidePrezzi delle API di generazione video con IA nel 2026, modello per modello
Come fatturano le API video con IA (al secondo, al clip, a crediti), cosa muove il prezzo, tariffe per modello e budget di batch calcolati con i tentativi.
GuideAPI Veo 3.1 Fast: prezzo, limiti e come chiamarla
Prezzo al secondo dell'API Veo 3.1 Fast, durata dei clip, risoluzioni, latenza e quote secondo Google, e come chiamarla da codice o da Claude Code, con esempi.
GuideAnnunci video immobiliari che generano visite
Come agenti e sviluppatori trasformano reel di immobili, angolazioni di quartiere e CTA precisi in visite confermate — specifiche, logica del funnel e scaletta di ripresa riutilizzabile.
GuideAnnunci video per palestre e studi fitness: il manuale 2026
Come palestre, studi e trainer realizzano annunci video che riempiono le lezioni — trasformazione, prova a pagamento, targeting locale e cadenza di rinnovo creativo nel fitness.
GuideAnnunci video per il Black Friday: un piano di produzione in due settimane
Un calendario creativo BFCM giorno per giorno per testare e validare i tuoi video promozionali prima che i CPM di Meta salgano fino al 16% — con specifiche verificate e checklist.
Strumenti gratuiti da provare
Free AI image generator
Describe what you want and get a high-quality AI image in seconds. A free AI image generator, no account needed to preview, keep your first image when you sign up.
Prova gratisFree toolFree AI product photo generator
Generate clean, studio-style product photos for your store and listings in seconds. Crisp lighting and tidy backgrounds, free to try with no account, keep your first shot on signup.
Prova gratisFree toolFree background remover
Remove the background from any image in seconds and get a clean, transparent cutout. A free background remover, no account needed to preview, keep your first cutout when you sign up.
Prova gratisSmetti di descrivere il tuo brand. Incolla il tuo URL.
Aitachyon legge tutto il tuo brand dal tuo sito e crea video, immagini, caroselli, post e banner, fedeli al brand, per ogni formato e ogni feed.