Skip to content
Ratgeber30. September 2026· 8 min Lesezeit

ElevenLabs API Preise: Was ein Voiceover wirklich kostet (2026)

ElevenLabs API Preise pro 1.000 Zeichen und Modell, Kosten eines Voiceovers von 30 oder 60 Sekunden und die Batch-Generierung per Code ohne 429-Fehler.

elevenlabsvoiceoverttspricing
Ratgeber

ElevenLabs API Preise: Was ein Voiceover wirklich kostet (2026)

Ein 30-Sekunden-Voiceover sind etwa 600 Zeichen Skript. Beim günstigsten Standard-API-Tarif von ElevenLabs zum Zeitpunkt des Schreibens sind das grob zweieinhalb Cent Audio. Was Ihre Rechnung tatsächlich bestimmt, ist die Zahl der Takes, Sprachen und Varianten, die Sie rendern, und das Modell, das Sie ohne viel Nachdenken gewählt haben.

Dieser Leitfaden geht die Zeichenpreise Modell für Modell durch, rechnet sie in die Längen um, die Sie tatsächlich ausliefern (30 und 60 Sekunden), bepreist realistische Batches und behandelt dann den Teil, den die meisten Preisseiten auslassen: Hunderte Voiceovers per Code erzeugen, ohne das Concurrency-Limit zu reißen. Alle Zahlen wurden am 30. September 2026 geprüft. ElevenLabs ändert seine Tarife, teils mit zeitlich befristeten Aktionen, daher gilt letztlich die aktuelle Preisseite.

ElevenLabs API Preise pro Modell, Stand September 2026

ElevenLabs rechnet Text-to-Speech pro Zeichen ab. Die API-Preisseite nennt zum Zeitpunkt des Schreibens diese Preise pro 1.000 Zeichen:

  • Eleven v4: $0.022 pro 1K Zeichen, ein Aktionsrabatt von 72 % auf den Listenpreis von $0.08, gültig bis 12. Oktober.
  • Eleven v4 Turbo: $0.011 pro 1K Zeichen, ebenfalls 72 % Rabatt, ausgehend von einem Listenpreis von $0.04, gleiches Enddatum.
  • Eleven v3: $0.08 pro 1K Zeichen.
  • Eleven v3 Conversational: $0.04 pro 1K Zeichen.
  • Multilingual v2: $0.08 pro 1K Zeichen.
  • Flash und Turbo: $0.04 pro 1K Zeichen.

Zwei Hinweise, bevor Sie ein Budget auf diese Zahlen stützen. Erstens sind die v4-Preise Aktionspreise. Jedes Kostenmodell, das über Mitte Oktober hinausreicht, sollte mit den Listenpreisen $0.08 und $0.04 rechnen, sonst fallen die Ausgaben um fast das Vierfache zu niedrig aus. Zweitens nennen ältere Drittquellen andere Werte. Ein Puter-Tutorial vom Juni 2026 führt $0.05 pro 1K für Flash und Turbo sowie $0.10 pro 1K für Multilingual v2 und v3 auf. Die Preise haben sich innerhalb eines Quartals bewegt, und genau deshalb sollten Sie Preise zur Laufzeit von der Quelle holen, statt sie fest im Code zu hinterlegen.

Wie Credits auf Zeichen abgebildet werden

Die Preisseite für Endkunden misst Text-to-Speech mit 1 Credit pro Zeichen. Flash-Modelle sind in Credits günstiger: Die Aufschlüsselung von Smallest.ai nennt je nach Tarif 0,5 bis 1 Credit pro Zeichen. Der zweite Wert stammt von einem Dritten, prüfen Sie ihn also im eigenen Nutzungs-Dashboard, bevor Sie sich darauf verlassen.

Was ein 30-Sekunden- und ein 60-Sekunden-Voiceover kosten

Preise werden pro 1.000 Zeichen genannt, Skripte dagegen in Sekunden geplant, also braucht es eine Umrechnung. Üblich sind etwa 1.200 Zeichen pro Minute Sprechzeit, was Smallest.ai herleitet, weil eine zweiminütige Narration bei rund 2.400 Zeichen landet. Das ergibt etwa 600 Zeichen für 30 Sekunden und 1.200 für 60 Sekunden. Ein Skript mit 500 Wörtern kommt laut derselben Quelle auf rund 3.000 Zeichen.

Wenden Sie die API-Preise vom September 2026 an:

  • Flash / Turbo ($0.04 pro 1K): 30 s = 0.6 x $0.04 = $0.024. 60 s = 1.2 x $0.04 = $0.048.
  • Multilingual v2 oder v3 ($0.08 pro 1K): 30 s = $0.048. 60 s = $0.096.
  • v4 zum Aktionspreis ($0.022 pro 1K): 30 s = etwa $0.013. 60 s = etwa $0.026.
  • v4 Turbo zum Aktionspreis ($0.011 pro 1K): 30 s = etwa $0.007. 60 s = etwa $0.013.

Eine Kostenformel für Ihre Tabellenkalkulation

Bei etwa 1.200 Zeichen pro Minute liegt das Sprechtempo bei rund 20 Zeichen pro Sekunde. Daraus folgt eine Schätzung in einer Zeile:

  • Zeichen = Sekunden x 20
  • Kosten pro Voiceover = Zeichen x Preis pro 1K / 1.000
  • Kosten pro Batch = Kosten pro Voiceover x Varianten x Sprachen x Takes

Die letzte Zeile wird am häufigsten vergessen. Drei Takes pro Skript in zwei Sprachen multiplizieren die Sprachkosten mit sechs, bevor jemand auch nur eine Datei angehört hat.

Das Tempo verschiebt diese Zahlen. Ein ruhiges Produkterklärvideo wird langsamer gesprochen als ein schneller Hook im UGC-Stil, daher passen in dieselben 30 Sekunden spürbar mehr oder weniger Zeichen. Wenn Sie über Ton und Tempo noch nicht entschieden haben, finden Sie die Abwägungen in die richtige Stimme und das richtige Tempo für Werbe-Voiceovers wählen. Für das Budget zählen Sie die Zeichen im tatsächlichen Skript und nutzen die Pro-Minute-Regel nur als Plausibilitätsprüfung.

Abo-Credits im Vergleich zum API-Preis pro Zeichen

ElevenLabs verkauft außerdem Monatstarife mit enthaltenen Credits. Die Preisseite nennt zum Zeitpunkt des Schreibens:

  1. Free: 10.000 Credits, keine kommerzielle Nutzung.
  2. Starter: 30.000 Credits für $6.
  3. Creator: 121.000 Credits für $22 ($11 im ersten Monat).
  4. Pro: 600.000 Credits für $99.
  5. Scale: 1.800.000 Credits für $299.
  6. Business: 6.000.000 Credits für $990.

Teilen Sie den Preis durch die Credits, ergibt sich der implizite Preis pro 1.000 Credits: $0.20 bei Starter, etwa $0.18 bei Creator (etwa $0.09 im rabattierten ersten Monat) und etwa $0.165 bei Pro, Scale und Business. Bei 1 Credit pro Zeichen liegen diese impliziten Preise über den oben genannten API-Listenpreisen pro Zeichen. Das Puter-Tutorial beschreibt das Modell als denselben Preis pro Einheit in allen Stufen, wobei Abos Kontingente bündeln. Die beiden offiziellen Seiten lassen sich von außen nicht sauber in Einklang bringen. Lassen Sie daher vor der Festlegung auf einen Tarif eine Woche echten Traffic laufen und vergleichen Sie die Rechnung mit der Rechnung auf dem Papier.

Was Tarife über Credits hinaus liefern, ist Spielraum. Die Tarifstufe bestimmt Ihre Concurrency-Obergrenze (nächste Abschnitte) und die kommerzielle Lizenz. ElevenLabs gibt an, dass die kommerzielle Nutzung ab Starter beginnt, und die Text-to-Speech-Dokumentation wiederholt, dass kommerzielle Nutzung einen kostenpflichtigen Tarif voraussetzt. Alles, was in bezahlter Werbung läuft, braucht mindestens Starter.

Wenn Sie allgemein zwischen gebündelten Credits und Zahlung pro Aufruf abwägen, gilt die Argumentation ebenso für Video und Bilder und ist in Credits gegenüber Pay-per-Call-Preisen ausgeführt.

Batch-Budgets: die Rechnung für reale Workloads

Ein einzelnes Voiceover kostet zu wenig, um ins Gewicht zu fallen, deshalb zeigt sich die Modellwahl erst beim Rendern im Batch. Hier vier typische Workloads, bepreist zu den API-Listenpreisen vom September 2026 für Flash ($0.04 pro 1K) und Multilingual v2 ($0.08 pro 1K), mit 600 Zeichen pro 30 Sekunden.

20 Hook-Varianten für eine Anzeige

Hooks sind kurz. Nehmen wir an, Hook plus Text ergeben je 30 Sekunden: 20 Varianten x 600 Zeichen = 12.000 Zeichen. Flash: $0.48. Multilingual v2: $0.96. Wenn Sie diese Varianten schreiben, liefern diese Hook-Vorlagen 18 Einstiege zum Durchrotieren.

Eine Woche tägliche 60-Sekunden-Shorts

7 x 1.200 = 8.400 Zeichen. Flash: etwa $0.34. Multilingual v2: etwa $0.67.

50 Produkterklärvideos à 60 Sekunden

50 x 1.200 = 60.000 Zeichen. Flash: $2.40. Multilingual v2: $4.80.

Eine 60-Sekunden-Anzeige, lokalisiert in sechs Sprachen

6 x 1.200 = 7.200 Zeichen. Multilingual v2: etwa $0.58. Übersetzte Skripte behalten selten die exakte englische Länge, budgetieren Sie daher jede Sprache anhand des übersetzten Textes. Die Produktionsseite behandelt Videoanzeigen in mehreren Sprachen schalten.

Bei großen Mengen ist der Abstand zwischen den Modellen real, in absoluten Zahlen aber klein. Das Beispiel von Puter mit 3 Millionen Zeichen kam auf $150 bei Flash gegenüber $300 bei Multilingual, zu den damals älteren Preisen. Für die meisten Werbe- und Content-Teams ist die Stimme der günstigste Posten im Stack. Der teure Fehler ist, ganze Skripte neu zu rendern, um einen einzelnen Satz zu korrigieren. Die Kontinuitätsparameter weiter unten helfen, das zu vermeiden.

Ein Modell wählen: Preis, Sprachen, Limits und Latenz

Der Preis ist eine von vier Achsen. Die ElevenLabs-Modelldokumentation nennt die übrigen:

  • Sprachen: v4 deckt über 90 ab, v3 über 70, Flash v2.5 deckt 32 ab, Multilingual v2 deckt 29 ab, und Flash v2 kann nur Englisch.
  • Zeichen pro Anfrage: Flash v2.5 akzeptiert 40.000, Flash v2 30.000, v4 und Multilingual v2 je 10.000, und v3 5.000.
  • Latenz: Flash v2.5 rund 75 ms, v4 Turbo rund 100 ms, v3 Conversational rund 280 ms.

Eine wiederverwendbare Entscheidungsregel

  1. Nur Englisch, hohes Volumen, Latenz zählt (Live-Agenten, Vorschauen, interne Entwürfe): Flash. Niedrigster Listenpreis, größte Anfragegröße, am schnellsten.
  2. Finales Anzeigen-Voiceover in einer der großen Sprachen: Multilingual v2 oder v3 zum Listenpreis, oder v4, solange die Aktion läuft. Rendern Sie ein paar Takes und behalten Sie den besten.
  3. Sprache außerhalb der 29 von Multilingual v2: Prüfen Sie zuerst die Abdeckung von v4 (über 90) oder v3 (über 70).
  4. Lange Narration in einem Aufruf: Das 40.000-Zeichen-Limit von Flash v2.5 fasst ein Skript, das bei den 5.000 von v3 geteilt werden müsste.
  5. Budget über den 12. Oktober hinaus: Rechnen Sie v4 mit $0.08 und v4 Turbo mit $0.04, egal was die Seite heute anzeigt.

Qualitätsurteile zwischen Modellen sind subjektiv und ändern sich mit jeder Version. Der praktische Test ist billig: Rendern Sie für ein paar Cent pro 60 Sekunden dasselbe Skript mit zwei Modellen und hören Sie hin.

Voiceovers per Code im Batch erzeugen

Der Endpunkt ist einfach. Die API-Referenz dokumentiert ihn so:

  • Anfrage: POST https://api.elevenlabs.io/v1/text-to-speech/{voice_id}, mit Ihrem Schlüssel im Header xi-api-key.
  • Body: text ist Pflicht. model_id ist standardmäßig eleven_multilingual_v2, und output_format ist standardmäßig mp3_44100_128.
  • Konsistenz: seed nimmt eine Ganzzahl von 0 bis 4.294.967.295, und previous_text und next_text geben dem Modell Kontext um ein Fragment.
  • Normalisierung: apply_text_normalization akzeptiert auto, on oder off.
  • Antwort: Binäres Audio bei 200 und 422 bei einem Validierungsfehler.

Beachten Sie das Standardmodell. Lässt Ihr Skript model_id weg, läuft jeder Aufruf auf Multilingual v2 zu $0.08 pro 1K, dem doppelten Flash-Preis. Setzen Sie es ausdrücklich.

Das Ausgabeformat kostet nichts, verdient aber eine bewusste Entscheidung

Die Text-to-Speech-Dokumentation nennt MP3 mit 22,05 bis 44,1 kHz und 32 bis 192 kbit/s, PCM mit 16 bis 44,1 kHz, mu-law und A-law mit 8 kHz für Telefonie sowie Opus mit 48 kHz. Für Audio, das in einen Videoeditor geht, vermeidet PCM eine zweite verlustbehaftete Kodierung. Für Web-Vorschauen reicht der MP3-Standard.

Ein Batch-Job Schritt für Schritt

  1. Manifest vorbereiten. Eine Zeile pro Ausgabe: id, voice_id, model_id, text, seed, Ausgabepfad. Eine Zeile sieht so aus: hook-07-en, Ihre Voice-ID, die Flash-Modell-ID, "Ihr erster Entwurf hat drei Stunden gedauert...", 42, out/hook-07-en.mp3. Zählen Sie die Zeichen pro Zeile und summieren Sie sie. Diese Summe mal Preis pro 1K ist Ihre Kostenobergrenze, bevor Sie irgendetwas senden.
  2. Lange Texte an Satzgrenzen teilen, unterhalb des Anfragelimits des Modells, und die benachbarten Abschnitte als previous_text und next_text mitgeben, damit die Übergänge durchgehend klingen, wie es die Dokumentation empfiehlt.
  3. Seed pro Stimme festlegen. Wird eine Zeile mit gleichem Seed und gleichen Einstellungen neu gerendert, bleibt sie näher am Rest des Takes, sodass Sie einen Satz korrigieren, statt das ganze Skript erneut zu bezahlen.
  4. Einen begrenzten Worker-Pool laufen lassen, dimensioniert nach der Concurrency Ihres Tarifs (nächster Abschnitt), damit Anfragen die Obergrenze nie überschreiten.
  5. Jede Datei und eine Logzeile schreiben mit id, Modell, Zeichenzahl und berechneten Kosten. Dieses Log dient dem Abgleich mit der Rechnung.
  6. Nur Fehlgeschlagenes wiederholen, per id, damit ein Absturz mittendrin fertige Zeilen nie erneut abrechnet.

Concurrency ist das Limit, das wehtut

ElevenLabs misst gleichzeitige Anfragen, nicht Anfragen pro Minute, laut seinem Beitrag zum Rate Limiting. Die Obergrenzen je Tarif, aus der Hilfeseite zum 429-Fehler:

  • Free: 2
  • Starter: 3
  • Creator: 5
  • Pro: 10
  • Scale und Business: 15

Flash-Modelle erhalten höhere Limits, zwischen 4 und 30 je nach Tarif. Anfragen über der Obergrenze werden nach Tarifpriorität eingereiht, was laut ElevenLabs etwa 50 ms hinzufügt, und darüber hinaus erhalten Sie einen 429.

429-Fehler richtig behandeln

Die Hilfeseite unterscheidet zwei Ursachen für einen 429, die unterschiedlich behandelt werden müssen:

  • too_many_concurrent_requests: Sie haben die Concurrency Ihres Tarifs überschritten. Sofortiges Wiederholen verschlimmert es. Verkleinern Sie den Pool.
  • system_busy: Last auf Seiten von ElevenLabs. Ein erneuter Versuch klappt meist.

Das empfohlene Muster ist ein begrenzter Concurrency-Pool, ein Token Bucket und exponentielles Backoff mit Jitter. Die Antworten enthalten die Header current-concurrent-requests und maximum-concurrent-requests, sodass Ihr Pool sein echtes Limit lesen kann, statt einem Konfigurationswert zu vertrauen.

Checkliste für den Batch-Runner

  • Poolgröße aus maximum-concurrent-requests abgeleitet, minus eins, wenn etwas anderes den Schlüssel mitnutzt.
  • model_id bei jedem Aufruf ausdrücklich gesetzt.
  • Backoff mit Jitter bei system_busy; Pool verkleinern bei too_many_concurrent_requests.
  • Kein Retry bei 422: Korrigieren Sie stattdessen die Payload.
  • Zeichenzahl und Kosten pro Datei protokolliert.
  • Idempotente ids, damit ein erneuter Lauf fertige Zeilen überspringt.
  • Aktionspreise im Kostenlog markiert, damit die Zahlen des nächsten Monats niemanden überraschen.

Bei einem Pool von 5 auf Creator sind 50 Erklärvideos in etwa zehn Anfragerunden fertig. Die Laufzeit wird von der Generierung bestimmt, und der Job ist klein genug, um von einem Laptop aus zu laufen.

Voiceover in einer größeren Pipeline

Ein Voiceover ist selten das Endergebnis. Es steht neben einem Videoclip, einer Produktaufnahme und Untertiteln, und jedes davon stammt von einem anderen Modell mit eigenem Schlüssel, eigener Rechnung und eigenem Rate Limit. Teams, die in Menge produzieren, steuern die ganze Kette am Ende meist per Skript oder Agent: ein Manifest hinein, Dateien und ihre Kosten heraus. Eine funktionierende Variante dieses Aufbaus mit einem Agenten, der die Schritte orchestriert, beschreibt Videoproduktion mit KI-Agenten automatisieren, und die Claude-Code-Seite im Besonderen Video aus Claude Code über einen MCP-Server erzeugen.

Die Kostenlogik ist in jedem Schritt dieselbe. Einheiten zählen (Zeichen, Sekunden, Bilder), mit dem aktuellen Preis pro Einheit multiplizieren, neben der Datei protokollieren und abgleichen. Die Stimme ist der am leichtesten zu treffende Posten, weil die Zeichen bekannt sind, bevor Sie die Anfrage senden.

FAQ

Was kostet die ElevenLabs API pro Zeichen?

Zum Zeitpunkt des Schreibens nennt die API-Preisseite $0.04 pro 1.000 Zeichen für Flash und Turbo, $0.08 für Multilingual v2 und v3 sowie Aktionspreise von $0.022 für v4 und $0.011 für v4 Turbo bis 12. Oktober. Das sind $0.00004 bis $0.00008 pro Zeichen zum Listenpreis.

Was kostet ein einminütiges KI-Voiceover mit ElevenLabs?

Etwa 1.200 Zeichen, also grob $0.048 bei Flash und $0.096 bei Multilingual v2 zu den API-Preisen vom September 2026. Die genaue Eingangsgröße ist die tatsächliche Zeichenzahl Ihres Skripts.

Gibt es eine kostenlose Stufe der ElevenLabs API?

Der Free-Tarif enthält 10.000 Credits pro Monat und 2 gleichzeitige Anfragen, erlaubt aber keine kommerzielle Nutzung. Voiceovers für bezahlte Kampagnen oder Kundenarbeit brauchen Starter oder höher.

Warum bekomme ich 429-Fehler von der ElevenLabs API?

Entweder liegen Sie über dem Limit gleichzeitiger Anfragen Ihres Tarifs (too_many_concurrent_requests), oder ElevenLabs ist ausgelastet (system_busy). Verkleinern Sie im ersten Fall Ihren Worker-Pool, wiederholen Sie im zweiten mit Backoff, wie die Hilfeseite erklärt.

Wie lang darf der Text pro ElevenLabs-API-Anfrage maximal sein?

Das hängt vom Modell ab: 40.000 Zeichen bei Flash v2.5, 30.000 bei Flash v2, 10.000 bei v4 und Multilingual v2 sowie 5.000 bei v3, laut der Modelldokumentation.

Quellen

  1. ElevenLabs: API-Preise
  2. ElevenLabs: Preise
  3. ElevenLabs: Modelldokumentation
  4. ElevenLabs: Überblick über Text to Speech
  5. ElevenLabs: API-Referenz Text to Speech convert
  6. ElevenLabs: API-Fehlercode 429
  7. ElevenLabs: Rate Limiting für KI-Stimmen
  8. Puter: ElevenLabs API Pricing, vollständige Kostenaufschlüsselung (Jun 2026)
  9. Smallest.ai: ElevenLabs-Preise erklärt

Wenn Sie neben Ihren Video- und Bildschlüsseln kein separates ElevenLabs-Abo halten möchten: Aitachyon betreibt ElevenLabs-Voiceover über dasselbe Prepaid-Guthaben wie Seedance, Kling, Veo und die Bildmodelle, zum Zeitpunkt des Schreibens für $0.043 bis $0.086 pro 450 Zeichen (siehe die ElevenLabs-Modellseite). Dieser Preis pro Zeichen liegt über dem direkten API-Listenpreis von ElevenLabs. Dafür erhalten Sie einen Schlüssel für das Web-Studio, die HTTP-API und den gehosteten MCP-Server, jeden Job einzeln aufgeführt mit dem verwendeten Modell und den Kosten, automatische Erstattungen bei fehlgeschlagenen Renderings, einen Ausgabenalarm pro Schlüssel und ein Guthaben, das nie verfällt. Jedes Voiceover bekommt eine stabile vo_-Referenz, die Ihr Code mit GET /api/generations/{ref} abrufen kann. Der Schnellstart für API und MCP enthält das einzeilige Claude-Code-Setup.

Ähnliche Artikel

Kostenlose Tools zum Ausprobieren

Beschreiben Sie Ihre Marke nicht mehr. Fügen Sie Ihre URL ein.

Aitachyon liest Ihre ganze Marke von Ihrer Website und erstellt dann Videos, Bilder, Karussells, Posts und Banner, markengerecht, für jedes Format und jeden Feed.