Skip to content
Ratgeber30. September 2026· 9 min Lesezeit

KI-Avatar-Video-API: sprechende Köpfe aus einem Foto und einer Stimme

Wie Avatar-APIs aus Foto und Audio funktionieren, was sie pro Sekunde kosten, wo sie scheitern und wie du sie per Code oder mit einem KI-Agenten aufrufst.

avatarsapilip synctalking head
Ratgeber

KI-Avatar-Video-API: sprechende Köpfe aus einem Foto und einer Stimme

Ein 30-Sekunden-Clip eines sprechenden Kopfes aus einem Porträt und einer Sprachspur kostet über eine API zwischen 0,75 $ und 6,40 $, je nach Anbieter und Auflösung. Die Spanne ist größer, als die meisten erwarten, und sie geht auf eine einzige Variable zurück: den Preis pro Sekunde. Modell, Eingaben und Aufbau der Anfrage sind bei allen Anbietern fast identisch.

Dieser Leitfaden erklärt, wie diese Modelle aus einem Standbild ein sprechendes Gesicht machen, was jeder Anbieter pro Sekunde Ausgabe berechnet, wo die Ergebnisse auseinanderfallen und wie du das Ganze in ein Skript oder einen Agenten einbaust, sodass ein Briefing hineingeht und fertige MP4s mit Kosten herauskommen.

Wie ein Avatar-Modell aus Foto und Audio arbeitet

Alle Anbieter dieser Kategorie folgen demselben Vertrag. Du schickst ein Porträt und eine Sprachspur, das Modell animiert das Gesicht passend zum Audio, und du bekommst ein Video zurück, dessen Länge der des Audios entspricht. Die Kling-Avatar-V2-Seite von Replicate sagt es klar: Die Dauer richtet sich automatisch nach der Audiolänge. Du wählst nie eine Dauer. Du wählst eine Sprachspur, und die Sprachspur bestimmt die Rechnung.

Der Avatar-API-Leitfaden von APIframe teilt den Ablauf in drei Stufen:

  1. Identitätsextraktion. Das Modell liest das Gesicht aus dem Porträt und fixiert es, damit die Person im ersten Bild dieselbe ist wie im letzten.
  2. Audio-Mapping. Das Audio wird Bild für Bild auf Mundformen und Gesichtsausdrücke abgebildet. Hier entscheidet sich die Qualität der Lippensynchronisation.
  3. Asynchrones Rendering. Das Video wird als Hintergrundjob gerendert. Du sendest ab, wartest und lädst herunter.

Die meisten Modelle akzeptieren außerdem einen optionalen Text-Prompt, um Ausdruck oder Bewegung zu steuern. Auf der Seite zu Kling AI Avatar 2.0 bei Kie.ai nimmt das Prompt-Feld 0 bis 5.000 Zeichen auf und ist für die einfache Nutzung optional. In der Praxis leisten Porträt und Audio fast die ganze Arbeit.

Das Motiv muss keine reale Person sein. Der Eintrag zu Kling Avatar v2 Pro bei fal nennt realistische Menschen, Tiere, Cartoons und stilisierte Figuren, und VEED beschreibt sein Fabric-Modell als geeignet für Fotos, Illustrationen, Maskottchen, 3D-Renderings und Anime. Das ist wichtig für Marken, die ein Maskottchen oder einen generierten Moderator statt eines gefilmten Gründers wollen. Wenn du noch klärst, ob ein sprechender Kopf überhaupt das richtige Format ist, behandelt unsere Analyse, wann Avatar-Anzeigen funktionieren und wann nicht die kreative Seite.

Was eine Avatar-Video-API pro Sekunde kostet

Fast alle Anbieter rechnen pro Sekunde Ausgabevideo ab. APIframe nennt als üblichen Bereich 0,02 $ bis 0,07 $ pro Sekunde bei Standardauflösungen. Die zum Redaktionszeitpunkt veröffentlichten Preise aus Anbieterseiten und Drittanbieter-Leitfäden:

Zwei Einschränkungen. Diese Zahlen stammen von Anbieterseiten und aus Leitfäden und wurden nicht mit echten Rechnungen abgeglichen, also mache ein paar Testrenderings, bevor du ein Budget festlegst. Und dasselbe Modell kann je nach Anbieter sehr unterschiedlich kosten: Kling Avatar v2 taucht mit 0,056 $/s (Standard, WaveSpeed) und 0,115 $/s (Pro, fal) auf, während Kie.ai auf Credits basiert und auf der Seite keinen Preis pro Sekunde nennt, und die Modellseite bei Replicate zeigte bei unserer Prüfung keinen Preis.

Die Kostenformel

Weil die Ausgabelänge dem Audio folgt, ist die Rechnung für einen Clip kurz:

Clipkosten = Audiosekunden x Avatar-Preis + Stimmkosten + Porträtkosten

Das Porträt fällt nur einmal an, wenn du dasselbe Gesicht wiederverwendest. Die Stimme ist neben dem Avatar günstig. Bei Aitachyon kostet die ElevenLabs-Sprachausgabe zum Redaktionszeitpunkt 0,043 $ bis 0,086 $ pro 450 Zeichen, und ein mit Nano Banana generiertes Porträt kostet 0,13 $ pro Bild. Die Avatar-Sekunden dominieren jede Zeile des Budgets.

Drei Batches, durchgerechnet

Mit den oben genannten Preisen:

  1. 20 Avatar-Hooks à 10 Sekunden (200 Sekunden Video). Auf Kling Avatar Standard zu 0,056 $/s: 11,20 $. Auf Kling Avatar Pro zu 0,115 $/s: 23,00 $. Dazu 20 kurze Sprachzeilen unter je 450 Zeichen (0,86 $ bis 1,72 $) und ein wiederverwendetes Porträt (0,13 $), dann liegt der Batch bei ungefähr 12,19 $ bis 24,85 $.
  2. Eine Woche Shorts, sieben sprechende Köpfe à 45 Sekunden (315 Sekunden). Standard: 17,64 $. Pro: 36,23 $. P-Video-Avatar bei 720p: 7,88 $. Angenommen, jedes Skript umfasst zwei Sprachblöcke zu 450 Zeichen, kommen 14 Blöcke zu 0,60 $ bis 1,20 $ hinzu.
  3. Ein 60-Sekunden-Erklärvideo in 1080p. P-Video-Avatar: 2,70 $. Kling Pro: 6,90 $. Pixverse: 12,80 $.

Dieselbe Woche Content kann 8 $ oder 37 $ kosten, bevor eine einzige kreative Entscheidung gefallen ist. Wenn du Videomodelle breiter vergleichst, nutzt unsere Preisaufschlüsselung der Video-APIs Modell für Modell dieselbe Methode pro Sekunde.

Wo Avatar-Modelle scheitern

Dauer

Die harten Obergrenzen sind großzügig. WaveSpeed berechnet Kling Avatar Standard bis zu höchstens 300 Sekunden pro Job, Kie.ai gibt an, dass das Audio nicht länger als 5 Minuten sein darf, und VEED nennt für Fabric 5 Minuten pro Generierung.

Die Qualitätsgrenze kommt viel früher. APIframe warnt, dass manche Modelle jenseits von 30 Sekunden Identitätsdrift und Verzerrungen zeigen. Der Leitfaden zu P-Video-Avatar empfiehlt, Clips unter drei Minuten zu halten und längere Inhalte aufzuteilen. Eine Grenze von fünf Minuten sagt, was die API annimmt. Sie sagt wenig darüber, was in Minute vier noch wie dieselbe Person aussieht.

Lippensynchronisation und Ausdruck

Die Lippensynchronisation ist nur so gut wie die Audio-Mapping-Stufe, und diese ist nur so gut wie das Audio. WaveSpeed verlangt eine saubere Sprachspur, aufgenommen oder per TTS, ohne lange Pausen. Stille kostet bei einem Modell mit Sekundenabrechnung Geld und gibt dem Gesicht nichts zu tun, und genau dort entstehen gern die unheimlichen Leerlaufbilder.

Gesten und Körper

Die meisten dieser Modelle animieren aus einem einzelnen Bild nur Gesicht und Kopf. VEED beschreibt Fabric als Modell mit natürlichen Kopfbewegungen und ausdrucksstarker Körpersprache, doch das ist die Beschreibung des Anbieters. Plane mit einer Einstellung auf Kopf und Schultern und betrachte Handgesten als Zugabe.

Bildausschnitt und Auflösung

Der Leitfaden zu P-Video-Avatar merkt an, dass das Seitenverhältnis dem Eingabebild folgt. Für einen Short in 9:16 erzeugst oder beschneidest du zuerst ein Porträt in 9:16. Die Auflösung hängt von der Stufe ab: Kie.ai nennt bis zu 720p bei Standard und bis zu 1080p mit 48 fps bei Pro.

Abgelehnte Jobs

APIframe nennt als häufige Fehlerursachen schlechte Quellbilder, nicht unterstützte Audioformate und Ablehnungen wegen der Inhaltsrichtlinien. Alle drei lassen sich vermeiden, bevor du einen Cent ausgibst, und dafür ist die Checkliste unten da.

Die Eingabe-Checkliste: vor jedem Job durchgehen

Die Qualität der Eingaben bestimmt das Ergebnis stärker als die Modellwahl. Kopiere die Liste und führe sie als Validierungsschritt in deinem Skript aus:

  1. Porträtwinkel. Frontal oder leicht im Dreiviertelprofil, wie WaveSpeed empfiehlt. Keine Profilaufnahmen, kein Gesicht, das teilweise aus dem Bild ragt.
  2. Porträtbeleuchtung. Gleichmäßig ausgeleuchtetes Gesicht. Harte Schatten über dem Mund geben dem Modell weniger zum Abbilden.
  3. Porträt-Seitenverhältnis. An die Zielplatzierung anpassen (9:16 für Shorts, sonst 1:1 oder 16:9), denn der Ausgabeausschnitt folgt dem Bild.
  4. Bilddatei. JPEG oder PNG unter 10 MB bei Kie.ai; PNG, JPEG oder WebP unter 20 MB und unter 10.000 px an der langen Kante bei Pixverse. fal akzeptiert JPG, JPEG, PNG, WebP, GIF und AVIF.
  5. Audioformat. MP3, OGG, WAV, M4A oder AAC sind bei fal und Pixverse sicher. Kie.ai akzeptiert MPEG, WAV, AAC, MP4 und OGG bis 100 MB.
  6. Saubere Audiospur. Ein Sprecher, kein Musikbett, kein Raumhall. Musik kommt nach dem Rendering dazu.
  7. Stille gekürzt. Schneide Stille am Anfang und Ende sowie lange Pausen weg. Jede Sekunde wird berechnet.
  8. Länge. Halte jedes Segment unter 30 Sekunden, es sei denn, du hast dein Modell darüber hinaus getestet. Teile längere Skripte an Satzgrenzen und rendere die Segmente einzeln.
  9. Richtlinien. Keine Ähnlichkeit mit einer realen Person ohne deren Einwilligung und nichts, was die Inhaltsrichtlinie des Anbieters ablehnen würde. Ein abgelehnter Job kostet Wartezeit, auch wenn er kein Geld kostet.

Wenn du das Porträt generierst, statt es zu fotografieren, wähle das Bildmodell nach Hauttextur und Konsistenz. Unser Vergleich von Nano Banana und FLUX.2 Pro behandelt diesen Zielkonflikt für Produkt- und Personenbilder.

Einen Anbieter wählen: eine Entscheidungsregel

Entscheide mit drei Fragen, in dieser Reihenfolge:

  1. Wie lang ist das fertige Segment? Unter 30 Sekunden stehen alle Optionen offen. Darüber teilst du auf oder testest das konkrete Modell auf Drift, bevor du einen Batch startest.
  2. Welche Auflösung braucht die Platzierung? Feed-Platzierungen, die auf dem Handy angesehen werden, brauchen selten 1080p. Wenn doch, ist der günstigste veröffentlichte 1080p-Preis in unserer Recherche P-Video-Avatar mit 0,045 $/s und der teuerste Pixverse mit 0,213333 $/s.
  3. Wie lange kannst du warten? WaveSpeed nennt für Kling Avatar Standard eine typische Generierungszeit von etwa 177 Sekunden. inference.sh behauptet, P-Video-Avatar verarbeite etwa 1,83 Sekunden pro Sekunde Ausgabe, gegenüber 26 s/s bei HeyGen und 34 s/s bei Veed Fabric. Das ist eine Herstellerangabe zum eigenen Produkt, also miss selbst nach.

Ein vernünftiger Standardweg: auf der günstigsten Stufe prototypen, die deine Auflösung erreicht, fünf Clips mit deinem echten Porträt und deiner echten Stimme rendern, sie nebeneinander vergleichen und nur dann eine Stufe höher gehen, wenn das günstigere Ergebnis an einem konkreten, benennbaren Problem scheitert (Mundartefakte, Drift, steifer Kopf).

API oder Abo-Tool

Avatar-Tools mit Seat-Lizenz rechnen pro Monat statt pro Sekunde ab. Laut VEEDs Übersicht für 2026: HeyGen startet bei 29 $/Monat auf Credit-Basis mit Lippensynchronisation in über 40 Sprachen, D-ID Lite startet bei 5,90 $/Monat mit einer API-Stufe ab 18 $/Monat, die 16 Minuten reguläres Video enthält, Synthesia startet bei 18 $/Monat für 120 Minuten pro Jahr, und Tavus arbeitet mit individuellen Enterprise-Preisen und einem digitalen Zwilling aus etwa 2 Minuten Material. Wenn du alle 16 D-ID-Minuten nutzt, ergeben 18 $ etwa 1,13 $ pro Minute. Der Haken: Ungenutzte Minuten verfallen, und für Überschreitungen gelten eigene Regeln. APIs mit Sekundenabrechnung kosten am oberen Ende mehr pro Einheit und in einem Monat ohne Rendering gar nichts.

Eine Avatar-API aus dem Code aufrufen

Der Ablauf der Anfragen ist bei allen Anbietern gleich. APIframe beschreibt ihn als einen POST, der eine Job-ID zurückgibt, dann Polling oder einen Webhook und schließlich den Download des Videos. Konkret für Kling Avatar Standard bei WaveSpeed:

  1. Absenden. POST an https://api.wavespeed.ai/api/v3/kwaivgi/kling-v2-ai-avatar-standard mit einem Bearer-Token, einer Bild-URL und einer Audio-URL. Die Antwort enthält eine Prediction-ID zum Abfragen.
  2. Abfragen. Die Doku von WaveSpeed beginnt mit Polling alle 2 Sekunden. Erhöhe die Abstände nach der ersten Minute, denn typische Jobs dauern einige Minuten.
  3. Herunterladen. Bei fal ist das Ergebnis ein JSON mit einem Feld video.url, das auf ein MP4 mit synchronem Ton zeigt. Kopiere die Datei sofort in deinen eigenen Speicher; URLs von Anbietern sind kein Ort für dauerhafte Dateien.
  4. Kosten festhalten. Multipliziere die Audiosekunden mit dem Preis und speichere das Ergebnis neben der Datei. Du brauchst diese Zahl, wenn ein Batch mit 200 Clips zurückkommt.

Fabric wird über REST via fal.ai mit Python- und JavaScript-Clients ausgeliefert, also gelten dieselben vier Schritte mit anderem Endpunktnamen.

Vorgelagerte Schritte: Porträt und Stimme

Der Avatar-Aufruf braucht zwei URLs, und in einer automatisierten Pipeline werden beide meist generiert. Bei Aitachyon deckt ein einziger API-Schlüssel (Authorization: Bearer ait_...) die Bild- und Stimmmodelle ab, jede generierte Datei erhält eine stabile Referenz (img_ für Bilder, vo_ für Sprachausgaben), die du mit GET /api/generations/{ref} abrufen kannst, und jeder Job wird mit dem verwendeten Modell und seinen Kosten einzeln aufgeführt. Der Schnellstart für API und MCP zeigt die Anfrageformen. Für Details zu Stimmpreisen und Tempo siehe unsere Aufschlüsselung der ElevenLabs-API-Kosten.

Aus einem Agenten heraus ausführen

Für Entwickler, die ohnehin in Claude Code oder Cursor arbeiten, ist die schnellste Schleife, den Agenten die vorgelagerten Assets und die Buchhaltung erledigen zu lassen, während ein kleines Skript den Avatar-Anbieter ansteuert. Den gehosteten MCP-Server von Aitachyon mit Claude Code zu verbinden, ist ein einziger Befehl:

claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."

Eine funktionierende Sitzung sieht dann so aus:

  1. Du gibst dem Agenten ein Briefing: „Zwanzig 10-Sekunden-Hooks für die Preisseite, derselbe Moderator, 9:16."
  2. Der Agent schreibt zwanzig Skripte, kürzt jedes auf einen Sprachblock von 450 Zeichen und erzeugt über den MCP-Server ein 9:16-Porträt und zwanzig Sprachspuren. Jede kommt mit Referenz und Kosten zurück.
  3. Der Agent führt dein Avatar-Skript beim Anbieter deiner Wahl aus, übergibt Porträt- und Audio-URLs, fragt den Status ab und speichert die MP4s.
  4. Er schreibt ein Manifest: Skript, Stimm-Referenz, Porträt-Referenz, Avatar-Datei, Sekunden, Kosten pro Zeile und die Summe des Batches.

Die Einrichtung ist Schritt für Schritt in unserer Anleitung zum Erzeugen von Video aus Claude Code mit einem MCP-Server beschrieben. Zwei Schutzmaßnahmen zählen, sobald ein Agent in einer Schleife Geld ausgibt: die Batch-Größe im Briefing begrenzen und dem Agenten einen eigenen Schlüssel geben, damit seine Ausgaben getrennt bleiben. Bei Aitachyon hat jeder Schlüssel eigene Ausgaben, einen Alarm bei ungewöhnlich schnellem Verbrauch und eine Sperrung mit einem Klick. Zu Parallelitätsgrenzen, Wiederholungen und Dateihandling bei größerem Volumen geht unser Leitfaden zur massenhaften KI-Videogenerierung weiter ins Detail.

Das Hybridmuster: kurzer Avatar, dann B-Roll

Der wirksamste Hebel für Kosten und Qualität ist, den sprechenden Kopf kurz zu halten. Ein Avatar-Hook von 5 bis 10 Sekunden, gefolgt von B-Roll unter derselben Sprachausgabe, bleibt weit innerhalb der 30-Sekunden-Zone, in der Drift weniger wahrscheinlich ist, und verlagert den größten Teil der Laufzeit auf günstigeres Material.

Durchgerechnetes Beispiel, insgesamt 30 Sekunden zum Redaktionszeitpunkt:

  • Nur Avatar, 30 s auf Kling Avatar Standard zu 0,056 $/s: 1,68 $. Auf Kling Pro zu 0,115 $/s: 3,45 $.
  • Hybrid: 8 s Avatar auf Kling Standard (0,45 $) plus 22 s B-Roll auf Hailuo 02 zu 0,085 $/s (1,87 $). Gesamt etwa 2,32 $.

Auf der günstigsten Avatar-Stufe kostet der Hybrid mehr als ein reiner Avatar. Gegenüber der Pro-Stufe kostet er weniger, und in beiden Fällen sieht der Zuschauer das Gesicht nur im Hook, wo es Aufmerksamkeit bringt, während der Rest der Zeit das Produkt im Bild ist. B-Roll, das weiterhin wie echtes Material wirkt, braucht Sorgfalt, und unser Leitfaden zu KI-B-Roll, das nicht falsch aussieht geht das Einstellung für Einstellung durch.

FAQ

Was kostet eine KI-Avatar-Video-API pro Minute?

Nach den zum Redaktionszeitpunkt veröffentlichten Preisen: etwa 1,50 $ pro Minute bei P-Video-Avatar in 720p, 3,36 $ bei Kling Avatar Standard über WaveSpeed, 6,90 $ bei Kling Avatar Pro über fal, 9,00 $ bei VEED Fabric in 720p und 12,80 $ bei Pixverse in 1080p. Dazu kommen Stimm- und Porträtkosten, die im Vergleich gering sind.

Wie lang darf ein KI-Avatar-Video höchstens sein?

Kling Avatar und VEED Fabric akzeptieren bis zu 5 Minuten pro Job. Die Qualität ist die engere Grenze: Manche Modelle driften oder verzerren jenseits von 30 Sekunden, und der Leitfaden zu P-Video-Avatar empfiehlt, unter drei Minuten zu bleiben. Teile lange Skripte in Segmente und rendere jedes einzeln.

Kann ich aus einem einzigen Foto einen sprechenden Avatar machen?

Ja. Ein einzelnes frontales oder leicht dreiviertelseitliches Porträt plus eine Audiodatei ist alles, was diese APIs brauchen. Illustrationen, Maskottchen, Tiere und stilisierte Figuren funktionieren ebenfalls bei Kling Avatar v2 und VEED Fabric.

Muss ich meine eigene Stimme aufnehmen?

Nein. Jeder Anbieter in diesem Leitfaden akzeptiert eine TTS-Spur, und P-Video-Avatar und Pixverse können ein Textskript direkt verarbeiten. Sauberes Audio ohne Pausen liefert unabhängig von der Quelle die beste Lippensynchronisation.

Ist eine Avatar-API günstiger als HeyGen oder Synthesia?

Das hängt vom Volumen ab. Seat-Tarife kosten jeden Monat, ob du renderst oder nicht. APIs mit Sekundenabrechnung berechnen nur, was du erzeugst, und gewinnen daher bei unregelmäßigem oder stoßweisem Volumen und bei allem, was aus dem Code automatisiert läuft.

Quellen

  1. WaveSpeedAI: Kling V2 AI Avatar Standard API
  2. fal.ai: Kling AI Avatar v2 Pro
  3. Kie.ai: Kling AI Avatar 2.0 API
  4. Replicate: Kling Avatar V2
  5. VEED: Best Avatar APIs (2026), Build Talking Videos at Scale
  6. APIframe: AI Avatar API Guide
  7. inference.sh: P-Video-Avatar, the Fastest AI Talking Head Generator
  8. Empirio Labs: Pixverse Avatar API

Aitachyon deckt die Eingaben rund um den Avatar-Aufruf ab: Porträts mit Nano Banana oder FLUX.2 [pro], Stimme mit ElevenLabs und B-Roll mit Seedance, Kling, Veo, Wan oder Hailuo, alles aus einem einzigen Prepaid-Guthaben, das nie verfällt, pro Aufruf abgerechnet, mit automatischer Erstattung fehlgeschlagener Renderings und jeder Datei einzeln mit ihren Kosten aufgeführt. Du kannst es über das Web-Studio, die HTTP-API oder den MCP-Server in Claude Code steuern, und die vollständige Preistabelle ist öffentlich unter /api/pricing einsehbar.

Ähnliche Artikel

Kostenlose Tools zum Ausprobieren

Beschreiben Sie Ihre Marke nicht mehr. Fügen Sie Ihre URL ein.

Aitachyon liest Ihre ganze Marke von Ihrer Website und erstellt dann Videos, Bilder, Karussells, Posts und Banner, markengerecht, für jedes Format und jeden Feed.