Skip to content
Strategien30. September 2026· 10 min Lesezeit

Videoproduktion mit KI-Agenten automatisieren: ein Setup, das funktioniert

Eine Pipeline für die Videoproduktion mit KI-Agenten: Skript, Shots, Stimme und Schnitt, mit echten Kosten pro Stufe und den Freigaben, auf die es ankommt.

automationai agentsvideo productionmcp
Strategien

Videoproduktion mit KI-Agenten automatisieren: ein Setup, das funktioniert

Ein kurzes Produktvideo bedeutete früher ein Briefing, einen Freelancer, zwei Feedbackrunden und eine Woche. Heute kann ein Coding-Agent ein Briefing von einem Absatz nehmen, das Skript schreiben, jeden Shot generieren, den Voiceover aufnehmen und ein MP4 rendern, während Sie etwas anderes prüfen. Alle Bausteine gibt es. Was den meisten Teams fehlt, ist die Verdrahtung: welche Stufe auf welchem Modell läuft, was jede Stufe kostet und an welcher Stelle ein Mensch hinsehen muss, bevor etwas online geht.

Dies ist das Setup, das wir heute bauen würden. Sieben Schritte, eine Kostentabelle, die Sie für Ihren eigenen Batch nachrechnen können, zwei Freigabepunkte und die Kennzeichnungspflichten der Plattformen, die die meisten automatisierten Pipelines vergessen, bis ein Video markiert oder entfernt wird.

Die Pipeline, Stufe für Stufe

Veröffentlichte Berichte über Video-Workflows mit Agenten laufen auf dieselbe Form hinaus. MindStudio beschreibt fünf Agenten: Skript, Storyboard, Bild- oder Videogenerierung, Stimme und Schnitt. Ein zweiter MindStudio-Beitrag zum Content-Marketing ordnet es so: Skript und Shotliste, Voiceover mit wortgenauen Zeitmarken, Videogenerierung, dann Schnitt, Untertitel und Export. Wir nutzen dasselbe Gerüst und ergänzen eine ausdrückliche Prüfstufe, weil dort das Geld gespart wird.

  1. Vom Briefing zu Skript und Shotliste. Ein LLM macht aus dem Briefing ein gesprochenes Skript und eine nummerierte Liste von Shots, jeweils mit Dauer, visuellem Prompt und der Voiceover-Zeile, unter der er liegt.
  2. Storyboard-Standbilder. Ein günstiges Standbild pro Shot, damit Sie die Bildkomposition beurteilen, bevor Sie für Bewegung zahlen.
  3. Freigabe eins: menschliche Abnahme von Skript und Standbildern.
  4. Shot-Generierung. Jedes freigegebene Standbild oder jeder Prompt wird auf dem Modell, das zu diesem Shot passt, zu einem Videoclip.
  5. Voiceover. Text-to-Speech aus dem freigegebenen Skript, aufgeteilt pro Shot oder pro Absatz.
  6. Schnitt und Untertitel. Clips, Stimme, Untertitel und Endkarte werden programmatisch zur fertigen Datei zusammengesetzt.
  7. Freigabe zwei: menschliche Prüfung des Schnitts, dann Kennzeichnung und Veröffentlichung.

Stufe 1: das Briefing und die Shotliste, die der Agent liefern muss

Der größte Qualitätshebel der ganzen Pipeline ist, die Skriptstufe zu zwingen, eine Shotliste in festem Format zurückzugeben, denn alle späteren Stufen lesen daraus. Dieses Format verlangen wir. Kopieren Sie es unverändert in die Anweisungen Ihres Agenten.

Zum Kopieren: der Vertrag für die Shotliste

  1. shot_id: s01, s02 und so weiter, in Reihenfolge.
  2. duration_s: eine ganze Zahl Sekunden für den Clip.
  3. vo_line: die exakten Worte, die über diesem Shot gesprochen werden, oder leer für einen stillen Moment.
  4. visual: ein Satz, der Motiv, Handlung, Umgebung und Kamerabewegung beschreibt. Keine Marken, die das Modell nicht darstellen kann.
  5. needs_audio: nur true, wenn der Shot nativen Ton braucht (Dialog, an die Handlung gebundene Umgebungsgeräusche).
  6. model_hint: fast, premium oder audio, gewählt nach den Regeln im Abschnitt zum Routing weiter unten.
  7. on_screen_text: der Untertitel oder das Overlay, kurz genug, um auf dem Handy lesbar zu sein.

Fügen Sie dem Briefing dann drei feste Regeln hinzu: Gesamtdauer innerhalb der Plattformvorgabe, eine Idee pro Shot und ein letzter Shot, der dem Call-to-Action vorbehalten ist.

Diese Stufe ist die günstigste der Pipeline. MindStudio beziffert den Skriptschritt für ein Erklärvideo von fünf Minuten auf $0.05 bis $0.20.

Stufen 2 und 4: jeden Shot zum passenden Modell leiten

Der Fehler, den wir am häufigsten sehen, ist die Wahl eines einzigen Videomodells, an das alle Shots gehen. Shots sind verschieden. Eine langsame Produktrotation, eine Sprechszene mit Umgebungsgeräuschen und ein schneller Establishing Shot haben unterschiedliche Anforderungen, und die Preise liegen weit auseinander. Zum Zeitpunkt des Schreibens reichen die Video-Sekundenpreise bei Aitachyon von Hailuo 02 mit $0.085/s bis Seedance 2.5 mit $0.44/s bei 720p, dazu Kling v3 mit $0.16/s ohne Ton oder $0.32/s mit nativem Audio, Veo 3.1 Fast ab $0.19/s und Wan 2.7 mit $0.19/s. Die vollständige Übersicht steht auf der Modellseite mit jedem Preis pro Aufruf.

Entscheidungsregeln für das Feld model_hint

  • Storyboard-Standbilder: nehmen Sie das günstigste Bildmodell, das Ihre Komposition hält. Seedream 4.0 mit $0.057 pro Bild oder FLUX.2 [pro] mit $0.057 bis $0.086 sind zum Zeitpunkt des Schreibens die Standardwahl. Heben Sie sich Nano Banana ($0.13) oder gpt-image-2 ($0.10 bis $0.40) für Standbilder auf, die direkt in den finalen Schnitt gehen. Unser Vergleich von Nano Banana und FLUX.2 Pro zeigt, wo sich beide bei Produktfotos bewähren.
  • Fast: Füllmaterial, Establishing Shots und B-Roll unter der Stimme. Hailuo 02 setzt die Preisuntergrenze.
  • Audio: nur Shots, bei denen needs_audio true ist. Kling v3 mit nativem Audio kostet das Doppelte des Tarifs ohne Ton, deshalb sollte der Agent nie Audio für einen Shot anfordern, der ohnehin unter einem Voiceover liegt.
  • Premium: der Hero-Shot und die ersten zwei Sekunden, in denen der Zuschauer entscheidet, ob er weiterschaut. Dort rechtfertigen Seedance 2.5 oder Veo 3.1 Fast ihren Preis. Die beiden Spitzenmodelle haben wir in Kling v3 gegen Seedance 2.5 verglichen.

Ein ehrlicher Hinweis zu den Preisen: Der Direktkauf beim Anbieter kann pro Einheit günstiger sein. Google nennt Veo 3.1 Fast mit $0.10 pro Sekunde bei 720p, $0.12 bei 1080p und $0.30 bei 4K, Veo 3.1 Lite mit $0.05 pro Sekunde bei 720p. Wenn Ihre Pipeline nur ein Modell nutzt, ist der Direktweg sinnvoll. Für ein einziges Konto spricht das Routing: ein Schlüssel, ein Guthaben und eine Abrechnungsspur über ein Dutzend Modelle, und genau das brauchen die obigen Regeln.

Stufe 5: Voiceover, Timing und Kosten

Bei der Stimme spart die Automatisierung am meisten Kalenderzeit und am wenigsten Geld, weil sie ohnehin günstig ist. Die API-Preisliste von ElevenLabs nennt Text-to-Speech mit $0.08 pro 1.000 Zeichen für v3 und Multilingual v2 und $0.04 für Flash und Turbo, dazu einen ermäßigten v4-Preis von $0.022 pro 1.000 Zeichen bis zum 12. Oktober. Über Aitachyon kostet ein ElevenLabs-Voiceover zum Zeitpunkt des Schreibens $0.043 bis $0.086 pro 450 Zeichen. Die Kostendetails stehen in unserer Aufschlüsselung der ElevenLabs-Voiceover-Kosten.

Zwei Timing-Entscheidungen für den Anfang

  • Die Stimme bestimmt den Schnitt, oder der Schnitt bestimmt die Stimme. Bei Erklärvideos erzeugen Sie zuerst die Stimme und schneiden die Shots nach ihrem Timing. Der oben genannte Content-Marketing-Workflow verlangt vor der Videogenerierung ausdrücklich ein Voiceover mit wortgenauen Zeitmarken, damit der Agent die Dauer jedes Clips aus dem echten Audio ableiten kann.
  • Eine Datei oder eine Datei pro Shot. Dateien pro Shot machen Korrekturen günstig: Sie ändern eine Zeile und erzeugen ein paar hundert Zeichen neu statt der ganzen Aufnahme.

Stufe 6: Schnitt ohne Timeline-Editor

Beim Schnitt fallen viele "automatisierte" Pipelines stillschweigend auf eine Person zurück, die Clips in einem Editor verschiebt. Zwei Ansätze halten ihn im Code.

FFmpeg für einfache Schnitte

Besteht das Video aus einer Folge von Clips unter einer Sprachspur mit eingebrannten Untertiteln, erledigt FFmpeg das. MindStudio hält fest, dass der Schnitt programmatisch mit FFmpeg erfolgen kann.

Remotion für alles mit Motion Design

Für animierten Text, Bauchbinden, Preis-Einblendungen oder vorlagenbasierte Endkarten passt Remotion besser: Das Video ist eine React-Komponente, und der Agent schreibt sie. Remotion liefert offizielle Agent Skills, die sich mit npx skills add remotion-dev/skills installieren lassen, Markup, Rendering, Untertitel und mehr abdecken und für Coding-Assistenten wie Claude Code und Cursor gedacht sind. Der Skill /remotion-best-practices ist der Sammelskill, der die anderen enthält, installieren Sie also zuerst diesen.

Wofür Sie sich auch entscheiden: Die Untertitel gehören in diese Stufe und werden aus dem Skripttext erzeugt, statt aus dem Audio rücktranskribiert zu werden. Unsere Notiz dazu, warum Untertitel nicht mehr optional sind, behandelt die Platzierung in vertikalen Formaten.

Die Kostentabelle: was ein echter Batch kostet

Hier die Rechnung mit den Aitachyon-Preisen zum Zeitpunkt des Schreibens. Setzen Sie Ihre eigenen Laufzeiten ein, die Formel gilt weiter.

Formel

Batch-Kosten = (Standbilder x Bildpreis) + (Videosekunden x Sekundenpreis je Modellgruppe) + (Sprachzeichen / 450 x Stimmpreis) + Puffer für Wiederholungen. Der Schnitt mit FFmpeg oder Remotion läuft auf Ihrem eigenen Rechner und verursacht Rechenzeit, keine Gebühren pro Aufruf.

Rechenbeispiele

  • 20 Hook-Varianten, je 5 Sekunden, auf Hailuo 02: 20 x 5 s x $0.085 = $8.50.
  • 50 Produkt-Standbilder: auf Seedream 4.0 50 x $0.057 = $2.85. Auf FLUX.2 [pro] $2.85 bis $4.30. Auf Nano Banana 50 x $0.13 = $6.50.
  • Eine Woche Shorts (7 Videos, 6 Shots à 5 Sekunden, 210 Sekunden Material): alles auf Hailuo 02, 210 x $0.085 = $17.85. Alles auf Veo 3.1 Fast ab $0.19/s, $39.90. Alles auf Kling v3 mit Audio, $67.20. Dazu 7 Storyboards mit je 6 Seedream-Standbildern (42 x $0.057 = $2.39) und zwei Sprachblöcke à 450 Zeichen pro Video (14 x $0.043 bis $0.086 = $0.60 bis $1.20).
  • Die geroutete Version derselben Woche: der erste Shot jedes Videos auf Veo 3.1 Fast (7 x 5 s x $0.19 = $6.65) und die übrigen 175 Sekunden auf Hailuo 02 (175 x $0.085 = $14.88). Video gesamt $21.53, gegenüber $39.90, wenn alles auf Veo läuft.

Planen Sie einen Puffer für Wiederholungen ein. Wenn Sie erwarten, die Hälfte Ihrer Shots einmal neu zu erzeugen, multiplizieren Sie die Videozeile mit 1,5. Dieser Puffer ist das Argument für die Storyboard-Freigabe: Wiederholungen bei einem Standbild kosten Cent, bei Video kosten sie Dollar.

Zur Einordnung: MindStudio schätzt ein fünfminütiges Erklärvideo auf $2 bis $7 insgesamt und $10 bis $20 mit Premium-Modellen wie Veo und Premium-Stimmen von ElevenLabs. Derselbe Anbieter stellt einen klassischen 60-Sekunden-Markenspot mit $2,000 bis $20,000 gegen $5 bis $50 bei Generierung gegenüber. Nehmen Sie beides als Anbieterschätzungen. Unser API-Preisguide Modell für Modell enthält den Rest der Tabelle.

Wo Menschen im Prozess bleiben

Jeder ernstzunehmende Bericht behält einen Menschen im Prozess. MindStudio empfiehlt einen menschlichen Prüfschritt für alles, was öffentlich geht, und der Marketing-Workflow sieht manuelle Prüfung der Ausgabe, automatische Hinweise bei Clips unter Dauer- oder Konfidenzschwellen und eine menschliche Freigabe vor dem finalen Schnitt vor. Wir setzen die Freigaben an die zwei Stellen, an denen eine falsche Entscheidung am teuersten wird.

Checkliste für Freigabe eins: bevor irgendein Video generiert wird

  1. Das Skript sagt eine Sache, und der erste Satz verdient den zweiten.
  2. Jede Aussage im Voiceover ließe sich vor einem Plattform-Prüfer verteidigen.
  3. Jedes Standbild zeigt das richtige Produkt, ohne erfundene Logos oder verstümmelten Verpackungstext.
  4. Nur Shots, die nativen Ton brauchen, haben needs_audio auf true.
  5. Premium-Routing beschränkt sich auf den Hook und den Hero-Shot.
  6. Die mit der obigen Formel berechneten Kosten liegen unter dem Batch-Budget.

Checkliste für Freigabe zwei: vor der Veröffentlichung

  1. Sehen Sie sich den ganzen Schnitt mit Ton an und danach einmal stumm, um zu prüfen, ob die Untertitel allein tragen.
  2. Prüfen Sie Hände, Gesichter und Bildschirmtext im Hook Bild für Bild.
  3. Entscheiden Sie die Kennzeichnungsfrage (nächster Abschnitt) und legen Sie die Antwort bei der Datei ab.
  4. Stimmen Sie die Endkarte auf die Landingpage ab, zu der das Video führt.

Automatisieren Sie die Hinweise, damit der Prüfer nur dort hinsieht, wo es zählt: ein Clip, der kürzer ist als sein duration_s, ein fehlgeschlagenes Rendering, eine Sprachdatei, die länger ist als ihr Shot.

Die Kennzeichnung gehört in die Pipeline

Plattformen erwarten inzwischen, dass Sie angeben, wenn realistisches Material generiert wurde, und eine automatisierte Pipeline sollte diese Antwort pro Video festhalten.

Die praktische Regel: Fügen Sie jedem Video-Datensatz ein Feld disclose hinzu, setzen Sie es für jedes realistische generierte Material standardmäßig auf true und lassen Sie den Veröffentlichungsschritt die Ausführung verweigern, solange es leer ist. Bei Werbekonten gelten zusätzlich die Richtlinienfallen aus Videoanzeigen auf Meta und TikTok genehmigt bekommen.

Der Betrieb aus Claude Code oder Cursor

Die ganze Pipeline kann in einer einzigen Agentensitzung laufen. Der Agent liest das Briefing, schreibt die Shotliste in eine Datei, ruft die Bild- und Videomodelle auf, fragt den Status ab, bis jedes Rendering fertig ist, schreibt den FFmpeg-Befehl oder die Remotion-Komposition und rendert. Zusammen hält das, weil jede generierte Datei eine stabile Referenz hat, zu der der Agent zurückkehren kann, und weil jeder Aufruf meldet, was er gekostet hat. Bei Aitachyon erhält jede Ausgabe eine Referenz wie img_, scn_ oder vo_, die Code mit GET /api/generations/{ref} abrufen kann, und jeder Job wird mit Modell und Preis aufgeführt, sodass der Agent neben jeden Shot echte Kosten statt einer Schätzung schreiben kann. Claude Code mit dem gehosteten MCP-Server zu verbinden, ist ein einziger Befehl: claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_...". Derselbe Schlüssel funktioniert mit der normalen HTTP-API, falls Sie die Pipeline lieber als Skript ausführen.

Ein Briefing, das Sie dem Agenten geben können

Erstelle ein 30-sekündiges Hochformat-Video für [Produkt]. Gib zuerst die Shotliste im Vertragsformat zurück und halte für meine Freigabe an. Nach der Freigabe erzeuge ein Standbild pro Shot mit dem günstigsten Bildmodell und halte wieder an. Nach meiner zweiten Freigabe erzeuge das Video nach den Routing-Regeln, erzeuge das Voiceover pro Shot, schneide mit Remotion mit Untertiteln aus dem Skript und schreibe eine Kostentabelle mit Referenz, Modell und Preis jedes Elements. Setze disclose auf true.

Die zwei ausdrücklichen Stopps sind die menschlichen Freigaben. Ohne sie gibt der Agent gern das ganze Budget für die erste Version des Skripts aus. Die Einrichtungsschritte finden Sie in KI-Video aus Claude Code mit einem MCP-Server erzeugen.

FAQ

Kann KI die Videoproduktion vollständig von Anfang bis Ende automatisieren?

Technisch ja: Skript, Shots, Stimme und Schnitt können alle von einem Agenten aus laufen. In der Praxis behält jeder veröffentlichte Workflow, den wir gefunden haben, eine menschliche Prüfung vor der Veröffentlichung, und die Kennzeichnungsregeln der Plattformen machen ohnehin eine Person für die finale Datei verantwortlich. Lassen Sie den Agenten produzieren und behalten Sie das Schlussurteil bei einem Menschen.

Was kostet es, ein kurzes Video mit KI zu automatisieren?

Es hängt von den Sekunden Material ab und davon, welches Modell sie rendert. Zum Zeitpunkt des Schreibens kosten 30 Sekunden bei Aitachyon auf Hailuo 02 $2.55, auf Veo 3.1 Fast ab $5.70 und auf Kling v3 mit Audio $9.60, zuzüglich einiger Cent für Standbilder und Stimme. Die Schätzung von MindStudio für ein fünfminütiges Erklärvideo liegt bei $2 bis $7, mit Premium-Modellen bei $10 bis $20.

Wie lange dauert die Produktion eines automatisierten KI-Videos?

MindStudio nennt 5 bis 15 Minuten vom Prompt bis zum Export bei einem 60-Sekunden-Social-Clip und 20 bis 40 Minuten bei einem Erklärvideo von 2 bis 3 Minuten sowie 30 bis 60 Minuten für ein 3 bis 5 Minuten langes Video aus generierten Clips.

Sollte ich FFmpeg oder Remotion zum Zusammensetzen von KI-Video verwenden?

FFmpeg für einfache Schnitte unter einer Sprachspur mit eingebrannten Untertiteln. Remotion, wenn Sie animierten Text, Vorlagen oder alles brauchen, was Sie sonst in einem Motion-Design-Tool bauen würden, da der Agent die React-Komposition schreiben und als MP4 rendern kann.

Muss ich KI-generierte Videos auf YouTube und TikTok kennzeichnen?

Bei realistischem generiertem Material ja, auf beiden. YouTube fragt beim Hochladen in YouTube Studio danach, TikTok verlangt eine Kennzeichnung und kann C2PA Content Credentials selbst erkennen. Fantastische oder klar unrealistische Inhalte und KI, die nur für Skripte oder Untertitel genutzt wurde, brauchen auf YouTube keine Kennzeichnung.

Quellen

  1. Google AI for Developers: Gemini Developer API pricing (Veo 3.1), September 2026
  2. ElevenLabs: API Pricing, September 2026
  3. YouTube Help: Disclosing use of altered or synthetic content
  4. TikTok Newsroom: Partnering with our industry to advance AI transparency and literacy, May 2024
  5. TechCrunch: TikTok will automatically label AI-generated content created on other platforms, May 2024
  6. Remotion: Agent Skills
  7. MindStudio: AI Agent Workflow, YouTube Video From One Prompt
  8. MindStudio: AI Video Generation for Content Marketing, Multi-Agent Workflow

Wenn Sie diese Pipeline ohne fünf Anbieterkonten betreiben möchten: Aitachyon bündelt die oben genannten Bild-, Video- und Stimmmodelle hinter einem vorausbezahlten Guthaben und einem Schlüssel, nutzbar über das Web-Studio, die HTTP-API oder einen gehosteten MCP-Server, mit dem sich Claude Code per Befehl verbindet. Fehlgeschlagene Renderings werden automatisch erstattet, jeder Schlüssel hat seinen eigenen Ausgabenalarm, und der Schnellstart für API und MCP dauert wenige Minuten.

Ähnliche Artikel

Strategien

KI-Credits oder Pay-per-Call: Was wirklich weniger kostet

Wie KI-Credits abgerechnet werden: wo Verfall, Neuversuche und fehlgeschlagene Renders Kosten verstecken,, dazu ein Beispiel gegen den Dollarpreis pro Sekunde

Strategien

Anzeige-zu-Landingpage-Konsistenz: Das Conversion-Leck, das niemand prüft

Eine starke Anzeige konvertiert kaum, wenn die Landingpage ihr Versprechen bricht. Warum fehlende Konsistenz Budget kostet – plus eine Checkliste zur Abstimmung der Botschaft von Anfang bis Ende.

Strategien

Die Video-Ad-Metriken, die wirklich Gewinner vorhersagen

Hook Rate, Hold Rate und Cost-per-outbound-Click prognostizieren Gewinner-Ads bei geringem Budget. Die Eitelkeitswerte, die man ignorieren sollte – mit zitierten Benchmarks.

Strategien

Retargeting-Creatives: Was du Menschen zeigst, die abgesprungen sind

Warum Retargeting andere Creatives braucht als Prospecting — Botschaftswechsel bei Einwänden, Beweis und Dringlichkeit, die abgebrochene Warenkörbe und kalte Leads zurückgewinnen.

Strategien

Markenkonsistenz in Anzeigen: Wiedererkennbarkeit bei hohem Volumen sichern

Ein sofort einsetzbares Marken-Kit-System — Farben, Schrift, Tonalität, Verbotslisten — das fünfzig Anzeigenvarianten als eine Marke erkennbar hält, ohne jede einzelne prüfen zu müssen.

Strategien

Creative-Volume-Strategie: Wie viele Anzeigen sollte man schalten?

Die Mathematik hinter einer Creative-Volume-Strategie — Varianten, Rotationen und Erneuerungsrate pro 1.000 $ monatlichem Paid-Social-Budget.

Kostenlose Tools zum Ausprobieren

Beschreiben Sie Ihre Marke nicht mehr. Fügen Sie Ihre URL ein.

Aitachyon liest Ihre ganze Marke von Ihrer Website und erstellt dann Videos, Bilder, Karussells, Posts und Banner, markengerecht, für jedes Format und jeden Feed.