Skip to content
Estratégias30 de setembro de 2026· 10 min de leitura

Automatizar a produção de vídeo com agentes de IA: uma configuração que funciona

Um pipeline para automatizar a produção de vídeo com agentes de IA: roteiro, planos, voz e montagem, com custo real por etapa e as aprovações humanas.

automationai agentsvideo productionmcp
Estratégias

Automatizar a produção de vídeo com agentes de IA: uma configuração que funciona

Um vídeo curto de produto significava um briefing, um freelancer, duas rodadas de revisão e uma semana. Hoje um agente de código pode pegar um briefing de um parágrafo, escrever o roteiro, gerar cada plano, gravar a narração e renderizar um MP4 enquanto você revisa outra coisa. Todas as peças existem. O que falta à maioria das equipes é a ligação entre elas: qual etapa roda em qual modelo, quanto cada etapa custa e em que ponto uma pessoa precisa olhar antes de qualquer coisa ir ao ar.

Esta é a configuração que montaríamos hoje. Sete passos, uma planilha de custos que você pode recalcular para o seu próprio lote, dois pontos de aprovação e as etapas de declaração exigidas pelas plataformas, que a maioria dos pipelines automatizados esquece até que um vídeo seja rotulado ou removido.

O pipeline, etapa por etapa

Os relatos publicados sobre fluxos de vídeo com agentes convergem para o mesmo formato. A MindStudio descreve cinco agentes: roteiro, storyboard, geração de imagem ou vídeo, voz e montagem. Um segundo texto da MindStudio sobre marketing de conteúdo os ordena assim: roteiro e lista de planos, narração com marcação de tempo palavra por palavra, geração de vídeo e, depois, montagem, legendas e exportação. Usamos o mesmo esqueleto com um acréscimo, uma etapa de revisão explícita, porque é aí que o dinheiro é economizado.

  1. Do briefing ao roteiro e à lista de planos. Um LLM transforma o briefing em um roteiro falado e em uma lista numerada de planos, cada um com duração, prompt visual e a linha de narração sobre a qual fica.
  2. Imagens de storyboard. Uma imagem estática barata por plano, para avaliar a composição antes de pagar pelo movimento.
  3. Aprovação um: validação humana do roteiro e das imagens.
  4. Geração dos planos. Cada imagem ou prompt aprovado vira um clipe de vídeo no modelo que serve para aquele plano.
  5. Narração. Texto para fala a partir do roteiro aprovado, dividido por plano ou por parágrafo.
  6. Montagem e legendas. Clipes, voz, legendas e cartela final são unidos por código no arquivo final.
  7. Aprovação dois: revisão humana do corte, depois declaração e publicação.

Etapa 1: o briefing e a lista de planos que o agente deve devolver

A maior alavanca de qualidade de todo o pipeline é obrigar a etapa de roteiro a devolver uma lista de planos em formato fixo, porque todas as etapas seguintes leem dela. Este é o formato que pedimos. Cole-o como está nas instruções do seu agente.

Para copiar e colar: o contrato da lista de planos

  1. shot_id: s01, s02 e assim por diante, em ordem.
  2. duration_s: um número inteiro de segundos para o clipe.
  3. vo_line: as palavras exatas faladas sobre este plano, ou vazio para um momento silencioso.
  4. visual: uma frase que descreve sujeito, ação, cenário e movimento de câmera. Sem marcas que o modelo não consiga renderizar.
  5. needs_audio: true somente se o plano precisar de som nativo (diálogo, som ambiente ligado à ação).
  6. model_hint: fast, premium ou audio, escolhido pelas regras da seção de roteamento abaixo.
  7. on_screen_text: a legenda ou sobreposição, curta o bastante para ler no celular.

Depois acrescente três regras rígidas ao briefing: duração total dentro da meta da plataforma, uma ideia por plano e um último plano reservado para a chamada para ação.

Esta é a etapa mais barata do pipeline. A MindStudio calcula o passo de roteiro de um vídeo explicativo de cinco minutos em $0.05 a $0.20.

Etapas 2 e 4: encaminhar cada plano para o modelo certo

O erro que mais vemos é escolher um único modelo de vídeo e mandar todos os planos para ele. Os planos são diferentes. Uma rotação lenta de produto, uma cena falada com som ambiente e um plano de estabelecimento rápido têm requisitos distintos, e os preços se espalham bastante. No momento em que escrevemos, os preços de vídeo por segundo na Aitachyon vão do Hailuo 02 a $0.085/s até o Seedance 2.5 a $0.44/s em 720p, com Kling v3 a $0.16/s sem som ou $0.32/s com áudio nativo, Veo 3.1 Fast a partir de $0.19/s e Wan 2.7 a $0.19/s. A tabela completa está na página de modelos com o preço de cada chamada.

Regras de decisão para o campo model_hint

  • Imagens de storyboard: use o modelo de imagem mais barato que sustente a sua composição. Seedream 4.0 a $0.057 por imagem ou FLUX.2 [pro] de $0.057 a $0.086 são as opções padrão no momento em que escrevemos. Reserve Nano Banana ($0.13) ou gpt-image-2 ($0.10 a $0.40) para as imagens que vão direto para o corte final. Nossa comparação entre Nano Banana e FLUX.2 Pro mostra onde cada um se sustenta em fotos de produto.
  • Fast: planos de preenchimento, planos de estabelecimento e B-roll sob a voz. O Hailuo 02 define o piso de preço.
  • Audio: somente os planos em que needs_audio é true. O Kling v3 com áudio nativo custa o dobro da tarifa sem som, então o agente nunca deve pedir áudio para um plano que ficará sob uma narração de qualquer forma.
  • Premium: o plano principal e os dois primeiros segundos, onde o espectador decide se continua assistindo. É aí que o Seedance 2.5 ou o Veo 3.1 Fast justifica o preço. Comparamos os dois primeiros em Kling v3 contra Seedance 2.5.

Uma observação sobre preços, por honestidade. Comprar direto do fornecedor pode sair mais barato por unidade. O Google lista o Veo 3.1 Fast a $0.10 por segundo em 720p, $0.12 em 1080p e $0.30 em 4K, com o Veo 3.1 Lite a $0.05 por segundo em 720p. Se o seu pipeline usa apenas um modelo, ir direto faz sentido. O argumento a favor de uma única conta é o roteamento: uma chave, um saldo e um único rastro de cobrança para uma dúzia de modelos, que é o que as regras acima exigem.

Etapa 5: narração, tempo e custo

A voz é a etapa em que a automação economiza mais tempo de calendário e menos dinheiro, porque ela já é barata. A tabela de preços de API da própria ElevenLabs lista texto para fala a $0.08 por 1.000 caracteres para v3 e Multilingual v2, e $0.04 para Flash e Turbo, com uma tarifa reduzida do v4 de $0.022 por 1.000 caracteres exibida até 12 de outubro. Pela Aitachyon, a narração da ElevenLabs custa de $0.043 a $0.086 por 450 caracteres no momento em que escrevemos. O detalhamento de custos está em nossa análise do custo de narração com ElevenLabs.

Duas decisões de tempo para tomar logo de início

  • A voz conduz a edição, ou a edição conduz a voz. Em vídeos explicativos, gere a voz primeiro e corte os planos no ritmo dela. O fluxo de marketing de conteúdo citado acima pede justamente uma narração com marcação de tempo palavra por palavra antes da geração de vídeo, para que o agente defina a duração de cada clipe a partir do áudio real.
  • Um arquivo ou um arquivo por plano. Arquivos por plano deixam os retoques baratos: você muda uma linha e regenera algumas centenas de caracteres em vez da leitura inteira.

Etapa 6: montagem sem editor de linha do tempo

A montagem é onde muitos pipelines "automatizados" voltam em silêncio a ter uma pessoa arrastando clipes em um editor. Duas abordagens a mantêm no código.

FFmpeg para cortes diretos

Se o vídeo é uma sequência de clipes sobre uma faixa de voz com legendas gravadas na imagem, o FFmpeg resolve. A MindStudio observa que a montagem pode ser feita por código com FFmpeg.

Remotion para tudo que tenha motion design

Para texto animado, tarjas, destaques de preço ou cartelas finais com modelo, o Remotion é a opção mais forte: o vídeo é um componente React e o agente o escreve. O Remotion traz skills oficiais para agentes, instaladas com npx skills add remotion-dev/skills, que cobrem marcação, renderização, legendas e mais, e foram pensadas para assistentes de código como Claude Code e Cursor. A skill /remotion-best-practices é a que reúne as demais, então instale essa primeiro.

Qualquer que seja a sua escolha, as legendas pertencem a esta etapa, geradas a partir do texto do roteiro em vez de transcritas de volta do áudio. Nossa nota sobre por que as legendas deixaram de ser opcionais trata do posicionamento em formatos verticais.

A planilha de custos: quanto custa um lote real

Aqui está a aritmética, com os preços da Aitachyon no momento em que escrevemos. Troque pelas suas próprias durações e a fórmula continua valendo.

Fórmula

Custo do lote = (imagens x preço da imagem) + (segundos de vídeo x preço por segundo, por grupo de modelo) + (caracteres de voz / 450 x preço da voz) + margem para refações. A montagem com FFmpeg ou Remotion roda na sua própria máquina e soma processamento, não tarifas por chamada.

Exemplos calculados

  • 20 variações de gancho, 5 segundos cada, no Hailuo 02: 20 x 5 s x $0.085 = $8.50.
  • 50 imagens de produto: no Seedream 4.0, 50 x $0.057 = $2.85. No FLUX.2 [pro], de $2.85 a $4.30. No Nano Banana, 50 x $0.13 = $6.50.
  • Uma semana de shorts (7 vídeos, 6 planos de 5 segundos cada, 210 segundos de imagens): tudo no Hailuo 02, 210 x $0.085 = $17.85. Tudo no Veo 3.1 Fast a partir de $0.19/s, $39.90. Tudo no Kling v3 com áudio, $67.20. Some 7 storyboards de 6 imagens Seedream (42 x $0.057 = $2.39) e dois blocos de voz de 450 caracteres por vídeo (14 x $0.043 a $0.086 = $0.60 a $1.20).
  • A versão roteada dessa semana: o primeiro plano de cada vídeo no Veo 3.1 Fast (7 x 5 s x $0.19 = $6.65) e os outros 175 segundos no Hailuo 02 (175 x $0.085 = $14.88). Total de vídeo $21.53, contra $39.90 com tudo no Veo.

Reserve uma margem para refações. Se você espera regenerar metade dos planos uma vez, multiplique a linha de vídeo por 1,5. Essa margem é o argumento a favor da aprovação do storyboard: refazer uma imagem custa centavos, refazer um vídeo custa dólares.

Para ter uma noção da faixa, a MindStudio estima um vídeo explicativo de cinco minutos em $2 a $7 no total, e $10 a $20 com modelos premium como o Veo e as vozes premium da ElevenLabs. A mesma empresa compara um comercial de marca tradicional de 60 segundos a $2,000 a $20,000 contra $5 a $50 gerado. Trate as duas como estimativas do fornecedor. Nosso guia de preços de API modelo por modelo traz o resto da tabela.

Onde as pessoas continuam no processo

Todo relato sério mantém uma pessoa no processo. A MindStudio recomenda uma etapa de revisão humana para tudo que for público, e o fluxo de marketing dela especifica revisão manual da saída, alertas automáticos para clipes abaixo de limites de duração ou de confiança e uma aprovação humana antes da montagem final. Colocamos as aprovações nos dois pontos em que uma decisão errada sai mais cara.

Checklist da aprovação um: antes de gerar qualquer vídeo

  1. O roteiro diz uma coisa só, e a primeira frase merece a segunda.
  2. Toda afirmação da narração é defensável diante de um revisor da plataforma.
  3. Cada imagem mostra o produto certo, sem logotipos inventados nem texto de embalagem embaralhado.
  4. Somente os planos que precisam de som nativo têm needs_audio em true.
  5. O roteamento premium fica limitado ao gancho e ao plano principal.
  6. O custo previsto pela fórmula acima está abaixo do orçamento do lote.

Checklist da aprovação dois: antes de publicar

  1. Assista ao corte completo com som e depois uma vez sem som, para conferir se as legendas se sustentam sozinhas.
  2. Confira mãos, rostos e texto na tela quadro a quadro no gancho.
  3. Decida a resposta da declaração (próxima seção) e registre-a junto com o arquivo.
  4. Alinhe a cartela final com a página de destino para a qual o vídeo vai levar as pessoas.

Automatize os alertas para que o revisor olhe apenas onde importa: um clipe mais curto que o seu duration_s, uma renderização que falhou, um arquivo de voz mais longo que o seu plano.

A declaração faz parte do pipeline

As plataformas agora esperam que você informe quando imagens realistas foram geradas, e um pipeline automatizado deve registrar essa resposta por vídeo.

A regra prática: adicione um campo disclose ao registro de cada vídeo, deixe-o em true por padrão para qualquer imagem realista gerada e faça a etapa de publicação se recusar a rodar enquanto ele estiver vazio. Em contas de anúncios, as armadilhas de política de como aprovar anúncios em vídeo no Meta e no TikTok valem além disso.

Rodando a partir do Claude Code ou do Cursor

O pipeline inteiro pode rodar dentro de uma única sessão de agente. O agente lê o briefing, escreve a lista de planos em um arquivo, chama os modelos de imagem e vídeo, consulta o estado até cada renderização terminar, escreve o comando do FFmpeg ou a composição do Remotion e renderiza. O que mantém tudo coeso é que cada arquivo gerado tem uma referência estável à qual o agente pode voltar, e que cada chamada informa quanto custou. Na Aitachyon, cada saída recebe uma referência como img_, scn_ ou vo_ que o código pode buscar com GET /api/generations/{ref}, e cada job é detalhado com seu modelo e preço, de modo que o agente pode escrever um custo real ao lado de cada plano em vez de uma estimativa. Conectar o Claude Code ao servidor MCP hospedado é um único comando: claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_...". A mesma chave funciona com a API HTTP comum, se você preferir rodar o pipeline como um script.

Um briefing que você pode entregar ao agente

Faça um vídeo vertical de 30 segundos para [produto]. Devolva primeiro a lista de planos no formato do contrato e pare para a minha aprovação. Depois da aprovação, gere uma imagem por plano no modelo de imagem mais barato e pare de novo. Depois da minha segunda aprovação, gere o vídeo conforme as regras de roteamento, gere a narração por plano, monte com Remotion usando legendas tiradas do roteiro e escreva uma tabela de custos com a referência, o modelo e o preço de cada item. Defina disclose como true.

As duas paradas explícitas são as aprovações humanas. Sem elas, o agente gasta feliz o orçamento inteiro na primeira versão do roteiro. Para os passos de configuração, veja como gerar vídeo com IA no Claude Code com um servidor MCP.

FAQ

A IA consegue automatizar a produção de vídeo por completo, de ponta a ponta?

Tecnicamente sim: roteiro, planos, voz e montagem podem rodar todos a partir de um único agente. Na prática, todo fluxo publicado que encontramos mantém uma revisão humana antes de qualquer coisa ir a público, e as regras de declaração das plataformas tornam uma pessoa responsável pelo arquivo final de qualquer forma. Deixe o agente produzir e mantenha o julgamento final com uma pessoa.

Quanto custa automatizar um vídeo curto com IA?

Depende dos segundos de imagem e do modelo que os renderiza. No momento em que escrevemos, na Aitachyon, 30 segundos custam $2.55 no Hailuo 02, a partir de $5.70 no Veo 3.1 Fast e $9.60 no Kling v3 com áudio, mais alguns centavos para imagens e voz. A estimativa da MindStudio para um vídeo explicativo de cinco minutos é de $2 a $7, ou de $10 a $20 com modelos premium.

Quanto tempo leva para produzir um vídeo de IA automatizado?

A MindStudio informa de 5 a 15 minutos do prompt à exportação para um clipe social de 60 segundos e de 20 a 40 minutos para um vídeo explicativo de 2 a 3 minutos, e de 30 a 60 minutos para um vídeo de 3 a 5 minutos feito com clipes gerados.

Devo usar FFmpeg ou Remotion para montar vídeo de IA?

FFmpeg para cortes diretos sob uma faixa de voz com legendas gravadas. Remotion quando você precisa de texto animado, modelos ou qualquer coisa que faria em uma ferramenta de motion design, já que o agente pode escrever a composição em React e renderizá-la em MP4.

Preciso rotular vídeos gerados por IA no YouTube e no TikTok?

Para imagens realistas geradas, sim nos dois. O YouTube pergunta no upload, no YouTube Studio, e o TikTok exige um rótulo e consegue detectar sozinho as Content Credentials do C2PA. Conteúdo fantasioso ou claramente irreal, e IA usada apenas para roteiros ou legendas, não precisa de declaração no YouTube.

Fontes

  1. Google AI for Developers: Gemini Developer API pricing (Veo 3.1), September 2026
  2. ElevenLabs: API Pricing, September 2026
  3. YouTube Help: Disclosing use of altered or synthetic content
  4. TikTok Newsroom: Partnering with our industry to advance AI transparency and literacy, May 2024
  5. TechCrunch: TikTok will automatically label AI-generated content created on other platforms, May 2024
  6. Remotion: Agent Skills
  7. MindStudio: AI Agent Workflow, YouTube Video From One Prompt
  8. MindStudio: AI Video Generation for Content Marketing, Multi-Agent Workflow

Se você quer rodar este pipeline sem abrir cinco contas de fornecedores, a Aitachyon reúne os modelos de imagem, vídeo e voz acima sob um único saldo pré-pago e uma só chave, utilizável pelo estúdio web, pela API HTTP ou por um servidor MCP hospedado ao qual o Claude Code se conecta com um comando. Renderizações que falham são reembolsadas automaticamente, cada chave tem o seu próprio alerta de gasto e o guia rápido de API e MCP leva alguns minutos.

Artigos relacionados

Estratégias

Créditos de IA ou pagamento por chamada: qual custa menos de verdade

Como funcionam os créditos de IA, onde validade, tentativas e renders com falha escondem custo, e um exemplo com números contra o preço por segundo em dólares

Estratégias

Coerência entre anúncio e landing page: o vazamento de conversões que ninguém verifica

Um anúncio forte converte mal se a landing page não cumpre sua promessa. Por que essa falta de coerência desperdiça orçamento, com um checklist para alinhar a mensagem do início ao fim.

Estratégias

As métricas de anúncios de vídeo que realmente preveem os vencedores

Hook rate, hold rate e custo por clique de saída antecipam um anúncio de vídeo vencedor com baixo investimento. Os números de vaidade a ignorar, com benchmarks citados.

Estratégias

Criativos de Retargeting: O Que Mostrar a Quem Abandonou o Seu Site

Por que o retargeting precisa de criativos diferentes da prospecção — as mudanças de mensagem sobre objeções, provas e urgência que recuperam carrinhos e leads frios.

Estratégias

Consistência de marca em anúncios: manter a identidade em alto volume

Um sistema de brand kit pronto para usar — cores, tipografia, voz, regras de proibição — que mantém cinquenta variantes de anúncios reconhecíveis como uma só marca sem revisar cada uma individualmente.

Estratégias

Estratégia de volume criativo: quantos anúncios você deveria publicar?

A matemática por trás de uma estratégia de volume publicitário — variantes, rotações e frequência de renovação por cada 1.000 $ de gasto mensal em social pago.

Ferramentas grátis para experimentar

Pare de descrever a sua marca. Cole o seu URL.

A Aitachyon lê toda a sua marca a partir do seu site e cria vídeos, imagens, carrosséis, publicações e banners, fiéis à marca, em cada formato e cada feed.