Skip to content
Guias30 de setembro de 2026· 9 min de leitura

API de vídeo com avatar de IA: rostos que falam a partir de uma foto e uma voz

Como funcionam as APIs de avatar com foto e áudio, quanto custam por segundo, onde falham e como chamá-las por código ou por um agente de IA, com exemplos.

avatarsapilip synctalking head
Guias

API de vídeo com avatar de IA: rostos que falam a partir de uma foto e uma voz

Um clipe de 30 segundos de um rosto que fala, a partir de um retrato e de uma faixa de voz, custa entre US$ 0,75 e US$ 6,40 por API, conforme o fornecedor e a resolução. A diferença é maior do que a maioria espera e vem de uma única variável: o preço por segundo. O modelo, as entradas e o formato da requisição são quase idênticos entre os fornecedores.

Este guia explica como esses modelos transformam uma foto parada em um rosto que fala, quanto cada fornecedor cobra por segundo de saída, onde os resultados se desfazem e como ligar tudo a um script ou a um agente, de modo que entre um briefing e saiam MP4 prontos com o custo anexado.

Como funciona um modelo de avatar com foto e áudio

Todo fornecedor dessa categoria segue o mesmo contrato. Você envia um retrato e uma faixa de fala, o modelo anima o rosto para acompanhar o áudio e você recebe um vídeo com a mesma duração do áudio. A página do Kling Avatar V2 na Replicate diz isso claramente: a duração acompanha automaticamente o tamanho do áudio. Você nunca escolhe uma duração. Você escolhe uma faixa de voz, e a faixa de voz define a conta.

O guia de APIs de avatar da APIframe divide o processo em três etapas:

  1. Extração de identidade. O modelo lê o rosto do retrato e o fixa, para que a pessoa do primeiro quadro seja a mesma do último.
  2. Mapeamento de áudio. O áudio é associado quadro a quadro aos formatos da boca e às expressões faciais. É aqui que a qualidade do lip sync se ganha ou se perde.
  3. Renderização assíncrona. O vídeo é renderizado como uma tarefa em segundo plano. Você envia, espera e baixa.

A maioria dos modelos também aceita um prompt de texto opcional para orientar a expressão ou o movimento. Na página do Kling AI Avatar 2.0 na Kie.ai, o campo de prompt aceita de 0 a 5.000 caracteres e é opcional para o uso básico. Na prática, o retrato e o áudio fazem quase todo o trabalho.

O sujeito não precisa ser uma pessoa real. A listagem do Kling Avatar v2 Pro na fal afirma que o modelo lida com humanos realistas, animais, desenhos animados e personagens estilizados, e a VEED descreve seu modelo Fabric como compatível com fotos, ilustrações, mascotes, renders 3D e anime. Isso importa para marcas que querem um mascote ou um apresentador gerado em vez de um fundador filmado. Se você ainda está decidindo se uma cabeça falante é mesmo o formato certo, nossa análise de quando anúncios com avatar funcionam e quando não cobre o lado criativo.

Quanto custa por segundo uma API de vídeo com avatar

Quase todos os fornecedores cobram por segundo de vídeo gerado. A APIframe aponta como faixa típica de US$ 0,02 a US$ 0,07 por segundo em resoluções padrão. Os preços publicados no momento da redação, vindos de páginas de fornecedores e guias de terceiros:

Duas ressalvas. Esses números vêm de páginas de fornecedores e de guias e não foram conferidos com faturas reais, então faça alguns renders de teste antes de fechar um orçamento. E o mesmo modelo pode custar valores bem diferentes conforme quem o serve: o Kling Avatar v2 aparece a US$ 0,056/s (Standard, WaveSpeed) e a US$ 0,115/s (Pro, fal), enquanto a Kie.ai usa cobrança por créditos, sem preço por segundo na página, e a página do modelo na Replicate não mostrava preço quando conferimos.

A fórmula de custo

Como a duração da saída acompanha o áudio, a conta de um clipe é curta:

custo do clipe = segundos de áudio x preço do avatar + custo da voz + custo do retrato

O retrato é um custo único se você reutilizar o mesmo rosto. A voz é barata perto do avatar. Na Aitachyon, a narração da ElevenLabs custa de US$ 0,043 a US$ 0,086 a cada 450 caracteres no momento da redação, e um retrato gerado no Nano Banana custa US$ 0,13 por imagem. Os segundos de avatar dominam cada linha do orçamento.

Três lotes, calculados

Usando os preços publicados acima:

  1. 20 ganchos com avatar de 10 segundos cada (200 segundos de vídeo). No Kling Avatar Standard a US$ 0,056/s: US$ 11,20. No Kling Avatar Pro a US$ 0,115/s: US$ 23,00. Some 20 falas curtas de menos de 450 caracteres cada (US$ 0,86 a US$ 1,72) e um retrato reutilizado (US$ 0,13), e o lote fica entre cerca de US$ 12,19 e US$ 24,85.
  2. Uma semana de shorts, sete cabeças falantes de 45 segundos (315 segundos). Standard: US$ 17,64. Pro: US$ 36,23. P-Video-Avatar em 720p: US$ 7,88. Suponha que cada roteiro ocupe dois blocos de voz de 450 caracteres, o que soma 14 blocos a US$ 0,60 a US$ 1,20.
  3. Um vídeo explicativo de 60 segundos em 1080p. P-Video-Avatar: US$ 2,70. Kling Pro: US$ 6,90. Pixverse: US$ 12,80.

A mesma semana de conteúdo pode custar US$ 8 ou US$ 37 antes de qualquer decisão criativa. Se você está comparando preços de modelos de vídeo de forma mais ampla, nosso detalhamento de preços de APIs de vídeo modelo por modelo usa o mesmo método por segundo.

Onde os modelos de avatar falham

Duração

Os limites técnicos são generosos. A WaveSpeed cobra o Kling Avatar Standard até um máximo de 300 segundos por tarefa, a Kie.ai informa que o áudio não pode passar de 5 minutos, e a VEED lista o Fabric com 5 minutos por geração.

O teto de qualidade chega bem antes. A APIframe alerta que alguns modelos mostram deriva de identidade e deformações depois de 30 segundos. O guia do P-Video-Avatar recomenda manter os clipes abaixo de três minutos e dividir conteúdos mais longos. Um limite de cinco minutos diz o que a API vai aceitar. Diz pouco sobre o que ainda vai parecer a mesma pessoa no minuto quatro.

Lip sync e expressão

O lip sync só é tão bom quanto a etapa de mapeamento de áudio, e essa etapa só é tão boa quanto o áudio. A WaveSpeed pede uma faixa de voz limpa, gravada ou sintética, sem silêncios longos. Em um modelo cobrado por segundo, o silêncio custa dinheiro e não dá nada para o rosto fazer, e é aí que costumam aparecer aqueles quadros parados e estranhos.

Gestos e corpo

A maioria desses modelos anima rosto e cabeça a partir de uma única imagem. A VEED descreve o Fabric como um modelo que produz gestos naturais de cabeça e linguagem corporal expressiva, mas é uma descrição do próprio fornecedor. Planeje um enquadramento de cabeça e ombros e trate os gestos das mãos como um bônus.

Enquadramento e resolução

O guia do P-Video-Avatar observa que a proporção da tela segue a da imagem de entrada. Se você quer um short em 9:16, gere ou recorte primeiro um retrato em 9:16. A resolução depende do plano: a Kie.ai lista até 720p no Standard e até 1080p a 48 fps no Pro.

Tarefas rejeitadas

A APIframe lista como causas comuns de falha imagens de origem ruins, formatos de áudio não suportados e rejeições por política de conteúdo. Os três podem ser evitados antes de gastar um centavo, e é para isso que serve o checklist abaixo.

O checklist de entradas: rode antes de cada tarefa

A qualidade das entradas pesa mais no resultado do que a escolha do modelo. Copie esta lista e rode-a como etapa de validação no seu script:

  1. Ângulo do retrato. De frente ou levemente em três quartos, como recomenda a WaveSpeed. Sem perfil e sem rosto parcialmente fora do quadro.
  2. Iluminação do retrato. Rosto bem e uniformemente iluminado. Sombras duras sobre a boca dão menos o que mapear ao modelo.
  3. Proporção do retrato. Ajuste ao destino final (9:16 para shorts, 1:1 ou 16:9 nos demais casos), porque o enquadramento da saída segue a imagem.
  4. Arquivo de imagem. JPEG ou PNG abaixo de 10 MB na Kie.ai; PNG, JPEG ou WebP abaixo de 20 MB e abaixo de 10.000 px no lado maior na Pixverse. A fal aceita JPG, JPEG, PNG, WebP, GIF e AVIF.
  5. Formato de áudio. MP3, OGG, WAV, M4A ou AAC funcionam com segurança na fal e na Pixverse. A Kie.ai aceita MPEG, WAV, AAC, MP4 e OGG de até 100 MB.
  6. Limpeza do áudio. Um só falante, sem trilha musical, sem eco de ambiente. Adicione a música depois do render.
  7. Silêncio cortado. Corte o silêncio no início e no fim e as pausas longas. Cada segundo é cobrado.
  8. Duração. Mantenha cada segmento abaixo de 30 segundos, a menos que você tenha testado seu modelo além disso. Divida roteiros longos nos fins de frase e renderize os segmentos separadamente.
  9. Política. Nenhuma semelhança com uma pessoa real sem consentimento e nada que a política de conteúdo do fornecedor rejeitaria. Uma tarefa rejeitada desperdiça tempo de espera mesmo quando não custa nada.

Se você gera o retrato em vez de fotografá-lo, escolha o modelo de imagem pela textura da pele e pela consistência. Nossa comparação entre Nano Banana e FLUX.2 Pro cobre esse equilíbrio para fotos de produto e de pessoas.

Escolhendo um fornecedor: uma regra de decisão

Decida com três perguntas, nesta ordem:

  1. Qual é a duração do segmento final? Abaixo de 30 segundos, todas as opções estão abertas. Acima disso, divida, ou teste o modelo específico quanto à deriva antes de rodar um lote.
  2. Que resolução o destino exige? Posicionamentos de feed vistos no celular raramente precisam de 1080p. Se precisar, o menor preço de 1080p publicado na nossa pesquisa é o do P-Video-Avatar, US$ 0,045/s, e o maior é o da Pixverse, US$ 0,213333/s.
  3. Quanto tempo você pode esperar? A WaveSpeed indica um tempo típico de geração de cerca de 177 segundos para o Kling Avatar Standard. A inference.sh afirma que o P-Video-Avatar processa cerca de 1,83 segundo por segundo de saída, contra 26 s/s da HeyGen e 34 s/s da Veed Fabric. É uma alegação do fornecedor sobre o próprio produto, então meça você mesmo.

Um caminho razoável: prototipe no plano mais barato que atinja sua resolução, renderize cinco clipes com seu retrato e sua voz reais, compare-os lado a lado e só suba de plano se a saída mais barata falhar em um problema específico e nomeável (artefatos na boca, deriva, cabeça rígida).

API ou ferramenta por assinatura

Ferramentas de avatar por assento cobram por mês, não por segundo. Segundo o levantamento de 2026 da VEED: a HeyGen começa em US$ 29/mês com créditos e lip sync em mais de 40 idiomas, o D-ID Lite começa em US$ 5,90/mês com um plano de API a partir de US$ 18/mês que inclui 16 minutos de vídeo normal, a Synthesia começa em US$ 18/mês para 120 minutos por ano, e a Tavus usa preço enterprise sob medida com um gêmeo digital criado a partir de cerca de 2 minutos de filmagem. Se você usar os 16 minutos do D-ID, US$ 18 saem a cerca de US$ 1,13 por minuto. A contrapartida é que minutos não usados se perdem e o excedente tem regras próprias. APIs por segundo custam mais por unidade no topo da faixa e nada em um mês em que você não renderiza.

Chamando uma API de avatar por código

O fluxo de requisições é o mesmo em todos os fornecedores. A APIframe o descreve como um POST que devolve um ID de tarefa, depois polling ou um webhook, depois o download do vídeo. Na prática, para o Kling Avatar Standard na WaveSpeed:

  1. Enviar. POST para https://api.wavespeed.ai/api/v3/kwaivgi/kling-v2-ai-avatar-standard com um token Bearer, uma URL de imagem e uma URL de áudio. A resposta traz um ID de predição para consultar.
  2. Consultar. A documentação da WaveSpeed começa com polling a cada 2 segundos. Espace as consultas depois do primeiro minuto, já que tarefas típicas levam alguns minutos.
  3. Baixar. Na fal, o resultado é um JSON com um campo video.url apontando para um MP4 com áudio sincronizado. Copie o arquivo para o seu próprio armazenamento logo: URLs de fornecedores não são lugar para guardar arquivos.
  4. Registrar o custo. Multiplique os segundos de áudio pelo preço e guarde o resultado junto do arquivo. Você vai querer esse número quando voltar um lote de 200 clipes.

O Fabric é servido por REST via fal.ai com clientes em Python e JavaScript, então valem os mesmos quatro passos com outro nome de endpoint.

Etapas anteriores: retrato e voz

A chamada do avatar precisa de duas URLs, e em um pipeline automatizado as duas costumam ser geradas. Na Aitachyon, uma única chave de API (Authorization: Bearer ait_...) cobre os modelos de imagem e de voz, cada arquivo gerado recebe uma ref estável (img_ para imagens, vo_ para narrações) que você pode buscar com GET /api/generations/{ref}, e cada tarefa é detalhada com o modelo em que rodou e quanto custou. O guia rápido de API e MCP traz o formato das requisições. Para preço e ritmo da voz em detalhe, veja nosso detalhamento do custo da API da ElevenLabs.

Rodando a partir de um agente

Para desenvolvedores que já trabalham no Claude Code ou no Cursor, o ciclo mais rápido é deixar o agente cuidar dos ativos anteriores e da contabilidade enquanto um script pequeno cuida do fornecedor de avatar. Conectar o servidor MCP hospedado da Aitachyon ao Claude Code é um único comando:

claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."

Uma sessão de trabalho fica assim:

  1. Você dá um briefing ao agente: "Vinte ganchos de 10 segundos para a página de preços, mesmo apresentador, 9:16."
  2. O agente escreve vinte roteiros, reduz cada um a um bloco de voz de 450 caracteres e gera um retrato 9:16 e vinte faixas de voz pelo servidor MCP. Cada uma volta com uma ref e um custo.
  3. O agente roda seu script de avatar no fornecedor que você escolher, passando as URLs do retrato e do áudio, consultando o status e salvando os MP4.
  4. Ele escreve um manifesto: roteiro, ref da voz, ref do retrato, arquivo do avatar, segundos, custo por linha e o total do lote.

A configuração é explicada passo a passo em nosso guia para gerar vídeo no Claude Code com um servidor MCP. Duas salvaguardas importam quando um agente gasta dinheiro em loop: limitar o tamanho do lote no briefing e dar ao agente uma chave própria, para que o gasto dele fique isolado. Na Aitachyon, cada chave tem seu próprio gasto, um alerta quando ela gasta de forma incomumente rápida e uma revogação com um clique. Para limites de concorrência, novas tentativas e manuseio de arquivos em volume maior, nosso guia de geração de vídeo com IA em massa vai mais fundo.

O padrão híbrido: avatar curto, depois B-roll

A alavanca mais eficaz para custo e qualidade é manter a cabeça falante curta. Um gancho com avatar de 5 a 10 segundos, seguido de B-roll sob a mesma narração, fica bem dentro da zona de 30 segundos em que a deriva é menos provável e move a maior parte da duração para imagens mais baratas.

Exemplo calculado, 30 segundos no total no momento da redação:

  • Avatar completo, 30 s no Kling Avatar Standard a US$ 0,056/s: US$ 1,68. No Kling Pro a US$ 0,115/s: US$ 3,45.
  • Híbrido: 8 s de avatar no Kling Standard (US$ 0,45) mais 22 s de B-roll no Hailuo 02 a US$ 0,085/s (US$ 1,87). Total de cerca de US$ 2,32.

No plano de avatar mais barato, o híbrido custa mais que um avatar completo. Diante do plano Pro, custa menos, e nos dois casos o espectador vê o rosto só durante o gancho, onde ele ganha atenção, enquanto o produto ocupa a tela no resto do tempo. Um B-roll que ainda pareça filmagem real exige cuidado, e nosso guia de B-roll de IA que não parece falso mostra isso plano a plano.

Perguntas frequentes

Quanto custa por minuto uma API de vídeo com avatar de IA?

Pelos preços publicados no momento da redação: cerca de US$ 1,50 por minuto no P-Video-Avatar em 720p, US$ 3,36 no Kling Avatar Standard pela WaveSpeed, US$ 6,90 no Kling Avatar Pro pela fal, US$ 9,00 no VEED Fabric em 720p e US$ 12,80 na Pixverse em 1080p. Some os custos de voz e de retrato, pequenos em comparação.

Qual é a duração máxima de um vídeo com avatar de IA?

O Kling Avatar e o VEED Fabric aceitam até 5 minutos por tarefa. A qualidade é o limite mais apertado: alguns modelos derivam ou se deformam depois de 30 segundos, e o guia do P-Video-Avatar recomenda ficar abaixo de três minutos. Divida roteiros longos em segmentos e renderize cada um separadamente.

Posso criar um avatar falante a partir de uma única foto?

Sim. Um único retrato de frente ou levemente em três quartos mais um arquivo de áudio é tudo de que essas APIs precisam. Ilustrações, mascotes, animais e personagens estilizados também funcionam no Kling Avatar v2 e no VEED Fabric.

Preciso gravar minha própria voz?

Não. Todo fornecedor deste guia aceita uma faixa de TTS, e o P-Video-Avatar e a Pixverse podem receber um roteiro em texto diretamente. Áudio limpo e sem silêncios dá o melhor lip sync, seja qual for a origem.

Uma API de avatar é mais barata que HeyGen ou Synthesia?

Depende do volume. Planos por assento cobram todo mês, você renderizando ou não. APIs por segundo cobram só o que você produz, então ganham em volume irregular ou em rajadas e em tudo que seja automatizado por código.

Fontes

  1. WaveSpeedAI: Kling V2 AI Avatar Standard API
  2. fal.ai: Kling AI Avatar v2 Pro
  3. Kie.ai: Kling AI Avatar 2.0 API
  4. Replicate: Kling Avatar V2
  5. VEED: Best Avatar APIs (2026), Build Talking Videos at Scale
  6. APIframe: AI Avatar API Guide
  7. inference.sh: P-Video-Avatar, the Fastest AI Talking Head Generator
  8. Empirio Labs: Pixverse Avatar API

A Aitachyon cobre as entradas em torno da chamada do avatar: retratos no Nano Banana ou FLUX.2 [pro], voz na ElevenLabs e B-roll no Seedance, Kling, Veo, Wan ou Hailuo, tudo a partir de um único saldo pré-pago que nunca expira, cobrado por chamada, com reembolso automático de renders que falham e cada arquivo detalhado com seu custo. Você pode operar pelo estúdio web, pela API HTTP ou pelo servidor MCP no Claude Code, e a tabela de preços completa é pública em /api/pricing.

Artigos relacionados

Ferramentas grátis para experimentar

Pare de descrever a sua marca. Cole o seu URL.

A Aitachyon lê toda a sua marca a partir do seu site e cria vídeos, imagens, carrosséis, publicações e banners, fiéis à marca, em cada formato e cada feed.