Skip to content
Guias30 de setembro de 2026· 10 min de leitura

Preços das APIs de geração de vídeo com IA em 2026, modelo a modelo

Como as APIs de vídeo com IA cobram (por segundo, clipe, créditos), o que move o preço, tarifas por modelo e orçamentos de lote com as repetições.

video apipricingveoklingseedance
Guias

Preços das APIs de geração de vídeo com IA em 2026, modelo a modelo

Dez segundos de vídeo com IA podem custar setenta e cinco cêntimos ou quatro dólares, e a maior parte dessa diferença vem do nome do modelo na fatura. A análise da HackerNoon de julho de 2026 coloca um clipe de 10 segundos no Kling 3.0 em cerca de 0,75 $ e a mesma duração no Veo 3.1 Standard em cerca de 4,00 $. Em todo o mercado, o levantamento da invideo de agosto de 2026 sobre tarifas oficiais encontrou preços por segundo entre 0,02 $ e 0,70 $, uma amplitude de cerca de 35 vezes.

Se você está ligando a geração de vídeo a um produto, a um pipeline de cliente ou a um agente, o preço de tabela por segundo é apenas o primeiro dado. A unidade de cobrança, o nível de resolução, se o áudio vem incluído e quantas tentativas você gasta por plano aproveitável definem o que você paga de fato. Este guia percorre cada um desses fatores e depois traz uma lista de tarifas por modelo e três orçamentos de lote calculados que você pode adaptar.

As três formas como as APIs de vídeo cobram

Quase todos os fornecedores usam uma de três unidades. Saber qual é a sua indica como fazer a previsão e onde ficam as surpresas.

Por segundo de saída

É o modelo dominante. Você paga uma tarifa multiplicada pela duração do clipe pedido. A página de preços da Gemini API do Google lista o Veo 3.1 assim, e a Replicate cobra seus modelos Wan 2.1 de imagem para vídeo por segundo de vídeo gerado (0,09 $/s em 480p, 0,25 $/s em 720p). A previsão é simples: segundos vezes tarifa. O problema é que cada mudança de nível (resolução, áudio, uma variante «Pro») é outra tarifa, então o mesmo roteiro pode custar bem diferente conforme um único parâmetro.

Por clipe ou por unidade

Alguns modelos cobram um preço fixo por vídeo gerado, seja qual for a duração. A fal.ai observa que os modelos de vídeo são cobrados por unidade de saída, por segundo ou por vídeo conforme o modelo, e lista o Ovi a 0,2 $ por vídeo. O preço por clipe favorece clipes longos e penaliza cortes curtos. A Replicate cobra a maioria dos outros modelos pelo tempo de execução no hardware subjacente, mais difícil de prever antes de rodar uma amostra.

Créditos

Créditos são uma camada de moeda sobre uma das unidades acima. A tabela de preços da API da Runway é a versão mais limpa: um crédito custa 0,01 $, e cada modelo consome um número fixo de créditos por segundo (o gen4.5 usa 12 créditos/s, ou seja, 0,12 $/s). Se você está pesando uma assinatura contra a cobrança por uso, a comparação entre créditos e pagamento por chamada mostra quando cada uma sai mais barata.

Uma regra prática: converta sempre para dólares por segundo de saída aproveitável antes de comparar qualquer coisa. Um preço em créditos, um preço por vídeo e um preço por tempo de execução só são comparáveis depois disso.

O que realmente move o preço

O guia de preços 2026 da Coverr agrupa os fatores em resolução e áudio, escolha do modelo, estrutura de cobrança e custos de infraestrutura. As fontes primárias mostram o tamanho de cada alavanca.

Nível do modelo

Dentro de uma mesma família, o nível é a maior alavanca. Na Gemini API, o Veo 3.1 Standard custa 0,40 $/s em 720p e 1080p, o Veo 3.1 Fast custa 0,10 $/s em 720p e o Veo 3.1 Lite custa 0,05 $/s em 720p. São 8 vezes de diferença sob o mesmo nome de modelo. A Runway mostra o mesmo padrão com o gen4.5 a 12 créditos/s contra o gen4_turbo a 5 créditos/s.

Resolução

Os degraus de resolução raramente são lineares. O Veo 3.1 Fast na Gemini API vai de 0,10 $/s em 720p para 0,12 $/s em 1080p e depois 0,30 $/s em 4K. O wan3 da Runway vai de 5 para 10 e 20 créditos/s em 480p, 720p e 1080p, dobrando a cada degrau. Para a maior parte do trabalho de redes sociais e de produto, a pergunta útil é se os pixels extras sobrevivem à compressão da plataforma.

Áudio

O áudio nativo às vezes vem incluído e às vezes é cobrado como um nível separado. O Google afirma que o preço do Veo inclui vídeo com áudio por padrão. A Runway lista suas entradas do Veo 3.1 com áudio (40 créditos/s para o veo3.1, 15 créditos/s para o veo3.1_fast). Em outros lugares, as versões silenciosa e com áudio têm tarifas diferentes, então confira qual você está chamando. Se de qualquer forma você vai colocar narração e música sobre o clipe, pagar por áudio gerado é dinheiro jogado fora na edição.

Adicionais e referências

A Runway observa que alguns modelos acrescentam cobranças por referência além da tarifa por segundo. Imagens de referência, referências de personagem e extensões podem ter cada uma o seu próprio item. Leia a página do modelo, não apenas a tarifa de destaque.

Renders com falha

O Google afirma que você só é cobrado se o vídeo for gerado com sucesso. Nem todo fornecedor documenta isso, e em um lote de centenas de tarefas a diferença entre «falhas são gratuitas» e «falhas são cobradas» aparece com clareza na fatura.

Tarifas de mercado no momento da redação

Os preços mudam com frequência, então trate cada número abaixo como datado na sua fonte. As páginas primárias estão identificadas como tal. Onde um valor só existe em fonte secundária, ele é rotulado assim.

Tarifas dos fabricantes e plataformas (fontes primárias)

  • Veo 3.1 na Gemini API: Standard 0,40 $/s (720p e 1080p), 0,60 $/s em 4K. Fast 0,10 $/s em 720p, 0,12 $/s em 1080p, 0,30 $/s em 4K. Lite 0,05 $/s em 720p, 0,08 $/s em 1080p, sem 4K. Fonte: Google AI for Developers.
  • API da Runway: gen4.5 0,12 $/s, gen4_turbo 0,05 $/s, seedance2 0,36 $/s em 480p/720p e 0,40 $/s em 1080p, seedance2_fast 0,29 $/s, seedance2_mini 0,16 $/s, veo3.1_fast com áudio 0,15 $/s, veo3.1 com áudio 0,40 $/s. Fonte: Runway.
  • fal.ai: Wan 2.5 0,05 $/s, Kling 2.5 Turbo Pro 0,07 $/s, Veo 3 0,40 $/s, Ovi 0,2 $ por vídeo. Fonte: fal.ai.
  • Replicate: wan-2.1-i2v-480p 0,09 $/s, wan-2.1-i2v-720p 0,25 $/s de saída. Fonte: Replicate.

Tarifas reportadas por fontes secundárias (confirme antes de orçar)

  • API do Sora 2: reportada a 0,10 $/s no nível base e até 0,70 $/s para o Sora 2 Pro pela invideo e pela HackerNoon. Os preços próprios da OpenAI não foram confirmados para este artigo, então trate os valores como indicativos.
  • Kling 3.0: cerca de 0,075 $/s segundo a HackerNoon. A invideo indica o Kling 3.0 Turbo a cerca de 0,11 $/s, apenas em 720p.
  • Seedance 2.x direto: cobrado por milhão de tokens, o que a invideo aproxima em cerca de 0,14 $/s.
  • Grok Video: 0,05 $/s para a 1.0 e 0,08 $/s para a 1.5, segundo a invideo.
  • Acesso à Runway: a Coverr informa que o acesso à API da Runway exige um plano Max de 76 $ ou mais por mês. É uma afirmação de segunda mão; confira os termos atuais da Runway.

Duas ressalvas. Os números de versão diferem entre hosts (a fal lista Wan 2.5 e Kling 2.5 Turbo Pro, a Replicate lista Wan 2.1), e versões mais novas têm preços diferentes. Além disso, o mesmo modelo pode custar valores diferentes em hosts diferentes. O Veo 3.1 Fast com áudio custa 0,10 $/s em 720p na Gemini API e 15 créditos/s (0,15 $/s) na Runway.

A tabela de um agregador: uma chave, vários modelos

Para comparação, esta é a grade por chamada da Aitachyon no momento da redação. Cada item leva à página de preços do próprio modelo, e a grade completa, legível por máquina, está publicada em /api/pricing, para que um script a leia em vez de uma pessoa copiar números.

Vídeo

  • Seedance 2.5 (ByteDance): a partir de 0,20 $/s em 480p, 0,44 $/s em 720p.
  • Kling v3 (Kuaishou): 0,16 $/s sem áudio, 0,32 $/s com áudio nativo.
  • Veo 3.1 Fast (Google): a partir de 0,19 $/s.
  • Wan 2.7 (Alibaba): 0,19 $/s.
  • Hailuo 02 (MiniMax): 0,085 $/s.

Imagens e voz (para as imagens estáticas e a narração que acompanham o vídeo)

Lido junto das fontes primárias, o trade-off é claro. Chamar o Veo 3.1 Fast diretamente na Gemini API sai mais barato por segundo do que chamá-lo por um agregador. O que um agregador vende é todo o resto: uma chave e um saldo únicos entre fornecedores, uma linha de fatura por tarefa e a possibilidade de encaminhar cada plano a um modelo diferente sem abrir cinco contas. A comparação da Coverr para 100 clipes de oito segundos por mês coloca o Veo 3.1 direto em cerca de 160 $ a 320 $ e agregadores como fal.ai e Replicate entre 40 $ e 200 $, e a maior parte dessa diferença vem de direcionar volume para modelos mais baratos. Para ver mais a fundo dois desses modelos, veja Kling v3 contra Seedance 2.5 e a análise da API do Veo 3.1 Fast.

Custo por clipe aproveitável: a fórmula que importa

O número de uma página de preços é o custo de uma tentativa. O número que você deve orçar é o custo de um clipe que você mantém. A HackerNoon relata que o trabalho profissional costuma exigir de três a cinco passadas por plano principal, e recomenda limitar as regenerações a três tentativas antes de repensar a abordagem. Isso coloca o custo real de um plano principal em três a cinco vezes o preço de tabela.

Use esta fórmula em todo orçamento:

  1. Custo da tentativa = tarifa por segundo x segundos pedidos (ou o preço fixo por clipe).
  2. Adicionais = cobranças de referência, áudio ou upscale daquela chamada, se houver.
  3. Tentativas por clipe mantido = sua média medida. Comece com 3 para planos principais, seguindo a HackerNoon, e troque pelo seu número depois do primeiro lote.
  4. Custo de renders com falha = zero se o fornecedor reembolsa ou não cobra falhas; caso contrário, some a taxa de falha.
  5. Custo por clipe aproveitável = (custo da tentativa + adicionais) x tentativas por clipe mantido + custo de renders com falha.

Um exemplo calculado: um clipe de 10 segundos do Kling v3 sem áudio a 0,16 $/s custa 1,60 $ por tentativa. Com três tentativas, o clipe mantido custa 4,80 $. Com cinco, custa 8,00 $. O mesmo plano no Hailuo 02 a 0,085 $/s custa 0,85 $ por tentativa e 2,55 $ com três tentativas. Quando o número de tentativas domina, um modelo mais barato no qual se itera rápido muitas vezes vence um mais caro que precisa ser refeito menos vezes, e a única forma de saber é registrar as tentativas por clipe mantido em cada modelo.

Para reduzir o custo da tentativa, teste os prompts na menor duração que o modelo permitir, fixe a composição e renderize a duração completa uma única vez.

Três orçamentos de lote calculados

Eles usam as tarifas da Aitachyon listadas acima, no momento da redação. As premissas de repetição estão explícitas para você trocar pelas suas.

Lote 1: 20 ganchos de vídeo para um teste criativo

Vinte planos de abertura de 5 segundos, cada um testado como primeiro momento de um vídeo pago para redes sociais. Ganchos são curtos e de baixo risco, então assuma 2 tentativas por clipe mantido.

  • Hailuo 02: 20 x 5 s x 0,085 $ = 8,50 $ por passada, 17,00 $ com 2 tentativas.
  • Kling v3 sem áudio: 20 x 5 s x 0,16 $ = 16,00 $ por passada, 32,00 $ com 2 tentativas.
  • Seedance 2.5 em 720p: 20 x 5 s x 0,44 $ = 44,00 $ por passada, 88,00 $ com 2 tentativas.

A escolha do modelo muda o custo do lote em cerca de 5 vezes para o mesmo briefing. Num teste de ganchos, em que o objetivo é descobrir qual abertura ganha atenção, o modelo barato costuma ser a escolha certa. As ideias de gancho pesam mais, e estes modelos de ganchos dão a você vinte prompts para começar.

Lote 2: 50 imagens de produto

Cinquenta imagens estáticas para renovar um catálogo ou para criativos estáticos, uma tentativa cada mais 50% de margem de refação (75 gerações no total).

  • Seedream 4.0: 75 x 0,057 $ = 4,28 $.
  • FLUX.2 [pro]: 75 x 0,057 $ a 0,086 $ = 4,28 $ a 6,45 $.
  • Nano Banana: 75 x 0,13 $ = 9,75 $.
  • gpt-image-2: 75 x 0,10 $ a 0,40 $ = 7,50 $ a 30,00 $.

Imagens estáticas custam uma ordem de grandeza a menos que vídeo. Se algumas dessas 50 forem animadas depois, anime só as vencedoras. Cinco imagens escolhidas e transformadas em clipes de 5 segundos do Kling v3 sem áudio, com três tentativas cada, somam 5 x 5 x 0,16 $ x 3 = 12,00 $.

Lote 3: uma semana de shorts

Sete shorts, cada um montado com quatro clipes de 5 segundos (20 segundos de vídeo), um roteiro de narração de até 900 caracteres e uma imagem de capa. Assuma 2 tentativas por clipe.

  • Vídeo no Kling v3 sem áudio: 7 x 20 s x 0,16 $ x 2 = 44,80 $.
  • Narração: 900 caracteres são duas unidades de 450, ou seja, de 0,086 $ a 0,172 $ por short, de 0,60 $ a 1,20 $ na semana.
  • Capas no Seedream 4.0: 7 x 0,057 $ = 0,40 $.
  • Total da semana: cerca de 45,80 $ a 46,40 $.

Troque o Kling sem áudio pelo Kling com áudio nativo (0,32 $/s) e a linha de vídeo dobra para 89,60 $, e é por isso que combinar vídeo sem áudio com uma narração separada costuma ser a pilha mais barata quando a narração carrega a mensagem. O detalhamento do custo da narração da ElevenLabs aprofunda os preços de narração.

Regras de roteamento: qual modelo para qual plano

Com preço por chamada, escolher um modelo é uma decisão plano a plano, e não uma assinatura com a qual você se compromete. Estas regras usam apenas as diferenças de preço e de especificações documentadas acima.

  1. Exploração e testes de ganchos: use o modelo mais barato que produza uma composição aceitável. O Hailuo 02 a 0,085 $/s é o extremo baixo desta grade.
  2. Conteúdo narrado: use vídeo sem áudio e acrescente uma narração separada. O Kling v3 sem áudio a 0,16 $/s mais ElevenLabs custa menos que o Kling com áudio a 0,32 $/s pelos mesmos segundos.
  3. Planos que exigem som nativo sincronizado (diálogo, ruído ambiente): pague o nível de áudio e orce-o no dobro da tarifa sem áudio quando o modelo tiver uma.
  4. Resolução: comece no nível mais baixo que sobreviva à compressão do seu destino. O Seedance 2.5 custa 0,20 $/s em 480p e 0,44 $/s em 720p; suba só para um clipe que você vá manter.
  5. Planos principais: gaste no modelo premium só depois de fixar o prompt em um barato, e limite as tentativas a três, como recomenda a HackerNoon.
  6. Primeiro as imagens estáticas: se uma imagem resolve, ela custa centavos. Quando uma imagem estática vence um vídeo mostra onde isso vale.

Automatizar a geração sem perder o controle do gasto

Os orçamentos de lote continuam honestos quando a geração roda a partir de código, porque o código registra cada chamada, enquanto uma interface web convida a refações que ninguém conta. Desenvolvedores e equipes pequenas que produzem em volume acionam a geração por um script, ou por um agente como Claude Code ou Cursor por meio de um servidor MCP: entra um prompt ou um arquivo de tarefas, saem arquivos com o custo de cada chamada.

Uma checklist prévia para qualquer lote automatizado

  • Fixe o modelo e o nível explicitamente na chamada. Nunca confie em uma resolução ou configuração de áudio padrão.
  • Leia a grade de preços por programa antes da execução e calcule o teto do lote: tarefas x segundos x tarifa x tentativas esperadas.
  • Defina no código um limite rígido de tentativas por plano (três é um padrão sensato para planos principais).
  • Use uma chave de API dedicada por projeto ou por cliente, para que o gasto seja separável.
  • Confirme como os renders com falha são cobrados antes de rodar centenas de tarefas.
  • Guarde uma referência estável de cada saída e o custo da chamada que a produziu, para calcular depois o custo por clipe mantido.
  • Revise as tentativas por clipe mantido em cada modelo após cada lote e atualize suas regras de roteamento.

Agentes tornam tudo isso mais rápido e também mais arriscado: um agente refaz um plano dez vezes sem reclamar se nada o impedir. Alertas de gasto por chave e uma chave revogável são as proteções. Para uma configuração de agente que funciona, veja gerar vídeo a partir do Claude Code com um servidor MCP, e para o início rápido de API e MCP, veja a documentação para desenvolvedores.

FAQ

Quanto custa por segundo uma API de geração de vídeo com IA?

As tarifas oficiais no momento da redação vão de cerca de 0,02 $ a 0,70 $ por segundo, segundo o levantamento da invideo de agosto de 2026. Na própria API do Google, o Veo 3.1 vai de 0,05 $/s (Lite, 720p) a 0,60 $/s (Standard, 4K).

É mais barato usar uma API de vídeo diretamente ou por um agregador?

Para um único modelo em volume, ir direto pode sair mais barato por segundo, como o Veo 3.1 Fast na Gemini API. Os agregadores vencem quando você encaminha planos diferentes a modelos diferentes, já que modelos mais baratos em um saldo compartilhado puxam a média para baixo. O exemplo da Coverr, com 100 clipes de oito segundos por mês, coloca o Veo 3.1 direto em 160 $ a 320 $ contra 40 $ a 200 $ nos agregadores.

Paga-se por gerações de vídeo com IA que falham?

Depende do fornecedor. O Google afirma que o Veo só é cobrado quando o vídeo é gerado com sucesso. Confira os termos de cada fornecedor, porque em lotes grandes a cobrança de tarefas com falha se acumula.

Quantas tentativas devo orçar por clipe de vídeo com IA?

A HackerNoon relata de três a cinco passadas por plano principal no trabalho profissional, e sugere limitar a três antes de mudar de abordagem. Para clipes de baixo risco, como testes de ganchos, meça a sua própria taxa depois do primeiro lote e oriente o orçamento por ela.

Fontes

  1. Google AI for Developers: Gemini Developer API pricing
  2. Runway: API pricing
  3. fal.ai: Pricing
  4. Replicate: Pricing
  5. invideo: AI Video Model Pricing (Aug 2026), Official Per-Second Rates, Normalized
  6. HackerNoon: The same 10 seconds of AI video can cost $0.75 or $4
  7. Coverr: AI video generation API pricing 2026

Se você quer rodar os lotes acima sem abrir uma conta em cada fornecedor, a Aitachyon reúne esses modelos de vídeo, imagem e voz atrás de um único saldo pré-pago que nunca expira, acessível pelo estúdio web, por uma API HTTP simples ou por um servidor MCP hospedado. Cada tarefa é detalhada com seu modelo e seu custo, renders com falha são reembolsados automaticamente, e cada chave tem seu próprio alerta de gasto e revogação com um clique. Os preços estão na página de cada modelo.

Artigos relacionados

Ferramentas grátis para experimentar

Pare de descrever a sua marca. Cole o seu URL.

A Aitachyon lê toda a sua marca a partir do seu site e cria vídeos, imagens, carrosséis, publicações e banners, fiéis à marca, em cada formato e cada feed.