Skip to content
Guide30 settembre 2026· 10 min di lettura

Prezzi delle API di generazione video con IA nel 2026, modello per modello

Come fatturano le API video con IA (al secondo, al clip, a crediti), cosa muove il prezzo, tariffe per modello e budget di batch calcolati con i tentativi.

video apipricingveoklingseedance
Guide

Prezzi delle API di generazione video con IA nel 2026, modello per modello

Dieci secondi di video con IA possono costare settantacinque centesimi o quattro dollari, e gran parte di questa differenza dipende dal nome del modello in fattura. L'analisi di HackerNoon di luglio 2026 stima un clip di 10 secondi con Kling 3.0 a circa 0,75 $ e la stessa durata con Veo 3.1 Standard a circa 4,00 $. Sull'intero mercato, l'indagine di invideo di agosto 2026 sulle tariffe ufficiali ha trovato prezzi al secondo da 0,02 $ a 0,70 $, una forbice di circa 35 volte.

Se stai integrando la generazione video in un prodotto, in una pipeline per clienti o in un agente, il prezzo di listino al secondo è solo il primo dato. L'unità di fatturazione, il livello di risoluzione, la presenza dell'audio nel prezzo e quanti tentativi bruci per ogni inquadratura utilizzabile decidono quanto paghi davvero. Questa guida esamina ciascuno di questi fattori, poi propone un elenco di tariffe per modello e tre budget di batch calcolati che puoi adattare.

I tre modi in cui le API video ti fatturano

Quasi tutti i fornitori usano una di tre unità. Sapere quale ti riguarda indica come fare previsioni e dove si nascondono le sorprese.

Al secondo di output

È il modello dominante. Paghi una tariffa moltiplicata per la durata del clip richiesto. La pagina dei prezzi della Gemini API di Google elenca Veo 3.1 in questo modo, e Replicate fattura i suoi modelli Wan 2.1 da immagine a video per secondo di video prodotto (0,09 $/s a 480p, 0,25 $/s a 720p). La previsione è semplice: secondi per tariffa. Il problema è che ogni cambio di livello (risoluzione, audio, una variante «Pro») è una tariffa diversa, quindi lo stesso script può costare molto diversamente a seconda di un solo parametro.

Al clip o all'unità

Alcuni modelli applicano un prezzo fisso per video generato, indipendentemente dalla durata. fal.ai precisa che i modelli video sono fatturati per unità di output, al secondo o al video a seconda del modello, ed elenca Ovi a 0,2 $ per video. Il prezzo al clip favorisce i clip lunghi e penalizza i tagli brevi. Replicate fattura la maggior parte degli altri modelli in base al tempo di esecuzione sull'hardware sottostante, più difficile da prevedere prima di aver provato un campione.

Crediti

I crediti sono uno strato di valuta sopra una delle unità precedenti. Le tariffe API di Runway sono la versione più pulita: un credito costa 0,01 $ e ogni modello consuma un numero fisso di crediti al secondo (gen4.5 usa 12 crediti/s, cioè 0,12 $/s). Se stai valutando un abbonamento contro la fatturazione a consumo, il confronto tra crediti e pagamento a chiamata spiega quando conviene l'uno o l'altro.

Una regola pratica: converti sempre in dollari al secondo di output utilizzabile prima di confrontare qualsiasi cosa. Un prezzo in crediti, un prezzo per video e un prezzo a tempo di esecuzione non sono confrontabili finché non lo fai.

Cosa muove davvero il prezzo

La guida ai prezzi 2026 di Coverr raggruppa i fattori in risoluzione e audio, scelta del modello, struttura di fatturazione e costi di infrastruttura. Le fonti primarie mostrano quanto pesa ciascuna leva.

Livello del modello

All'interno di una stessa famiglia, il livello è la leva più grande. Sulla Gemini API, Veo 3.1 Standard costa 0,40 $/s a 720p e 1080p, Veo 3.1 Fast costa 0,10 $/s a 720p e Veo 3.1 Lite costa 0,05 $/s a 720p. Sono 8 volte di differenza sotto lo stesso nome di modello. Runway mostra lo stesso schema con gen4.5 a 12 crediti/s contro gen4_turbo a 5 crediti/s.

Risoluzione

I passaggi di risoluzione raramente sono lineari. Veo 3.1 Fast sulla Gemini API passa da 0,10 $/s a 720p a 0,12 $/s a 1080p, poi a 0,30 $/s a 4K. Il wan3 di Runway sale a 5, 10 e 20 crediti/s tra 480p, 720p e 1080p, raddoppiando a ogni gradino. Per la maggior parte del lavoro social e di prodotto, la domanda utile è se i pixel in più sopravvivono alla compressione della piattaforma.

Audio

L'audio nativo a volte è incluso e a volte è fatturato come livello a parte. Google dichiara che il prezzo di Veo include per impostazione predefinita il video con audio. Runway elenca le sue voci Veo 3.1 con audio (40 crediti/s per veo3.1, 15 crediti/s per veo3.1_fast). Altrove le versioni mute e con audio hanno tariffe diverse, quindi controlla quale stai chiamando. Se comunque hai in programma di sovrapporre voce fuori campo e musica al clip, pagare l'audio generato significa buttare via denaro al montaggio.

Extra e riferimenti

Runway segnala che alcuni modelli aggiungono costi per riferimento oltre alla tariffa al secondo. Immagini di riferimento, riferimenti di personaggio ed estensioni possono avere ciascuno una voce propria. Leggi la pagina del modello, non solo la tariffa in evidenza.

Render falliti

Google afferma che si paga solo se il video viene generato con successo. Non tutti i fornitori lo documentano, e su un batch di centinaia di lavori la differenza tra «i fallimenti sono gratuiti» e «i fallimenti sono fatturati» si vede chiaramente in fattura.

Tariffe di mercato al momento della stesura

I prezzi cambiano spesso, quindi considera ogni cifra qui sotto datata alla sua fonte. Le pagine primarie sono indicate come tali. Dove una cifra esiste solo in una fonte secondaria, è etichettata così.

Tariffe di produttori e piattaforme (fonti primarie)

  • Veo 3.1 sulla Gemini API: Standard 0,40 $/s (720p e 1080p), 0,60 $/s a 4K. Fast 0,10 $/s a 720p, 0,12 $/s a 1080p, 0,30 $/s a 4K. Lite 0,05 $/s a 720p, 0,08 $/s a 1080p, senza 4K. Fonte: Google AI for Developers.
  • API Runway: gen4.5 0,12 $/s, gen4_turbo 0,05 $/s, seedance2 0,36 $/s a 480p/720p e 0,40 $/s a 1080p, seedance2_fast 0,29 $/s, seedance2_mini 0,16 $/s, veo3.1_fast con audio 0,15 $/s, veo3.1 con audio 0,40 $/s. Fonte: Runway.
  • fal.ai: Wan 2.5 0,05 $/s, Kling 2.5 Turbo Pro 0,07 $/s, Veo 3 0,40 $/s, Ovi 0,2 $ per video. Fonte: fal.ai.
  • Replicate: wan-2.1-i2v-480p 0,09 $/s, wan-2.1-i2v-720p 0,25 $/s di output. Fonte: Replicate.

Tariffe riportate da fonti secondarie (da verificare prima di fare il budget)

  • API Sora 2: riportata a 0,10 $/s al livello base e fino a 0,70 $/s per Sora 2 Pro da invideo e HackerNoon. I prezzi ufficiali di OpenAI non sono stati confermati per questo articolo, quindi considerali indicativi.
  • Kling 3.0: circa 0,075 $/s secondo HackerNoon. invideo indica Kling 3.0 Turbo a circa 0,11 $/s, solo a 720p.
  • Seedance 2.x diretto: fatturato per milione di token, che invideo approssima a circa 0,14 $/s.
  • Grok Video: 0,05 $/s per la 1.0 e 0,08 $/s per la 1.5, secondo invideo.
  • Accesso a Runway: Coverr riferisce che l'accesso alle API di Runway richiede un piano Max da 76 $ o più al mese. È un'affermazione di seconda mano; controlla le condizioni attuali di Runway.

Due avvertenze. I numeri di versione differiscono tra gli host (fal elenca Wan 2.5 e Kling 2.5 Turbo Pro, Replicate elenca Wan 2.1) e le versioni più recenti hanno prezzi diversi. Inoltre lo stesso modello può costare cifre diverse su host diversi. Veo 3.1 Fast con audio costa 0,10 $/s a 720p sulla Gemini API e 15 crediti/s (0,15 $/s) su Runway.

Il listino di un aggregatore: una chiave, molti modelli

Per confronto, ecco la griglia per chiamata di Aitachyon al momento della stesura. Ogni voce rimanda alla pagina dei prezzi del relativo modello, e la griglia completa leggibile da macchina è pubblicata su /api/pricing, così uno script può leggerla invece di far ricopiare le cifre a una persona.

Video

Immagini e voce (per le immagini fisse e la narrazione che accompagnano il video)

Letto accanto alle fonti primarie, il compromesso è chiaro. Chiamare Veo 3.1 Fast direttamente sulla Gemini API costa meno al secondo che passare da un aggregatore. Quello che vende un aggregatore è tutto il resto: una chiave e un saldo unici tra i vari fornitori, una riga di fattura per lavoro e la possibilità di indirizzare ogni inquadratura a un modello diverso senza aprire cinque account. Il confronto di Coverr su 100 clip da otto secondi al mese colloca Veo 3.1 diretto attorno a 160 $ a 320 $ e gli aggregatori come fal.ai e Replicate tra 40 $ e 200 $, e gran parte del divario deriva dallo spostare volume su modelli più economici. Per approfondire due di questi modelli, vedi Kling v3 contro Seedance 2.5 e l'analisi dell'API di Veo 3.1 Fast.

Costo per clip utilizzabile: la formula che conta

Il numero su una pagina dei prezzi è il costo di un tentativo. Il numero da mettere a budget è il costo di un clip che tieni. HackerNoon riferisce che il lavoro professionale richiede di solito da tre a cinque passaggi per ogni inquadratura chiave, e raccomanda di limitare le rigenerazioni a tre tentativi prima di ripensare l'approccio. Ne risulta un costo reale per inquadratura chiave pari da tre a cinque volte il prezzo di listino.

Usa questa formula per ogni budget:

  1. Costo del tentativo = tariffa al secondo x secondi richiesti (o il prezzo fisso per clip).
  2. Extra = costi di riferimento, audio o upscaling per quella chiamata, se presenti.
  3. Tentativi per clip tenuto = la tua media misurata. Parti da 3 per le inquadrature chiave, seguendo HackerNoon, e sostituiscilo con il tuo numero dopo il primo batch.
  4. Costo dei render falliti = zero se il fornitore rimborsa o non fattura i fallimenti, altrimenti aggiungi il tasso di fallimento.
  5. Costo per clip utilizzabile = (costo del tentativo + extra) x tentativi per clip tenuto + costo dei render falliti.

Un esempio calcolato: un clip muto di 10 secondi con Kling v3 a 0,16 $/s costa 1,60 $ a tentativo. Con tre tentativi il clip tenuto costa 4,80 $. Con cinque, 8,00 $. La stessa inquadratura con Hailuo 02 a 0,085 $/s costa 0,85 $ a tentativo e 2,55 $ con tre tentativi. Quando pesa soprattutto il numero di tentativi, un modello più economico su cui si itera in fretta spesso batte uno più caro da rilanciare meno volte, e l'unico modo per saperlo è registrare i tentativi per clip tenuto, modello per modello.

Per ridurre il costo del tentativo, prova i prompt alla durata minima consentita dal modello, blocca la composizione e poi renderizza la durata piena una sola volta.

Tre budget di batch calcolati

Usano le tariffe Aitachyon elencate sopra, al momento della stesura. Le ipotesi sui tentativi sono dichiarate così puoi sostituirle con le tue.

Batch 1: 20 hook video per un test creativo

Venti inquadrature di apertura da 5 secondi, ciascuna provata come primo beat di un video social a pagamento. Gli hook sono brevi e a basso rischio, quindi ipotizza 2 tentativi per clip tenuto.

  • Hailuo 02: 20 x 5 s x 0,085 $ = 8,50 $ a passaggio, 17,00 $ con 2 tentativi.
  • Kling v3 muto: 20 x 5 s x 0,16 $ = 16,00 $ a passaggio, 32,00 $ con 2 tentativi.
  • Seedance 2.5 a 720p: 20 x 5 s x 0,44 $ = 44,00 $ a passaggio, 88,00 $ con 2 tentativi.

La scelta del modello cambia il costo del batch di circa 5 volte a parità di brief. Per un test di hook, dove lo scopo è capire quale apertura conquista attenzione, il modello economico è di solito la scelta giusta. Le idee di hook contano di più, e questi modelli di hook ti danno venti prompt da cui partire.

Batch 2: 50 immagini prodotto

Cinquanta immagini fisse per un aggiornamento di catalogo o per creatività statiche, un tentativo ciascuna più il 50% di margine per i rifacimenti (75 generazioni in totale).

  • Seedream 4.0: 75 x 0,057 $ = 4,28 $.
  • FLUX.2 [pro]: 75 x 0,057 $ a 0,086 $ = 4,28 $ a 6,45 $.
  • Nano Banana: 75 x 0,13 $ = 9,75 $.
  • gpt-image-2: 75 x 0,10 $ a 0,40 $ = 7,50 $ a 30,00 $.

Le immagini fisse costano un ordine di grandezza in meno del video. Se poi alcune di queste 50 vengono animate, anima solo le vincenti. Cinque immagini selezionate e trasformate in clip muti da 5 secondi con Kling v3, con tre tentativi ciascuna, aggiungono 5 x 5 x 0,16 $ x 3 = 12,00 $.

Batch 3: una settimana di short

Sette short, ciascuno composto da quattro clip da 5 secondi (20 secondi di video), un copione di voce fuori campo fino a 900 caratteri e un'immagine di copertina. Ipotizza 2 tentativi per clip.

  • Video con Kling v3 muto: 7 x 20 s x 0,16 $ x 2 = 44,80 $.
  • Voce fuori campo: 900 caratteri sono due unità da 450, quindi da 0,086 $ a 0,172 $ per short, da 0,60 $ a 1,20 $ per la settimana.
  • Copertine con Seedream 4.0: 7 x 0,057 $ = 0,40 $.
  • Totale della settimana: circa 45,80 $ a 46,40 $.

Sostituisci Kling muto con Kling con audio nativo (0,32 $/s) e la riga video raddoppia a 89,60 $, ed è per questo che abbinare video muto a una voce fuori campo separata è di solito la combinazione più economica quando è la narrazione a portare il messaggio. L'analisi dei costi delle voci fuori campo ElevenLabs approfondisce i prezzi della narrazione.

Regole di instradamento: quale modello per quale inquadratura

Con i prezzi a chiamata, scegliere un modello è una decisione inquadratura per inquadratura e non un abbonamento a cui ti vincoli. Queste regole si basano solo sulle differenze di prezzo e di specifiche documentate sopra.

  1. Esplorazione e test di hook: usa il modello più economico che produce una composizione accettabile. Hailuo 02 a 0,085 $/s è il limite basso di questa griglia.
  2. Contenuti narrati: usa video muto e aggiungi una voce fuori campo separata. Kling v3 muto a 0,16 $/s più ElevenLabs costa meno di Kling con audio a 0,32 $/s per gli stessi secondi.
  3. Inquadrature che richiedono suono nativo sincronizzato (dialoghi, rumori d'ambiente): paga il livello audio e mettilo a budget al doppio della tariffa muta, dove il modello ne ha una.
  4. Risoluzione: parti dal livello più basso che sopravvive alla compressione della tua destinazione. Seedance 2.5 costa 0,20 $/s a 480p e 0,44 $/s a 720p; sali solo per un clip da tenere.
  5. Inquadrature chiave: spendi sul modello premium solo dopo aver fissato il prompt su uno economico, e limita i tentativi a tre come raccomanda HackerNoon.
  6. Prima le immagini fisse: se un'immagine può bastare, costa pochi centesimi. Quando un'immagine statica batte un video spiega dove vale.

Automatizzare la generazione senza perdere il controllo della spesa

I budget dei batch restano onesti quando la generazione parte da codice, perché il codice registra ogni chiamata mentre un'interfaccia web invita a rifacimenti che nessuno conta. Sviluppatori e piccoli team che producono in volume guidano la generazione da uno script, o da un agente come Claude Code o Cursor tramite un server MCP: entra un prompt o un file di lavori, escono file con il costo di ogni chiamata.

Una checklist preliminare per qualsiasi batch automatizzato

  • Fissa esplicitamente modello e livello nella chiamata. Non affidarti mai a una risoluzione o a un'impostazione audio predefinita.
  • Leggi la griglia dei prezzi da programma prima dell'esecuzione e calcola il tetto del batch: lavori x secondi x tariffa x tentativi previsti.
  • Imposta nel codice un tetto rigido di tentativi per inquadratura (tre è un valore ragionevole per le inquadrature chiave).
  • Usa una chiave API dedicata per progetto o per cliente, così la spesa resta separabile.
  • Verifica come vengono fatturati i render falliti prima di lanciare centinaia di lavori.
  • Conserva un riferimento stabile per ogni output e il costo della chiamata che lo ha prodotto, per calcolare poi il costo per clip tenuto.
  • Rivedi i tentativi per clip tenuto per modello dopo ogni batch e aggiorna le tue regole di instradamento.

Gli agenti rendono tutto più veloce e anche più rischioso: un agente rifarà volentieri un'inquadratura dieci volte se nulla lo ferma. Gli avvisi di spesa per chiave e una chiave revocabile sono i guardrail. Per una configurazione di agente funzionante, vedi generare video da Claude Code con un server MCP, e per l'avvio rapido di API e MCP, la documentazione per sviluppatori.

FAQ

Quanto costa al secondo un'API di generazione video con IA?

Le tariffe ufficiali al momento della stesura vanno da circa 0,02 $ a 0,70 $ al secondo, secondo l'indagine di invideo di agosto 2026. Sull'API di Google stessa, Veo 3.1 va da 0,05 $/s (Lite, 720p) a 0,60 $/s (Standard, 4K).

Conviene usare un'API video direttamente o tramite un aggregatore?

Per un singolo modello in grandi volumi, andare diretti può costare meno al secondo, come con Veo 3.1 Fast sulla Gemini API. Gli aggregatori vincono quando instradi inquadrature diverse verso modelli diversi, perché i modelli più economici su un saldo condiviso abbassano la media. L'esempio di Coverr con 100 clip da otto secondi al mese colloca Veo 3.1 diretto a 160 $ a 320 $ contro 40 $ a 200 $ sugli aggregatori.

Si pagano le generazioni video con IA fallite?

Dipende dal fornitore. Google afferma che Veo viene fatturato solo quando il video è generato con successo. Controlla i termini di ciascun fornitore, perché sui batch grandi la fatturazione dei lavori falliti si accumula.

Quanti tentativi devo mettere a budget per clip video con IA?

HackerNoon riferisce da tre a cinque passaggi per inquadratura chiave nel lavoro professionale, e suggerisce di fermarsi a tre prima di cambiare approccio. Per clip a basso rischio come i test di hook, misura il tuo tasso dopo il primo batch e fai il budget da lì.

Fonti

  1. Google AI for Developers: Gemini Developer API pricing
  2. Runway: API pricing
  3. fal.ai: Pricing
  4. Replicate: Pricing
  5. invideo: AI Video Model Pricing (Aug 2026), Official Per-Second Rates, Normalized
  6. HackerNoon: The same 10 seconds of AI video can cost $0.75 or $4
  7. Coverr: AI video generation API pricing 2026

Se vuoi eseguire i batch qui sopra senza aprire un account per ogni fornitore, Aitachyon riunisce questi modelli video, immagine e voce dietro un unico saldo prepagato che non scade mai, utilizzabile dallo studio web, da una semplice API HTTP o da un server MCP ospitato. Ogni lavoro è dettagliato con il suo modello e il suo costo, i render falliti vengono rimborsati automaticamente e ogni chiave ha il proprio avviso di spesa e una revoca con un clic. I prezzi sono sulla pagina di ogni modello.

Articoli correlati

Strumenti gratuiti da provare

Smetti di descrivere il tuo brand. Incolla il tuo URL.

Aitachyon legge tutto il tuo brand dal tuo sito e crea video, immagini, caroselli, post e banner, fedeli al brand, per ogni formato e ogni feed.