API per video con avatar IA: volti parlanti da una foto e una voce
Come funzionano le API di avatar con foto e audio, quanto costano al secondo nei vari provider, dove si rompono e come chiamarle da codice o da un agente IA.
API per video con avatar IA: volti parlanti da una foto e una voce
Una clip di 30 secondi con un volto parlante, partendo da un ritratto e una traccia vocale, costa tra 0,75 $ e 6,40 $ tramite API, a seconda del provider e della risoluzione. Lo scarto è più ampio di quanto molti si aspettino e dipende da una sola variabile: la tariffa al secondo. Il modello, gli input e la forma della richiesta sono quasi identici da un fornitore all'altro.
Questa guida spiega come questi modelli trasformano una foto statica in un volto che parla, quanto addebita ogni provider per secondo di output, dove i risultati si sfaldano e come collegare il tutto a uno script o a un agente, così che entri un brief ed escano MP4 finiti con il loro costo allegato.
Come funziona un modello di avatar con foto e audio
Ogni provider di questa categoria segue lo stesso contratto. Invii un ritratto e una traccia parlata, il modello anima il volto per farlo coincidere con l'audio e ricevi un video la cui durata è pari a quella dell'audio. La pagina di Kling Avatar V2 su Replicate lo dice chiaramente: la durata si allinea automaticamente alla lunghezza dell'audio. Non scegli mai una durata. Scegli una traccia vocale, ed è la traccia vocale a fissare il conto.
La guida di APIframe alle API di avatar divide il processo in tre fasi:
- Estrazione dell'identità. Il modello legge il volto dal ritratto e lo blocca, così la persona nel primo fotogramma è la stessa dell'ultimo.
- Mappatura audio. L'audio viene associato fotogramma per fotogramma alle forme della bocca e alle espressioni del viso. Qui la qualità del lip sync si vince o si perde.
- Rendering asincrono. Il video viene generato come job in background. Invii, aspetti, scarichi.
La maggior parte dei modelli accetta anche un prompt di testo facoltativo per guidare espressione o movimento. Sulla pagina di Kling AI Avatar 2.0 di Kie.ai il campo prompt accetta da 0 a 5.000 caratteri ed è facoltativo per l'uso di base. Nella pratica, ritratto e audio fanno quasi tutto il lavoro.
Il soggetto non deve per forza essere una persona reale. La scheda di Kling Avatar v2 Pro su fal dice che gestisce esseri umani realistici, animali, cartoni animati e personaggi stilizzati, e VEED descrive il suo modello Fabric come compatibile con foto, illustrazioni, mascotte, render 3D e anime. Conta per i brand che vogliono una mascotte o un presentatore generato invece di un fondatore ripreso in video. Se stai ancora valutando se una testa parlante sia il formato giusto, la nostra analisi di quando le pubblicità con avatar funzionano e quando no copre il lato creativo.
Quanto costa al secondo un'API per video con avatar
Quasi tutti i provider fatturano al secondo di video prodotto. APIframe indica come intervallo tipico da 0,02 $ a 0,07 $ al secondo a risoluzioni standard. Le tariffe pubblicate al momento della stesura, tratte da pagine dei provider e guide di terze parti:
- P-Video-Avatar: 0,025 $/s a 720p e 0,045 $/s a 1080p (inference.sh, 2026).
- Kling Avatar v2 Standard su WaveSpeed: 0,056 $ per secondo di audio, quindi 5 secondi costano 0,28 $.
- VEED Fabric 1.0: 0,08 $/s a 480p e 0,15 $/s a 720p, erogato tramite fal.ai.
- Kling Avatar v2 Pro su fal: 0,115 $ per secondo di output, circa 6,90 $ al minuto.
- Pixverse Avatar: 0,053333 $/s a 360p, 0,106667 $/s a 540p, 0,16 $/s a 720p e 0,213333 $/s a 1080p (catalogo Empirio Labs).
Due avvertenze. Queste cifre vengono da pagine di provider e guide e non sono state confrontate con fatture reali, quindi fai qualche render di prova prima di fissare un budget. Inoltre lo stesso modello può costare cifre molto diverse a seconda di chi lo eroga: Kling Avatar v2 compare a 0,056 $/s (Standard, WaveSpeed) e a 0,115 $/s (Pro, fal), mentre Kie.ai usa una fatturazione a crediti senza tariffa al secondo sulla pagina e la pagina del modello su Replicate non mostrava alcun prezzo quando l'abbiamo controllata.
La formula del costo
Poiché la durata dell'output segue l'audio, il calcolo per una clip è breve:
costo della clip = secondi di audio x tariffa avatar + costo della voce + costo del ritratto
Il ritratto è un costo una tantum se riusi lo stesso volto. La voce costa poco rispetto all'avatar. Su Aitachyon, la voce fuori campo di ElevenLabs costa da 0,043 $ a 0,086 $ ogni 450 caratteri al momento della stesura, e un ritratto generato con Nano Banana costa 0,13 $ a immagine. I secondi di avatar dominano ogni riga del budget.
Tre lotti, calcolati
Con le tariffe pubblicate qui sopra:
- 20 hook con avatar da 10 secondi ciascuno (200 secondi di video). Su Kling Avatar Standard a 0,056 $/s: 11,20 $. Su Kling Avatar Pro a 0,115 $/s: 23,00 $. Aggiungi 20 brevi battute vocali sotto i 450 caratteri ciascuna (da 0,86 $ a 1,72 $) e un ritratto riutilizzato (0,13 $), e il lotto si attesta tra circa 12,19 $ e 24,85 $.
- Una settimana di short, sette teste parlanti da 45 secondi (315 secondi). Standard: 17,64 $. Pro: 36,23 $. P-Video-Avatar a 720p: 7,88 $. Supponi che ogni copione occupi due blocchi vocali da 450 caratteri, il che aggiunge 14 blocchi a un costo da 0,60 $ a 1,20 $.
- Un video esplicativo di 60 secondi a 1080p. P-Video-Avatar: 2,70 $. Kling Pro: 6,90 $. Pixverse: 12,80 $.
La stessa settimana di contenuti può costare 8 $ o 37 $ prima ancora di prendere una decisione creativa. Se stai confrontando più in generale i prezzi dei modelli video, la nostra analisi dei prezzi delle API video modello per modello usa lo stesso metodo al secondo.
Dove si rompono i modelli di avatar
Durata
I limiti rigidi sono generosi. WaveSpeed fattura Kling Avatar Standard fino a un massimo di 300 secondi per job, Kie.ai dichiara che l'audio non può superare i 5 minuti e VEED indica per Fabric 5 minuti per generazione.
Il tetto di qualità arriva molto prima. APIframe avverte che alcuni modelli mostrano deriva dell'identità e deformazioni oltre i 30 secondi. La guida di P-Video-Avatar consiglia di restare sotto i tre minuti e dividere i contenuti più lunghi. Un limite di cinque minuti dice cosa l'API accetterà. Dice poco su cosa sembrerà ancora la stessa persona al minuto quattro.
Lip sync ed espressione
Il lip sync vale quanto la fase di mappatura audio, e quella fase vale quanto l'audio. WaveSpeed chiede una traccia vocale pulita, registrata o sintetica, senza lunghi silenzi. Su un modello a pagamento al secondo il silenzio costa denaro e non dà al volto nulla da fare, ed è lì che tendono a comparire i fotogrammi inquietanti a riposo.
Gesti e corpo
La maggior parte di questi modelli anima viso e testa a partire da una sola immagine. VEED descrive Fabric come un modello che produce gesti naturali della testa e un linguaggio del corpo espressivo, ma è una descrizione del fornitore. Pianifica un'inquadratura a testa e spalle e considera i gesti delle mani un extra.
Inquadratura e risoluzione
La guida di P-Video-Avatar osserva che il rapporto d'aspetto segue quello dell'immagine in ingresso. Se vuoi uno short in 9:16, genera o ritaglia prima un ritratto in 9:16. La risoluzione dipende dal livello: Kie.ai indica fino a 720p su Standard e fino a 1080p a 48 fps su Pro.
Job rifiutati
APIframe elenca come cause comuni di errore immagini di partenza scadenti, formati audio non supportati e rifiuti per la policy sui contenuti. Tutte e tre si prevengono prima di spendere un centesimo, ed è a questo che serve la checklist qui sotto.
La checklist degli input: da eseguire prima di ogni job
La qualità degli input incide sul risultato più della scelta del modello. Copia questa lista ed eseguila come passo di validazione nel tuo script:
- Angolazione del ritratto. Frontale o leggermente di tre quarti, come consiglia WaveSpeed. Niente profili, niente volti parzialmente fuori inquadratura.
- Illuminazione del ritratto. Volto ben illuminato in modo uniforme. Ombre dure sulla bocca danno meno materiale al modello.
- Rapporto d'aspetto del ritratto. Adattalo alla destinazione finale (9:16 per gli short, 1:1 o 16:9 altrove), perché l'inquadratura in uscita segue l'immagine.
- File immagine. JPEG o PNG sotto i 10 MB per Kie.ai; PNG, JPEG o WebP sotto i 20 MB e sotto i 10.000 px sul lato lungo per Pixverse. fal accetta JPG, JPEG, PNG, WebP, GIF e AVIF.
- Formato audio. MP3, OGG, WAV, M4A o AAC vanno bene su fal e Pixverse. Kie.ai accetta MPEG, WAV, AAC, MP4 e OGG fino a 100 MB.
- Pulizia dell'audio. Un solo parlante, niente base musicale, niente eco d'ambiente. La musica si aggiunge dopo il render.
- Silenzi tagliati. Elimina il silenzio iniziale e finale e le pause lunghe. Ogni secondo viene fatturato.
- Lunghezza. Tieni ogni segmento sotto i 30 secondi, a meno che tu non abbia testato il modello oltre quel punto. Dividi i copioni più lunghi ai confini di frase e renderizza i segmenti separatamente.
- Policy. Nessuna somiglianza con una persona reale senza consenso, e nulla che la policy del provider rifiuterebbe. Un job rifiutato fa perdere tempo d'attesa anche quando non costa nulla.
Se generi il ritratto invece di fotografarlo, scegli il modello di immagine in base a texture della pelle e coerenza. Il nostro confronto tra Nano Banana e FLUX.2 Pro tratta questo compromesso per foto di prodotto e di persone.
Scegliere un provider: una regola di decisione
Decidi con tre domande, in quest'ordine:
- Quanto dura il segmento finito? Sotto i 30 secondi tutte le opzioni sono aperte. Oltre, dividi, oppure testa quel modello specifico per la deriva prima di lanciare un lotto.
- Quale risoluzione richiede la destinazione? I formati da feed visti su smartphone raramente richiedono il 1080p. Se ti serve, la tariffa 1080p pubblicata più bassa nella nostra ricerca è quella di P-Video-Avatar a 0,045 $/s, e la più alta quella di Pixverse a 0,213333 $/s.
- Quanto tempo puoi aspettare? WaveSpeed indica per Kling Avatar Standard un tempo di generazione tipico di circa 177 secondi. inference.sh sostiene che P-Video-Avatar elabora circa 1,83 secondi per secondo di output, contro i 26 s/s di HeyGen e i 34 s/s di Veed Fabric. È un'affermazione del fornitore sul proprio prodotto, quindi misura da solo.
Un approccio ragionevole: prototipa sul livello più economico che raggiunge la tua risoluzione, renderizza cinque clip con il tuo vero ritratto e la tua vera voce, confrontale fianco a fianco e sali di livello solo se l'output più economico fallisce su un problema specifico e nominabile (artefatti alla bocca, deriva, testa rigida).
API o strumento in abbonamento
Gli strumenti di avatar a postazione si pagano al mese invece che al secondo. Secondo la rassegna 2026 di VEED: HeyGen parte da 29 $/mese a crediti con lip sync in oltre 40 lingue, D-ID Lite parte da 5,90 $/mese con un livello API da 18 $/mese che include 16 minuti di video normale, Synthesia parte da 18 $/mese per 120 minuti all'anno, e Tavus usa prezzi enterprise su misura con un gemello digitale creato da circa 2 minuti di riprese. Se usi tutti i 16 minuti di D-ID, 18 $ equivalgono a circa 1,13 $ al minuto. Il rovescio è che i minuti non usati si perdono e gli extra hanno regole proprie. Le API al secondo costano di più per unità nella fascia alta e nulla nei mesi in cui non renderizzi.
Chiamare un'API di avatar da codice
Il flusso delle richieste è lo stesso per tutti i provider. APIframe lo descrive come una POST che restituisce un ID del job, poi polling o un webhook, poi il download del video. In concreto, per Kling Avatar Standard su WaveSpeed:
- Invia. POST a https://api.wavespeed.ai/api/v3/kwaivgi/kling-v2-ai-avatar-standard con un token Bearer, un URL dell'immagine e un URL dell'audio. La risposta contiene un ID di predizione da interrogare.
- Interroga. La documentazione di WaveSpeed parte con un polling ogni 2 secondi. Dopo il primo minuto allarga gli intervalli, visto che i job tipici durano qualche minuto.
- Scarica. Su fal il risultato è un JSON con un campo video.url che punta a un MP4 con audio sincronizzato. Copia subito il file nel tuo storage: gli URL dei provider non sono un posto dove conservare gli asset.
- Registra il costo. Moltiplica i secondi di audio per la tariffa e salva il risultato accanto al file. Ti servirà quel numero quando tornerà un lotto da 200 clip.
Fabric viene erogato via REST tramite fal.ai con client Python e JavaScript, quindi valgono gli stessi quattro passaggi con un nome di endpoint diverso.
Passaggi a monte: ritratto e voce
La chiamata all'avatar richiede due URL, e in una pipeline automatizzata di solito vengono generati entrambi. Su Aitachyon una sola chiave API (Authorization: Bearer ait_...) copre i modelli di immagine e di voce, ogni file generato riceve un riferimento stabile (img_ per le immagini, vo_ per le voci fuori campo) che puoi recuperare con GET /api/generations/{ref}, e ogni job è dettagliato con il modello su cui è girato e il suo costo. La guida rapida ad API e MCP contiene la forma delle richieste. Per prezzi e ritmo della voce nel dettaglio, vedi la nostra analisi dei costi dell'API di ElevenLabs.
Eseguirlo da un agente
Per gli sviluppatori che lavorano già in Claude Code o Cursor, il ciclo più rapido è lasciare che l'agente gestisca gli asset a monte e la contabilità, mentre un piccolo script si occupa del provider di avatar. Collegare a Claude Code il server MCP ospitato di Aitachyon richiede un solo comando:
claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."
Una sessione di lavoro si presenta così:
- Dai all'agente un brief: «Venti hook da 10 secondi per la pagina dei prezzi, stesso presentatore, 9:16.»
- L'agente scrive venti copioni, ne riduce ciascuno a un blocco vocale da 450 caratteri e genera un ritratto 9:16 e venti tracce vocali tramite il server MCP. Ognuno torna con un riferimento e un costo.
- L'agente esegue il tuo script di avatar sul provider che preferisci, passando gli URL di ritratto e audio, interrogando lo stato e salvando gli MP4.
- Scrive un manifesto: copione, riferimento della voce, riferimento del ritratto, file avatar, secondi, costo per riga e totale del lotto.
La configurazione è spiegata passo dopo passo nella nostra guida per generare video da Claude Code con un server MCP. Due misure di sicurezza contano quando un agente spende denaro in un ciclo: limitare la dimensione del lotto nel brief e dare all'agente una chiave propria, così la sua spesa resta isolata. Su Aitachyon ogni chiave ha la propria spesa, un avviso quando spende in modo insolitamente rapido e una revoca con un clic. Per limiti di concorrenza, ripetizioni e gestione dei file a volumi maggiori, la nostra guida alla generazione video IA in blocco va più a fondo.
Lo schema ibrido: avatar breve, poi B-roll
La leva più efficace per costo e qualità è tenere breve la testa parlante. Un hook con avatar di 5-10 secondi, seguito da B-roll sotto la stessa voce fuori campo, resta ben dentro la zona dei 30 secondi in cui la deriva è meno probabile e sposta gran parte della durata su riprese più economiche.
Esempio calcolato, 30 secondi in totale al momento della stesura:
- Solo avatar, 30 s su Kling Avatar Standard a 0,056 $/s: 1,68 $. Su Kling Pro a 0,115 $/s: 3,45 $.
- Ibrido: 8 s di avatar su Kling Standard (0,45 $) più 22 s di B-roll su Hailuo 02 a 0,085 $/s (1,87 $). Totale circa 2,32 $.
Sul livello di avatar più economico l'ibrido costa più di un avatar intero. Rispetto al livello Pro costa meno, e in entrambi i casi lo spettatore vede il volto solo durante l'hook, dove cattura l'attenzione, mentre il prodotto resta sullo schermo per il resto del tempo. Un B-roll che continui a sembrare materiale reale richiede cura, e la nostra guida al B-roll IA che non sembra finto lo spiega inquadratura per inquadratura.
FAQ
Quanto costa al minuto un'API per video con avatar IA?
Dalle tariffe pubblicate al momento della stesura: circa 1,50 $ al minuto su P-Video-Avatar a 720p, 3,36 $ su Kling Avatar Standard via WaveSpeed, 6,90 $ su Kling Avatar Pro via fal, 9,00 $ su VEED Fabric a 720p e 12,80 $ su Pixverse a 1080p. Aggiungi i costi di voce e ritratto, modesti al confronto.
Qual è la durata massima di un video con avatar IA?
Kling Avatar e VEED Fabric accettano fino a 5 minuti per job. Il limite più stretto è la qualità: alcuni modelli derivano o si deformano oltre i 30 secondi, e la guida di P-Video-Avatar consiglia di restare sotto i tre minuti. Dividi i copioni lunghi in segmenti e renderizza ciascuno separatamente.
Posso creare un avatar parlante da una sola foto?
Sì. Un solo ritratto frontale o leggermente di tre quarti più un file audio è tutto ciò che queste API richiedono. Anche illustrazioni, mascotte, animali e personaggi stilizzati funzionano su Kling Avatar v2 e VEED Fabric.
Devo registrare la mia voce?
No. Ogni provider di questa guida accetta una traccia TTS, e P-Video-Avatar e Pixverse possono ricevere direttamente un copione di testo. Un audio pulito e senza silenzi dà il miglior lip sync, qualunque sia l'origine.
Un'API di avatar costa meno di HeyGen o Synthesia?
Dipende dal volume. I piani a postazione si pagano ogni mese, che tu renderizzi o no. Le API al secondo fatturano solo ciò che produci, quindi vincono con volumi irregolari o a raffica e con tutto ciò che è automatizzato da codice.
Fonti
- WaveSpeedAI: Kling V2 AI Avatar Standard API
- fal.ai: Kling AI Avatar v2 Pro
- Kie.ai: Kling AI Avatar 2.0 API
- Replicate: Kling Avatar V2
- VEED: Best Avatar APIs (2026), Build Talking Videos at Scale
- APIframe: AI Avatar API Guide
- inference.sh: P-Video-Avatar, the Fastest AI Talking Head Generator
- Empirio Labs: Pixverse Avatar API
Aitachyon copre gli input attorno alla chiamata all'avatar: ritratti su Nano Banana o FLUX.2 [pro], voce su ElevenLabs e B-roll su Seedance, Kling, Veo, Wan o Hailuo, tutto da un unico saldo prepagato che non scade mai, fatturato a chiamata, con rimborso automatico dei render falliti e ogni file dettagliato con il suo costo. Puoi usarlo dallo studio web, dall'API HTTP o dal server MCP in Claude Code, e il listino completo è pubblico su /api/pricing.
Articoli correlati
Prezzi API Seedance 2.5: quanto costa davvero una clip
Prezzi API di Seedance 2.5 al secondo in 480p, 720p e 1080p, costi reali di clip da 5, 10 e 30 s e di lotti, e dove ottenere l'accesso senza abbonamento.
GuidePrezzi delle API di generazione video con IA nel 2026, modello per modello
Come fatturano le API video con IA (al secondo, al clip, a crediti), cosa muove il prezzo, tariffe per modello e budget di batch calcolati con i tentativi.
GuideAPI Veo 3.1 Fast: prezzo, limiti e come chiamarla
Prezzo al secondo dell'API Veo 3.1 Fast, durata dei clip, risoluzioni, latenza e quote secondo Google, e come chiamarla da codice o da Claude Code, con esempi.
GuidePrezzi dell'API di ElevenLabs: quanto costa davvero un voiceover (2026)
Prezzi dell'API di ElevenLabs per 1.000 caratteri e per modello, costo di un voiceover da 30 o 60 secondi e come generarli in batch da codice senza errori 429.
GuideCome gestire un canale YouTube senza volto con l'IA nel 2026
La pipeline reale di un canale YouTube senza volto con l'IA: script, voce, visual, montaggio, costo per fase e effetto delle regole IA sulla monetizzazione.
GuideCosto di un canale faceless: quanto costa ogni video con l'IA
Modello di costo riga per riga per video faceless con IA da 30, 60 e 600 secondi, con prezzi dei modelli, calcoli in chiaro e tariffe di montatori e voci
Strumenti gratuiti da provare
Free AI avatar generator
Create a unique AI avatar for your profile in seconds, from realistic portraits to stylized and anime looks. Free to try with no account, keep your first avatar when you sign up.
Prova gratisFree toolFree AI image generator
Describe what you want and get a high-quality AI image in seconds. A free AI image generator, no account needed to preview, keep your first image when you sign up.
Prova gratisFree toolFree AI product photo generator
Generate clean, studio-style product photos for your store and listings in seconds. Crisp lighting and tidy backgrounds, free to try with no account, keep your first shot on signup.
Prova gratisSmetti di descrivere il tuo brand. Incolla il tuo URL.
Aitachyon legge tutto il tuo brand dal tuo sito e crea video, immagini, caroselli, post e banner, fedeli al brand, per ogni formato e ogni feed.