Skip to content
Guides30 septembre 2026· 8 min de lecture

API Veo 3.1 Fast : prix, limites et mode d'appel

Prix par seconde de l'API Veo 3.1 Fast, durées, résolutions, latence et quotas d'après la doc de Google, et comment l'appeler depuis le code ou Claude Code.

veogooglevideo api
Guides

API Veo 3.1 Fast : prix, limites et mode d'appel

Un clip Veo 3.1 Fast de 8 secondes en 720p coûte $0.80 sur l'API de Google. Le même clip en 4K coûte $2.40. Les deux chiffres viennent de la page de tarifs de la Gemini Developer API, et ils déterminent la plupart des décisions qui suivent : la résolution des brouillons, le nombre de variantes que vous pouvez vous permettre de jeter, et le choix entre appeler Google directement ou passer par une passerelle.

Ci-dessous : ce que coûte une seconde de Veo 3.1 Fast selon l'endroit où vous l'achetez, les limites strictes de la documentation de Google, et la séquence d'appel depuis un script ou depuis un agent comme Claude Code. Tous les prix sont ceux de septembre 2026, date de rédaction.

Ce qu'est Veo 3.1 Fast et sa place dans la famille

Google a annoncé Veo 3.1 et Veo 3.1 Fast le 15 octobre 2025, en préversion payante sur la Gemini API, AI Studio et Vertex AI, selon l'annonce du Google Developers Blog. La même version ajoutait le guidage par images de référence (jusqu'à trois), l'extension de scène pour des vidéos plus longues et la génération à partir d'une première et d'une dernière image. Google a fixé le prix de Veo 3.1 au même niveau que Veo 3 au lancement.

Le panorama vidéo de la Gemini API décrit Veo 3.1 comme un modèle qui génère de la vidéo avec audio natif, et liste l'extension vidéo, la génération par images clés et la direction à partir d'images parmi les entrées prises en charge. Il existe trois niveaux, chacun avec son code modèle dans la documentation développeur de Veo 3.1 :

  • veo-3.1-generate-preview : Standard, le niveau le plus cher.
  • veo-3.1-fast-generate-preview : Fast, le sujet de ce guide.
  • veo-3.1-lite-generate-preview : Lite, le moins cher, sans sortie 4K.

La fiche de la passerelle Vercel résume bien l'usage du niveau Fast : il est optimisé pour les workflows où le volume et la vitesse d'itération comptent autant que la qualité finale.

Une règle de décision pour les trois niveaux

  1. Prenez Lite pour les brouillons jetables où il suffit de juger la composition et le mouvement, et où vous n'avez jamais besoin de 4K.
  2. Prenez Fast par défaut pour tout ce qui peut être publié : hooks, B-roll, plans produit, shorts.
  3. Réservez Standard à un plan déjà validé avec Fast que vous voulez refaire, car il coûte quatre fois plus par seconde en 720p.

Prix de Veo 3.1 Fast par seconde et par clip

Google facture Veo à la seconde de sortie. La page de tarifs de la Gemini API indique ces taux à la date de rédaction, audio inclus :

  • Veo 3.1 Fast : $0.10/s en 720p, $0.12/s en 1080p, $0.30/s en 4K.
  • Veo 3.1 Standard : $0.40/s en 720p et 1080p, $0.60/s en 4K.
  • Veo 3.1 Lite : $0.05/s en 720p, $0.08/s en 1080p, 4K non pris en charge.

La même page précise : « You will only be charged if your video is successfully generated. » Les tâches filtrées ou échouées n'apparaissent pas sur la facture.

Converti en clips (Veo génère 4, 6 ou 8 secondes, et le 1080p et la 4K uniquement à 8), le tarif public de Google donne :

  • Fast, 720p : $0.40 pour 4 s, $0.60 pour 6 s, $0.80 pour 8 s.
  • Fast, 1080p (8 s uniquement) : $0.96.
  • Fast, 4K (8 s uniquement) : $2.40.
  • Standard, 720p, 8 s : $3.20. Standard, 4K, 8 s : $4.80.
  • Lite, 720p, 8 s : $0.40. Lite, 1080p, 8 s : $0.64.

Le suivi de prix de BenchLM note qu'en 720p, Veo 3.1 Fast se situe au niveau de Sora 2 standard ou en dessous, à $0.10/s, ce qui le place en bas du marché pour un modèle qui produit l'audio dans la même passe.

Les passerelles facturent le même modèle différemment

Google n'est pas le seul endroit où l'acheter, et les passerelles ne recopient pas toutes la grille de Google :

Pour comparer côte à côte le tarif à la seconde de chaque grand modèle vidéo, voir le détail des prix d'API vidéo modèle par modèle.

Ce que coûte un lot réaliste

Lot 1 : 20 variantes de hook. Vingt clips de 8 secondes en 720p, soit 160 secondes de sortie.

  • Google en direct : 160 x $0.10 = $16.00.
  • fal avec audio : 160 x $0.15 = $24.00.
  • Aitachyon, à partir de : 160 x $0.19 = $30.40.

Refaites ensuite les trois gagnants en 1080p chez Google : 3 x $0.96 = $2.88. Produire les vingt brouillons en 1080p coûterait $19.20, un écart modeste. En 4K, il devient important : vingt brouillons 4K coûtent $48.00, soit trois fois le lot en 720p.

Lot 2 : une semaine de shorts. Trois shorts par jour, chacun assemblé à partir de trois clips de 8 secondes, font 63 clips ou 504 secondes par semaine.

  • Google en direct en 720p : $50.40. En 1080p : $60.48. En 4K : $151.20.
  • Aitachyon, à partir de $0.19/s : $95.76.

Ces totaux supposent que chaque clip est utilisable du premier coup. Si vous gardez un clip sur deux, doublez-les. Le volume de hooks est ce qui fait grimper la facture le plus vite, et une bibliothèque de formules de hooks éprouvées réduit le nombre de rendus à l'aveugle que vous payez.

Les limites strictes de la documentation de Google

Ces contraintes viennent de la page Veo 3.1 de la doc Gemini API, sauf mention contraire :

  • Durée : durationSeconds accepte 4, 6 ou 8. Huit secondes sont obligatoires pour les résolutions supérieures et pour les images de référence.
  • Résolution : 720p (par défaut), 1080p ou 4k. Le 1080p et la 4k ne fonctionnent qu'à 8 secondes.
  • Format d'image : 16:9 (par défaut) ou 9:16. Rien d'autre.
  • Latence : un minimum de 11 secondes et jusqu'à 6 minutes aux heures de pointe.
  • Conservation : les vidéos générées sont stockées sur les serveurs de Google pendant 2 jours, puis supprimées.
  • Filigrane : toutes les vidéos reçoivent un filigrane SynthID.
  • Règles régionales : dans l'UE, au Royaume-Uni, en Suisse et dans la zone MENA, allow_adult est la seule valeur de personGeneration autorisée.
  • Limites de débit : la page des limites de débit Gemini ne liste pas Veo dans ses tableaux publiés. Les limites par projet sont visibles dans AI Studio à aistudio.google.com/rate-limit.
  • Cadence d'image : la fiche de Vercel indique 24 fps pour le texte vers vidéo comme pour l'image vers vidéo.
  • Dimensions exactes : Leonardo documente uniquement 1280x720, 720x1280, 1920x1080 et 1080x1920 sur son intégration.

Ce que ces limites impliquent dans un vrai pipeline

  1. Huit secondes sont l'unité de travail. Tout ce qui est plus long s'assemble à partir de plusieurs clips ou se construit avec l'extension de scène. Écrivez vos scripts comme une suite de temps de 8 secondes dès le départ.
  2. Il n'existe pas de clip 1080p court et bon marché. Un rendu 1080p de 4 secondes n'existe pas, donc un plan en 1080p coûte toujours au moins $0.96 sur la grille de Google. Si vous n'avez besoin que de 4 secondes, faites le brouillon en 720p et coupez.
  3. Le vertical est natif. Le 9:16 est une option à part entière, vous n'avez donc pas à recadrer un rendu paysage pour Shorts, Reels ou TikTok. Le cadrage compte quand même, et les règles de production d'une vidéo 9:16 s'appliquent aux images générées comme aux images filmées.
  4. Concevez pour le travail asynchrone. Une plage de 11 secondes à 6 minutes exclut une requête synchrone qui garde une connexion HTTP ouverte. Mettez les tâches en file, interrogez l'état, et laissez le reste du pipeline avancer.
  5. Téléchargez immédiatement. Après 2 jours, le fichier a disparu. Un pipeline qui stocke l'URL de Google au lieu du fichier cassera deux jours plus tard.
  6. Prévoyez le filigrane. SynthID marque chaque sortie comme générée par IA : rédigez vos mentions en conséquence.
  7. Vérifiez la génération de personnes par marché. Si votre équipe ou vos utilisateurs sont dans l'UE, au Royaume-Uni, en Suisse ou dans la zone MENA, testez un prompt avec des personnes depuis cette région avant de promettre une fonctionnalité qui en dépend.

Comment appeler Veo 3.1 Fast depuis le code

Le flux de la Gemini API est une opération de longue durée. La documentation officielle décrit les mêmes quatre étapes pour tous les SDK :

  1. Soumettre. En Python, appelez client.models.generate_videos avec le modèle veo-3.1-fast-generate-preview et votre prompt. En REST, envoyez un POST vers models/veo-3.1-fast-generate-preview:predictLongRunning. Renseignez durationSeconds, resolution et aspectRatio explicitement plutôt que de compter sur les valeurs par défaut, pour que le coût de chaque appel soit prévisible.
  2. Recevoir une opération. La réponse est un identifiant d'opération, pas une vidéo.
  3. Interroger. Relisez l'opération jusqu'à ce qu'elle indique done.
  4. Télécharger. Récupérez le fichier généré et écrivez-le dans votre propre stockage dans la fenêtre de 2 jours.

Interroger sans gaspiller de requêtes

Le plancher de latence documenté est de 11 secondes : faites donc la première vérification vers 10 à 15 secondes, puis interrogez à intervalle fixe avec un délai maximal au-dessus du pic de 6 minutes. Journalisez le nom de l'opération avec le prompt, afin de reprendre une tâche expirée au lieu de la soumettre de nouveau et de la payer deux fois.

Le même appel via une passerelle

  • fal.ai (Python) : fal_client.subscribe('fal-ai/veo3.1/fast', arguments={...}) gère la file à votre place. Les paramètres documentés sont aspect_ratio, duration (4s, 6s ou 8s, 8s par défaut), resolution, generate_audio (true par défaut), negative_prompt, seed, auto_fix et safety_tolerance de 1 à 6.
  • Vercel AI SDK : experimental_generateVideo({ model, prompt }) avec le modèle défini sur google/veo-3.1-fast-generate-001, d'après la page modèle de Vercel.

Un détail de passerelle qui a un vrai coût : si vous comptez poser une voix off séparée sur les images, désactiver generate_audio sur fal économise $0.05 par seconde, soit $0.40 par clip de 8 secondes. Sur un lot de 20 clips, cela fait $8.00. La piste voix devient alors un poste de dépense à part, et le détail du coût d'une voix off montre comment la chiffrer.

Appeler le modèle depuis un agent plutôt que depuis un script

Lancer la génération depuis un agent retire la boucle d'interrogation de votre code. Dans Claude Code ou Cursor, un serveur MCP expose la génération vidéo comme un outil : l'agent écrit les prompts, appelle l'outil, attend la tâche et enregistre le fichier, et vous vérifiez le résultat et le coût. Générer de la vidéo IA depuis Claude Code via MCP détaille cette configuration de bout en bout.

Avec un serveur MCP hébergé, la connexion tient en une commande. Pour Aitachyon, c'est :

claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."

Le guide de démarrage API et MCP couvre la même clé utilisée en HTTP simple. Chaque fichier généré revient avec une référence stable (scn_ pour une scène) que le code peut récupérer plus tard avec GET /api/generations/{ref}, ce qui évite le problème d'expiration à 2 jours d'une URL temporaire de fournisseur.

Un brief à coller dans l'agent

Un agent dépense l'argent aussi vite que vous le laissez faire. Mettez les contraintes dans le brief, pas dans votre tête :

  • Tâche : générer un clip Veo 3.1 Fast par hook listé dans hooks.md.
  • Format : 8 secondes, 9:16, 720p. Ne changez ni la résolution ni la durée sans demander.
  • Sortie : enregistrer chaque fichier sous renders/[hook-id].mp4 et ajouter modèle, durée, résolution, prompt et coût à renders/costs.csv.
  • Budget : s'arrêter et faire un rapport si le total cumulé dépasse $20.
  • Escalade : demander avant tout rendu 1080p ou 4K, et avant de relancer plus d'une fois une tâche échouée.
  • Revue : à la fin, lister les trois clips dont les deux premières secondes correspondent le mieux au texte du hook.

Douze hooks sous ce brief coûtent $9.60 au tarif 720p de Google ou à partir de $18.24 à $0.19/s : un plafond de $20 tient dans les deux cas. Pour un pipeline plus complet qui réunit script, voix et montage en une seule exécution, voir une configuration éprouvée pour automatiser la production vidéo avec des agents.

Écrire des prompts adaptés à un clip de 8 secondes

Huit secondes contiennent une seule idée. La plupart des rendus ratés viennent de prompts qui décrivent l'arc complet d'une scène. Une structure adaptée aux limites :

  1. Sujet : qui ou quoi, avec un ou deux détails visuels concrets.
  2. Action unique : un mouvement qui peut se terminer dans le clip.
  3. Caméra : le cadrage et un seul mouvement de caméra.
  4. Lumière et décor : moment de la journée, lieu, surface.
  5. Son : l'audio étant généré dans la même passe, dites ce qui doit s'entendre, ou dites le silence.

Avant : « A woman discovers our skincare product, tries it, loves it, and shows the results to her friends at a party. »

Après : « Close-up, vertical frame. A woman in her thirties presses a pump bottle of face serum into her palm in a bright bathroom at morning light. Slow push-in on her hands. Sound: the soft click of the pump and a quiet room tone, no music. »

Le premier prompt demande quatre scènes en huit secondes ; le second demande un seul plan. Quand vous avez besoin de continuité entre les plans, utilisez les commandes livrées par Google avec la 3.1 : jusqu'à trois images de référence pour un produit ou un personnage cohérent, et la génération première et dernière image pour fixer le début et la fin d'un clip. Les images de référence exigent la durée de 8 secondes : budgétez-les au prix de 8 secondes. Sur fal, fixer le seed permet de changer un mot du prompt et de comparer des résultats comparables.

Quand choisir Veo 3.1 Fast plutôt qu'un autre modèle vidéo

Le choix est le plus souvent un problème de contraintes. D'après la grille d'Aitachyon à la date de rédaction, les tarifs à la seconde des autres modèles vidéo sont : Hailuo 02 à $0.085/s, Kling v3 à $0.16/s muet et $0.32/s avec audio natif, Wan 2.7 à $0.19/s, et Seedance 2.5 à partir de $0.20/s en 480p et $0.44/s en 720p. Veo 3.1 Fast est affiché à partir de $0.19/s sur la même grille.

  • Coût le plus bas par seconde de brouillon : Hailuo 02 sur cette grille, ou Veo 3.1 Lite à $0.05/s si vous achetez chez Google directement.
  • Audio dans le même rendu : Veo 3.1 Fast inclut l'audio dans le prix de Google ; Kling v3 facture le double pour son mode audio.
  • Sortie 4K : Veo 3.1 Fast ou Standard. Lite ne génère pas de 4K.
  • Clips de plus de 8 secondes en un seul appel : Veo ne le permet pas ; enchaînez donc des clips Veo avec l'extension de scène, ou testez un autre modèle.

Pour un face-à-face des deux alternatives les plus demandées, lisez la comparaison Kling v3 contre Seedance 2.5. La plupart des équipes s'en sortent mieux en gardant deux modèles en rotation et en envoyant chaque plan vers le moins cher qui respecte sa contrainte.

Checklist avant un lot Veo 3.1 Fast

  1. Confirmez le quota Veo de votre projet dans AI Studio.
  2. Figez le code du modèle dans la config et renseignez durationSeconds, resolution et aspectRatio à chaque appel.
  3. Faites les brouillons en 720p. Ne passez en 1080p ou 4K que les gagnants.
  4. Décidez si vous avez besoin d'audio généré ; sur fal, il augmente le prix de moitié.
  5. Multipliez le coût du lot par votre taux de rejet attendu et fixez un plafond de budget strict.
  6. Vérifiez les règles de personGeneration pour la région où vous opérez.
  7. Copiez chaque fichier vers votre propre stockage à la fin du rendu, avant la suppression au bout de 2 jours.
  8. Journalisez prompt, seed, modèle, résolution, durée et coût par clip pour pouvoir reproduire les gagnants.

FAQ

Combien coûte l'API Veo 3.1 Fast par seconde ?

Sur la Gemini API de Google, à la date de rédaction, $0.10 par seconde en 720p, $0.12 en 1080p et $0.30 en 4K, audio inclus : un clip 720p de 8 secondes coûte donc $0.80. Les passerelles facturent différemment.

Quel est le nom du modèle Veo 3.1 Fast dans la Gemini API ?

veo-3.1-fast-generate-preview. Vercel AI Gateway utilise google/veo-3.1-fast-generate-001 et fal utilise fal-ai/veo3.1/fast.

Quelle durée peut avoir une vidéo Veo 3.1 Fast ?

Chaque appel renvoie 4, 6 ou 8 secondes, et le 1080p, la 4K et les images de référence exigent 8. Les vidéos plus longues se construisent en enchaînant des clips ou avec l'extension de scène.

Quelles sont les limites de débit de Veo 3.1 Fast ?

Google ne liste pas Veo dans ses tableaux publiés de limites de débit. Les limites de votre projet s'affichent dans AI Studio à aistudio.google.com/rate-limit, et c'est le chiffre autour duquel planifier la concurrence.

Veo 3.1 Fast génère-t-il de l'audio, et peut-on retirer le filigrane ?

Veo 3.1 génère de l'audio natif, et le prix par seconde de Google l'inclut. Chaque sortie porte un filigrane SynthID, et la doc ne documente aucune option pour le désactiver.

Sources

  1. Google AI for Developers: Gemini Developer API pricing
  2. Google AI for Developers: Generate videos with Veo 3.1 in Gemini API
  3. Google AI for Developers: Video generation with Veo
  4. Google AI for Developers: Gemini API rate limits
  5. Google Developers Blog: Introducing Veo 3.1 and new creative capabilities in the Gemini API (October 15, 2025)
  6. fal.ai: Veo 3.1 Fast
  7. Vercel: Veo 3.1 Fast Generate on AI Gateway
  8. Leonardo.Ai: Generate with Veo3.1, Veo3.1 Fast using text prompts
  9. BenchLM.ai: Veo 3.1 API pricing

Si Veo 3.1 Fast n'est qu'un modèle parmi d'autres dans votre pipeline, Aitachyon le place derrière la même clé que Kling, Seedance, Hailuo, les modèles d'image et ElevenLabs, appelable depuis le studio, l'API HTTP ou Claude Code via MCP. Chaque tâche est détaillée avec son modèle et son coût, les rendus échoués sont remboursés au centime près, et le solde prépayé n'expire pas. Le tarif à la seconde est plus élevé que le prix direct de Google : si vous n'appelez jamais que Veo, passer directement par Google reste l'option la moins chère.

Articles similaires

Outils gratuits à essayer

Arrêtez de décrire votre marque. Collez votre URL.

Aitachyon lit toute votre marque depuis votre site, puis crée vidéos, images, carrousels, posts et bannières, fidèles à votre marque, pour chaque format et chaque réseau.