Skip to content
Guías30 de septiembre de 2026· 8 min de lectura

API de Veo 3.1 Fast: precio, límites y cómo llamarla

Precio por segundo de la API de Veo 3.1 Fast, duraciones, resoluciones, latencia y cuotas según Google, y cómo llamarla desde código o desde Claude Code.

veogooglevideo api
Guías

API de Veo 3.1 Fast: precio, límites y cómo llamarla

Un clip de Veo 3.1 Fast de 8 segundos en 720p cuesta $0.80 en la API de Google. El mismo clip en 4K cuesta $2.40. Ambas cifras salen de la página de precios de la Gemini Developer API, y condicionan casi todas las decisiones que vienen después: en qué resolución haces los borradores, cuántas variantes puedes permitirte descartar y si llamas a Google directamente o pasas por una pasarela.

A continuación: cuánto cuesta un segundo de Veo 3.1 Fast en cada sitio donde puedes comprarlo, los límites estrictos de la documentación de Google y la secuencia de llamadas desde un script o desde un agente como Claude Code. Todos los precios son de septiembre de 2026, fecha de redacción.

Qué es Veo 3.1 Fast y dónde encaja en la familia

Google anunció Veo 3.1 y Veo 3.1 Fast el 15 de octubre de 2025, en vista previa de pago en la Gemini API, AI Studio y Vertex AI, según el anuncio del Google Developers Blog. La misma versión añadió guía con imágenes de referencia (hasta tres), extensión de escena para vídeos más largos y generación a partir de un primer y un último fotograma. Google fijó el precio de Veo 3.1 igual al de Veo 3 en el lanzamiento.

La vista general de vídeo de la Gemini API describe Veo 3.1 como un modelo que genera vídeo con audio nativo, y enumera la extensión de vídeo, la generación por fotogramas concretos y la dirección a partir de imágenes entre las entradas admitidas. Hay tres niveles, cada uno con su código de modelo en la documentación para desarrolladores de Veo 3.1:

  • veo-3.1-generate-preview: Standard, el nivel más caro.
  • veo-3.1-fast-generate-preview: Fast, el tema de esta guía.
  • veo-3.1-lite-generate-preview: Lite, el más barato, sin salida en 4K.

La ficha de la pasarela de Vercel resume bien para qué sirve el nivel Fast: está optimizado para flujos de trabajo donde el volumen y la velocidad de iteración importan tanto como la calidad final.

Una regla de decisión para los tres niveles

  1. Usa Lite para borradores desechables en los que solo necesitas juzgar la composición y el movimiento, y nunca necesitas 4K.
  2. Usa Fast como opción por defecto para todo lo que pueda publicarse: hooks, B-roll, planos de producto, shorts.
  3. Usa Standard solo para un plano que ya validaste con Fast y quieres renderizar de nuevo, porque cuesta cuatro veces más por segundo en 720p.

Precio de Veo 3.1 Fast por segundo y por clip

Google cobra Veo por segundo de salida. La página de precios de la Gemini API lista estas tarifas en la fecha de redacción, con audio incluido:

  • Veo 3.1 Fast: $0.10/s en 720p, $0.12/s en 1080p, $0.30/s en 4K.
  • Veo 3.1 Standard: $0.40/s en 720p y 1080p, $0.60/s en 4K.
  • Veo 3.1 Lite: $0.05/s en 720p, $0.08/s en 1080p, 4K no admitido.

La misma página afirma: "You will only be charged if your video is successfully generated." Los trabajos filtrados o fallidos no aparecen en la factura.

Convertido a clips (Veo renderiza 4, 6 u 8 segundos, y 1080p y 4K solo a 8), el precio de lista de Google da:

  • Fast, 720p: $0.40 por 4 s, $0.60 por 6 s, $0.80 por 8 s.
  • Fast, 1080p (solo 8 s): $0.96.
  • Fast, 4K (solo 8 s): $2.40.
  • Standard, 720p, 8 s: $3.20. Standard, 4K, 8 s: $4.80.
  • Lite, 720p, 8 s: $0.40. Lite, 1080p, 8 s: $0.64.

El rastreador de precios de BenchLM señala que en 720p Veo 3.1 Fast está al nivel de Sora 2 estándar o por debajo, a $0.10/s, lo que lo sitúa en la parte baja del mercado para un modelo que produce audio en la misma pasada.

Las pasarelas cobran el mismo modelo de forma distinta

Google no es el único sitio donde comprarlo, y no todas las pasarelas copian la tabla de Google:

Para ver lado a lado la tarifa por segundo de cada modelo de vídeo importante, consulta el desglose de precios de API de vídeo modelo por modelo.

Cuánto cuesta un lote realista

Lote 1: 20 variantes de hook. Veinte clips de 8 segundos en 720p suman 160 segundos de salida.

  • Google directo: 160 x $0.10 = $16.00.
  • fal con audio: 160 x $0.15 = $24.00.
  • Aitachyon, desde: 160 x $0.19 = $30.40.

Después, renderiza de nuevo los tres ganadores en 1080p en Google: 3 x $0.96 = $2.88. Hacer los veinte borradores en 1080p costaría $19.20, una diferencia pequeña. En 4K la diferencia es grande: veinte borradores en 4K cuestan $48.00, el triple que el lote en 720p.

Lote 2: una semana de shorts. Tres shorts al día, cada uno montado con tres clips de 8 segundos, son 63 clips o 504 segundos por semana.

  • Google directo en 720p: $50.40. En 1080p: $60.48. En 4K: $151.20.
  • Aitachyon, desde $0.19/s: $95.76.

Esos totales suponen que cada clip sirve a la primera. Si aprovechas un clip de cada dos, duplícalos. El volumen de hooks es donde la factura sube más rápido, y una biblioteca de fórmulas de hooks probadas reduce el número de renders a ciegas que pagas.

Los límites estrictos de la documentación de Google

Estas restricciones proceden de la página de Veo 3.1 en la documentación de la Gemini API, salvo que se indique otra cosa:

  • Duración: durationSeconds acepta 4, 6 u 8. Se exigen ocho segundos para las resoluciones altas y para las imágenes de referencia.
  • Resolución: 720p (por defecto), 1080p o 4k. 1080p y 4k solo funcionan a 8 segundos.
  • Relación de aspecto: 16:9 (por defecto) o 9:16. Ninguna otra.
  • Latencia: un mínimo de 11 segundos y hasta 6 minutos en horas punta.
  • Retención: los vídeos generados se guardan en los servidores de Google durante 2 días y luego se eliminan.
  • Marca de agua: todos los vídeos reciben una marca de agua SynthID.
  • Reglas regionales: en la UE, el Reino Unido, Suiza y MENA, allow_adult es el único valor permitido de personGeneration.
  • Límites de uso: la página de límites de uso de Gemini no incluye Veo en sus tablas publicadas. Los límites por proyecto se ven en AI Studio, en aistudio.google.com/rate-limit.
  • Fotogramas por segundo: la ficha de Vercel indica 24 fps tanto para texto a vídeo como para imagen a vídeo.
  • Tamaños exactos: Leonardo documenta solo 1280x720, 720x1280, 1920x1080 y 1080x1920 en su integración.

Qué implican esos límites en un pipeline real

  1. Ocho segundos son la unidad de trabajo. Todo lo más largo se monta con varios clips o se construye con extensión de escena. Escribe los guiones como una secuencia de tiempos de 8 segundos desde el principio.
  2. No existe un clip corto y barato en 1080p. Un render de 4 segundos en 1080p no existe, así que un plano en 1080p siempre cuesta al menos $0.96 en la tabla de Google. Si solo necesitas 4 segundos, haz el borrador en 720p y recorta.
  3. El formato vertical es nativo. El 9:16 es una opción de primera clase, así que no tienes que recortar un render horizontal para Shorts, Reels o TikTok. El encuadre sigue importando, y las reglas para producir vídeo 9:16 valen tanto para material generado como para material rodado.
  4. Diseña para trabajo asíncrono. Un rango de 11 segundos a 6 minutos descarta una petición síncrona que mantenga abierta una conexión HTTP. Encola los trabajos, consulta su estado y deja que el resto del pipeline siga.
  5. Descarga de inmediato. A los 2 días el archivo desaparece. Un pipeline que guarda la URL de Google en vez del archivo se romperá dos días después.
  6. Cuenta con la marca de agua. SynthID marca cada salida como generada por IA, así que redacta tus avisos en consecuencia.
  7. Comprueba la generación de personas por mercado. Si tu equipo o tus usuarios están en la UE, el Reino Unido, Suiza o MENA, prueba un prompt con personas desde esa región antes de prometer una función que dependa de ello.

Cómo llamar a Veo 3.1 Fast desde código

El flujo de la Gemini API es una operación de larga duración. La documentación oficial describe los mismos cuatro pasos para todos los SDK:

  1. Enviar. En Python, llama a client.models.generate_videos con el modelo veo-3.1-fast-generate-preview y tu prompt. Por REST, envía un POST a models/veo-3.1-fast-generate-preview:predictLongRunning. Define durationSeconds, resolution y aspectRatio de forma explícita en lugar de fiarte de los valores por defecto, para que el coste por llamada sea predecible.
  2. Recibir una operación. La respuesta es un identificador de operación, no un vídeo.
  3. Consultar. Vuelve a leer la operación hasta que indique done.
  4. Descargar. Obtén el archivo generado y guárdalo en tu propio almacenamiento dentro de la ventana de 2 días.

Consultar sin malgastar peticiones

El suelo de latencia documentado es de 11 segundos, así que haz la primera comprobación hacia los 10 a 15 segundos y luego consulta a intervalo fijo con un tiempo límite por encima del pico de 6 minutos. Registra el nombre de la operación junto con el prompt, para poder retomar un trabajo caducado en lugar de reenviarlo y pagarlo dos veces.

La misma llamada a través de una pasarela

  • fal.ai (Python): fal_client.subscribe('fal-ai/veo3.1/fast', arguments={...}) gestiona la cola por ti. Los parámetros documentados son aspect_ratio, duration (4s, 6s u 8s, 8s por defecto), resolution, generate_audio (true por defecto), negative_prompt, seed, auto_fix y safety_tolerance de 1 a 6.
  • Vercel AI SDK: experimental_generateVideo({ model, prompt }) con el modelo definido como google/veo-3.1-fast-generate-001, según la página de modelo de Vercel.

Un detalle de las pasarelas con coste real: si piensas poner una locución aparte sobre las imágenes, desactivar generate_audio en fal ahorra $0.05 por segundo, o $0.40 por clip de 8 segundos. En un lote de 20 clips son $8.00. La pista de voz pasa entonces a ser una partida propia, y el desglose del coste de la locución muestra cómo calcularla.

Llamarlo desde un agente en lugar de un script

Lanzar la generación desde un agente saca el bucle de consulta de tu código. En Claude Code o Cursor, un servidor MCP expone la generación de vídeo como una herramienta: el agente escribe los prompts, llama a la herramienta, espera el trabajo y guarda el archivo, y tú revisas el resultado y el coste. Generar vídeo con IA desde Claude Code mediante MCP recorre esa configuración de principio a fin.

Con un servidor MCP alojado, la conexión es un solo comando. Para Aitachyon es:

claude mcp add --transport http aitachyon https://aitachyon.com/api/mcp --header "Authorization: Bearer ait_..."

La guía de inicio de API y MCP cubre la misma clave usada por HTTP simple. Cada archivo generado vuelve con una referencia estable (scn_ para una escena) que el código puede recuperar después con GET /api/generations/{ref}, lo que evita el problema de la caducidad a los 2 días de guardar una URL temporal de un proveedor.

Un brief para pegar en el agente

Los agentes gastan dinero tan rápido como les dejes. Pon las restricciones en el brief, no en tu cabeza:

  • Tarea: generar un clip de Veo 3.1 Fast por cada hook listado en hooks.md.
  • Formato: 8 segundos, 9:16, 720p. No cambiar resolución ni duración sin preguntar.
  • Salida: guardar cada archivo como renders/[hook-id].mp4 y añadir modelo, duración, resolución, prompt y coste a renders/costs.csv.
  • Presupuesto: parar y avisar si el total acumulado supera $20.
  • Escalado: preguntar antes de cualquier render en 1080p o 4K, y antes de reintentar más de una vez un trabajo fallido.
  • Revisión: al terminar, listar los tres clips cuyos dos primeros segundos encajan mejor con el texto del hook.

Doce hooks con ese brief cuestan $9.60 al precio de lista de Google en 720p o desde $18.24 a $0.19/s, así que un tope de $20 se cumple en ambos casos. Para un pipeline más completo con guion, voz y montaje en una sola ejecución, consulta una configuración real para automatizar la producción de vídeo con agentes.

Escribir prompts que quepan en un clip de 8 segundos

Ocho segundos dan para una sola idea. La mayoría de los renders fallidos vienen de prompts que describen el arco completo de una escena. Una estructura que encaja con los límites:

  1. Sujeto: quién o qué, con uno o dos detalles visuales concretos.
  2. Acción única: un movimiento que pueda terminar dentro del clip.
  3. Cámara: el encuadre y un solo movimiento de cámara.
  4. Luz y escenario: hora del día, lugar, superficie.
  5. Sonido: como el audio se genera en la misma pasada, indica qué debe oírse, o indica silencio.

Antes: "A woman discovers our skincare product, tries it, loves it, and shows the results to her friends at a party."

Después: "Close-up, vertical frame. A woman in her thirties presses a pump bottle of face serum into her palm in a bright bathroom at morning light. Slow push-in on her hands. Sound: the soft click of the pump and a quiet room tone, no music."

El primer prompt pide cuatro escenas en ocho segundos; el segundo pide un solo plano. Cuando necesites continuidad entre planos, usa los controles que Google lanzó con la 3.1: hasta tres imágenes de referencia para un producto o personaje consistente, y la generación con primer y último fotograma para fijar dónde empieza y termina un clip. Las imágenes de referencia exigen la duración de 8 segundos, así que presupuéstalas al precio de 8 segundos. En fal, fijar la seed permite cambiar una palabra del prompt y comparar cosas comparables.

Cuándo elegir Veo 3.1 Fast frente a otros modelos de vídeo

La elección suele ser un problema de restricciones. Con la tabla propia de Aitachyon en la fecha de redacción, las tarifas por segundo de los demás modelos de vídeo son: Hailuo 02 a $0.085/s, Kling v3 a $0.16/s sin audio y $0.32/s con audio nativo, Wan 2.7 a $0.19/s, y Seedance 2.5 desde $0.20/s en 480p y $0.44/s en 720p. Veo 3.1 Fast figura desde $0.19/s en la misma tabla.

  • Menor coste por segundo de borrador: Hailuo 02 en esa tabla, o Veo 3.1 Lite a $0.05/s si compras directamente a Google.
  • Audio en el mismo render: Veo 3.1 Fast incluye el audio en el precio de Google; Kling v3 cobra el doble por su modo con audio.
  • Salida en 4K: Veo 3.1 Fast o Standard. Lite no renderiza en 4K.
  • Clips de más de 8 segundos en una sola llamada: Veo no puede, así que encadena clips de Veo con extensión de escena o prueba otro modelo.

Para un cara a cara de las dos alternativas más pedidas, lee la comparativa entre Kling v3 y Seedance 2.5. A la mayoría de los equipos les va mejor con dos modelos en rotación, enviando cada plano al más barato que cumpla su restricción.

Lista de comprobación antes de un lote de Veo 3.1 Fast

  1. Confirma la cuota de Veo de tu proyecto en AI Studio.
  2. Fija el código del modelo en la configuración y define durationSeconds, resolution y aspectRatio en cada llamada.
  3. Haz los borradores en 720p. Sube a 1080p o 4K solo los ganadores.
  4. Decide si necesitas audio generado; en fal cambia el precio en otro 50 %.
  5. Multiplica el coste del lote por tu tasa de rechazo prevista y fija un tope de presupuesto firme.
  6. Revisa las reglas de personGeneration de la región en la que operas.
  7. Copia cada archivo a tu propio almacenamiento al terminar, antes de que se borre a los 2 días.
  8. Registra prompt, seed, modelo, resolución, duración y coste por clip para poder reproducir los ganadores.

FAQ

¿Cuánto cuesta por segundo la API de Veo 3.1 Fast?

En la Gemini API de Google, en la fecha de redacción, $0.10 por segundo en 720p, $0.12 en 1080p y $0.30 en 4K, con audio incluido, así que un clip de 8 segundos en 720p cuesta $0.80. Las pasarelas cobran de forma distinta.

¿Cuál es el nombre del modelo Veo 3.1 Fast en la Gemini API?

veo-3.1-fast-generate-preview. Vercel AI Gateway usa google/veo-3.1-fast-generate-001 y fal usa fal-ai/veo3.1/fast.

¿Cuánto puede durar un vídeo de Veo 3.1 Fast?

Cada llamada devuelve 4, 6 u 8 segundos, y 1080p, 4K y las imágenes de referencia exigen 8. Los vídeos más largos se construyen encadenando clips o con extensión de escena.

¿Cuáles son los límites de uso de Veo 3.1 Fast?

Google no incluye Veo en sus tablas publicadas de límites de uso. Los límites de tu proyecto se muestran en AI Studio, en aistudio.google.com/rate-limit, y son la cifra en torno a la cual planificar la concurrencia.

¿Veo 3.1 Fast genera audio y se puede quitar la marca de agua?

Veo 3.1 genera audio nativo, y el precio por segundo de Google lo incluye. Cada salida lleva una marca de agua SynthID, y la documentación no describe ninguna opción para desactivarla.

Sources

  1. Google AI for Developers: Gemini Developer API pricing
  2. Google AI for Developers: Generate videos with Veo 3.1 in Gemini API
  3. Google AI for Developers: Video generation with Veo
  4. Google AI for Developers: Gemini API rate limits
  5. Google Developers Blog: Introducing Veo 3.1 and new creative capabilities in the Gemini API (October 15, 2025)
  6. fal.ai: Veo 3.1 Fast
  7. Vercel: Veo 3.1 Fast Generate on AI Gateway
  8. Leonardo.Ai: Generate with Veo3.1, Veo3.1 Fast using text prompts
  9. BenchLM.ai: Veo 3.1 API pricing

Si Veo 3.1 Fast es solo uno de varios modelos de tu pipeline, Aitachyon lo pone detrás de la misma clave que Kling, Seedance, Hailuo, los modelos de imagen y ElevenLabs, y se puede llamar desde el estudio, la API HTTP o Claude Code mediante MCP. Cada trabajo se detalla con su modelo y su coste, los renders fallidos se reembolsan al céntimo y el saldo prepago no caduca. La tarifa por segundo es más alta que el precio directo de Google, así que si solo llamas a Veo, ir directamente a Google es la opción más barata.

Artículos relacionados

Herramientas gratis para probar

Deja de describir tu marca. Pega tu URL.

Aitachyon lee toda tu marca desde tu sitio web y crea vídeos, imágenes, carruseles, publicaciones y banners, fieles a tu marca, en cada formato y cada feed.