DEV Community

Cover image for Gemini 3.7 Flash Precios Explicados: Asegura tus Tarifas Antes de que se Dupliquen
Roobia
Roobia

Posted on • Originally published at apidog.com

Gemini 3.7 Flash Precios Explicados: Asegura tus Tarifas Antes de que se Dupliquen

Google lanzó Gemini 3.7 Flash el 13 de agosto de 2026, tres semanas después de 3.6 Flash, y lo presenta como “nuestro modelo de caballo de batalla más inteligente”. Para presupuestar una API, el dato clave no está en los benchmarks: la tarifa introductoria de $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida vence el 31 de diciembre de 2026. Desde el 1 de enero de 2027, ambas tarifas se duplican.

Prueba Apidog hoy

Esto duplica el coste de cualquier carga de trabajo que permanezca en el modelo. Un chatbot que cuesta $790 al mes hoy costará $1,575 en enero, aunque no cambien su código, tráfico ni prompts. Planifique los dos niveles de precio desde el inicio.

Esta guía muestra cómo calcular costes para cargas reales, controlar tokens por endpoint y reducir gasto antes del cambio de tarifa. Si todavía no ha enviado su primera solicitud, consulte la guía de inicio rápido de la API de Gemini 3.7 Flash. Una vez que haga llamadas, Apidog permite inspeccionar los recuentos de usageMetadata en cada respuesta para validar las estimaciones con tráfico real.

En resumen

  • Tarifa introductoria: $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida, hasta el 31 de diciembre de 2026.
  • Tarifa estándar: desde el 1 de enero de 2027, $1.50 de entrada y $7.50 de salida. Exactamente el doble.
  • El precio introductorio es la mitad de lo que costó Gemini 3.6 Flash en su lanzamiento.
  • El modelo acepta texto, imagen, vídeo, audio y PDF, con contexto de 1M de tokens y un máximo de salida de 64k tokens.
  • Un chatbot con 10,000 solicitudes diarias cuesta aproximadamente $26.25/día con tarifa introductoria y $52.50/día con tarifa estándar.
  • Las principales palancas de ahorro son: limitar salida, caché de contexto, lotes y enrutamiento a modelos más pequeños.

Los dos niveles de precios

Gemini 3.7 Flash se lanzó con un descuento temporal, no con un precio permanente.

Nivel Ventana Entrada por 1M de tokens Salida por 1M de tokens
Introductorio 13 de agosto de 2026 al 31 de diciembre de 2026 $0.75 $3.75
Estándar Desde el 1 de enero de 2027 $1.50 $7.50

Hay dos implicaciones prácticas:

  1. La tarifa introductoria es la mitad del precio de lanzamiento de Gemini 3.6 Flash. Si evalúa actualizar desde 3.6, use la guía de migración de 3.6 a 3.7 Flash para planificar pruebas de regresión.
  2. Los tokens de salida cuestan 5 veces más que los tokens de entrada. Reducir una respuesta demasiado larga suele generar más ahorro que recortar un prompt de sistema.

Estas tarifas corresponden a la API de Gemini facturada mediante una clave de AI Studio. Vertex AI usa la facturación de Google Cloud y sus propias SKU. Además, el caché de contexto y el procesamiento por lotes tienen cargos específicos. Confirme los importes vigentes en la página oficial de precios antes de cerrar un presupuesto.

Cómo calcular el coste de una carga real

Use esta fórmula para cada endpoint:

coste_diario =
  (tokens_entrada_diarios / 1_000_000 × precio_entrada)
  +
  (tokens_salida_diarios / 1_000_000 × precio_salida)
Enter fullscreen mode Exit fullscreen mode

Después, multiplique el resultado por los días de operación del mes.

Carga de trabajo 1: chatbot de soporte

Suposiciones:

  • 10,000 solicitudes al día.
  • 2,000 tokens de entrada por solicitud.
  • 300 tokens de salida por solicitud.
Elemento Tokens diarios Coste introductorio/día Coste estándar/día
Entrada 20M $15.00 $30.00
Salida 3M $11.25 $22.50
Total 23M $26.25 $52.50

En un mes de 30 días:

  • Tarifa introductoria: aproximadamente $788/mes.
  • Tarifa estándar: aproximadamente $1,575/mes.

La implementación más útil aquí es definir un límite de salida específico para el endpoint de soporte:

{
  "generationConfig": {
    "maxOutputTokens": 500
  }
}
Enter fullscreen mode Exit fullscreen mode

Una respuesta de soporte rara vez requiere decenas de miles de tokens. Dejar el máximo en 64k aumenta innecesariamente el riesgo de una generación costosa.

Carga de trabajo 2: pipeline de documentos PDF

Gemini 3.7 Flash procesa PDFs de forma nativa. Su benchmark GDP.pdf subió del 22.0% al 34.0% respecto a 3.6 Flash, por lo que la extracción documental es una carga prevista para este modelo.

Suposiciones:

  • 500 documentos al día.
  • 40,000 tokens de entrada por documento.
  • 1,000 tokens de salida por resumen estructurado.
Elemento Tokens diarios Coste introductorio/día Coste estándar/día
Entrada 20M $15.00 $30.00
Salida 0.5M $1.88 $3.75
Total 20.5M $16.88 $33.75

Resultado mensual aproximado:

  • Ahora: $506/mes.
  • Desde enero: $1,013/mes.

En este perfil domina la entrada, porque los documentos son largos y los resúmenes son cortos. Priorice caché de contexto si reenvía instrucciones o documentos de referencia estáticos, y procese por lotes los trabajos no interactivos.

Carga de trabajo 3: bucle de agente

Los agentes multiplican llamadas y contexto. Suposiciones:

  • 200 tareas al día.
  • 12 llamadas al modelo por tarea.
  • 8,000 tokens de entrada por llamada.
  • 400 tokens de salida por llamada.
Elemento Tokens diarios Coste introductorio/día Coste estándar/día
Entrada 19.2M $14.40 $28.80
Salida 0.96M $3.60 $7.20
Total 20.16M $18.00 $36.00

Resultado mensual aproximado:

  • Tarifa introductoria: $540/mes.
  • Tarifa estándar: $1,080/mes.

En un agente, vigile dos métricas por separado:

coste_por_tarea = llamadas_por_tarea × coste_medio_por_llamada
tokens_de_contexto = tokens_prompt + historial + resultados_de_herramientas
Enter fullscreen mode Exit fullscreen mode

Si una tarea pasa de 12 a 20 llamadas, su coste sube aproximadamente un 67%, incluso si el precio por token no cambia.

El límite de salida de 64k fija un peor caso por llamada de aproximadamente $0.24 con tarifa introductoria y $0.48 con tarifa estándar. No es ilimitado, pero un bucle de reintentos que alcance ese máximo repetidamente puede encarecerse rápido.

Cómo se compara el precio de 3.7 Flash

Las comparaciones entre proveedores cambian con frecuencia, así que use estos datos como posicionamiento, no como una tabla permanente de precios.

Gemini 3.7 Flash ocupa el nivel de “caballo de batalla”: es más barato que modelos de vanguardia como Gemini Pro, los modelos grandes de Claude o el nivel insignia de OpenAI, mientras ofrece benchmarks como 65.3% en DeepSWE v1.1 y un Elo de 1588 en WebDev Arena.

La tesis de Google es que gran parte del tráfico de producción no necesita un modelo de máxima capacidad. El descuento introductorio ofrece cuatro meses para validar esa hipótesis en sus propias rutas, prompts y cargas.

El contexto competitivo también importa. Los proveedores económicos pueden cambiar sus tarifas; DeepSeek, por ejemplo, aumentó sus precios de API. Consulte la guía de aumento de precios y optimización de costes de DeepSeek para un caso similar.

La diferencia entre un prototipo y una carga sostenida es importante:

  • Un experimento que pasa de $3 a $6 apenas afecta al presupuesto.
  • Una pipeline que pasa de $10,000 a $20,000 mensuales requiere planificación financiera antes del cambio.

Cinco formas de reducir el gasto en tokens

1. Limite la salida por endpoint

Configure maxOutputTokens según el caso de uso:

{
  "generationConfig": {
    "maxOutputTokens": 500
  }
}
Enter fullscreen mode Exit fullscreen mode

Ejemplos prácticos:

  • Chat de soporte: 300–500 tokens.
  • Clasificación: 50–150 tokens.
  • Resumen estructurado: defina un límite alineado con el esquema.
  • Agentes: aplique límites por paso, no solo por tarea completa.

Este cambio tiene alto impacto porque los tokens de salida cuestan 5 veces más que los de entrada.

2. Almacene en caché el contexto estático

Si cada solicitud incluye el mismo prompt de sistema, documentación de políticas o instrucciones de formato, no reenvíe ese contenido a precio completo miles de veces.

Por ejemplo, si su chatbot tiene 1,500 tokens estáticos en cada petición:

10,000 solicitudes/día × 1,500 tokens = 15M tokens estáticos/día
Enter fullscreen mode Exit fullscreen mode

El caché de contexto puede reducir ese coste repetido. Revise la documentación de la API de Gemini para confirmar la configuración y tarifas actuales.

3. Use lotes para trabajo no interactivo

La extracción de documentos, resúmenes nocturnos y enriquecimiento de datos no necesitan respuestas en tiempo real.

Flujo recomendado:

  1. Almacene los documentos pendientes.
  2. Agrúpelos en trabajos por lote.
  3. Ejecute el procesamiento fuera de horas pico.
  4. Registre tokens y resultados por documento.
  5. Reintente solo los elementos fallidos.

El procesamiento por lotes intercambia latencia por una tarifa reducida cuando el caso de uso lo permite.

4. Enrute por complejidad

No todas las solicitudes necesitan Gemini 3.7 Flash. Use modelos más ligeros para:

  • Clasificación.
  • Enrutamiento.
  • Extracción corta.
  • Validación de formatos.
  • Transformaciones simples.

Reserve 3.7 Flash para tareas que realmente usan su capacidad: planificación de varios pasos, depuración compleja y cadenas de llamadas a herramientas.

5. Prototype con el nivel gratuito

Use la cuota gratuita de AI Studio para fijar:

  • Prompts.
  • Esquemas de respuesta.
  • Límites de salida.
  • Casos de error.
  • Cargas representativas.

La guía de acceso gratuito e ilimitado a la API de Gemini explica el alcance de la ruta gratuita y sus límites.

Rastree el gasto por endpoint con Apidog

Las estimaciones sirven para presupuestar; los datos por solicitud permiten mantener el gasto bajo control.

Cada respuesta de Gemini incluye usageMetadata, con recuentos de tokens de prompt y salida. Puede convertir esos valores en una señal de coste dentro de sus pruebas de API.

En Apidog, implemente este flujo:

  1. Guarde una solicitud por endpoint de producción: chat, resumen de documento y paso de agente.
  2. Vincule la clave a una variable de entorno llamada GEMINI_API_KEY.
  3. Cree escenarios con cargas útiles representativas.
  4. Extraiga usageMetadata.promptTokenCount y usageMetadata.candidatesTokenCount.
  5. Añada aserciones de presupuesto de tokens.
  6. Ejecute esos escenarios en cada cambio de prompt, esquema o lógica de herramientas.

Ejemplo de umbrales que puede aplicar:

chat:
  promptTokenCount <= 2500
  candidatesTokenCount <= 500

resumen_pdf:
  promptTokenCount <= 45000
  candidatesTokenCount <= 1200
Enter fullscreen mode Exit fullscreen mode

Si una modificación del prompt lleva el endpoint de chat de 2,000 a más de 2,500 tokens de entrada, el escenario puede fallar antes del despliegue. Así detecta una regresión de coste antes de que se convierta en una factura.

Multiplique los tokens observados por la tarifa actual:

coste_entrada = promptTokenCount / 1_000_000 × precio_entrada
coste_salida = candidatesTokenCount / 1_000_000 × precio_salida
coste_total = coste_entrada + coste_salida
Enter fullscreen mode Exit fullscreen mode

La guía de pruebas de API para ingenieros de QA muestra cómo estructurar escenarios con aserciones en un servicio completo.

Preguntas frecuentes

¿Cuándo se duplica el precio de Gemini 3.7 Flash?

El 1 de enero de 2027. La tarifa introductoria de $0.75 por 1M de tokens de entrada y $3.75 por 1M de tokens de salida estará vigente hasta el 31 de diciembre de 2026. Después pasará a $1.50 y $7.50.

¿Es Gemini 3.7 Flash más barato que Gemini 3.6 Flash?

En su lanzamiento, sí. El precio introductorio de 3.7 Flash es la mitad del precio de lanzamiento de 3.6 Flash, mientras que DeepSWE v1.1 pasó de 49.0% a 65.3%. Consulte la referencia rápida de Gemini 3.7 Flash para comparar especificaciones y benchmarks.

¿Se aplica el precio introductorio en Vertex AI?

Las tarifas de esta guía corresponden a la API de Gemini facturada mediante una clave de AI Studio. Vertex AI usa la facturación de Google Cloud, sus propias SKU y términos empresariales. Verifique los precios en su consola de GCP y en la página oficial de precios.

¿Qué cuenta como token de entrada?

Todo lo que envía: texto, imágenes, vídeo, audio y páginas PDF se convierten en tokens y se facturan como entrada. Los documentos largos y las peticiones con mucho contenido multimedia suelen ser los principales generadores de costes inesperados.

Después de cada llamada, revise usageMetadata para obtener el recuento real.

¿Cómo estimo tokens antes de enviar una solicitud?

Use el endpoint countTokens para medir una carga útil sin generar una respuesta, o envíe un conjunto de solicitudes representativas y lea usageMetadata.

Mida siempre con contenido real. Las estimaciones basadas en tokenizadores de otros proveedores no se trasladan necesariamente entre familias de modelos.

Dónde encaja 3.7 Flash en su pila

Gemini 3.7 Flash tiene un descuento introductorio con una fecha de finalización conocida. La estrategia práctica es:

  1. Mueva al modelo el tráfico de “caballo de batalla” que sea adecuado.
  2. Mida tokens reales por endpoint.
  3. Añada límites de salida y presupuestos de tokens.
  4. Identifique rutas que pueden usar un modelo más ligero.
  5. Calcule la factura con tarifa estándar antes de enero de 2027.

La medición necesita herramientas. Descargue Apidog para centralizar solicitudes de Gemini, entornos, aserciones de tokens y verificaciones de costes, y convertir la factura de enero en una cifra prevista.

Top comments (0)