Precios de Gemini 3.8 Flash: el mismo precio por token, pero más tokens por tarea
Gemini 3.8 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida, la misma tarifa introductoria que Google estableció para 3.7 Flash. Se mantiene hasta el 31 de diciembre de 2026; el 1 de enero de 2027 subirá a $1.50 y $7.50. La misma duplicación afectará a 3.6 Flash y 3.7 Flash. El precio por token no cambió con esta versión.
Lo que sí cambió es el consumo. Google afirma que 3.8 Flash “trabaja más duro”: ejecuta más pasos de razonamiento, llama a herramientas de forma iterativa y puede usar más tokens en tareas largas y complejas.
Artificial Analysis midió el impacto: su Índice de Inteligencia costó $0.58 por tarea con Gemini 3.8 Flash en nivel high, frente a $0.40 con 3.7 Flash. El modelo nuevo utilizó aproximadamente un 30 % más de tokens de salida por tarea.
Mismo precio de etiqueta, factura más alta.
Esta guía explica los precios oficiales, calcula un escenario de 1.000 tareas diarias por nivel de pensamiento y compara Gemini 3.8 Flash con Flash-Lite, Claude Sonnet 5 y GPT-5.6 Luna. Para conocer el modelo, consulta qué es Gemini 3.8 Flash.
Precios de Gemini 3.8 Flash
Todos los precios corresponden a 1 millón de tokens en el nivel de pago.
| Concepto | Introductorio hasta el 31 dic. 2026 |
Estándar desde el 1 ene. 2027 |
|---|---|---|
| Entrada: texto, imagen, vídeo, audio y PDF | $0.75 | $1.50 |
| Salida, incluidos los tokens de pensamiento | $3.75 | $7.50 |
| Lectura de caché de contexto | $0.075 | $0.15 |
| Almacenamiento en caché, por 1M de tokens/hora | $0.50 | $1.00 |
| Entrada de API por lotes, 50 % de descuento | $0.375 | $0.75 |
| Salida de API por lotes, 50 % de descuento | $1.875 | $3.75 |
| Google Search grounding | 5.000 solicitudes gratuitas/mes compartidas entre Gemini 3.x; después, $14 por 1.000 | Igual |
| Nivel gratuito | $0, con límites de tasa; los datos se utilizan para mejorar los productos de Google | Igual |
Hay tres puntos importantes:
- Los tokens de pensamiento se cobran como salida, a $3.75 por millón, no como entrada.
- La tarifa introductoria termina en una fecha fija.
- Las tarifas de 3.6 Flash y 3.7 Flash también se duplican el 1 de enero.
El desglose de precios de Gemini 3.7 Flash ayuda a comparar ambos modelos con el mismo esquema de tarifas.
Los tokens de pensamiento cuentan como salida
Gemini 3.8 Flash razona antes de responder. Cada token utilizado durante ese razonamiento se mide como salida.
En una respuesta de generateContent, la API informa:
-
usageMetadata.thoughtsTokenCount: tokens de pensamiento. -
candidatesTokenCount: tokens de la respuesta visible. -
promptTokenCount: tokens de entrada.
Los dos primeros se cobran al precio de salida de $3.75 por millón.
El nivel se configura con:
thinking_level: lowthinking_level: mediumthinking_level: high
En Gemini 3.8 Flash, el valor predeterminado es medium. minimal ya no es válido y produce un error de validación; si migras una configuración antigua, asígnala a low.
Estos niveles representan esfuerzo relativo, no un presupuesto exacto de tokens. A diferencia de thinking_budget, no puedes establecer directamente un límite de tokens de pensamiento. Consulta la documentación de pensamiento de Google y la guía de niveles de pensamiento de Gemini 3.8 Flash.
Ejemplo de coste por solicitud
Supón que una solicitud:
- Envía 10.000 tokens de entrada.
- Genera 2.000 tokens visibles.
- Utiliza 6.000 tokens de pensamiento.
Con las tarifas introductorias:
Entrada: 10.000 × $0.75 / 1.000.000 = $0.0075
Salida: (2.000 + 6.000) × $3.75 / 1.000.000 = $0.03
Total: $0.0375 por solicitud
El pensamiento representa el 75 % del coste de salida y el 60 % del coste total. Desde el 1 de enero, la misma solicitud costará:
Entrada: $0.015
Salida: $0.06
Total: $0.075
Por tanto, “el mismo precio que 3.7” es cierto, pero incompleto: la tarifa no cambió, mientras que el número de tokens sí.
Por qué subió el coste por tarea
En su publicación de lanzamiento, Google explica que, en tareas complejas, Gemini 3.8 Flash:
- Ejecuta pasos de razonamiento adicionales.
- Llama a herramientas de forma iterativa.
- Verifica su trabajo durante el proceso.
Eso aumenta los tokens de pensamiento y, en flujos agénticos, también el número de turnos de llamada a herramientas.
La mitigación recomendada es sencilla:
- Reduce
thinking_level. - Mantén Gemini 3.7 Flash para las rutas donde el coste sea prioritario.
Artificial Analysis cuantificó el resultado. En su Índice de Inteligencia, Gemini 3.8 Flash obtuvo 59 puntos frente a 56 de 3.7 Flash en nivel alto, pero utilizó unos 48.000 tokens de salida por tarea, aproximadamente un 30 % más.
| Configuración | Coste por tarea tarifas introductorias |
Tiempo por tarea |
|---|---|---|
Gemini 3.8 Flash, high
|
$0.58 | 2,5 min |
Gemini 3.8 Flash, medium
|
$0.41 | No publicado |
Gemini 3.8 Flash, low
|
$0.24 | 0,8 min |
Gemini 3.7 Flash, high
|
$0.40 | 2,2 min |
La tabla permite tomar dos decisiones:
- Frente a 3.7 Flash, 3.8 Flash en
highcuesta un 45 % más por tarea ($0.58 / $0.40 = 1.45) a cambio de tres puntos adicionales. - Dentro de 3.8 Flash, cambiar de
highamediumreduce el coste un 29 % y usarlowlo reduce un 59 %.
El coste de medium queda a un centavo del coste de 3.7 Flash en high, un punto de referencia útil para decidir si actualizar.
Artificial Analysis también muestra una tarifa combinada de $0.58 por millón de tokens con una relación entrada-salida de 3:1. Que coincida con el coste de una tarea en nivel alto es una coincidencia: una cifra es una tarifa por token y la otra depende de cuántos tokens consuma el modelo.
Cómo aprovechar la tarifa introductoria
La tarifa no se puede reservar ni prepagar. Google cobra la tarifa vigente cuando se consumen los tokens, por lo que no puedes comprar uso de 2027 a precios de 2026. Cambiar a 3.7 o 3.6 Flash tampoco evita el incremento.
Sí puedes adelantar trabajo discrecional:
- Ejecuta ahora las reposiciones y el procesamiento de documentos únicos mediante la API por lotes. Una reposición de 100 millones de tokens —75M de entrada y 25M de salida— cuesta aproximadamente:
75 × $0.375 + 25 × $1.875
= $28.13 + $46.88
= $74.99 en lotes este año
En enero costará el doble: $149.98.
Construye tu conjunto de evaluación y registra los tokens de referencia antes del cambio de precio. Así, en enero solo cambiará una variable: la tarifa.
Define el nivel de pensamiento por ruta. Cada ruta que permanezca en
mediumpor defecto debe considerarse una ruta cuyo coste aún no has validado.Si una ruta supera las evaluaciones con
low, déjala configurada enlowantes de enero.
Para comparar proveedores, consulta el resumen de proveedores de API de LLM más baratos y la comparación de Fable 5.1 frente a GPT-5.6 Sol.
Comparación con Flash-Lite, Sonnet 5 y GPT-5.6 Luna
Tarifas por 1 millón de tokens:
| Modelo | Entrada | Salida | Notas |
|---|---|---|---|
| Gemini 3.8 Flash, introductorio | $0.75 | $3.75 | El pensamiento se cobra como salida; lectura de caché a $0.075 |
| Gemini 3.8 Flash, desde el 1 de enero | $1.50 | $7.50 | Lectura de caché a $0.15 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Aproximadamente 350 tok/s |
| Claude Sonnet 5 | $2 | $10 | Permanente; se canceló el aumento del 1 de septiembre |
| GPT-5.6 Luna | $1 | $6 | — |
Con las tarifas introductorias:
- La entrada de 3.8 Flash cuesta 2,5 veces más que Flash-Lite.
- La salida cuesta 1,5 veces más que Flash-Lite.
- Frente a Sonnet 5, 3.8 Flash es aproximadamente 2,7 veces más barato tanto en entrada (
$2 / $0.75) como en salida ($10 / $3.75). - Frente a Luna, cuesta menos en entrada (
$0.75frente a$1) y salida ($3.75frente a$6).
El 1 de enero el panorama cambia:
- Gemini 3.8 Flash costará más que Luna en entrada y salida.
- La diferencia frente a Sonnet 5 se reducirá a aproximadamente 1,3 veces (
$2 / $1.50y$10 / $7.50). - Flash-Lite seguirá siendo más barato.
El precio por token es solo la mitad del análisis. Un modelo que utiliza menos tokens puede costar menos por tarea aunque su tarifa sea mayor. Ejecuta el mismo conjunto de tareas con cada candidato y compara sus recuentos de uso. La guía de la API de Gemini 3.8 Flash muestra cómo leer usageMetadata tanto en la API de Interactions como en generateContent.
Detecta regresiones con aserciones de tokens en Apidog
El fallo habitual no es una respuesta incorrecta. Es una respuesta correcta que, después de cambiar el prompt o el nivel de pensamiento, consume un 40 % más de tokens sin que nadie lo detecte hasta recibir la factura.
Trata el consumo de tokens como tratarías un código de estado: almacénalo, mídelo y valida sus límites.
1. Guarda la clave como variable de entorno
Crea GEMINI_API_KEY en un entorno de Apidog y utiliza {{GEMINI_API_KEY}} en el encabezado x-goog-api-key. Así, la clave no queda guardada directamente en la solicitud.
2. Crea un prompt de referencia
Guarda una solicitud POST a:
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Utiliza un prompt representativo y define explícitamente thinkingConfig.thinkingLevel. Crea una solicitud de referencia para cada ruta de producción.
3. Valida los campos de uso
Añade un script de postprocesamiento que lea usageMetadata y falle si los valores superan tu línea base:
const usage = pm.response.json().usageMetadata;
pm.test("tokens de pensamiento dentro del presupuesto", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
// Los tokens de pensamiento deben ser inferiores a 8000
});
pm.test("salida visible dentro del presupuesto", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
// La salida visible debe ser inferior a 2500
});
pm.test("costo de solicitud dentro del presupuesto", () => {
const cost =
usage.promptTokenCount * 0.75 / 1e6 +
(usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
// El costo debe ser inferior a 0.05
});
4. Programa las pruebas
Coloca las solicitudes en un escenario de prueba y ejecútalo según un cronograma. Una desviación en el consumo aparecerá como una ejecución fallida el mismo día. La guía para programar pruebas de API en Apidog explica la configuración.
El 1 de enero, actualiza las dos constantes de tarifa del script. Las aserciones seguirán monitorizando el coste real.
El mismo escenario puede funcionar como prueba comparativa: duplica la solicitud para Flash-Lite, Sonnet 5 y Luna y compara sus campos de uso en paralelo. El plan gratuito de Apidog cubre este flujo de trabajo.
Preguntas frecuentes
¿Gemini 3.8 Flash cuesta más que 3.7 Flash?
Por token, no. Ambos cuestan $0.75 de entrada y $3.75 de salida hasta el 31 de diciembre; después, $1.50 y $7.50.
Por tarea, sí. Artificial Analysis midió $0.58 por tarea del índice con 3.8 Flash en nivel alto frente a $0.40 con 3.7 Flash, porque el modelo nuevo genera aproximadamente un 30 % más de tokens de salida.
¿Los tokens de pensamiento se facturan por separado?
No. Se cobran como tokens de salida: $3.75 por millón durante el periodo introductorio y aparecen en usageMetadata.thoughtsTokenCount.
Se controlan indirectamente con thinking_level. Gemini 3.8 Flash no ofrece un presupuesto fijo de tokens y minimal devuelve un error de validación.
¿Existe un nivel gratuito?
Sí. AI Studio no cobra por entrada ni salida en el nivel gratuito, aunque aplica límites de tasa y Google utiliza esos datos para mejorar sus productos.
La aplicación Gemini para consumidores solo ofrece 3.8 Flash a suscriptores de AI Pro y Ultra. Consulta la guía de uso gratuito.
¿Qué ocurrirá con los costes el 1 de enero de 2027?
Se duplicarán las tarifas de:
- Entrada.
- Salida.
- Lectura de caché.
- Almacenamiento en caché.
- API por lotes.
Si el consumo por tarea permanece igual, la factura también se duplicará. Las tarifas de 3.6 y 3.7 Flash cambiarán en la misma fecha.
¿Qué nivel de pensamiento mantiene los costes bajos?
Utiliza estas cifras de Artificial Analysis como referencia:
-
low: $0.24 por tarea. -
medium: $0.41 por tarea. -
high: $0.58 por tarea.
Después, ejecuta tus propias evaluaciones, conserva el nivel más bajo que cumpla tus requisitos y añade aserciones sobre los recuentos de tokens.
Qué hacer esta semana
- Mide cada ruta con
low,mediumyhigh. - Define una línea base para
thoughtsTokenCount,candidatesTokenCounty el coste total. - Cambia a
lowlas rutas que superen las evaluaciones con ese nivel. - Ejecuta antes del 31 de diciembre el trabajo compatible con la API por lotes.
- Programa pruebas periódicas en Apidog para detectar aumentos de consumo.
- Revisa el presupuesto antes del 1 de enero de 2027.
Gemini 3.8 Flash mantiene un precio por token similar al de 3.7 Flash, pero consume tokens como un modelo más grande. Trata thinking_level como una configuración de coste, ajústalo por ruta y valida el uso automáticamente. Así, la duplicación de enero será un cambio presupuestario previsto, no una sorpresa.
Referencias
- Precios oficiales de la API de Gemini
- Qué es Gemini 3.8 Flash
- Desglose de precios de Gemini 3.7 Flash
- Documentación de pensamiento
- Niveles de pensamiento de Gemini 3.8 Flash
- Publicación de lanzamiento de Google
- Análisis de Artificial Analysis
- Gemini 3.8 Flash frente a 3.7 Flash
- Proveedores de API de LLM más baratos
- Gemini 3.8 Flash frente a Fable 5.1 y GPT-5.6 Sol
- Cómo usar la API de Gemini 3.8 Flash
- Apidog
- Cómo programar pruebas de API en Apidog
- Descargar Apidog
- Cómo usar Gemini 3.8 Flash gratis

Top comments (0)