DEV Community

Cover image for Gemini 3.8 Flash: Niveles de pensamiento bajo vs. medio vs. alto y por qué el nivel mínimo desapareció
Roobia
Roobia

Posted on Originally published at apidog.com

Gemini 3.8 Flash: Niveles de pensamiento bajo vs. medio vs. alto y por qué el nivel mínimo desapareció

Cómo elegir el nivel de razonamiento en Gemini 3.8 Flash

Gemini 3.8 Flash se ofrece con tres niveles de razonamiento: low, medium y high. Esta configuración controla cuánto razonamiento interno realiza el modelo antes de responder y, por tanto, afecta la latencia, los tokens de salida y el costo. Si es nuevo en el modelo, consulte la descripción general de Gemini 3.8 Flash; esta guía se concentra únicamente en el control del nivel.

Prueba Apidog hoy

Hay dos detalles importantes: el nivel predeterminado es medium, no high, y minimal, que todavía se enviaba en configuraciones de Gemini 3.7 Flash, ya no es compatible. La solicitud falla durante la validación antes de generar tokens. Google documenta ambos cambios en la página de Novedades de Gemini 3.8 Flash.

A continuación verá qué hace cada nivel, cuánto puede costar, cómo configurarlo en las dos superficies de API y cómo probar los tres niveles antes de desplegar.

Niveles de razonamiento de un vistazo

Nivel Orientación de Google Costo por tarea (AA) Tiempo por tarea (AA) Úselo cuando
low Minimiza latencia y costo; seguimiento de instrucciones simple, chat y rutas de alto rendimiento $0.24 0.8 min La latencia importa; búsqueda en transcripciones; clasificación
medium (predeterminado) Equilibrio para código complejo y trabajo de agente $0.41 No publicado en texto La mayoría de las rutas; preguntas y respuestas generales de video
high Máxima profundidad para problemas difíciles de varios pasos $0.58 2.5 min QA visual densa; videos de más de 60 minutos; planificación crítica
minimal No compatible con 3.8 Flash n/a n/a Nunca; conviértalo en low

Las cifras de costo y tiempo son promedios de Artificial Analysis al ejecutar su Intelligence Index con los precios de introducción de Google. Son independientes de Google y representan una carga de referencia, no sus prompts. Úselas para estimar proporciones y mida sus propias rutas.

Qué hace cada nivel

Las respuestas de 3.8 Flash pueden incluir tokens de razonamiento: contenido que el modelo genera antes de la respuesta visible. Se facturan como tokens de salida a $3.75 por millón hasta el 31/12/2026 y $7.50 desde el 01/01/2027. La API los informa por separado mediante usageMetadata.thoughtsTokenCount.

  • low mantiene corto el razonamiento. Reduce el tiempo hasta el primer token y el costo de salida. Está pensado para instrucciones simples, chat y endpoints de alto rendimiento.
  • medium es el equilibrio y el valor predeterminado. Google lo recomienda para código complejo y tareas de agente.
  • high solicita la mayor profundidad posible para problemas difíciles y con varios pasos.

En 3.8 Flash, las tareas complejas pueden ejecutar pasos de razonamiento adicionales, llamar herramientas de forma iterativa y verificar el trabajo durante la ejecución. Google advierte que el modelo puede usar más tokens en tareas largas y complejas, especialmente con niveles de esfuerzo altos.

Si aumenta el consumo de tokens, la primera recomendación es reducir thinking_level. La segunda es permanecer en Gemini 3.7 Flash, que sigue siendo totalmente compatible.

thinking_level no es un presupuesto

En Gemini 3 ya no existe thinking_budget. No puede solicitar, por ejemplo, un máximo de 2.000 tokens de razonamiento. Debe elegir un nivel y medir su impacto en sus propios prompts.

El valor predeterminado es medium, no high

Si omite el campo, Gemini 3.8 Flash usa medium.

Esto puede sorprender a:

  • Equipos que prototiparon con Gemini 3 Pro y esperaban high.
  • Equipos que eliminaron thinking_budget durante la migración desde 3.7 Flash y no añadieron un nivel nuevo.
  • Rutas de chat que deberían priorizar latencia, pero quedaron accidentalmente en medium.

Establezca thinking_level explícitamente en cada solicitud y mantenga el valor en la configuración de cada ruta, no disperso en el código. Los valores predeterminados de un proveedor pueden cambiar; su perfil de costos no debería hacerlo.

Por qué desapareció minimal

minimal funcionaba en Gemini 3.7 Flash, pero no forma parte de los niveles compatibles con Gemini 3.8 Flash. La página del modelo solo enumera low, medium y high.

Una solicitud REST con minimal se rechaza con 400 INVALID_ARGUMENT antes de ejecutar el modelo:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}
Enter fullscreen mode Exit fullscreen mode

El mensaje devuelto es:

Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.
Enter fullscreen mode Exit fullscreen mode

Los SDK pueden envolver el error en sus propias excepciones. Para detectarlo, compruebe el estado 400 o el código INVALID_ARGUMENT, no solo el texto del mensaje.

La corrección es un mapeo directo:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}
Enter fullscreen mode Exit fullscreen mode

La guía de migración de Gemini 3.7 a 3.8 Flash recomienda convertir minimal en low.

No intente reemplazarlo con thinking_budget: tampoco es compatible con Gemini 3. Google también recomienda conservar temperature en su valor predeterminado de 1.0; reducirla puede producir bucles o una salida degradada.

Como el error aparece durante la validación, una prueba programada que envíe minimal puede detectar gratis una regresión de configuración.

Cuánto cuesta cada nivel

El precio por token no cambia según el nivel. La página de precios de Google lista $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida a la tarifa de introducción. Desde el 01/01/2027 serán $1.50 y $7.50, respectivamente.

La diferencia entre niveles está en la cantidad de tokens que genera el modelo:

Modelo y nivel Costo por tarea Tiempo por tarea
Gemini 3.8 Flash low $0.24 0.8 min
Gemini 3.8 Flash medium $0.41 No publicado en texto
Gemini 3.8 Flash high $0.58 2.5 min
Gemini 3.7 Flash high $0.40 2.2 min

Fuente: Artificial Analysis, ejecuciones del Intelligence Index con precios de introducción.

Estas cifras sugieren tres relaciones:

  1. low cuesta aproximadamente el 41 % de high y tarda cerca de un tercio del tiempo.
  2. medium en 3.8 Flash cuesta aproximadamente lo mismo que high en 3.7 Flash: $0.41 frente a $0.40.
  3. high en 3.8 Flash cuesta un 45 % más por tarea que high en 3.7 Flash, con el mismo precio por token, porque genera aproximadamente un 30 % más de tokens de salida: unos 48.000 en promedio por tarea del índice.

La puntuación 59 del Intelligence Index de Artificial Analysis corresponde a una ejecución en high. No se publicaron en el texto las puntuaciones para medium o low, así que no asuma que la calidad disminuye linealmente con el costo. Evalúe sus prompts antes de cambiar de nivel.

Para un ejemplo con 1.000 tareas diarias y el límite de precios del 31 de diciembre, consulte Precios de Gemini 3.8 Flash.

Configurar thinking_level en la API de Interactions

La API de Interactions es la superficie principal de Google para Gemini 3.x. El campo se encuentra en generation_config y usa snake_case.

cURL

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Enter fullscreen mode Exit fullscreen mode

Python

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Explain HTTP caching in 3 sentences.",
    generation_config={"thinking_level": "low"},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Es un campo por solicitud. Configúrelo también en las interacciones de seguimiento que utilicen previous_interaction_id.

La respuesta contiene una lista de pasos de ejecución —pensamientos, llamadas a herramientas y otros eventos— que termina en model_output. El SDK expone el texto final mediante output_text. Para revisar estado, streaming y múltiples interacciones, consulte cómo usar la API de Gemini 3.8 Flash.

Configurarlo en generateContent

La mayoría del código existente todavía usa generateContent. Google lo considera heredado, pero sigue siendo compatible sin una fecha de obsolescencia anunciada.

Aquí el campo está un nivel más profundo y usa camelCase:

cURL

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Enter fullscreen mode Exit fullscreen mode

Python

from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Explain HTTP caching in 3 sentences.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)

print(response.usage_metadata.thoughts_token_count)
Enter fullscreen mode Exit fullscreen mode

includeThoughts: true añade resúmenes de pensamientos como partes marcadas con thought: true. Es útil durante la calibración, pero normalmente puede desactivarse después.

El campo clave para las pruebas es usageMetadata.thoughtsTokenCount, que representa el número exacto de tokens de razonamiento facturados como salida.

Una estrategia por ruta

Trate el nivel como una decisión de enrutamiento, no como una configuración global:

  • Chat y autocompletado: low, porque el usuario espera una respuesta rápida.
  • Clasificación, extracción y búsqueda en transcripciones: low, después de validar que la precisión sea suficiente.
  • Agentes de código y bucles de herramientas: medium. Eleve a high solo los pasos de planificación cuya salida determine todo lo posterior.
  • Flujos con muchos documentos o de larga duración: high, preferiblemente mediante la API por lotes, que ofrece un 50 % de descuento cuando el flujo no es interactivo.
  • Video:
    • high para QA visual densa o videos de más de 60 minutos.
    • medium para preguntas y respuestas generales.
    • low para buscar en transcripciones.

Si low sigue siendo demasiado lento o caro para una ruta, considere Flash-Lite. La guía de Gemini 3.1 Flash-Lite cubre la compensación; Gemini 3.5 Flash-Lite parte de $0.30 por millón de tokens de entrada y $2.50 de salida.

Mantenga gemini-3.7-flash detrás de una feature flag. Si el consumo aumenta después de la actualización, podrá cambiar de nivel o de modelo sin volver a desplegar toda la aplicación. La comparación entre Gemini 3.8 Flash y 3.7 Flash ayuda a decidir dónde los tokens adicionales aportan calidad.

Probar los tres niveles lado a lado en Apidog

Los promedios de Artificial Analysis muestran proporciones, pero solo sus prompts revelan los números de su aplicación. Puede usar Apidog para enviar el mismo prompt con los tres niveles.

  1. Guarde la clave como variable de entorno. Cree GEMINI_API_KEY en un entorno de Apidog y úsela como {{GEMINI_API_KEY}} en el encabezado x-goog-api-key. Añada también THINKING_LEVEL.
  2. Guarde una solicitud. Use POST /v1beta/models/gemini-3.8-flash:generateContent con su prompt dorado:
   {
     "generationConfig": {
       "thinkingConfig": {
         "thinkingLevel": "{{THINKING_LEVEL}}"
       }
     }
   }
Enter fullscreen mode Exit fullscreen mode
  1. Cree un escenario de tres pasos. Importe la solicitud tres veces y establezca THINKING_LEVEL en low, medium y high.
  2. Asegure los campos variables. En cada paso, compruebe que el estado sea 200 y que exista usageMetadata.thoughtsTokenCount. En low, establezca un límite de tokens y latencia después de la primera ejecución.
  3. Compare los niveles. Guarde el recuento de cada paso en una variable de postprocesamiento y compruebe que high razone al menos tanto como low. Una inversión puede indicar un cambio de modelo o de configuración.
  4. Añada una prueba de compatibilidad. Envíe thinkingLevel: "minimal" y compruebe que la respuesta no sea 200.
  5. Programe el escenario. Ejecútelo diariamente para detectar regresiones o cambios silenciosos antes de recibir una factura inesperada. Consulte cómo programar pruebas de API en Apidog.

Para respuestas en streaming, aplique el mismo escenario con SSE. La guía sobre cómo probar API de LLM que transmiten mediante SSE cubre la configuración. También puede descargar Apidog; el plan gratuito es suficiente para este escenario.

Preguntas frecuentes

¿El nivel cambia el precio por token?

No. Gemini 3.8 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida durante el periodo introductorio, independientemente del nivel. El nivel cambia la cantidad de tokens de razonamiento que genera el modelo y que se facturan como salida. Consulte el desglose de precios de Gemini para conocer caché, lotes y el aumento del 1 de enero.

¿Puedo establecer un presupuesto exacto de tokens?

No en los modelos Gemini 3. thinking_budget fue reemplazado por thinking_level, y 3.8 Flash solo acepta low, medium y high. Si necesita un límite, aplíquelo en las pruebas, alertas y controles de enrutamiento.

¿Qué nivel usa la puntuación 59 de Artificial Analysis?

high. Artificial Analysis ejecutó el Intelligence Index en high para la puntuación principal. Publicó costos y tiempos para otros niveles, pero no sus puntuaciones del índice.

¿Debo bajar temperature para reducir el razonamiento?

No. Google recomienda mantener temperature en 1.0 para todos los modelos Gemini 3. Reducirla puede provocar bucles o degradar la salida. Use thinking_level para controlar la profundidad.

¿Qué hago si incluso low es demasiado lento o caro?

Permanezca en Gemini 3.7 Flash, que sigue siendo compatible sin fecha de obsolescencia, o migre la ruta a Flash-Lite.

Elija el nivel por ruta y mídalo

Gemini 3.8 Flash ofrece tres niveles, pero no un presupuesto exacto de tokens. Configure thinking_level explícitamente, convierta cualquier minimal restante en low y supervise usageMetadata.thoughtsTokenCount.

Las cifras de Artificial Analysis —$0.24, $0.41 y $0.58 por tarea— muestran la forma general de la curva. Un escenario de tres pasos en Apidog le dará los números reales de sus prompts antes de que el cambio de precios del 31 de diciembre vuelva aún más importante cada decisión de enrutamiento.

Top comments (0)