Cómo elegir el nivel de razonamiento en Gemini 3.8 Flash
Gemini 3.8 Flash se ofrece con tres niveles de razonamiento: low, medium y high. Esta configuración controla cuánto razonamiento interno realiza el modelo antes de responder y, por tanto, afecta la latencia, los tokens de salida y el costo. Si es nuevo en el modelo, consulte la descripción general de Gemini 3.8 Flash; esta guía se concentra únicamente en el control del nivel.
Hay dos detalles importantes: el nivel predeterminado es medium, no high, y minimal, que todavía se enviaba en configuraciones de Gemini 3.7 Flash, ya no es compatible. La solicitud falla durante la validación antes de generar tokens. Google documenta ambos cambios en la página de Novedades de Gemini 3.8 Flash.
A continuación verá qué hace cada nivel, cuánto puede costar, cómo configurarlo en las dos superficies de API y cómo probar los tres niveles antes de desplegar.
Niveles de razonamiento de un vistazo
| Nivel | Orientación de Google | Costo por tarea (AA) | Tiempo por tarea (AA) | Úselo cuando |
|---|---|---|---|---|
low |
Minimiza latencia y costo; seguimiento de instrucciones simple, chat y rutas de alto rendimiento | $0.24 | 0.8 min | La latencia importa; búsqueda en transcripciones; clasificación |
medium (predeterminado) |
Equilibrio para código complejo y trabajo de agente | $0.41 | No publicado en texto | La mayoría de las rutas; preguntas y respuestas generales de video |
high |
Máxima profundidad para problemas difíciles de varios pasos | $0.58 | 2.5 min | QA visual densa; videos de más de 60 minutos; planificación crítica |
minimal |
No compatible con 3.8 Flash | n/a | n/a | Nunca; conviértalo en low
|
Las cifras de costo y tiempo son promedios de Artificial Analysis al ejecutar su Intelligence Index con los precios de introducción de Google. Son independientes de Google y representan una carga de referencia, no sus prompts. Úselas para estimar proporciones y mida sus propias rutas.
Qué hace cada nivel
Las respuestas de 3.8 Flash pueden incluir tokens de razonamiento: contenido que el modelo genera antes de la respuesta visible. Se facturan como tokens de salida a $3.75 por millón hasta el 31/12/2026 y $7.50 desde el 01/01/2027. La API los informa por separado mediante usageMetadata.thoughtsTokenCount.
-
lowmantiene corto el razonamiento. Reduce el tiempo hasta el primer token y el costo de salida. Está pensado para instrucciones simples, chat y endpoints de alto rendimiento. -
mediumes el equilibrio y el valor predeterminado. Google lo recomienda para código complejo y tareas de agente. -
highsolicita la mayor profundidad posible para problemas difíciles y con varios pasos.
En 3.8 Flash, las tareas complejas pueden ejecutar pasos de razonamiento adicionales, llamar herramientas de forma iterativa y verificar el trabajo durante la ejecución. Google advierte que el modelo puede usar más tokens en tareas largas y complejas, especialmente con niveles de esfuerzo altos.
Si aumenta el consumo de tokens, la primera recomendación es reducir thinking_level. La segunda es permanecer en Gemini 3.7 Flash, que sigue siendo totalmente compatible.
thinking_level no es un presupuesto
En Gemini 3 ya no existe thinking_budget. No puede solicitar, por ejemplo, un máximo de 2.000 tokens de razonamiento. Debe elegir un nivel y medir su impacto en sus propios prompts.
El valor predeterminado es medium, no high
Si omite el campo, Gemini 3.8 Flash usa medium.
Esto puede sorprender a:
- Equipos que prototiparon con Gemini 3 Pro y esperaban
high. - Equipos que eliminaron
thinking_budgetdurante la migración desde 3.7 Flash y no añadieron un nivel nuevo. - Rutas de chat que deberían priorizar latencia, pero quedaron accidentalmente en
medium.
Establezca thinking_level explícitamente en cada solicitud y mantenga el valor en la configuración de cada ruta, no disperso en el código. Los valores predeterminados de un proveedor pueden cambiar; su perfil de costos no debería hacerlo.
Por qué desapareció minimal
minimal funcionaba en Gemini 3.7 Flash, pero no forma parte de los niveles compatibles con Gemini 3.8 Flash. La página del modelo solo enumera low, medium y high.
Una solicitud REST con minimal se rechaza con 400 INVALID_ARGUMENT antes de ejecutar el modelo:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
El mensaje devuelto es:
Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.
Los SDK pueden envolver el error en sus propias excepciones. Para detectarlo, compruebe el estado 400 o el código INVALID_ARGUMENT, no solo el texto del mensaje.
La corrección es un mapeo directo:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
La guía de migración de Gemini 3.7 a 3.8 Flash recomienda convertir minimal en low.
No intente reemplazarlo con thinking_budget: tampoco es compatible con Gemini 3. Google también recomienda conservar temperature en su valor predeterminado de 1.0; reducirla puede producir bucles o una salida degradada.
Como el error aparece durante la validación, una prueba programada que envíe minimal puede detectar gratis una regresión de configuración.
Cuánto cuesta cada nivel
El precio por token no cambia según el nivel. La página de precios de Google lista $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida a la tarifa de introducción. Desde el 01/01/2027 serán $1.50 y $7.50, respectivamente.
La diferencia entre niveles está en la cantidad de tokens que genera el modelo:
| Modelo y nivel | Costo por tarea | Tiempo por tarea |
|---|---|---|
Gemini 3.8 Flash low
|
$0.24 | 0.8 min |
Gemini 3.8 Flash medium
|
$0.41 | No publicado en texto |
Gemini 3.8 Flash high
|
$0.58 | 2.5 min |
Gemini 3.7 Flash high
|
$0.40 | 2.2 min |
Fuente: Artificial Analysis, ejecuciones del Intelligence Index con precios de introducción.
Estas cifras sugieren tres relaciones:
-
lowcuesta aproximadamente el 41 % dehighy tarda cerca de un tercio del tiempo. -
mediumen 3.8 Flash cuesta aproximadamente lo mismo quehighen 3.7 Flash: $0.41 frente a $0.40. -
highen 3.8 Flash cuesta un 45 % más por tarea quehighen 3.7 Flash, con el mismo precio por token, porque genera aproximadamente un 30 % más de tokens de salida: unos 48.000 en promedio por tarea del índice.
La puntuación 59 del Intelligence Index de Artificial Analysis corresponde a una ejecución en high. No se publicaron en el texto las puntuaciones para medium o low, así que no asuma que la calidad disminuye linealmente con el costo. Evalúe sus prompts antes de cambiar de nivel.
Para un ejemplo con 1.000 tareas diarias y el límite de precios del 31 de diciembre, consulte Precios de Gemini 3.8 Flash.
Configurar thinking_level en la API de Interactions
La API de Interactions es la superficie principal de Google para Gemini 3.x. El campo se encuentra en generation_config y usa snake_case.
cURL
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Python
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Es un campo por solicitud. Configúrelo también en las interacciones de seguimiento que utilicen previous_interaction_id.
La respuesta contiene una lista de pasos de ejecución —pensamientos, llamadas a herramientas y otros eventos— que termina en model_output. El SDK expone el texto final mediante output_text. Para revisar estado, streaming y múltiples interacciones, consulte cómo usar la API de Gemini 3.8 Flash.
Configurarlo en generateContent
La mayoría del código existente todavía usa generateContent. Google lo considera heredado, pero sigue siendo compatible sin una fecha de obsolescencia anunciada.
Aquí el campo está un nivel más profundo y usa camelCase:
cURL
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-[REDACTED CREDENTIAL] \
-H 'Content-Type: application/json' \
-X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Python
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true añade resúmenes de pensamientos como partes marcadas con thought: true. Es útil durante la calibración, pero normalmente puede desactivarse después.
El campo clave para las pruebas es usageMetadata.thoughtsTokenCount, que representa el número exacto de tokens de razonamiento facturados como salida.
Una estrategia por ruta
Trate el nivel como una decisión de enrutamiento, no como una configuración global:
-
Chat y autocompletado:
low, porque el usuario espera una respuesta rápida. -
Clasificación, extracción y búsqueda en transcripciones:
low, después de validar que la precisión sea suficiente. -
Agentes de código y bucles de herramientas:
medium. Eleve ahighsolo los pasos de planificación cuya salida determine todo lo posterior. -
Flujos con muchos documentos o de larga duración:
high, preferiblemente mediante la API por lotes, que ofrece un 50 % de descuento cuando el flujo no es interactivo. -
Video:
-
highpara QA visual densa o videos de más de 60 minutos. -
mediumpara preguntas y respuestas generales. -
lowpara buscar en transcripciones.
-
Si low sigue siendo demasiado lento o caro para una ruta, considere Flash-Lite. La guía de Gemini 3.1 Flash-Lite cubre la compensación; Gemini 3.5 Flash-Lite parte de $0.30 por millón de tokens de entrada y $2.50 de salida.
Mantenga gemini-3.7-flash detrás de una feature flag. Si el consumo aumenta después de la actualización, podrá cambiar de nivel o de modelo sin volver a desplegar toda la aplicación. La comparación entre Gemini 3.8 Flash y 3.7 Flash ayuda a decidir dónde los tokens adicionales aportan calidad.
Probar los tres niveles lado a lado en Apidog
Los promedios de Artificial Analysis muestran proporciones, pero solo sus prompts revelan los números de su aplicación. Puede usar Apidog para enviar el mismo prompt con los tres niveles.
-
Guarde la clave como variable de entorno. Cree
GEMINI_API_KEYen un entorno de Apidog y úsela como{{GEMINI_API_KEY}}en el encabezadox-goog-api-key. Añada tambiénTHINKING_LEVEL. -
Guarde una solicitud. Use
POST /v1beta/models/gemini-3.8-flash:generateContentcon su prompt dorado:
{
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "{{THINKING_LEVEL}}"
}
}
}
-
Cree un escenario de tres pasos. Importe la solicitud tres veces y establezca
THINKING_LEVELenlow,mediumyhigh. -
Asegure los campos variables. En cada paso, compruebe que el estado sea
200y que existausageMetadata.thoughtsTokenCount. Enlow, establezca un límite de tokens y latencia después de la primera ejecución. -
Compare los niveles. Guarde el recuento de cada paso en una variable de postprocesamiento y compruebe que
highrazone al menos tanto comolow. Una inversión puede indicar un cambio de modelo o de configuración. -
Añada una prueba de compatibilidad. Envíe
thinkingLevel: "minimal"y compruebe que la respuesta no sea200. - Programe el escenario. Ejecútelo diariamente para detectar regresiones o cambios silenciosos antes de recibir una factura inesperada. Consulte cómo programar pruebas de API en Apidog.
Para respuestas en streaming, aplique el mismo escenario con SSE. La guía sobre cómo probar API de LLM que transmiten mediante SSE cubre la configuración. También puede descargar Apidog; el plan gratuito es suficiente para este escenario.
Preguntas frecuentes
¿El nivel cambia el precio por token?
No. Gemini 3.8 Flash cuesta $0.75 por millón de tokens de entrada y $3.75 por millón de tokens de salida durante el periodo introductorio, independientemente del nivel. El nivel cambia la cantidad de tokens de razonamiento que genera el modelo y que se facturan como salida. Consulte el desglose de precios de Gemini para conocer caché, lotes y el aumento del 1 de enero.
¿Puedo establecer un presupuesto exacto de tokens?
No en los modelos Gemini 3. thinking_budget fue reemplazado por thinking_level, y 3.8 Flash solo acepta low, medium y high. Si necesita un límite, aplíquelo en las pruebas, alertas y controles de enrutamiento.
¿Qué nivel usa la puntuación 59 de Artificial Analysis?
high. Artificial Analysis ejecutó el Intelligence Index en high para la puntuación principal. Publicó costos y tiempos para otros niveles, pero no sus puntuaciones del índice.
¿Debo bajar temperature para reducir el razonamiento?
No. Google recomienda mantener temperature en 1.0 para todos los modelos Gemini 3. Reducirla puede provocar bucles o degradar la salida. Use thinking_level para controlar la profundidad.
¿Qué hago si incluso low es demasiado lento o caro?
Permanezca en Gemini 3.7 Flash, que sigue siendo compatible sin fecha de obsolescencia, o migre la ruta a Flash-Lite.
Elija el nivel por ruta y mídalo
Gemini 3.8 Flash ofrece tres niveles, pero no un presupuesto exacto de tokens. Configure thinking_level explícitamente, convierta cualquier minimal restante en low y supervise usageMetadata.thoughtsTokenCount.
Las cifras de Artificial Analysis —$0.24, $0.41 y $0.58 por tarea— muestran la forma general de la curva. Un escenario de tres pasos en Apidog le dará los números reales de sus prompts antes de que el cambio de precios del 31 de diciembre vuelva aún más importante cada decisión de enrutamiento.
Top comments (0)