Cada artículo principal sobre el lanzamiento de Claude Opus 5 el 24 de julio de 2026 mencionó la posibilidad de alternar entre costo y capacidad. Lo importante para quienes integran la API es el parámetro de solicitud effort: tiene cinco niveles en Opus 5, su valor predeterminado es high y afecta directamente el razonamiento interno, la latencia y el costo de salida.
Anthropic recalibró estos niveles para Opus 5. Por eso, no conviene copiar una configuración de Opus 4.8 sin evaluarla de nuevo. Además, una combinación concreta de opciones devuelve un error 400: desactivar el pensamiento y usar effort: "xhigh" o effort: "max".
💡 Si quieres comparar los cinco niveles contra un endpoint real, envía la misma solicitud con cada configuración y registra calidad, tokens de salida y latencia.
Qué es realmente el parámetro effort
effort se configura dentro de output_config en una solicitud a la API de Mensajes:
{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": {
"effort": "high"
},
"messages": [
{
"role": "user",
"content": "Refactorizar este módulo y explicar las ventajas y desventajas."
}
]
}
Controla cuánto razonamiento interno realiza el modelo antes de responder:
- Un
effortmás alto usa más tokens de razonamiento. - Más razonamiento implica mayor latencia y mayor costo de salida.
- Un
effortmás bajo reduce esos tres factores.
Opus 5 activa el pensamiento adaptativo de forma predeterminada. Si no incluyes output_config, la solicitud se ejecuta con effort: "high".
Las interfaces visuales pueden presentar esto como un selector de costo-capacidad, pero en la API el control real es este campo. Consulta la guía detallada de la API de Opus 5 y la descripción general de modelos de Anthropic para la estructura completa de la solicitud.
effort no controla la longitud visible
No uses effort para pedir respuestas más cortas. Según la guía de prompting de Anthropic para Opus 5, bajar el esfuerzo reduce el razonamiento, no necesariamente la longitud del texto generado.
Si necesitas concisión, indícalo en el prompt:
Responde en un máximo de 5 viñetas. No incluyas razonamiento paso a paso.
Los cinco niveles
| Nivel | Qué hace | Uso típico |
|---|---|---|
low |
Razonamiento mínimo antes de responder | Clasificación de alto volumen, extracción, enrutamiento y resúmenes cortos |
medium |
Razonamiento moderado | Preguntas sobre contexto recuperado, ediciones de un solo archivo y transformaciones estructuradas |
high |
Valor predeterminado. Razonamiento sustancial | Trabajo general cuando todavía no tienes mediciones |
xhigh |
Razonamiento extendido | Codificación y bucles agénticos; es el punto de partida recomendado por Anthropic |
max |
Presupuesto máximo de razonamiento | Problemas difíciles de un solo intento, donde un error cuesta más que los tokens |
Dos detalles son especialmente importantes:
-
El valor predeterminado es
high. Una solicitud sinoutput_configya consume razonamiento adaptativo. Esto afecta la previsión de costos si migras desde Opus 4.8. -
Para código y agentes, empieza con
xhigh, no conmax. Anthropic recomiendaxhighcomo punto de partida. Usamaxsolo si tus evaluaciones demuestran una mejora que justifique el costo adicional.
El cambio de comportamiento predeterminado es uno de los puntos clave de la migración de Opus 4.8 a Opus 5.
Qué cambió con la recalibración
Anthropic recalibró el significado de cada nivel en Opus 5. Por ejemplo, medium en Opus 5 no representa la misma cantidad de razonamiento que medium en Opus 4.8.
La consecuencia práctica: vuelve a medir tus cargas de trabajo. No portes configuraciones por nombre.
En modelos Opus anteriores, low y medium podían ser demasiado débiles para muchas tareas serias. En Opus 5, los niveles bajos son más utilizables para producción, especialmente en tareas donde el razonamiento profundo no mejora la precisión:
- clasificación;
- extracción de campos;
- enrutamiento;
- transformaciones con salida estructurada;
- resúmenes breves.
Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, igual que Opus 4.8. Los tokens de razonamiento se cobran en la parte de salida. Por tanto, bajar de high a low en un pipeline de clasificación puede reducir una parte relevante del gasto sin degradar una tarea que no necesita razonamiento adicional.
Consulta el desglose de precios de Opus 5 para ver la tarifa completa, el descuento por lote del 50% y el mínimo de caché de 512 tokens.
Si buscas optimizar varios servicios de Claude, estas prácticas también se combinan con las recomendaciones para reducir tu factura de la API de Claude.
Cómo interactúan xhigh y max con max_tokens
max_tokens limita la suma de:
- tokens de razonamiento;
- tokens de respuesta visible.
No es un límite exclusivo para el texto final.
Al aumentar effort, el modelo puede dedicar más parte del presupuesto a razonar antes de escribir. Si usas xhigh o max con un valor de max_tokens pensado para un modelo sin razonamiento adaptativo, la respuesta puede truncarse antes de completarse.
Para xhigh o max, Anthropic recomienda comenzar con max_tokens: 64000:
{
"model": "claude-opus-5",
"max_tokens": 64000,
"output_config": {
"effort": "xhigh"
},
"messages": [
{
"role": "user",
"content": "Corregir la prueba de integración fallida y explicar la causa raíz."
}
]
}
Un límite alto no es una compra anticipada. Solo se facturan los tokens producidos. Establecer 64000 simplemente evita que el modelo se quede sin espacio durante el razonamiento o la respuesta.
Como comprobación operativa, revisa el motivo de parada en cada respuesta. Si obtienes stop_reason: "max_tokens", aumenta el límite antes de concluir que la respuesta era correcta pero breve.
El error 400: pensamiento desactivado con xhigh o max
La siguiente combinación falla:
{
"model": "claude-opus-5",
"max_tokens": 8192,
"thinking": {
"type": "disabled"
},
"output_config": {
"effort": "xhigh"
}
}
Opus 5 rechaza por solicitud la combinación de:
thinking: { "type": "disabled" }-
effort: "xhigh"oeffort: "max"
Desactivar el pensamiento limita el esfuerzo a high.
Estas son las combinaciones válidas:
- Pensamiento activado —el valor predeterminado— con cualquiera de los cinco niveles.
- Pensamiento desactivado solo con
low,mediumohigh.
La ruta de migración que suele provocar este 400 es clara:
- Mantienes
thinking: { "type": "disabled" }desde una configuración de Opus 4.8. - Cambias
effortaxhighporque es la recomendación para código o agentes. - La API rechaza la solicitud.
La recomendación de Anthropic es no desactivar el pensamiento en Opus 5. Con el pensamiento desactivado, pueden aparecer llamadas a herramientas como texto plano o filtraciones de etiquetas XML internas en la salida. En flujos agénticos, ese texto puede contaminar los siguientes turnos.
Para reducir costos, baja effort en lugar de desactivar el pensamiento. Consulta la guía de prompting de Opus 5 para más contexto sobre estos artefactos.
Cómo evaluar effort en tus propias pruebas
No elijas un nivel por intuición. Ejecuta una evaluación corta y conserva el resultado junto a la configuración del servicio.
1. Congela un conjunto de tareas reales
Extrae entre 30 y 50 prompts de registros de producción. Incluye los casos difíciles, no solo ejemplos sintéticos o prompts que ya sabes que funcionan.
Las diferencias entre niveles suelen desaparecer en tareas fáciles.
2. Define el criterio de aprobación antes de ejecutar
Usa criterios verificables, por ejemplo:
- la suite de pruebas pasa;
- el JSON valida contra un esquema;
- el campo extraído coincide con la fuente de verdad;
- un revisor humano marca aprobado o fallido.
Evita criterios subjetivos como “la salida parece mejor”.
3. Ejecuta cada prompt con los cinco niveles
Con 40 prompts tendrás 200 ejecuciones:
40 prompts × 5 niveles = 200 solicitudes
Para tareas sin sensibilidad a la latencia, puedes usar la API por lotes y aprovechar el descuento correspondiente.
4. Registra calidad, costo y latencia
Guarda al menos estos tres valores por ejecución:
{
"passed": true,
"output_tokens": 0,
"latency_ms": 0
}
Obtén el costo real desde el bloque usage de la respuesta. usage.output_tokens incluye la señal relevante para comparar el gasto de salida, incluidos los tokens de razonamiento que no puedes inferir solo a partir del texto visible.
También registra:
-
stop_reason; - errores HTTP;
-
cache_read_input_tokens, si usas caché; - versión del prompt y versión del modelo.
5. Selecciona el nivel más barato que cumpla el criterio
No selecciones el nivel con la puntuación máxima si un nivel inferior cumple el objetivo de calidad.
Después, confirma el resultado con un conjunto de validación que no hayas usado para ajustar. De lo contrario, puedes terminar optimizando para los 40 prompts iniciales.
6. Repite la evaluación al cambiar de modelo
La recalibración entre Opus 4.8 y Opus 5 demuestra que una misma etiqueta no garantiza un comportamiento equivalente entre versiones.
Trata la evaluación de effort como parte de tu checklist de migración.
Comparar niveles lado a lado en Apidog
La mecánica consiste en enviar el mismo cuerpo cinco veces y cambiar solo output_config.effort. Puedes hacerlo con scripts, pero una colección de solicitudes facilita revisar respuestas y mantener las comparaciones compartidas con el equipo.
Una configuración práctica en Apidog:
- Crea una solicitud para el endpoint de Mensajes de Anthropic.
- Guarda la clave API en una variable de entorno; no la pegues en el cuerpo ni en una colección compartida.
- Guarda la solicitud base en una colección.
- Duplica la solicitud cinco veces.
- Cambia únicamente
output_config.efforten cada copia. - Inspecciona
usageen cada respuesta. - Revisa
cache_read_input_tokenssi también verificas el comportamiento de caché. - Activa streaming y observa los eventos SSE si necesitas comparar la latencia percibida entre
lowyxhigh. - Añade una aserción para detectar truncamientos.
Una aserción útil es verificar que stop_reason exista y no sea max_tokens:
pm.test("La respuesta no fue truncada por max_tokens", () => {
const body = pm.response.json();
pm.expect(body.stop_reason).to.exist;
pm.expect(body.stop_reason).not.to.eql("max_tokens");
});
Esta comprobación es especialmente importante con xhigh y max: una respuesta truncada puede parecer simplemente corta si no inspeccionas el motivo de parada.
Puedes descargar Apidog para construir esta colección, aunque el procedimiento no depende de una herramienta concreta.
El límite de effort
effort permite ejecutar Opus 5 de forma más eficiente, pero no convierte al modelo en el más capaz de toda la oferta de Claude.
Los números de lanzamiento de Anthropic para Opus 5 indican más del doble de la puntuación de Frontier-Bench v0.1 de Opus 4.8, aproximadamente 3 veces el siguiente mejor modelo en ARC-AGI 3 y una diferencia de menos del 0.5% frente a Fable 5 en CursorBench 3.2 a la mitad del precio. Son cifras publicadas por el proveedor y no habían sido reproducidas independientemente hasta el 25 de julio de 2026.
Trátalas como afirmaciones con fuente, no como mediciones neutrales. Consulta el desglose de benchmarks de Opus 5 para conocer las advertencias de cada resultado.
Por encima de Opus 5, Fable 5 sigue siendo el modelo más capaz de Anthropic ampliamente lanzado, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida.
Opus 5 también sigue por detrás de Mythos 5 en explotación de ciberseguridad e investigación de biología autónoma, según declara Anthropic. Ejecutar Opus 5 con effort: "max" no elimina esas diferencias.
La decisión práctica es evaluar si la combinación de capacidad, latencia y precio cubre tu carga de trabajo. Para esa comparación, consulta Opus 5 vs Fable 5.
Preguntas frecuentes
¿Cuál es el nivel de effort predeterminado en Claude Opus 5?
high. Una solicitud sin output_config usa effort: "high" y pensamiento adaptativo activado.
¿Cuáles son los cinco niveles de effort?
low, medium, high, xhigh y max. Para código y tareas agénticas, Anthropic recomienda empezar con xhigh y ajustar según tus evaluaciones.
¿Por qué mi solicitud devuelve un 400 con effort: "xhigh"?
Probablemente también estás enviando:
{
"thinking": {
"type": "disabled"
}
}
Con el pensamiento desactivado, effort queda limitado a high. Elimina el bloque thinking o baja el esfuerzo a high, medium o low.
¿Puedo reutilizar mi configuración de effort de Opus 4.8 en Opus 5?
No deberías hacerlo sin evaluar. Los niveles fueron recalibrados y la misma etiqueta representa una cantidad diferente de razonamiento. Revisa la guía de migración.
¿Disminuir effort hace que las respuestas sean más cortas?
No necesariamente. effort controla el razonamiento interno, no la longitud visible. Pide explícitamente una respuesta concisa si eso es lo que necesitas.
¿Qué valor de max_tokens debo usar con xhigh o max?
Empieza con 64000. max_tokens limita conjuntamente el razonamiento y la respuesta, así que un límite pensado para modelos sin razonamiento puede truncar la salida. Solo se facturan los tokens generados.
Para consultar la hoja de especificaciones, la matriz de disponibilidad y el contexto de precios, empieza por qué es Claude Opus 5.
Top comments (0)