DEV Community

Cover image for Parámetro de Esfuerzo de Claude Opus 5: Compensación entre Costo y Capacidad
Roobia
Roobia

Posted on • Originally published at apidog.com

Parámetro de Esfuerzo de Claude Opus 5: Compensación entre Costo y Capacidad

Cada artículo principal sobre el lanzamiento de Claude Opus 5 el 24 de julio de 2026 mencionó la posibilidad de alternar entre costo y capacidad. Lo importante para quienes integran la API es el parámetro de solicitud effort: tiene cinco niveles en Opus 5, su valor predeterminado es high y afecta directamente el razonamiento interno, la latencia y el costo de salida.

Prueba Apidog hoy

Anthropic recalibró estos niveles para Opus 5. Por eso, no conviene copiar una configuración de Opus 4.8 sin evaluarla de nuevo. Además, una combinación concreta de opciones devuelve un error 400: desactivar el pensamiento y usar effort: "xhigh" o effort: "max".

💡 Si quieres comparar los cinco niveles contra un endpoint real, envía la misma solicitud con cada configuración y registra calidad, tokens de salida y latencia.

Qué es realmente el parámetro effort

effort se configura dentro de output_config en una solicitud a la API de Mensajes:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "high"
  },
  "messages": [
    {
      "role": "user",
      "content": "Refactorizar este módulo y explicar las ventajas y desventajas."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Controla cuánto razonamiento interno realiza el modelo antes de responder:

  • Un effort más alto usa más tokens de razonamiento.
  • Más razonamiento implica mayor latencia y mayor costo de salida.
  • Un effort más bajo reduce esos tres factores.

Opus 5 activa el pensamiento adaptativo de forma predeterminada. Si no incluyes output_config, la solicitud se ejecuta con effort: "high".

Las interfaces visuales pueden presentar esto como un selector de costo-capacidad, pero en la API el control real es este campo. Consulta la guía detallada de la API de Opus 5 y la descripción general de modelos de Anthropic para la estructura completa de la solicitud.

effort no controla la longitud visible

No uses effort para pedir respuestas más cortas. Según la guía de prompting de Anthropic para Opus 5, bajar el esfuerzo reduce el razonamiento, no necesariamente la longitud del texto generado.

Si necesitas concisión, indícalo en el prompt:

Responde en un máximo de 5 viñetas. No incluyas razonamiento paso a paso.
Enter fullscreen mode Exit fullscreen mode

Los cinco niveles

Nivel Qué hace Uso típico
low Razonamiento mínimo antes de responder Clasificación de alto volumen, extracción, enrutamiento y resúmenes cortos
medium Razonamiento moderado Preguntas sobre contexto recuperado, ediciones de un solo archivo y transformaciones estructuradas
high Valor predeterminado. Razonamiento sustancial Trabajo general cuando todavía no tienes mediciones
xhigh Razonamiento extendido Codificación y bucles agénticos; es el punto de partida recomendado por Anthropic
max Presupuesto máximo de razonamiento Problemas difíciles de un solo intento, donde un error cuesta más que los tokens

Dos detalles son especialmente importantes:

  1. El valor predeterminado es high. Una solicitud sin output_config ya consume razonamiento adaptativo. Esto afecta la previsión de costos si migras desde Opus 4.8.
  2. Para código y agentes, empieza con xhigh, no con max. Anthropic recomienda xhigh como punto de partida. Usa max solo si tus evaluaciones demuestran una mejora que justifique el costo adicional.

El cambio de comportamiento predeterminado es uno de los puntos clave de la migración de Opus 4.8 a Opus 5.

Qué cambió con la recalibración

Anthropic recalibró el significado de cada nivel en Opus 5. Por ejemplo, medium en Opus 5 no representa la misma cantidad de razonamiento que medium en Opus 4.8.

La consecuencia práctica: vuelve a medir tus cargas de trabajo. No portes configuraciones por nombre.

En modelos Opus anteriores, low y medium podían ser demasiado débiles para muchas tareas serias. En Opus 5, los niveles bajos son más utilizables para producción, especialmente en tareas donde el razonamiento profundo no mejora la precisión:

  • clasificación;
  • extracción de campos;
  • enrutamiento;
  • transformaciones con salida estructurada;
  • resúmenes breves.

Opus 5 cuesta $5 por millón de tokens de entrada y $25 por millón de tokens de salida, igual que Opus 4.8. Los tokens de razonamiento se cobran en la parte de salida. Por tanto, bajar de high a low en un pipeline de clasificación puede reducir una parte relevante del gasto sin degradar una tarea que no necesita razonamiento adicional.

Consulta el desglose de precios de Opus 5 para ver la tarifa completa, el descuento por lote del 50% y el mínimo de caché de 512 tokens.

Si buscas optimizar varios servicios de Claude, estas prácticas también se combinan con las recomendaciones para reducir tu factura de la API de Claude.

Cómo interactúan xhigh y max con max_tokens

max_tokens limita la suma de:

  • tokens de razonamiento;
  • tokens de respuesta visible.

No es un límite exclusivo para el texto final.

Al aumentar effort, el modelo puede dedicar más parte del presupuesto a razonar antes de escribir. Si usas xhigh o max con un valor de max_tokens pensado para un modelo sin razonamiento adaptativo, la respuesta puede truncarse antes de completarse.

Para xhigh o max, Anthropic recomienda comenzar con max_tokens: 64000:

{
  "model": "claude-opus-5",
  "max_tokens": 64000,
  "output_config": {
    "effort": "xhigh"
  },
  "messages": [
    {
      "role": "user",
      "content": "Corregir la prueba de integración fallida y explicar la causa raíz."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Un límite alto no es una compra anticipada. Solo se facturan los tokens producidos. Establecer 64000 simplemente evita que el modelo se quede sin espacio durante el razonamiento o la respuesta.

Como comprobación operativa, revisa el motivo de parada en cada respuesta. Si obtienes stop_reason: "max_tokens", aumenta el límite antes de concluir que la respuesta era correcta pero breve.

El error 400: pensamiento desactivado con xhigh o max

La siguiente combinación falla:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "thinking": {
    "type": "disabled"
  },
  "output_config": {
    "effort": "xhigh"
  }
}
Enter fullscreen mode Exit fullscreen mode

Opus 5 rechaza por solicitud la combinación de:

  • thinking: { "type": "disabled" }
  • effort: "xhigh" o effort: "max"

Desactivar el pensamiento limita el esfuerzo a high.

Estas son las combinaciones válidas:

  • Pensamiento activado —el valor predeterminado— con cualquiera de los cinco niveles.
  • Pensamiento desactivado solo con low, medium o high.

La ruta de migración que suele provocar este 400 es clara:

  1. Mantienes thinking: { "type": "disabled" } desde una configuración de Opus 4.8.
  2. Cambias effort a xhigh porque es la recomendación para código o agentes.
  3. La API rechaza la solicitud.

La recomendación de Anthropic es no desactivar el pensamiento en Opus 5. Con el pensamiento desactivado, pueden aparecer llamadas a herramientas como texto plano o filtraciones de etiquetas XML internas en la salida. En flujos agénticos, ese texto puede contaminar los siguientes turnos.

Para reducir costos, baja effort en lugar de desactivar el pensamiento. Consulta la guía de prompting de Opus 5 para más contexto sobre estos artefactos.

Cómo evaluar effort en tus propias pruebas

No elijas un nivel por intuición. Ejecuta una evaluación corta y conserva el resultado junto a la configuración del servicio.

1. Congela un conjunto de tareas reales

Extrae entre 30 y 50 prompts de registros de producción. Incluye los casos difíciles, no solo ejemplos sintéticos o prompts que ya sabes que funcionan.

Las diferencias entre niveles suelen desaparecer en tareas fáciles.

2. Define el criterio de aprobación antes de ejecutar

Usa criterios verificables, por ejemplo:

  • la suite de pruebas pasa;
  • el JSON valida contra un esquema;
  • el campo extraído coincide con la fuente de verdad;
  • un revisor humano marca aprobado o fallido.

Evita criterios subjetivos como “la salida parece mejor”.

3. Ejecuta cada prompt con los cinco niveles

Con 40 prompts tendrás 200 ejecuciones:

40 prompts × 5 niveles = 200 solicitudes
Enter fullscreen mode Exit fullscreen mode

Para tareas sin sensibilidad a la latencia, puedes usar la API por lotes y aprovechar el descuento correspondiente.

4. Registra calidad, costo y latencia

Guarda al menos estos tres valores por ejecución:

{
  "passed": true,
  "output_tokens": 0,
  "latency_ms": 0
}
Enter fullscreen mode Exit fullscreen mode

Obtén el costo real desde el bloque usage de la respuesta. usage.output_tokens incluye la señal relevante para comparar el gasto de salida, incluidos los tokens de razonamiento que no puedes inferir solo a partir del texto visible.

También registra:

  • stop_reason;
  • errores HTTP;
  • cache_read_input_tokens, si usas caché;
  • versión del prompt y versión del modelo.

5. Selecciona el nivel más barato que cumpla el criterio

No selecciones el nivel con la puntuación máxima si un nivel inferior cumple el objetivo de calidad.

Después, confirma el resultado con un conjunto de validación que no hayas usado para ajustar. De lo contrario, puedes terminar optimizando para los 40 prompts iniciales.

6. Repite la evaluación al cambiar de modelo

La recalibración entre Opus 4.8 y Opus 5 demuestra que una misma etiqueta no garantiza un comportamiento equivalente entre versiones.

Trata la evaluación de effort como parte de tu checklist de migración.

Comparar niveles lado a lado en Apidog

La mecánica consiste en enviar el mismo cuerpo cinco veces y cambiar solo output_config.effort. Puedes hacerlo con scripts, pero una colección de solicitudes facilita revisar respuestas y mantener las comparaciones compartidas con el equipo.

Una configuración práctica en Apidog:

  1. Crea una solicitud para el endpoint de Mensajes de Anthropic.
  2. Guarda la clave API en una variable de entorno; no la pegues en el cuerpo ni en una colección compartida.
  3. Guarda la solicitud base en una colección.
  4. Duplica la solicitud cinco veces.
  5. Cambia únicamente output_config.effort en cada copia.
  6. Inspecciona usage en cada respuesta.
  7. Revisa cache_read_input_tokens si también verificas el comportamiento de caché.
  8. Activa streaming y observa los eventos SSE si necesitas comparar la latencia percibida entre low y xhigh.
  9. Añade una aserción para detectar truncamientos.

Una aserción útil es verificar que stop_reason exista y no sea max_tokens:

pm.test("La respuesta no fue truncada por max_tokens", () => {
  const body = pm.response.json();

  pm.expect(body.stop_reason).to.exist;
  pm.expect(body.stop_reason).not.to.eql("max_tokens");
});
Enter fullscreen mode Exit fullscreen mode

Esta comprobación es especialmente importante con xhigh y max: una respuesta truncada puede parecer simplemente corta si no inspeccionas el motivo de parada.

Puedes descargar Apidog para construir esta colección, aunque el procedimiento no depende de una herramienta concreta.

El límite de effort

effort permite ejecutar Opus 5 de forma más eficiente, pero no convierte al modelo en el más capaz de toda la oferta de Claude.

Los números de lanzamiento de Anthropic para Opus 5 indican más del doble de la puntuación de Frontier-Bench v0.1 de Opus 4.8, aproximadamente 3 veces el siguiente mejor modelo en ARC-AGI 3 y una diferencia de menos del 0.5% frente a Fable 5 en CursorBench 3.2 a la mitad del precio. Son cifras publicadas por el proveedor y no habían sido reproducidas independientemente hasta el 25 de julio de 2026.

Trátalas como afirmaciones con fuente, no como mediciones neutrales. Consulta el desglose de benchmarks de Opus 5 para conocer las advertencias de cada resultado.

Por encima de Opus 5, Fable 5 sigue siendo el modelo más capaz de Anthropic ampliamente lanzado, a $10 por millón de tokens de entrada y $50 por millón de tokens de salida.

Opus 5 también sigue por detrás de Mythos 5 en explotación de ciberseguridad e investigación de biología autónoma, según declara Anthropic. Ejecutar Opus 5 con effort: "max" no elimina esas diferencias.

La decisión práctica es evaluar si la combinación de capacidad, latencia y precio cubre tu carga de trabajo. Para esa comparación, consulta Opus 5 vs Fable 5.

Preguntas frecuentes

¿Cuál es el nivel de effort predeterminado en Claude Opus 5?

high. Una solicitud sin output_config usa effort: "high" y pensamiento adaptativo activado.

¿Cuáles son los cinco niveles de effort?

low, medium, high, xhigh y max. Para código y tareas agénticas, Anthropic recomienda empezar con xhigh y ajustar según tus evaluaciones.

¿Por qué mi solicitud devuelve un 400 con effort: "xhigh"?

Probablemente también estás enviando:

{
  "thinking": {
    "type": "disabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

Con el pensamiento desactivado, effort queda limitado a high. Elimina el bloque thinking o baja el esfuerzo a high, medium o low.

¿Puedo reutilizar mi configuración de effort de Opus 4.8 en Opus 5?

No deberías hacerlo sin evaluar. Los niveles fueron recalibrados y la misma etiqueta representa una cantidad diferente de razonamiento. Revisa la guía de migración.

¿Disminuir effort hace que las respuestas sean más cortas?

No necesariamente. effort controla el razonamiento interno, no la longitud visible. Pide explícitamente una respuesta concisa si eso es lo que necesitas.

¿Qué valor de max_tokens debo usar con xhigh o max?

Empieza con 64000. max_tokens limita conjuntamente el razonamiento y la respuesta, así que un límite pensado para modelos sin razonamiento puede truncar la salida. Solo se facturan los tokens generados.

Para consultar la hoja de especificaciones, la matriz de disponibilidad y el contexto de precios, empieza por qué es Claude Opus 5.

Top comments (0)