DEV Community

Cover image for Claude Opus 5 Benchmarks: Qué revelan los números
Roobia
Roobia

Posted on • Originally published at apidog.com

Claude Opus 5 Benchmarks: Qué revelan los números

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 con afirmaciones de rendimiento llamativas: más del doble de Opus 4.8 en una evaluación, aproximadamente tres veces la puntuación del siguiente mejor modelo en otra y una victoria sobre Fable 5 a un tercio del coste en una tercera.

Prueba Apidog hoy

Eso no implica que las afirmaciones sean incorrectas. Significa que debe interpretarlas como cualquier gráfico de lanzamiento de un proveedor: revise qué se midió, contra qué modelo, con qué configuración y qué datos faltan. Esta guía reúne las afirmaciones publicadas de Opus 5, explica qué puede respaldar cada cifra y termina con un plan de evaluación que puede ejecutar en Apidog.

Para conocer el modelo (claude-opus-5, contexto de 1M, salida máxima de 128k y corte de conocimiento de mayo de 2026), consulte qué es Claude Opus 5. La fuente principal de las cifras es la publicación de lanzamiento de Claude Opus 5 de Anthropic.

Todas las afirmaciones publicadas, en una tabla

La columna de comparación es tan importante como el resultado. Varias afirmaciones se presentan como una relación frente a otro modelo, no como una puntuación absoluta.

Benchmark Afirmación de Anthropic Expresado como Comparado con
Frontier-Bench v0.1 Supera a todos los demás modelos; más del doble de la puntuación de Opus 4.8, con un coste por tarea menor Proporción y afirmación de coste Opus 4.8 y el campo
ARC-AGI 3 Aproximadamente 3 veces la puntuación del siguiente mejor modelo Proporción Siguiente mejor modelo sin nombre
OSWorld 2.0 Supera a Fable 5 a un tercio del coste Posición y afirmación de coste Fable 5
CursorBench 3.2 Dentro del 0.5% del pico de Fable 5, a mitad de precio Brecha y afirmación de coste Fable 5
Zapier AutomationBench Tasa de aprobación aproximadamente 1.5 veces la del siguiente mejor modelo Proporción Siguiente mejor modelo sin nombre
Química orgánica +10.2 puntos sobre Opus 4.8 Diferencia absoluta Opus 4.8
Análisis de proteínas +7.7 puntos sobre Opus 4.8 Diferencia absoluta Opus 4.8
Explotación de ciberseguridad Por detrás de Mythos 5 Posición Mythos 5
Investigación biológica autónoma Por detrás de Mythos 5 Posición Mythos 5

Fuente: publicación de lanzamiento y documentación del modelo de Anthropic. Al momento de escribir este artículo, ningún tercero había publicado una reproducción de estos resultados.

Antes de interpretar cada fila, tenga en cuenta dos puntos:

  1. Solo dos de las nueve afirmaciones muestran una mejora absoluta en puntos.
  2. Anthropic incluye dos casos en los que su nuevo modelo insignia pierde.

El problema de las proporciones

Cuatro afirmaciones —Frontier-Bench, ARC-AGI 3, AutomationBench y, en parte, CursorBench— se expresan como proporciones o brechas. Eso limita lo que puede concluir.

Una proporción oculta el denominador

Decir que Opus 5 logra “aproximadamente 3 veces” la puntuación del siguiente mejor modelo en ARC-AGI 3 no indica la puntuación real.

  • Si el siguiente modelo obtiene un 8%, tres veces equivale a un 24%.
  • Si obtiene un 25%, tres veces equivale a un 75%.

Ambos casos pueden describirse como “3 veces”, pero representan avances muy distintos. Anthropic no publicó el valor de referencia.

Duplicar puede implicar un salto absoluto pequeño

“Más del doble de la puntuación de Opus 4.8” en Frontier-Bench v0.1 plantea el mismo problema.

En un benchmark difícil y nuevo donde Opus 4.8 parte de una puntuación de un solo dígito, duplicar puede ser una mejora absoluta relativamente limitada. Si Opus 4.8 ya obtuviera un 40%, duplicar sería extraordinario.

La versión v0.1 también importa: es un benchmark nuevo, sin historial publicado, sin reproducciones comunitarias y sin un punto de saturación conocido.

“El siguiente mejor modelo” no está identificado

Dos afirmaciones comparan Opus 5 con un modelo no especificado. Podría ser Fable 5, Mythos 5 u otro modelo. Sin conocer el competidor, no puede evaluar correctamente el significado de la proporción.

Las brechas necesitan unidades claras

“Dentro del 0.5% del pico de Fable 5” en CursorBench 3.2 deja preguntas abiertas:

  • ¿Es una diferencia de 0.5 puntos porcentuales?
  • ¿Es una diferencia relativa del 0.5%?
  • ¿“Pico” significa una ejecución con la configuración más agresiva?

En benchmarks de programación, el nivel de effort puede cambiar de forma importante el resultado. Consulte el desglose de los benchmarks de Fable 5 para ver cómo se presentaron las cifras de ese modelo.

Las dos afirmaciones científicas son más interpretables porque usan diferencias absolutas:

  • +10.2 puntos en química orgánica.
  • +7.7 puntos en análisis de proteínas.

Aun así, las puntuaciones base no se publicaron.

Las afirmaciones de coste por tarea dependen de la configuración

Anthropic combina capacidad y coste en tres afirmaciones:

  • Menor coste por tarea en Frontier-Bench.
  • Un tercio del coste en OSWorld 2.0.
  • Mitad de precio en CursorBench 3.2.

La comparación de precio de lista sí es verificable:

Modelo Entrada por millón de tokens Salida por millón de tokens
Opus 5 $5 $25
Opus 4.8 $5 $25
Fable 5 $10 $50

Opus 5 cuesta la mitad que Fable 5 en precio de lista. Anthropic publica estas tarifas en su página de precios. Para caché, lotes y modo rápido, consulte el desglose de precios de Opus 5.

Sin embargo, el coste por tarea depende de la ejecución concreta:

  • Nivel de esfuerzo configurado.
  • Uso de pensamiento.
  • Número de turnos del flujo agéntico.
  • Cantidad de subagentes generados.
  • Lecturas y escrituras de caché.
  • Longitud de la salida.

La guía de prompts de Anthropic indica que Opus 5 genera respuestas predeterminadas más largas que Opus 4.8, delega con más facilidad a subagentes y puede ampliar el alcance de una tarea. Cada factor puede aumentar el consumo real de tokens.

La conclusión práctica es simple: el precio de lista es estable, pero el coste por tarea es específico de su configuración. La comparación de Opus 5 vs Fable 5 detalla dónde se paga esa diferencia. Para su caso, debe medirlo.

El techo que Anthropic se impone a sí mismo

La afirmación más útil del lanzamiento no es una victoria: Anthropic indica que Opus 5 sigue por detrás de Mythos 5 en explotación de ciberseguridad e investigación biológica autónoma.

Fable 5 también conserva la designación de “modelo más capaz ampliamente lanzado”.

El resumen técnico es:

Capacidad de clase fronteriza a la mitad del precio fronterizo, con un modelo superior identificado para algunas tareas.

Para investigación de seguridad fronteriza o trabajo científico autónomo, la referencia sigue siendo la clase Mythos. Consulte la explicación del modelo de clase Mythos y Fable 5 vs Mythos 5.

También hay una implicación operativa. Anthropic incorporó fallbacks: "default" detrás del encabezado beta server-side-fallback-2026-07-01. Esta opción recurre automáticamente a Opus 4.8 cuando Opus 5 rechaza una solicitud de categoría cibernética.

La existencia de ese mecanismo indica que debe medir los rechazos por separado, no solo la calidad de las respuestas aceptadas.

Lo que los benchmarks no cubren

Los benchmarks miden finalización de tareas. No miden varios comportamientos que pueden determinar si el modelo funciona en producción.

  • Desviación de comportamiento durante la migración. Opus 5 verifica su propio trabajo sin que se lo pida. Si sus prompts heredados incluyen instrucciones como “revisa tu respuesta”, puede provocar sobreverificación y gasto adicional. La guía de prompts de Anthropic para Opus 5 recomienda eliminar estas instrucciones.
  • Longitud de salida. Las respuestas y entregables predeterminados son más largos que en Opus 4.8. Reducir effort reduce los tokens de pensamiento, no necesariamente la longitud visible. Solicite concisión de forma explícita.
  • Fallos con pensamiento deshabilitado. Con thinking: {type: "disabled"}, las llamadas a herramientas pueden aparecer ocasionalmente como texto sin formato en lugar de ejecutarse. En flujos agénticos, ese texto puede contaminar turnos posteriores. También pueden filtrarse etiquetas XML internas.
  • Recalibración de esfuerzo. Anthropic recalibró los niveles de esfuerzo en Opus 5. No copie directamente la configuración de Opus 4.8: vuelva a evaluar low, medium, high y xhigh. Consulte la guía del parámetro de esfuerzo.
  • Errores 400 de migración. Combinar thinking: {type: "disabled"} con xhigh o max devuelve un error HTTP 400 por solicitud. Es un detalle de integración, no de capacidad. Está cubierto en la guía de migración de Opus 4.8 a Opus 5.

Qué probar usted mismo

Los benchmarks del proveedor son una hipótesis inicial. Para validar Opus 5 en su carga de trabajo, ejecute esta evaluación compacta.

1. Cree un conjunto de tareas reales

Seleccione entre 20 y 50 tareas de su propio historial:

  • Tickets cerrados.
  • Pull requests fusionadas.
  • Incidencias de soporte.
  • Consultas internas.
  • Flujos que hoy resuelve otro modelo.

Use entradas reales. Conservan su formato, ambigüedad y casos extremos.

2. Fije la configuración

Registre la configuración exacta de cada ejecución:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "medium"
  },
  "thinking": {
    "type": "enabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

Anote si el pensamiento está activado, el valor de max_tokens, el nivel de output_config.effort, el conjunto de herramientas y la versión del prompt. Sin una configuración fija, no habrá comparación válida.

3. Calcule el coste por tarea resuelta

No compare solo coste por token. Calcule:

coste por tarea resuelta =
  gasto total de las ejecuciones /
  número de tareas que pasan la verificación de aceptación
Enter fullscreen mode Exit fullscreen mode

Para cada respuesta, registre el bloque usage:

  • Tokens de entrada.
  • Tokens de salida.
  • Lecturas de caché.
  • Escrituras de caché.
  • Coste total.
  • Estado de aceptación de la tarea.

Ese es el indicador que intenta resumir el gráfico de coste por tarea de Anthropic.

4. Ejecute un barrido de esfuerzo

Mantenga el mismo conjunto de tareas y pruebe:

low → medium → high → xhigh
Enter fullscreen mode Exit fullscreen mode

No transfiera directamente la configuración de Opus 4.8. Anthropic indica que low y medium son significativamente más fuertes en Opus 5 que en modelos Opus anteriores.

Para cada nivel, compare:

  • Tasa de tareas resueltas.
  • Coste por tarea resuelta.
  • Latencia.
  • Número de turnos.
  • Tokens de entrada y salida.
  • Errores y rechazos.

Controle especialmente max_tokens en los niveles superiores.

5. Evalúe el bucle agéntico completo

Gran parte de los benchmarks de lanzamiento son agénticos: OSWorld, CursorBench y AutomationBench. Un prompt de turno único no reproduce ese escenario.

Conecte sus herramientas reales y mida:

  • Número de turnos.
  • Llamadas a herramientas emitidas.
  • Llamadas ejecutadas correctamente.
  • Reintentos.
  • Resultado final.
  • Coste acumulado.

6. Compare con su modelo actual

Ejecute el mismo arnés contra el modelo que usa hoy: Opus 4.8, Sonnet 5 u otro. Mantenga iguales los prompts, las herramientas, las condiciones de aceptación y el conjunto de tareas.

Un resultado relativo en sus propios datos es más útil que una puntuación absoluta en datos ajenos.

7. Registre los rechazos por separado

En cargas relacionadas con ciberseguridad, Opus 5 puede rechazar más solicitudes que 4.8. No mezcle estos casos con fallos de calidad o errores de herramientas.

Registre al menos:

tarea_id
modelo
effort
resultado
rechazada
motivo_del_rechazo
fallback_activado
coste_total
Enter fullscreen mode Exit fullscreen mode

Para una metodología similar, consulte el artículo sobre los benchmarks de Sonnet 5 y la guía de la API de Opus 5.

Ejecutando la evaluación en Apidog

La evaluación consiste en solicitudes HTTP autenticadas, cuerpos JSON, respuestas de transmisión y bloques usage que debe inspeccionar en cada ejecución. Apidog puede centralizar ese flujo de trabajo.

Configure la evaluación de esta forma:

  1. Cree una solicitud al endpoint de mensajes de Anthropic.
  2. Guarde la clave de API como variable de entorno; no la pegue en el cuerpo de la solicitud.
  3. Duplique la solicitud para cada nivel de esfuerzo: low, medium, high y xhigh.
  4. Mantenga fijo el prompt, las herramientas y max_tokens.
  5. Active streaming cuando necesite inspeccionar los eventos SSE.
  6. Verifique que las llamadas a herramientas sean estructuradas y no texto descriptivo.
  7. Añada aserciones sobre los campos usage para capturar tokens y caché en cada ejecución.
  8. Guarde las solicitudes en una colección para reutilizarlas en futuras migraciones.

Solicitud base:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Cambie un solo campo por ejecución, mantenga el resto fijo y registre usage cada vez. Descargue Apidog si quiere seguir este patrón con entornos y aserciones.

El resumen honesto

La historia de benchmarks de Opus 5 es sólida según las cifras de Anthropic: el mayor salto sobre su predecesor que la empresa afirma para un lanzamiento de Opus, sin cambio de precio de lista.

Al mismo tiempo:

  • Los resultados los reporta el proveedor.
  • No estaban reproducidos de forma independiente al 25 de julio de 2026.
  • Muchas afirmaciones usan proporciones que no muestran el denominador.
  • El coste por tarea depende de una configuración específica.
  • Anthropic identifica límites frente a Mythos 5 en seguridad y ciencia autónoma.

Use la tabla de este artículo como la hipótesis de Anthropic sobre su modelo. Después, ejecute la evaluación sobre sus tareas, su configuración y sus criterios de aceptación. La diferencia entre un gráfico de lanzamiento y una carga de trabajo de producción es donde realmente se decide una migración de modelo.

La guía fundamental de Opus 5 cubre el resto de los cambios.

Preguntas frecuentes

¿Los benchmarks de Claude Opus 5 están verificados de forma independiente?

No. A partir del 25 de julio de 2026, todos los resultados de benchmark publicados de Opus 5 provienen de Anthropic. Ningún laboratorio de terceros o evaluador independiente había publicado una reproducción. Interprételos como cifras reportadas por el proveedor.

¿Cuál es la afirmación de benchmark más grande de Opus 5?

Frontier-Bench v0.1. Anthropic afirma que Opus 5 supera en más del doble la puntuación de Opus 4.8 con un coste por tarea menor. No publicó las puntuaciones subyacentes, solo la proporción, y Frontier-Bench v0.1 es un benchmark nuevo sin historial establecido.

¿Es Claude Opus 5 el modelo Claude más capaz?

No. Fable 5 conserva la designación de “el modelo más capaz ampliamente lanzado”, y Anthropic afirma que Opus 5 sigue por detrás de Mythos 5 en explotación de ciberseguridad e investigación biológica autónoma. La propuesta de Opus 5 es capacidad de clase fronteriza a la mitad del precio de Fable 5, no la cima de la pila.

¿Cuánto mejor es Opus 5 que Opus 4.8 en tareas científicas?

Anthropic informa +10.2 puntos en química orgánica y +7.7 puntos en análisis de proteínas sobre Opus 4.8. Son las dos afirmaciones expresadas como diferencias absolutas, no como proporciones, aunque las puntuaciones base no se publicaron.

¿Opus 5 supera a Fable 5?

Según los números de Anthropic, supera a Fable 5 en OSWorld 2.0 a un tercio del coste y se sitúa dentro del 0.5% del pico de Fable 5 en CursorBench 3.2 a mitad de precio. Fable 5 conserva la designación de capacidad general. Consulte la comparación completa.

¿Qué debería comparar yo mismo?

El coste por tarea resuelta sobre 20 a 50 tareas reales de su propio historial. Ejecute cada tarea en varios niveles de esfuerzo, con sus herramientas reales conectadas y flujos multiturno habilitados. Compare el resultado con el modelo que usa hoy mediante el mismo arnés.

Top comments (0)