DEV Community

Cover image for Claude Fable 5.1 Benchmarks: Qué Dicen Realmente los Números
Roobia
Roobia

Posted on Originally published at apidog.com

Claude Fable 5.1 Benchmarks: Qué Dicen Realmente los Números

Claude Fable 5.1: todos sus benchmarks, qué significan y cómo evaluarlo

Anthropic lanzó Claude Fable 5.1 el 1 de septiembre de 2026. En su tabla comparativa lo enfrentó a Fable 5, Opus 5 y GPT-5.6 Sol en nueve pruebas. El resultado más difundido fue Terminal-Bench-Science, donde Fable 5.1 obtuvo un 52.6% frente al 24.7% de Fable 5. El menos comentado fue CursorBench: allí la ventaja sobre Opus 5 es de solo 3.4 puntos, en un modelo que cuesta el doble.

Prueba Apidog hoy

Esta guía reúne los números publicados, explica qué mide cada benchmark y separa las diferencias grandes de las pequeñas. También cubre lo que la cobertura del lanzamiento omitió: todos los resultados fueron ejecutados por el proveedor, Mythos 5.1 supera a Fable 5.1 en la única prueba de codificación agentiva publicada para ambos y la única forma fiable de tomar una decisión es ejecutar evaluaciones propias.

La fuente principal es la publicación de lanzamiento de Anthropic. Para conocer el modelo, consulta qué es Claude Fable 5.1.

La tabla completa

Benchmark Qué mide Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Investigación científica agentiva en una terminal 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 Codificación agentiva en una terminal 55.8% 42.0% 52.3% 37.3%
GDPval-AA v2 Trabajo de conocimiento de valor económico (Elo) 1853 1723 1824 1711
OSWorld 2.0 (crédito parcial) Uso de la computadora en tareas de escritorio reales 77.9% 72.9% 75.4% No reportado
OSWorld 2.0 (estricto) Lo mismo, contando solo la finalización completa 41.7% 36.1% 39.6% No reportado
Examen Final de la Humanidad (sin herramientas) Preguntas de razonamiento a nivel experto 60.9% 57.8% 56.6% No reportado
Examen Final de la Humanidad (con herramientas) Lo mismo, con búsqueda y código 65.0% 63.8% 63.6% No reportado
AutomationBench Flujos de trabajo empresariales de extremo a extremo 31.4% 17.1% 26.9% 19.6%
CursorBench 3.2.0 Tareas de codificación estilo IDE 73.4% 70.5% 70.0% 67.2%

Anthropic también publicó un resultado de Mythos 5.1: 60.9% en Terminal-Bench 4.0.

VentureBeat informó además un 82% para Fable 5.1 en Browserbase, frente al 74% de Opus 5 y el 57% de Fable 5, en las tareas de agente de navegador más difíciles. Esta cifra procede de la cobertura de prensa y no de la publicación de lanzamiento.

Las diferencias grandes

Terminal-Bench-Science 0.1: 52.6% frente a 24.7% y 29.0%

Fable 5.1 más que duplica a Fable 5 y casi duplica a Opus 5 en un benchmark que coloca al modelo en una terminal con herramientas científicas para realizar investigaciones de varios pasos.

Es la evidencia más clara de que el enfoque de Anthropic en la «resolución de problemas a largo plazo» produjo una mejora medible. Sin embargo, la versión 0.1 todavía es joven, por lo que las puntuaciones pueden cambiar a medida que madure el conjunto de tareas.

AutomationBench: 31.4% frente a 17.1% y 26.9%

AutomationBench evalúa flujos empresariales de extremo a extremo a través de varias aplicaciones. Los números absolutos son bajos para todos los modelos, pero Fable 5.1 casi duplica a Fable 5 y supera a Opus 5 por 4.5 puntos.

Si tu producto automatiza procesos comerciales entre aplicaciones, esta es una de las filas más relevantes.

Terminal-Bench 4.0: 55.8% frente a 42.0%

Fable 5.1 mejora a Fable 5 en 13.8 puntos en codificación agentiva y supera a Opus 5 por 3.5 puntos. Este fue el número principal de la sección de codificación del lanzamiento.

Opus 5 ya había superado a F/claude-opus-5-benchmarks?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) para ver los números de julio.

GDPval-AA v2: 1853 frente a 1723

Fable 5.1 obtiene una ganancia de 130 Elo sobre Fable 5 en tareas de trabajo de conocimiento. Es el benchmark que Anthropic utiliza para sus afirmaciones sobre documentos, hojas de cálculo y presentaciones.

La ventaja frente a Opus 5 es de 29 Elo: una diferencia real, pero pequeña.

Las diferencias pequeñas

CursorBench 3.2.0: 73.4% frente a 70.5% y 70.0%

CursorBench evalúa tareas de codificación estilo IDE. Fable 5.1 queda aproximadamente tres puntos por encima de Fable 5 y Opus 5.

Es probablemente el benchmark más relevante para la mayor parte de los desarrolladores, y también donde la ventaja es más estrecha. Si tu caso de uso es «ayúdame dentro del editor», la tabla de lanzamiento no justifica por sí sola pagar el doble.

OSWorld 2.0: 77.9% / 41.7% frente a 75.4% / 39.6%

OSWorld mide el uso de la computadora en tareas de escritorio reales. Fable 5.1 supera a Opus 5 por dos puntos en las métricas de crédito parcial y estricta, y a Fable 5 por cinco puntos.

La mejora es consistente, pero no dramática. Presta especial atención a la puntuación estricta: menos de la mitad de las tareas se completaron completamente en cualquiera de los modelos. El uso de la computadora continúa siendo una de las áreas más débiles de la frontera.

Examen Final de la Humanidad: 60.9% / 65.0% frente a 56.6% / 63.6%

Sin herramientas, Fable 5.1 supera a Opus 5 por 4.3 puntos, la mayor de las diferencias pequeñas. Con búsqueda y ejecución de código, la ventaja cae a 1.4 puntos.

La puntuación sin herramientas aproxima mejor el razonamiento puro. La puntuación con herramientas representa mejor el uso cotidiano del modelo.

Fable 5.1 frente a GPT-5.6 Sol

Anthropic publicó cuatro filas con una columna para GPT-5.6 Sol, y Fable 5.1 lidera todas:

  • Terminal-Bench-Science: 30.2 puntos.
  • Terminal-Bench 4.0: 18.5 puntos.
  • AutomationBench: 11.8 puntos.
  • CursorBench: 6.2 puntos.

En GDPval-AA, la comparación es 1853 frente a 1711.

Hay dos advertencias importantes:

  1. Anthropic ejecutó los resultados del modelo competidor.
  2. Cinco de las nueve filas no incluyen una puntuación de GPT-5.6 Sol, sin que Anthropic explique el motivo.

La comparación de GPT-5.6 Sol y Fable 5 cubrió el enfrentamiento anterior. Según los números actuales, Fable 5.1 amplía todas las brechas que Fable 5 ya tenía.

Lo que la cobertura del lanzamiento omitió

Todos los resultados fueron ejecutados por el proveedor

Anthropic ejecutó todos los benchmarks, incluida la columna del competidor. En el momento del lanzamiento, ningún laboratorio independiente había reproducido los resultados.

El historial de Anthropic en benchmarks suele ser consistente, pero las diferencias en CursorBench y OSWorld son lo bastante pequeñas como para que un arnés distinto o una elección diferente de métrica pueda invertir el resultado.

Mythos 5.1 es el techo de capacidad

La tarjeta del sistema y la publicación de lanzamiento describen Fable 5.1 y Mythos 5.1 como «el mismo modelo, pero con diferentes niveles de salvaguardas».

En Terminal-Bench 4.0, Mythos 5.1 obtuvo 60.9%, frente al 55.8% de Fable 5.1. Es una diferencia de cinco puntos en codificación agentiva: el costo medible de las salvaguardas.

Esto también significa que el modelo más capaz ampliamente lanzado por Anthropic tiene un hermano superior, aunque con acceso más restringido. La comparación de Mythos 5.1 y Fable 5.1 explica quién puede utilizarlo.

Anthropic no especificó el nivel de esfuerzo

La documentación de esfuerzo de Anthropic indica que las mejoras de Fable 5.1 son mayores con xhigh y max.

Sin embargo, la publicación no especifica qué nivel produjo cada puntuación ni con qué esfuerzo se ejecutaron los modelos comparados. Como el esfuerzo es uno de los principales factores de calidad, esta omisión dificulta reproducir los resultados.

El rendimiento multilingüe permanece plano

Anthropic afirma que el rendimiento multilingüe está a la par con Fable 5, no por encima. Si tu carga de trabajo no es principalmente en inglés, la tabla de lanzamiento puede exagerar la mejora que experimentarás.

Las métricas de salvaguardas son diferentes

Anthropic informa un 85% menos de falsos positivos en biología en solicitudes benignas y aproximadamente un 60% menos de intervenciones cibernéticas por sesión de Claude Code frente a Fable 5.

Estas cifras se miden con tráfico propio de Anthropic y no son reproducibles externamente. Aun así, para quienes sufren rechazos incorrectos, pueden ser más importantes que cualquier benchmark de capacidad.

Qué probar por tu cuenta

Una tabla de lanzamiento indica dónde investigar. Tus propias evaluaciones deben decidir si migras.

1. Evalúa un agente de largo plazo

Ejecuta una tarea propia de tu producto hasta su finalización con:

  • Fable 5.1 en high.
  • Opus 5 en xhigh.
  • Fable 5 en high.

Esta prueba aproxima Terminal-Bench-Science y AutomationBench. También te dirá si la diferencia de precio de 2x se justifica en tu caso.

2. Repite tus tareas de codificación más difíciles

Selecciona tus diez indicaciones de codificación más exigentes y usa el mismo nivel de esfuerzo en Fable 5.1 y Opus 5.

Si los resultados quedan empatados, tu experiencia reproduce la historia de CursorBench y Opus 5 puede ser la mejor opción.

3. Haz un barrido de esfuerzo

Ejecuta una tarea rutinaria únicamente con Fable 5.1, variando el esfuerzo de low a max.

Anthropic afirma que:

  • medium iguala a Fable 5.
  • low puede competir con Opus 5 en costo por tarea.

Verifica ambas afirmaciones con tus propios datos.

4. Cuenta los rechazos incorrectos

Compara Fable 5 y Fable 5.1 con solicitudes benignas de seguridad o ciencias de la vida.

Así puedes comprobar las afirmaciones de Anthropic sobre una reducción del 60% y el 85% de falsos positivos.

Crea estas cuatro pruebas como solicitudes en Apidog, usando model y effort como variables de entorno. Añade aserciones sobre stop_reason y sobre la presencia de una cadena esperada en cada respuesta. Después, ejecuta la colección por modelo.

El historial de ejecuciones te proporciona una tabla reproducible sin añadir infraestructura. Descarga Apidog para configurarlo y consulta el tutorial de la API para ver las formas de solicitud.

Cómo convertir los benchmarks en una decisión

  • Agentes de largo plazo, investigación y automatización: las brechas son grandes y consistentes. Fable 5.1 es el candidato más fuerte. El desglose de precios muestra cómo las lecturas de caché más baratas reducen la diferencia de costo en estas cargas.
  • Codificación en IDE, preguntas de conocimiento y razonamiento asistido por herramientas: las brechas frente a Opus 5 son de uno a cuatro puntos. Aplica la regla de Anthropic: conserva Opus 5 salvo que Fable 5.1 gane tus evaluaciones con un esfuerzo mayor. Consulta la comparación de Fable 5.1 y Opus 5.
  • Migración desde Fable 5: todas las filas mejoran, pero el precio no baja y la tasa de falsos positivos sí disminuye. La comparación de Fable 5.1 y Fable 5 detalla el costo de migrar.

Preguntas frecuentes

¿Cuál es el mejor resultado de Claude Fable 5.1?

Terminal-Bench-Science 0.1, con un 52.6%. Es más del doble del 24.7% de Fable 5 y supera el 29.0% de Opus 5 y el 22.4% de GPT-5.6 Sol. Todas las cifras fueron ejecutadas por Anthropic.

¿Cómo se compara Fable 5.1 con Opus 5 en codificación?

Obtiene 55.8% frente a 52.3% en Terminal-Bench 4.0 y 73.4% frente a 70.0% en CursorBench 3.2.0. Son ventajas reales, pero estrechas: alrededor de tres puntos.

¿Es Fable 5.1 mejor que GPT-5.6 Sol?

En los cuatro benchmarks donde Anthropic publicó ambos resultados, sí: la ventaja va de 6 a 30 puntos. Anthropic ejecutó las cifras de GPT-5.6 Sol y no incluyó ese modelo en cinco de las nueve filas.

¿Los benchmarks están verificados de forma independiente?

No en el momento del lanzamiento. Todos los resultados fueron ejecutados por Anthropic. Deben tratarse como afirmaciones que necesitas probar con tu propia carga de trabajo.

¿Qué puntuación obtuvo Mythos 5.1?

Anthropic publicó un único resultado: 60.9% en Terminal-Bench 4.0, cinco puntos por encima del 55.8% de Fable 5.1. Ambos se describen como el mismo modelo con diferentes salvaguardas.

¿Qué nivel de esfuerzo produjo estas puntuaciones?

Anthropic no lo especificó. Su documentación indica que las mejoras de Fable 5.1 son mayores con xhigh y max, así que conviene asumir un nivel de esfuerzo alto y esperar puntuaciones inferiores con configuraciones más bajas.

Top comments (0)