DEV Community

Cover image for Claude Fable 5.1 Benchmarks : Analyse des chiffres réels
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

Claude Fable 5.1 Benchmarks : Analyse des chiffres réels

Claude Fable 5.1 : tableau des benchmarks et méthode d’évaluation

Anthropic a lancé Claude Fable 5.1 le 1er septembre 2026. Son tableau de référence le compare à Fable 5, Opus 5 et GPT-5.6 Sol sur neuf tests. Le résultat le plus médiatisé est Terminal-Bench-Science, où Fable 5.1 atteint 52,6 %, contre 24,7 % pour Fable 5. Le chiffre plus révélateur pour les développeurs est CursorBench : l’avance sur Opus 5 n’est que de 3,4 points, alors que ce dernier coûte deux fois plus cher.

Essayez Apidog dès aujourd’hui

Ce guide rassemble les chiffres publiés, explique ce que mesure chaque benchmark et distingue les écarts significatifs des gains marginaux. Il couvre aussi les limites du tableau : tous les résultats viennent du fournisseur, Mythos 5.1 dépasse Fable 5.1 sur le seul test de codage agentique commun, et vos propres évaluations restent indispensables.

La source principale est le billet de lancement. Pour le contexte, consultez ce qu’est Claude Fable 5.1.

Le tableau complet

Benchmark Ce qu’il mesure Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 Recherche scientifique agentique dans un terminal 52,6 % 24,7 % 29,0 % 22,4 %
Terminal-Bench 4.0 Codage agentique dans un terminal 55,8 % 42,0 % 52,3 % 37,3 %
GDPval-AA v2 Travail de connaissance à valeur économique, en Elo 1853 1723 1824 1711
OSWorld 2.0, crédit partiel Utilisation d’un ordinateur sur des tâches de bureau réelles 77,9 % 72,9 % 75,4 % Non rapporté
OSWorld 2.0, strict Achèvement complet de la tâche 41,7 % 36,1 % 39,6 % Non rapporté
Examen Final de l’Humanité, sans outils Raisonnement de niveau expert 60,9 % 57,8 % 56,6 % Non rapporté
Examen Final de l’Humanité, avec outils Raisonnement avec recherche et code 65,0 % 63,8 % 63,6 % Non rapporté
AutomationBench Flux de travail métier de bout en bout 31,4 % 17,1 % 26,9 % 19,6 %
CursorBench 3.2.0 Tâches de codage de style IDE 73,4 % 70,5 % 70,0 % 67,2 %

Anthropic a également publié un score de 60,9 % pour Mythos 5.1 sur Terminal-Bench 4.0.

Selon VentureBeat, Fable 5.1 atteint aussi 82 % sur les tâches d’agent de navigateur les plus difficiles de Browserbase, contre 74 % pour Opus 5 et 57 % pour Fable 5. Ce résultat provient de la couverture médiatique, pas du billet de lancement : il doit donc être interprété avec davantage de prudence.

Les écarts les plus importants

Terminal-Bench-Science 0.1

52,6 % contre 24,7 % pour Fable 5 et 29,0 % pour Opus 5.

Fable 5.1 fait plus que doubler le score de Fable 5 et dépasse largement Opus 5 sur un benchmark qui place le modèle dans un terminal équipé d’outils scientifiques pour effectuer des recherches en plusieurs étapes.

C’est l’indicateur le plus concret de l’amélioration de la résolution de problèmes à long terme revendiquée par Anthropic. Le benchmark est toutefois encore en version 0.1 : son ensemble de tâches est jeune et les scores peuvent évoluer.

Résultats Terminal-Bench-Science

AutomationBench

31,4 % contre 17,1 % pour Fable 5 et 26,9 % pour Opus 5.

AutomationBench évalue des flux de travail métier de bout en bout, répartis sur plusieurs applications. Les scores absolus restent faibles pour tous les modèles, mais Fable 5.1 fait presque doubler le résultat de Fable 5 et devance Opus 5 de 4,5 points.

Pour un produit qui automatise des tâches métier multi-applications, c’est probablement la ligne la plus pertinente du tableau.

Terminal-Bench 4.0

55,8 % contre 42,0 % pour Fable 5 et 52,3 % pour Opus 5.

Le gain atteint 13,8 points par rapport à Fable 5 sur le codage agentique. Face à Opus 5, l’avance est plus limitée : 3,5 points.

Opus 5 avait dépassé Fable 5 sur ce benchmark en juillet. Fable 5.1 reprend donc l’avantage, mais avec une marge plus étroite qu’en juin. Consultez le détail des benchmarks d’Opus 5 pour le contexte.

Résultats Terminal-Bench

GDPval-AA v2

1853 contre 1723 pour Fable 5 et 1824 pour Opus 5.

Fable 5.1 gagne 130 points Elo sur les tâches de travail de connaissance. Anthropic utilise ce benchmark pour ses revendications concernant les documents, les feuilles de calcul et les présentations.

L’avance sur Opus 5 n’est toutefois que de 29 points : un écart faible comparé aux résultats des tâches agentiques.

Les écarts plus modestes

CursorBench 3.2.0

73,4 % contre 70,5 % pour Fable 5 et 70,0 % pour Opus 5.

CursorBench évalue des tâches de codage de style IDE. Fable 5.1 gagne environ trois points sur les deux modèles.

C’est le benchmark le plus directement pertinent pour de nombreux développeurs, et celui où l’avance est la plus mince. Pour une charge de travail centrée sur l’éditeur, le tableau de lancement ne justifie pas à lui seul un prix deux fois supérieur.

Résultats CursorBench

OSWorld 2.0

77,9 % / 41,7 % pour Fable 5.1 contre 75,4 % / 39,6 % pour Opus 5.

Les deux chiffres correspondent respectivement au crédit partiel et au score strict. Fable 5.1 gagne environ deux points sur Opus 5 et cinq points sur Fable 5.

Le gain est réel, mais pas spectaculaire. Le score strict reste inférieur à 50 % pour tous les modèles : l’utilisation d’un ordinateur demeure un point faible de la frontière actuelle.

L’Examen Final de l’Humanité

Sans outils : 60,9 % contre 56,6 % pour Opus 5.

Avec outils : 65,0 % contre 63,6 % pour Opus 5.

Sans outils, Fable 5.1 dispose d’une avance de 4,3 points, la plus importante parmi les petits écarts. Avec la recherche et l’exécution de code, elle tombe à 1,4 point.

Le score sans outils mesure mieux le raisonnement brut. Le score avec outils est plus proche des conditions réelles d’utilisation.

Résultats de l’Examen Final de l’Humanité

Fable 5.1 face à GPT-5.6 Sol

Anthropic a publié quatre comparaisons avec GPT-5.6 Sol, et Fable 5.1 arrive en tête à chaque fois :

  • Terminal-Bench-Science : +30,2 points
  • Terminal-Bench 4.0 : +18,5 points
  • AutomationBench : +11,8 points
  • CursorBench : +6,2 points
  • GDPval-AA : 1853 contre 1711

Deux réserves sont importantes :

  1. Anthropic a exécuté elle-même les tests du modèle concurrent.
  2. Cinq des neuf lignes du tableau ne comportent aucun score pour GPT-5.6 Sol, sans explication publiée.

Notre comparaison GPT-5.6 Sol vs Fable 5 couvrait la génération précédente. Sur les chiffres publiés ici, Fable 5.1 élargit tous les écarts observés avec Fable 5.

Ce que le lancement ne dit pas

Tous les scores viennent du fournisseur

Anthropic a exécuté tous les tests, y compris ceux de la colonne consacrée aux modèles concurrents. Aucun laboratoire indépendant n’avait reproduit ces résultats au moment du lancement.

L’historique d’Anthropic sur les benchmarks est généralement solide. Cependant, les écarts réduits de CursorBench et d’OSWorld pourraient être inversés par un harnais différent ou une autre méthode de notation.

Mythos 5.1 représente le plafond connu

La fiche système et le billet de lancement décrivent Fable 5.1 et Mythos 5.1 comme « le même modèle mais avec des niveaux de protection différents ».

Anthropic publie :

  • Mythos 5.1 : 60,9 % sur Terminal-Bench 4.0
  • Fable 5.1 : 55,8 % sur le même test

Les cinq points d’écart représentent le coût des protections sur le codage agentique. Le modèle largement disponible n’est donc pas le modèle le plus capable connu d’Anthropic. La comparaison Mythos 5.1 vs Fable 5.1 détaille les conditions d’accès.

Le niveau d’effort n’est pas documenté

La documentation sur l’effort indique que les gains de Fable 5.1 sont les plus importants à xhigh et max.

Le billet de lancement ne précise toutefois pas le niveau d’effort utilisé pour chaque score, ni celui des modèles comparés. Comme l’effort est un levier majeur de qualité, cette omission complique la reproduction des résultats.

Le multilingue reste stable

Anthropic indique que les performances multilingues sont comparables à celles de Fable 5, et non supérieures. Pour une charge de travail qui n’est pas en anglais, le tableau peut donc surestimer le gain réel.

Les mesures de protection sont différentes des benchmarks de capacité

Anthropic rapporte :

  • 85 % de faux positifs en moins en biologie sur des requêtes bénignes ;
  • environ 60 % d’interventions cybernétiques en moins par session Claude Code par rapport à Fable 5.

Ces statistiques sont calculées sur le trafic interne d’Anthropic et ne sont pas reproductibles directement en externe. Elles peuvent néanmoins compter davantage qu’un gain de quelques points pour les utilisateurs confrontés régulièrement à des refus.

Ce qu’il faut tester soi-même

Un tableau de lancement indique où regarder. Vos propres évaluations déterminent si vous devez migrer.

1. Tester une tâche agentique de bout en bout

Exécutez une tâche à long terme issue de votre propre produit jusqu’à son achèvement avec :

  • Fable 5.1 à high ;
  • Opus 5 à xhigh ;
  • Fable 5 à high.

Cette comparaison reproduit l’esprit de Terminal-Bench-Science et d’AutomationBench. Elle permet de vérifier si le prix deux fois supérieur d’Opus 5 se justifie réellement.

2. Comparer vos invites de codage

Sélectionnez vos dix invites de codage les plus difficiles et exécutez-les avec le même niveau d’effort sur Fable 5.1 et Opus 5.

Si les résultats sont proches, vous retrouverez probablement l’histoire de CursorBench : Fable 5.1 est légèrement devant, mais Opus 5 peut rester le meilleur choix économique.

3. Effectuer un balayage du niveau d’effort

Sur Fable 5.1, exécutez une tâche de routine avec des niveaux allant de low à max.

Anthropic affirme que :

  • medium correspond approximativement à Fable 5 ;
  • low peut rivaliser avec Opus 5 en coût par tâche ;
  • les gains les plus importants apparaissent à xhigh et max.

Mesurez le compromis entre qualité, latence et coût au lieu de reprendre ces affirmations telles quelles.

4. Mesurer les refus

Préparez un ensemble d’invites bénignes liées à la sécurité ou aux sciences de la vie. Comparez le taux de refus de Fable 5 et Fable 5.1.

C’est la meilleure façon de vérifier les revendications de réduction de 60 % et 85 % sur une seule après-midi.

Automatiser les évaluations avec Apidog

Créez les quatre tests sous forme de requêtes dans Apidog :

  1. définissez model et effort comme variables d’environnement ;
  2. ajoutez une assertion sur stop_reason ;
  3. ajoutez une assertion vérifiant la présence d’une chaîne attendue dans la réponse ;
  4. exécutez la collection pour chaque modèle ;
  5. comparez les résultats dans l’historique des exécutions.

Vous obtenez ainsi un tableau reproductible sans ajouter d’infrastructure. Téléchargez Apidog pour commencer. La procédure pas à pas de l’API présente les formats de requête.

Évaluation des modèles dans Apidog

Relier les benchmarks à une décision

  • Agents à long terme, recherche et automatisation : les écarts sont importants et cohérents. Fable 5.1 est le choix le plus évident. Les prix de Fable 5.1, notamment les lectures de cache moins coûteuses, réduisent aussi l’écart sur ces charges de travail.
  • Codage IDE, questions-réponses et raisonnement avec outils : l’avance sur Opus 5 varie de un à quatre points. Restez sur Opus 5 s’il réussit mieux vos évaluations à effort élevé. Consultez la comparaison Fable 5.1 vs Opus 5.
  • Migration depuis Fable 5 : toutes les lignes publiées progressent, le prix reste inchangé et les faux positifs diminuent. La comparaison Fable 5.1 vs Fable 5 détaille le coût de la migration.

FAQ

Quel est le meilleur résultat de benchmark de Claude Fable 5.1 ?

Terminal-Bench-Science 0.1, avec 52,6 %. C’est plus du double du score de Fable 5 (24,7 %) et davantage qu’Opus 5 (29,0 %) ou GPT-5.6 Sol (22,4 %). Tous ces chiffres viennent d’Anthropic.

Comment Fable 5.1 se compare-t-il à Opus 5 en codage ?

Fable 5.1 obtient 55,8 % contre 52,3 % sur Terminal-Bench 4.0 et 73,4 % contre 70,0 % sur CursorBench 3.2.0. L’avantage est réel, mais reste proche de trois points sur les deux tests.

Fable 5.1 est-il meilleur que GPT-5.6 Sol ?

Sur les benchmarks publiés pour les deux modèles, oui : l’avance varie de 6 à 30 points. Anthropic a exécuté les tests de GPT-5.6 Sol elle-même, et cinq des neuf lignes n’ont pas de score concurrent.

Les benchmarks de Fable 5.1 sont-ils vérifiés indépendamment ?

Non, pas au lancement. Tous les chiffres ont été produits par Anthropic. Utilisez-les comme des indications à valider sur votre propre charge de travail.

Quel est le score de Mythos 5.1 ?

Anthropic publie 60,9 % sur Terminal-Bench 4.0, soit cinq points de plus que Fable 5.1. Les deux modèles sont présentés comme le même modèle avec des protections différentes.

Quel niveau d’effort a produit ces scores ?

Anthropic ne l’a pas précisé. Sa documentation indique que les gains de Fable 5.1 sont les plus importants à xhigh et max. Il est donc plus prudent de supposer un effort élevé et d’attendre des scores inférieurs avec des réglages plus bas.

Top comments (0)