Claude Fable 5.1 : tableau des benchmarks et méthode d’évaluation
Anthropic a lancé Claude Fable 5.1 le 1er septembre 2026. Son tableau de référence le compare à Fable 5, Opus 5 et GPT-5.6 Sol sur neuf tests. Le résultat le plus médiatisé est Terminal-Bench-Science, où Fable 5.1 atteint 52,6 %, contre 24,7 % pour Fable 5. Le chiffre plus révélateur pour les développeurs est CursorBench : l’avance sur Opus 5 n’est que de 3,4 points, alors que ce dernier coûte deux fois plus cher.
Essayez Apidog dès aujourd’hui
Ce guide rassemble les chiffres publiés, explique ce que mesure chaque benchmark et distingue les écarts significatifs des gains marginaux. Il couvre aussi les limites du tableau : tous les résultats viennent du fournisseur, Mythos 5.1 dépasse Fable 5.1 sur le seul test de codage agentique commun, et vos propres évaluations restent indispensables.
La source principale est le billet de lancement. Pour le contexte, consultez ce qu’est Claude Fable 5.1.
Le tableau complet
| Benchmark | Ce qu’il mesure | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Recherche scientifique agentique dans un terminal | 52,6 % | 24,7 % | 29,0 % | 22,4 % |
| Terminal-Bench 4.0 | Codage agentique dans un terminal | 55,8 % | 42,0 % | 52,3 % | 37,3 % |
| GDPval-AA v2 | Travail de connaissance à valeur économique, en Elo | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0, crédit partiel | Utilisation d’un ordinateur sur des tâches de bureau réelles | 77,9 % | 72,9 % | 75,4 % | Non rapporté |
| OSWorld 2.0, strict | Achèvement complet de la tâche | 41,7 % | 36,1 % | 39,6 % | Non rapporté |
| Examen Final de l’Humanité, sans outils | Raisonnement de niveau expert | 60,9 % | 57,8 % | 56,6 % | Non rapporté |
| Examen Final de l’Humanité, avec outils | Raisonnement avec recherche et code | 65,0 % | 63,8 % | 63,6 % | Non rapporté |
| AutomationBench | Flux de travail métier de bout en bout | 31,4 % | 17,1 % | 26,9 % | 19,6 % |
| CursorBench 3.2.0 | Tâches de codage de style IDE | 73,4 % | 70,5 % | 70,0 % | 67,2 % |
Anthropic a également publié un score de 60,9 % pour Mythos 5.1 sur Terminal-Bench 4.0.
Selon VentureBeat, Fable 5.1 atteint aussi 82 % sur les tâches d’agent de navigateur les plus difficiles de Browserbase, contre 74 % pour Opus 5 et 57 % pour Fable 5. Ce résultat provient de la couverture médiatique, pas du billet de lancement : il doit donc être interprété avec davantage de prudence.
Les écarts les plus importants
Terminal-Bench-Science 0.1
52,6 % contre 24,7 % pour Fable 5 et 29,0 % pour Opus 5.
Fable 5.1 fait plus que doubler le score de Fable 5 et dépasse largement Opus 5 sur un benchmark qui place le modèle dans un terminal équipé d’outils scientifiques pour effectuer des recherches en plusieurs étapes.
C’est l’indicateur le plus concret de l’amélioration de la résolution de problèmes à long terme revendiquée par Anthropic. Le benchmark est toutefois encore en version 0.1 : son ensemble de tâches est jeune et les scores peuvent évoluer.
AutomationBench
31,4 % contre 17,1 % pour Fable 5 et 26,9 % pour Opus 5.
AutomationBench évalue des flux de travail métier de bout en bout, répartis sur plusieurs applications. Les scores absolus restent faibles pour tous les modèles, mais Fable 5.1 fait presque doubler le résultat de Fable 5 et devance Opus 5 de 4,5 points.
Pour un produit qui automatise des tâches métier multi-applications, c’est probablement la ligne la plus pertinente du tableau.
Terminal-Bench 4.0
55,8 % contre 42,0 % pour Fable 5 et 52,3 % pour Opus 5.
Le gain atteint 13,8 points par rapport à Fable 5 sur le codage agentique. Face à Opus 5, l’avance est plus limitée : 3,5 points.
Opus 5 avait dépassé Fable 5 sur ce benchmark en juillet. Fable 5.1 reprend donc l’avantage, mais avec une marge plus étroite qu’en juin. Consultez le détail des benchmarks d’Opus 5 pour le contexte.
GDPval-AA v2
1853 contre 1723 pour Fable 5 et 1824 pour Opus 5.
Fable 5.1 gagne 130 points Elo sur les tâches de travail de connaissance. Anthropic utilise ce benchmark pour ses revendications concernant les documents, les feuilles de calcul et les présentations.
L’avance sur Opus 5 n’est toutefois que de 29 points : un écart faible comparé aux résultats des tâches agentiques.
Les écarts plus modestes
CursorBench 3.2.0
73,4 % contre 70,5 % pour Fable 5 et 70,0 % pour Opus 5.
CursorBench évalue des tâches de codage de style IDE. Fable 5.1 gagne environ trois points sur les deux modèles.
C’est le benchmark le plus directement pertinent pour de nombreux développeurs, et celui où l’avance est la plus mince. Pour une charge de travail centrée sur l’éditeur, le tableau de lancement ne justifie pas à lui seul un prix deux fois supérieur.
OSWorld 2.0
77,9 % / 41,7 % pour Fable 5.1 contre 75,4 % / 39,6 % pour Opus 5.
Les deux chiffres correspondent respectivement au crédit partiel et au score strict. Fable 5.1 gagne environ deux points sur Opus 5 et cinq points sur Fable 5.
Le gain est réel, mais pas spectaculaire. Le score strict reste inférieur à 50 % pour tous les modèles : l’utilisation d’un ordinateur demeure un point faible de la frontière actuelle.
L’Examen Final de l’Humanité
Sans outils : 60,9 % contre 56,6 % pour Opus 5.
Avec outils : 65,0 % contre 63,6 % pour Opus 5.
Sans outils, Fable 5.1 dispose d’une avance de 4,3 points, la plus importante parmi les petits écarts. Avec la recherche et l’exécution de code, elle tombe à 1,4 point.
Le score sans outils mesure mieux le raisonnement brut. Le score avec outils est plus proche des conditions réelles d’utilisation.
Fable 5.1 face à GPT-5.6 Sol
Anthropic a publié quatre comparaisons avec GPT-5.6 Sol, et Fable 5.1 arrive en tête à chaque fois :
- Terminal-Bench-Science : +30,2 points
- Terminal-Bench 4.0 : +18,5 points
- AutomationBench : +11,8 points
- CursorBench : +6,2 points
- GDPval-AA : 1853 contre 1711
Deux réserves sont importantes :
- Anthropic a exécuté elle-même les tests du modèle concurrent.
- Cinq des neuf lignes du tableau ne comportent aucun score pour GPT-5.6 Sol, sans explication publiée.
Notre comparaison GPT-5.6 Sol vs Fable 5 couvrait la génération précédente. Sur les chiffres publiés ici, Fable 5.1 élargit tous les écarts observés avec Fable 5.
Ce que le lancement ne dit pas
Tous les scores viennent du fournisseur
Anthropic a exécuté tous les tests, y compris ceux de la colonne consacrée aux modèles concurrents. Aucun laboratoire indépendant n’avait reproduit ces résultats au moment du lancement.
L’historique d’Anthropic sur les benchmarks est généralement solide. Cependant, les écarts réduits de CursorBench et d’OSWorld pourraient être inversés par un harnais différent ou une autre méthode de notation.
Mythos 5.1 représente le plafond connu
La fiche système et le billet de lancement décrivent Fable 5.1 et Mythos 5.1 comme « le même modèle mais avec des niveaux de protection différents ».
Anthropic publie :
- Mythos 5.1 : 60,9 % sur Terminal-Bench 4.0
- Fable 5.1 : 55,8 % sur le même test
Les cinq points d’écart représentent le coût des protections sur le codage agentique. Le modèle largement disponible n’est donc pas le modèle le plus capable connu d’Anthropic. La comparaison Mythos 5.1 vs Fable 5.1 détaille les conditions d’accès.
Le niveau d’effort n’est pas documenté
La documentation sur l’effort indique que les gains de Fable 5.1 sont les plus importants à xhigh et max.
Le billet de lancement ne précise toutefois pas le niveau d’effort utilisé pour chaque score, ni celui des modèles comparés. Comme l’effort est un levier majeur de qualité, cette omission complique la reproduction des résultats.
Le multilingue reste stable
Anthropic indique que les performances multilingues sont comparables à celles de Fable 5, et non supérieures. Pour une charge de travail qui n’est pas en anglais, le tableau peut donc surestimer le gain réel.
Les mesures de protection sont différentes des benchmarks de capacité
Anthropic rapporte :
- 85 % de faux positifs en moins en biologie sur des requêtes bénignes ;
- environ 60 % d’interventions cybernétiques en moins par session Claude Code par rapport à Fable 5.
Ces statistiques sont calculées sur le trafic interne d’Anthropic et ne sont pas reproductibles directement en externe. Elles peuvent néanmoins compter davantage qu’un gain de quelques points pour les utilisateurs confrontés régulièrement à des refus.
Ce qu’il faut tester soi-même
Un tableau de lancement indique où regarder. Vos propres évaluations déterminent si vous devez migrer.
1. Tester une tâche agentique de bout en bout
Exécutez une tâche à long terme issue de votre propre produit jusqu’à son achèvement avec :
- Fable 5.1 à
high; - Opus 5 à
xhigh; - Fable 5 à
high.
Cette comparaison reproduit l’esprit de Terminal-Bench-Science et d’AutomationBench. Elle permet de vérifier si le prix deux fois supérieur d’Opus 5 se justifie réellement.
2. Comparer vos invites de codage
Sélectionnez vos dix invites de codage les plus difficiles et exécutez-les avec le même niveau d’effort sur Fable 5.1 et Opus 5.
Si les résultats sont proches, vous retrouverez probablement l’histoire de CursorBench : Fable 5.1 est légèrement devant, mais Opus 5 peut rester le meilleur choix économique.
3. Effectuer un balayage du niveau d’effort
Sur Fable 5.1, exécutez une tâche de routine avec des niveaux allant de low à max.
Anthropic affirme que :
-
mediumcorrespond approximativement à Fable 5 ; -
lowpeut rivaliser avec Opus 5 en coût par tâche ; - les gains les plus importants apparaissent à
xhighetmax.
Mesurez le compromis entre qualité, latence et coût au lieu de reprendre ces affirmations telles quelles.
4. Mesurer les refus
Préparez un ensemble d’invites bénignes liées à la sécurité ou aux sciences de la vie. Comparez le taux de refus de Fable 5 et Fable 5.1.
C’est la meilleure façon de vérifier les revendications de réduction de 60 % et 85 % sur une seule après-midi.
Automatiser les évaluations avec Apidog
Créez les quatre tests sous forme de requêtes dans Apidog :
- définissez
modeleteffortcomme variables d’environnement ; - ajoutez une assertion sur
stop_reason; - ajoutez une assertion vérifiant la présence d’une chaîne attendue dans la réponse ;
- exécutez la collection pour chaque modèle ;
- comparez les résultats dans l’historique des exécutions.
Vous obtenez ainsi un tableau reproductible sans ajouter d’infrastructure. Téléchargez Apidog pour commencer. La procédure pas à pas de l’API présente les formats de requête.
Relier les benchmarks à une décision
- Agents à long terme, recherche et automatisation : les écarts sont importants et cohérents. Fable 5.1 est le choix le plus évident. Les prix de Fable 5.1, notamment les lectures de cache moins coûteuses, réduisent aussi l’écart sur ces charges de travail.
- Codage IDE, questions-réponses et raisonnement avec outils : l’avance sur Opus 5 varie de un à quatre points. Restez sur Opus 5 s’il réussit mieux vos évaluations à effort élevé. Consultez la comparaison Fable 5.1 vs Opus 5.
- Migration depuis Fable 5 : toutes les lignes publiées progressent, le prix reste inchangé et les faux positifs diminuent. La comparaison Fable 5.1 vs Fable 5 détaille le coût de la migration.
FAQ
Quel est le meilleur résultat de benchmark de Claude Fable 5.1 ?
Terminal-Bench-Science 0.1, avec 52,6 %. C’est plus du double du score de Fable 5 (24,7 %) et davantage qu’Opus 5 (29,0 %) ou GPT-5.6 Sol (22,4 %). Tous ces chiffres viennent d’Anthropic.
Comment Fable 5.1 se compare-t-il à Opus 5 en codage ?
Fable 5.1 obtient 55,8 % contre 52,3 % sur Terminal-Bench 4.0 et 73,4 % contre 70,0 % sur CursorBench 3.2.0. L’avantage est réel, mais reste proche de trois points sur les deux tests.
Fable 5.1 est-il meilleur que GPT-5.6 Sol ?
Sur les benchmarks publiés pour les deux modèles, oui : l’avance varie de 6 à 30 points. Anthropic a exécuté les tests de GPT-5.6 Sol elle-même, et cinq des neuf lignes n’ont pas de score concurrent.
Les benchmarks de Fable 5.1 sont-ils vérifiés indépendamment ?
Non, pas au lancement. Tous les chiffres ont été produits par Anthropic. Utilisez-les comme des indications à valider sur votre propre charge de travail.
Quel est le score de Mythos 5.1 ?
Anthropic publie 60,9 % sur Terminal-Bench 4.0, soit cinq points de plus que Fable 5.1. Les deux modèles sont présentés comme le même modèle avec des protections différentes.
Quel niveau d’effort a produit ces scores ?
Anthropic ne l’a pas précisé. Sa documentation indique que les gains de Fable 5.1 sont les plus importants à xhigh et max. Il est donc plus prudent de supposer un effort élevé et d’attendre des scores inférieurs avec des réglages plus bas.





Top comments (0)