Anthropic a lancé Claude Opus 5 le 24 juillet 2026 avec une série d’affirmations de benchmark très ambitieuses : plus du double d’Opus 4.8 sur une évaluation, environ trois fois le score du modèle suivant sur une autre, et de meilleures performances que Fable 5 à un tiers du coût sur une troisième. Ces chiffres ne sont pas nécessairement faux, mais ils doivent être lus comme tout benchmark publié par un fournisseur : en vérifiant précisément ce qui est mesuré, comparé et omis.
Essayez Apidog dès aujourd’hui
Pour le modèle lui-même — claude-opus-5, contexte de 1M, sortie maximale de 128k et date de coupure des connaissances en mai 2026 — commencez par ce qu’est Claude Opus 5. La source principale de cet article est l’annonce de lancement de Claude Opus 5 d’Anthropic.
Chaque affirmation publiée, dans un tableau
Voici l’ensemble des déclarations de benchmark publiées par Anthropic lors du lancement. La colonne de comparaison est essentielle : plusieurs résultats sont exprimés comme des ratios plutôt que comme des scores absolus.
| Benchmark | Affirmation d’Anthropic | Exprimé comme | Comparé à |
|---|---|---|---|
| Frontier-Bench v0.1 | Dépasse tous les autres modèles ; plus du double du score d’Opus 4.8, à un coût par tâche inférieur | Ratio + coût | Opus 4.8 et le domaine |
| ARC-AGI 3 | Environ 3 fois le score du modèle le mieux classé suivant | Ratio | Modèle suivant non nommé |
| OSWorld 2.0 | Dépasse Fable 5 à un tiers du coût | Position + coût | Fable 5 |
| CursorBench 3.2 | À moins de 0,5 % du pic de Fable 5, à moitié prix | Écart + coût | Fable 5 |
| Zapier AutomationBench | Taux de réussite environ 1,5 fois celui du modèle le mieux classé suivant | Ratio | Modèle suivant non nommé |
| Chimie organique | +10,2 points par rapport à Opus 4.8 | Delta absolu | Opus 4.8 |
| Analyse de protéines | +7,7 points par rapport à Opus 4.8 | Delta absolu | Opus 4.8 |
| Exploitation en cybersécurité | Derrière Mythos 5 | Position | Mythos 5 |
| Recherche en biologie autonome | Derrière Mythos 5 | Position | Mythos 5 |
Source : annonce de lancement et documentation du modèle d’Anthropic. Au moment de la rédaction, aucune tierce partie n’a publié de reproduction de ces résultats.
Deux constats ressortent immédiatement :
- Seulement deux lignes donnent un delta absolu en points.
- Anthropic inclut aussi les deux domaines où son nouveau modèle reste derrière un concurrent.
Pourquoi les ratios ne suffisent pas
Quatre affirmations — Frontier-Bench, ARC-AGI 3, AutomationBench et, dans une moindre mesure, CursorBench — sont formulées comme des ratios ou des écarts. C’est une limite importante.
Un ratio masque le dénominateur
« Environ 3 fois le score du modèle le mieux classé suivant » sur ARC-AGI 3 peut couvrir des réalités très différentes :
- Si le suivant obtient
8 %, un score 3× représente24 %. - Si le suivant obtient
25 %, un score 3× représente75 %.
Les deux formulations sont techniquement compatibles avec « 3× », mais la signification pratique n’est pas la même. Anthropic ne publie pas le score de référence.
Doubler un faible score est plus simple
La formulation « plus du double du score d’Opus 4.8 » sur Frontier-Bench v0.1 pose le même problème.
Si Opus 4.8 obtenait un score à un chiffre, le gain absolu peut rester limité malgré un ratio impressionnant. À l’inverse, doubler un score déjà proche de 40 % serait un saut majeur.
Le fait que Frontier-Bench soit en version v0.1 compte aussi : le benchmark n’a pas encore d’historique public, de saturation connue ou de reproductions communautaires.
Le concurrent n’est pas toujours nommé
Deux affirmations comparent Opus 5 au « modèle le mieux classé suivant » sans préciser son identité. Cela peut être Fable 5, Mythos 5 ou un modèle d’un autre laboratoire.
Sans connaître le modèle de référence, le ratio est difficile à interpréter.
Les écarts ont besoin d’unités
Sur CursorBench 3.2, Anthropic indique qu’Opus 5 est « à moins de 0,5 % du pic de Fable 5 ».
Cela ne précise pas s’il s’agit :
- de
0,5 point de pourcentage; - d’un écart relatif de
0,5 %; - d’une comparaison avec une exécution configurée au maximum plutôt qu’avec les paramètres par défaut.
Le mot « pic » suggère une configuration optimisée. Sur un benchmark de code, un niveau d’effort maximal peut changer fortement le coût, la latence et le résultat. Consultez notre analyse des benchmarks de Fable 5 pour le contexte.
Les deux chiffres scientifiques sont plus clairs :
-
+10,2 pointsen chimie organique ; -
+7,7 pointsen analyse de protéines.
Ce sont des deltas absolus face à une référence nommée : Opus 4.8. Les scores de départ ne sont toujours pas publiés, mais l’amélioration est explicite.
Les affirmations de coût dépendent de la configuration
Anthropic associe capacité et coût dans trois cas :
- coût par tâche inférieur sur Frontier-Bench ;
- un tiers du coût sur OSWorld 2.0 ;
- moitié prix sur CursorBench 3.2.
Le prix catalogue est vérifiable : Opus 5 coûte 5 $ par million de tokens d’entrée et 25 $ par million de tokens de sortie. C’est le même tarif qu’Opus 4.8 et la moitié du tarif de Fable 5 (10 $/50 $), selon la page de tarification Anthropic.
Le détail des écritures de cache, du traitement par lots et du mode rapide est disponible dans notre analyse de la tarification d’Opus 5.
Mais le coût par tâche ne se déduit pas du prix par token. Il dépend notamment :
- du niveau d’effort ;
- de l’activation de la réflexion (thinking) ;
- du nombre de tours dans votre boucle agentique ;
- du nombre de sous-agents créés ;
- de la longueur des réponses et des appels d’outils.
Anthropic indique qu’Opus 5 produit par défaut des réponses plus longues qu’Opus 4.8, délègue plus facilement aux sous-agents et étend plus souvent le périmètre d’une tâche. Ces comportements peuvent augmenter la consommation de tokens dans votre environnement.
La moitié du prix catalogue reste la moitié du prix catalogue. Notre comparaison Opus 5 vs Fable 5 explique où cet écart devient réellement rentable.
La règle pratique : mesurez votre propre coût par tâche résolue.
Le plafond qu’Anthropic reconnaît
L’information la plus utile dans le matériel de lancement n’est pas une victoire : Anthropic indique explicitement qu’Opus 5 reste derrière Mythos 5 pour :
- l’exploitation en cybersécurité ;
- la recherche en biologie autonome.
Fable 5 conserve également la désignation de « modèle le plus capable largement diffusé ».
Le résumé honnête est donc :
Opus 5 propose une capacité de classe frontière à la moitié du prix de Fable 5, mais ce n’est pas le sommet absolu de la gamme.
Pour la recherche de sécurité avancée ou le travail scientifique autonome, la référence reste la classe Mythos. Voir notre explication du modèle de classe Mythos et Fable 5 vs Mythos 5.
Anthropic propose aussi fallbacks: "default", derrière l’en-tête bêta server-side-fallback-2026-07-01. Cette option bascule automatiquement vers Opus 4.8 lorsqu’Opus 5 refuse une demande liée à une catégorie cyber.
Cette option est importante pour les équipes qui migrent des workflows existants : les refus font partie du comportement à tester, au même titre que la qualité ou le coût.
Ce que les benchmarks ne couvrent pas
Les benchmarks mesurent l’achèvement de tâches. Ils ne couvrent pas forcément les problèmes qui apparaissent en production.
- Dérive comportementale pendant la migration : Opus 5 vérifie davantage son travail sans instruction explicite. Les prompts hérités d’Opus 4.8 contenant « double-vérifiez votre réponse » peuvent provoquer une sur-vérification et des tokens inutiles. Le guide de prompting Anthropic recommande de retirer ces instructions.
- Longueur de sortie : réduire l’effort diminue les tokens de réflexion, mais pas nécessairement la taille visible de la réponse. Demandez explicitement une sortie concise.
-
Réflexion désactivée : avec
thinking: {type: "disabled"}, certains appels d’outils peuvent apparaître comme du texte brut plutôt que comme des appels structurés exécutables. Des balises XML internes peuvent aussi apparaître dans la sortie. - Recalibrage de l’effort : les niveaux d’effort ont changé avec Opus 5. Ne réutilisez pas aveuglément les réglages d’Opus 4.8 ; exécutez un nouveau balayage. Consultez le guide des paramètres d’effort.
-
Erreur de configuration : associer
thinking: {type: "disabled"}àxhighoumaxrenvoie une erreur400. Ce point est détaillé dans le guide de migration d’Opus 4.8 vers Opus 5.
Plan d’évaluation : testez votre propre charge de travail
Les benchmarks fournisseurs sont un point de départ. Pour décider d’une migration, exécutez cette évaluation compacte sur votre propre système.
1. Constituez un jeu de tâches réelles
Prenez entre 20 et 50 éléments issus de votre historique :
- tickets clôturés ;
- pull requests fusionnées ;
- conversations de support ;
- incidents résolus ;
- tâches d’automatisation réellement exécutées.
Les données réelles contiennent votre formatage, vos ambiguïtés et vos cas limites.
2. Figez la configuration
Documentez précisément :
- le modèle :
claude-opus-5; -
output_config.effort; - l’état de
thinking; -
max_tokens; - les outils exposés au modèle ;
- la version de vos prompts système et utilisateur.
Sans configuration fixe, les comparaisons ultérieures ne sont pas fiables.
3. Mesurez le coût par tâche résolue
Ne vous limitez pas au coût par token.
Pour chaque appel, enregistrez le bloc usage :
- tokens d’entrée ;
- tokens de sortie ;
- lectures de cache ;
- écritures de cache.
Ensuite, calculez :
coût par tâche résolue =
dépense totale / nombre de tâches ayant passé le contrôle d’acceptation
C’est la métrique utile pour comparer vos workflows, pas seulement la facture brute.
4. Exécutez un balayage d’effort
Lancez exactement le même jeu de tâches avec :
low
medium
high
xhigh
Comparez, pour chaque niveau :
- taux de réussite ;
- latence ;
- nombre de tours ;
- consommation de tokens ;
- coût par tâche résolue ;
- longueur de sortie ;
- taux de refus.
Surveillez max_tokens aux niveaux d’effort élevés.
5. Testez les boucles agentiques, pas seulement un tour
OSWorld, CursorBench et AutomationBench sont des évaluations agentiques. Un prompt unique ne reproduit pas un workflow avec outils.
Testez donc :
- plusieurs tours ;
- vos vrais outils ;
- des erreurs d’API ;
- des réponses d’outils incomplètes ;
- des contextes longs ;
- des reprises après échec.
Comptez aussi les tours nécessaires à la résolution, pas uniquement le résultat final.
6. Comparez avec votre système actuel
Exécutez le même harnais avec votre modèle actuel — Opus 4.8, Sonnet 5 ou autre.
Les comparaisons relatives sur vos propres tâches sont plus utiles qu’un score absolu obtenu dans un environnement tiers.
7. Comptabilisez les refus séparément
Pour les workflows liés à la cybersécurité, comptez les refus avant de décider si l’en-tête de fallback doit être activé.
Pour une méthodologie similaire, consultez notre article sur les benchmarks de Sonnet 5 et le guide de l’API Opus 5.
Exécuter l’évaluation dans Apidog
Cette évaluation consiste en des requêtes HTTP avec authentification, corps JSON, streaming, appels d’outils et blocs usage à analyser. C’est un workflow API standard que Apidog permet d’organiser et de répéter.
Voici une configuration pratique :
- Créez une requête vers l’endpoint Anthropic Messages.
- Stockez la clé API dans une variable d’environnement, jamais directement dans le corps de la requête.
- Dupliquez la requête pour chaque niveau d’effort, de
lowàxhigh. - Gardez le prompt et les outils identiques entre les exécutions.
- Activez le streaming si vous devez inspecter les événements SSE.
- Vérifiez que les appels d’outils sont structurés et non décrits en texte brut.
- Ajoutez des assertions sur les champs
usage. - Enregistrez le tout dans une collection afin de pouvoir réutiliser le harnais au prochain lancement de modèle.
Requête de base :
curl https://api.anthropic.com/v1/messages \
--header "x-api-key: $ANTHROPIC_API_KEY" \
--header "anthropic-version: 2023-06-01" \
--header "content-type: application/json" \
--data '{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": {"effort": "medium"},
"messages": [
{"role": "user", "content": "Corrige le test échoué dans ce diff."}
]
}'
Modifiez un seul paramètre à la fois, gardez le reste fixe et sauvegardez le bloc usage après chaque exécution. Vous pouvez télécharger Apidog pour organiser les environnements, collections et assertions.
Le résumé honnête
L’histoire des benchmarks d’Opus 5 est solide : Anthropic revendique son plus grand bond entre deux versions Opus, avec des prix catalogue inchangés.
Mais ces chiffres sont aussi :
- publiés par le fournisseur ;
- non reproduits indépendamment au 25 juillet 2026 ;
- souvent exprimés comme des ratios sans dénominateur ;
- dépendants de configurations qui ne correspondent pas forcément aux vôtres.
Considérez le tableau comme l’hypothèse d’Anthropic sur son propre modèle. Ensuite, récupérez vos propres chiffres sur votre backlog, avec vos outils, vos prompts et vos critères d’acceptation.
L’écart entre un graphique de lancement et une charge de travail de production est l’endroit où une migration de modèle se décide réellement. Le guide des piliers d’Opus 5 couvre les autres changements à préparer.
FAQ
Les benchmarks de Claude Opus 5 sont-ils vérifiés de manière indépendante ?
Non. Au 25 juillet 2026, tous les résultats publiés pour Opus 5 proviennent d’Anthropic. Aucun laboratoire tiers ou évaluateur indépendant n’a publié de reproduction.
Quelle est l’affirmation de benchmark la plus importante pour Opus 5 ?
Frontier-Bench v0.1 : Anthropic affirme qu’Opus 5 fait plus que doubler le score d’Opus 4.8 à un coût par tâche inférieur. Les scores sous-jacents ne sont pas publiés et le benchmark est récent.
Claude Opus 5 est-il le modèle Claude le plus performant ?
Non. Fable 5 conserve la désignation de « modèle le plus capable largement diffusé », et Anthropic indique qu’Opus 5 reste derrière Mythos 5 pour l’exploitation en cybersécurité et la recherche en biologie autonome.
Dans quelle mesure Opus 5 est-il meilleur qu’Opus 4.8 pour les tâches scientifiques ?
Anthropic rapporte +10,2 points en chimie organique et +7,7 points en analyse de protéines par rapport à Opus 4.8. Ces deux affirmations sont exprimées en deltas absolus, mais les scores de référence ne sont pas publiés.
Opus 5 bat-il Fable 5 ?
Selon les chiffres d’Anthropic, Opus 5 dépasse Fable 5 sur OSWorld 2.0 à un tiers du coût et se situe à moins de 0,5 % du pic de Fable 5 sur CursorBench 3.2 à moitié prix. Fable 5 conserve néanmoins sa désignation de capacité globale. Voir la comparaison complète.
Que devrais-je évaluer moi-même ?
Le coût par tâche résolue sur 20 à 50 tâches réelles de votre backlog, exécutées à plusieurs niveaux d’effort, avec vos outils et vos boucles multi-tours. Comparez les résultats au modèle que vous utilisez déjà avec le même harnais.




Top comments (0)