Chaque article grand public sur le lancement de Claude Opus 5 le 24 juillet 2026 a mentionné la même fonctionnalité. Fortune l'a décrit comme un moyen de basculer entre le coût et la capacité. CNBC, Bloomberg et TechCrunch l'ont tous souligné. Aucun d'entre eux n'a dit ce que c'est, quels sont les niveaux, ce qui se passe lorsque vous en changez un, ou ce que cela fait à votre facture.
Essayez Apidog dès aujourd’hui
C'est un paramètre de requête appelé effort, il a cinq niveaux sur Opus 5, et il est par défaut à high. C'est toute la fonctionnalité. Ce qui en fait un sujet digne d'un article, c'est qu'Anthropic a recalibré les niveaux pour ce modèle, ce qui signifie que les paramètres que vous aviez réglés sur Opus 4.8 sont maintenant incorrects, et une combinaison spécifique de paramètres renvoie une erreur 400 qui apparaîtra dans de nombreux journaux de migration cette semaine.
💡 Si vous souhaitez tester les niveaux sur un véritable point de terminaison pendant votre lecture, Apidog est un moyen simple d'envoyer la même requête avec cinq réglages différents et de comparer les résultats.
Ce qu'est réellement le paramètre effort
Le paramètre effort se trouve dans l'objet output_config d'une requête Messages API :
{
"model": "claude-opus-5",
"max_tokens": 8192,
"output_config": { "effort": "high" },
"messages": [
{ "role": "user", "content": "Refactorisez ce module et expliquez les compromis." }
]
}
Il contrôle la quantité de raisonnement interne que le modèle effectue avant de répondre. Opus 5 exécute par défaut une réflexion adaptative, et l'effort est le cadran qui détermine la générosité avec laquelle ce budget de réflexion est dépensé.
Un effort plus élevé signifie :
- plus de jetons de raisonnement ;
- plus de coût ;
- plus de latence.
Un effort plus faible réduit ces trois éléments.
Les interfaces utilisateur exposent la même idée sous la forme d'un sélecteur d'effort plutôt qu'un champ JSON brut, ce qui explique le cadrage par la presse d'un interrupteur coût-vs-capacité. Si vous développez sur l'API, c'est ce paramètre que vous contrôlez réellement.
La forme complète de la requête se trouve dans notre guide détaillé de l'API Opus 5, et la référence des paramètres se trouve dans l'aperçu des modèles d'Anthropic.
Une chose que l'effort n'est pas : un contrôle de la verbosité. Le guide de prompt pour Opus 5 d'Anthropic indique explicitement que réduire l'effort diminue la réflexion, pas la longueur de la réponse visible.
Si vous voulez une sortie plus courte, demandez-la explicitement dans le prompt. Passer à low ne le fera pas automatiquement.
Les cinq niveaux
| Niveau | Ce qu'il fait | Cas d'usage typique |
|---|---|---|
low |
Raisonnement minimal avant de répondre | Classification à grand volume, extraction, routage, résumés courts |
medium |
Raisonnement modéré | Q&A sur un contexte récupéré, modifications de fichier unique, transformations structurées |
high |
Par défaut. Raisonnement substantiel | Travail général lorsque vous n'avez encore rien mesuré |
xhigh |
Raisonnement étendu | Codage et boucles agentiques. Point de départ recommandé par Anthropic pour les deux |
max |
Budget de raisonnement maximal | Problèmes difficiles à résoudre en un coup où une mauvaise réponse coûte plus cher que les jetons |
Deux détails de ce tableau sont particulièrement importants.
high est le niveau par défaut
Si vous envoyez une requête sans output_config, vous obtenez high.
Cela compte pour la prévision des coûts : une requête Opus 5 non modifiée effectue du raisonnement et vous est facturée pour celui-ci, alors que la même requête non modifiée sur Opus 4.8 ne faisait aucune réflexion.
Ce changement est l'une des deux modifications majeures de la migration d'Opus 4.8 vers Opus 5, et c'est celle qui risque le plus de surprendre une équipe financière.
Commencez à xhigh, pas à max, pour le code et les agents
Anthropic positionne xhigh comme point de départ pour le codage et les charges de travail agentiques.
max est disponible au-dessus, mais commencer à ce niveau revient à payer pour une marge dont vous ne pourrez probablement pas mesurer le bénéfice. Commencez par xhigh, puis descendez selon vos évaluations.
Ce que le recalibrage a changé
Transporter des paramètres d'effort d'un modèle à un autre est une mauvaise idée.
Anthropic a recalibré la signification de chaque niveau sur Opus 5. L'étiquette medium sur Opus 5 ne correspond donc pas à la même quantité de raisonnement que medium sur Opus 4.8.
La recommandation est claire : exécutez un nouveau balayage d'effort sur Opus 5 au lieu de reprendre votre configuration 4.8.
La conséquence pratique est importante. Sur les modèles Opus précédents, low et medium étaient surtout théoriques pour des tâches sérieuses : moins chers, mais nettement moins performants. Les équipes laissaient donc souvent tout à high ou au-dessus.
Sur Opus 5, les niveaux inférieurs sont significativement plus performants qu'auparavant. C'est la première fois que low et medium deviennent réellement utilisables sur un modèle de niveau Opus pour des tâches de production.
C'est le véritable levier de coût du lancement.
Opus 5 coûte 5 $ par million de jetons d'entrée et 25 $ par million de jetons de sortie, soit le même prix qu'Opus 4.8. Les jetons de raisonnement sont facturés du côté de la sortie.
Par conséquent, exécuter un pipeline de classification à high plutôt qu'à low peut représenter une fraction importante de vos dépenses de sortie, lorsque le raisonnement supplémentaire n'améliore pas la précision.
Notre répartition des prix d'Opus 5 contient la grille tarifaire complète, y compris la réduction de 50 % sur les lots et le minimum de cache de 512 jetons.
Si vous cherchez à réduire les coûts sur l'ensemble de votre parc Claude, les leviers de réduction de votre facture d'API Claude s'appliquent également ici, avec l'effort désormais ajouté à la liste.
L'interaction de xhigh et max avec max_tokens
max_tokens limite ensemble les jetons de réflexion et les jetons de réponse. C'est un plafond strict pour toute la sortie de la requête, pas seulement pour le texte visible.
Augmenter l'effort augmente la part de ce plafond que le modèle consacre au raisonnement avant de rédiger sa réponse.
Si vous passez à xhigh ou max tout en conservant un max_tokens défini pour un modèle qui ne réfléchissait pas, le modèle peut épuiser son budget de raisonnement et tronquer la réponse avant sa fin.
La requête paraît correcte, mais la sortie est incomplète.
Donnez donc de la marge. La recommandation d'Anthropic est de commencer avec max_tokens: 64000 lorsque vous utilisez xhigh ou max sur Opus 5 :
{
"model": "claude-opus-5",
"max_tokens": 64000,
"output_config": { "effort": "xhigh" },
"messages": [
{
"role": "user",
"content": "Corrigez le test d'intégration qui échoue et expliquez la cause profonde."
}
]
}
Un max_tokens élevé est un plafond, pas un achat. Vous êtes facturé pour les jetons réellement produits. Définir 64000 ne signifie pas payer pour 64 000 jetons : cela évite que le modèle soit contraint de s'arrêter en pleine réflexion.
L'erreur 400 à anticiper
Désactiver la réflexion et demander un effort élevé sont des instructions contradictoires.
Opus 5 rejette la combinaison suivante avec une erreur 400 :
{
"model": "claude-opus-5",
"max_tokens": 8192,
"thinking": { "type": "disabled" },
"output_config": { "effort": "xhigh" }
}
Cette requête échoue.
Désactiver la réflexion vous limite à un effort high. Les combinaisons valides sont donc :
- Réflexion activée, par défaut, avec n'importe lequel des cinq niveaux.
- Réflexion désactivée uniquement avec
low,mediumouhigh.
Le scénario de migration typique est prévisible :
- une équipe reporte
thinking: { "type": "disabled" }depuis une configuration Opus 4.8 ; - elle augmente séparément l'effort à
xhigh, car c'est la recommandation pour le codage ; - les deux modifications semblent correctes isolément ;
- leur combinaison déclenche une erreur 400.
Le conseil d'Anthropic est de ne pas désactiver la réflexion sur Opus 5. Lorsque la réflexion est désactivée, deux modes d'échec peuvent apparaître :
- le modèle écrit les appels d'outils en texte brut au lieu de produire des appels exécutables ;
- des balises XML internes peuvent fuir dans la sortie visible.
Dans une boucle agentique, ce texte peut ensuite contaminer les tours suivants. Pour contrôler les coûts, préférez un niveau d'effort inférieur plutôt qu'une réflexion désactivée.
Nous approfondissons ces deux artefacts dans le guide de prompting d'Opus 5.
Comment effectuer un balayage d'effort sur vos propres évaluations
Anthropic recommande de refaire un balayage. Voici une procédure réalisable en un après-midi.
Figez un ensemble de tâches.
Extrayez 30 à 50 invites réelles de vos journaux de production, pas des exemples synthétiques. Incluez les cas difficiles qui vous préoccupent réellement. Les écarts entre niveaux disparaissent souvent sur les tâches faciles.Définissez le critère de succès avant d'observer les résultats.
Par exemple : les tests passent, le JSON est validé par un schéma, le champ extrait correspond à la vérité terrain, ou un évaluateur humain rend une décision binaire.Exécutez chaque invite à chaque niveau.
Cinq niveaux pour 40 invites représentent 200 appels. Vous pouvez les envoyer via l'API Batch à moitié prix si la latence n'est pas importante.-
Capturez trois métriques par exécution.
Ne vous limitez pas au succès ou à l'échec. Enregistrez :- le succès ou l'échec ;
-
usage.output_tokens; - la latence réelle.
Le bloc usage contient le signal de coût réel, car il inclut les jetons de raisonnement que vous devriez sinon estimer.
Choisissez le niveau le moins cher qui satisfait vos critères.
Confirmez ensuite ce choix sur un ensemble de validation non utilisé pendant le réglage.Répétez le balayage lors du prochain changement de modèle.
Les niveaux ont été recalibrés entre Opus 4.8 et Opus 5. Il faut supposer que cela peut se reproduire.
Comparaison des niveaux côte à côte dans Apidog
La mécanique d'un balayage consiste à envoyer le même corps de requête cinq fois, avec uniquement le champ output_config.effort modifié, puis à comparer les résultats.
C'est possible avec curl, mais cela implique beaucoup de copier-coller. Apidog rend cette comparaison plus simple.
Configuration recommandée :
- Créez une requête vers le point de terminaison Anthropic Messages et stockez votre clé dans une variable d'environnement plutôt que de l'inclure dans le corps de requête.
- Enregistrez la requête fonctionnelle dans une collection.
- Dupliquez-la cinq fois et modifiez uniquement
output_config.effortdans chaque copie. - Inspectez l'objet
usagede chaque réponse pour comparer les jetons de sortie par niveau, ainsi quecache_read_input_tokenslorsque vous vérifiez la mise en cache. - Activez le streaming et lisez les événements SSE pour observer la différence de latence entre
xhighetlow. - Ajoutez une assertion vérifiant que
stop_reasonest présent et différent demax_tokens.
Cette dernière assertion est importante : une réponse xhigh tronquée doit échouer explicitement dans votre collection, plutôt que de ressembler silencieusement à une réponse courte.
Téléchargez Apidog si vous souhaitez construire cette collection de comparaison. Rien dans ce processus ne l'exige, mais cela évite de maintenir cinq scripts shell.
Le véritable plafond
L'effort permet d'exécuter Opus 5 à moindre coût. Il ne fait pas pour autant d'Opus 5 le sommet de la pile Claude.
Les chiffres de lancement d'Anthropic pour Opus 5 sont solides : plus du double du score de Frontier-Bench v0.1 d'Opus 4.8, environ 3x le modèle suivant le plus performant sur ARC-AGI 3, et à moins de 0,5 % de Fable 5 sur CursorBench 3.2 à moitié prix.
Ces chiffres sont fournis par le fournisseur, publiés par Anthropic, et n'avaient pas été reproduits indépendamment au 25 juillet 2026. Traitez-les comme des affirmations sourcées, pas comme des mesures neutres.
Consultez notre analyse des benchmarks d'Opus 5 pour les mises en garde spécifiques à chacun d'eux.
Au-dessus d'Opus 5, Fable 5 reste le modèle le plus performant largement diffusé par Anthropic, à 10 $ par million de jetons d'entrée et 50 $ par million de jetons de sortie.
Opus 5 reste également en retrait par rapport à Mythos 5 en matière d'exploitation de cybersécurité et de recherche en biologie autonome, ce qu'Anthropic déclare directement.
Exécuter Opus 5 à max ne comble aucun de ces écarts. Le résumé honnête est donc : une capacité de pointe à la moitié du prix de pointe, avec un plafond de capacité clairement identifié au-dessus.
Pour déterminer si la différence de prix est justifiée pour votre charge de travail, consultez Opus 5 vs Fable 5.
FAQ
Quel est le niveau d'effort par défaut sur Claude Opus 5 ?
high. Une requête sans champ output_config s'exécute avec un effort high et une réflexion adaptative activée.
Quels sont les cinq niveaux d'effort ?
low, medium, high, xhigh et max. Anthropic recommande de commencer à xhigh pour le codage et le travail agentique, puis de descendre selon vos propres évaluations.
Pourquoi ma requête renvoie-t-elle une 400 lorsque je règle l'effort sur xhigh ?
Vous envoyez probablement aussi thinking: { "type": "disabled" }. Désactiver la réflexion plafonne l'effort à high, et la combinaison est rejetée. Supprimez le bloc qui désactive la réflexion ou réduisez l'effort à high ou moins.
Puis-je réutiliser mes paramètres d'effort Opus 4.8 sur Opus 5 ?
Non. Les niveaux ont été recalibrés, donc une même étiquette correspond à une quantité de raisonnement différente. Anthropic recommande d'effectuer un nouveau balayage. La liste complète des changements se trouve dans le guide de migration.
La réduction de l'effort rend-elle les réponses plus courtes ?
Non. L'effort contrôle le raisonnement, pas la longueur visible. Demandez explicitement une sortie concise dans l'invite si nécessaire.
Quel max_tokens dois-je utiliser avec xhigh ou max ?
Commencez à 64000. max_tokens plafonne la réflexion et la réponse ensemble, donc un budget dimensionné pour un modèle sans réflexion peut provoquer une troncature. Vous n'êtes facturé que pour les jetons produits : le plafond élevé ne coûte rien en lui-même.
Pour la fiche technique complète, la matrice de disponibilité et le contexte tarifaire, commencez par ce qu'est Claude Opus 5.
Top comments (0)