DEV Community

Cover image for Tarifs Claude Opus 5 : Ventilation complète des coûts (2026)
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Tarifs Claude Opus 5 : Ventilation complète des coûts (2026)

Claude Opus 5 a été lancé le 24 juillet 2026 au prix de 5 $ par million de jetons d’entrée et 25 $ par million de jetons de sortie. Ce tarif est identique à celui d’Opus 4.8 et représente la moitié du prix de Fable 5.

Essayez Apidog dès aujourd’hui

Le prix affiché ne suffit pas à prévoir votre facture. Vous devez aussi comptabiliser les écritures et lectures de cache, les lots, le mode rapide, le multiplicateur régional et les changements de comportement qui font varier le volume de jetons. Pour valider ces calculs sur votre trafic, envoyez vos requêtes depuis Apidog et inspectez le bloc usage de chaque réponse.

Le tableau complet des prix de Claude Opus 5

Les tarifs ci-dessous proviennent de la documentation tarifaire Anthropic et s’appliquent au modèle claude-opus-5.

Catégorie de jeton Prix par million de jetons
Entrée standard 5,00 $
Sortie standard 25,00 $
Écriture de cache de prompt, TTL 5 minutes 6,25 $
Écriture de cache de prompt, TTL 1 heure 10,00 $
Lecture ou rafraîchissement de cache 0,50 $
Entrée API par lot 2,50 $
Sortie API par lot 12,50 $
Entrée en mode rapide 10,00 $
Sortie en mode rapide 50,00 $

Points à retenir :

  • Une lecture de cache coûte un dixième de l’entrée standard. C’est le principal levier de réduction de coût.
  • L’écriture de cache à 5 minutes coûte 1,25× le prix d’entrée standard ; celle d’une heure coûte 2×.
  • L’API Batch réduit de 50 % les coûts d’entrée et de sortie.
  • Le mode rapide double les tarifs standards pour une vitesse de sortie environ 2,5 fois supérieure. C’est un aperçu de recherche disponible uniquement dans l’API propriétaire, incompatible avec l’API Batch.
  • Il n’existe pas de supplément pour les contextes longs. La fenêtre de contexte de 1 million de jetons est à la fois la valeur par défaut et le maximum, facturé au tarif standard.

Tarification Claude Opus 5

Le plafond théorique d’un appel Messages est donc clair :

1 000 000 jetons d’entrée × 5 $ / MTok = 5,00 $
128 000 jetons de sortie × 25 $ / MTok = 3,20 $
Total maximal = 8,20 $
Enter fullscreen mode Exit fullscreen mode

Avec l’API Batch et l’en-tête bêta output-300k-2026-03-24, la sortie peut atteindre 300 000 jetons, soit un plafond de sortie de 3,75 $.

Le point de référence : identique à 4.8, moitié de Fable 5

Modèle Entrée / MTok Sortie / MTok
Claude Opus 5 5,00 $ 25,00 $
Claude Opus 4.8 5,00 $ 25,00 $
Claude Fable 5 10,00 $ 50,00 $
Claude Sonnet 5 — introduction, jusqu’au 31 août 2026 2,00 $ 10,00 $
Claude Sonnet 5 — à partir du 1er septembre 2026 3,00 $ 15,00 $

Deux conséquences pratiques :

  1. Migrer d’Opus 4.8 vers Opus 5 ne change pas le coût unitaire par jeton. Les versions 4.5 à 4.8 étaient déjà facturées au même tarif. En revanche, le volume de jetons peut évoluer avec les changements de comportement du modèle. Le détail des prix d’Opus 4.8 reste pertinent pour les applications qui utilisent encore cet ID.

  2. Opus 5 coûte la moitié de Fable 5. Anthropic affirme qu’Opus 5 atteint 0,5 % du pic de Fable 5 sur CursorBench 3.2 et le dépasse sur OSWorld 2.0 à environ un tiers du coût par tâche. Ce sont des chiffres du fournisseur publiés dans le billet de lancement d’Opus 5, sans reproduction indépendante connue au 25 juillet 2026. Traitez-les comme des affirmations du fournisseur. Consultez aussi la comparaison Opus 5 vs Fable 5 et les prix de Fable 5.

Exemple 1 : calculer le coût d’une requête simple

Supposons une requête de résumé avec :

  • 8 000 jetons d’entrée ;
  • 1 200 jetons de sortie.

Utilisez cette formule :

coût = (jetons / 1 000 000) × prix par MTok
Enter fullscreen mode Exit fullscreen mode

Calcul :

Entrée : 8 000 / 1 000 000 × 5,00 $ = 0,040 $
Sortie : 1 200 / 1 000 000 × 25,00 $ = 0,030 $
Total : 0,070 $ par appel
Enter fullscreen mode Exit fullscreen mode

À 10 000 appels mensuels, cela représente 700 $ par mois.

Comparaison pour la même charge :

  • Fable 5 : 0,140 $ par appel, soit 1 400 $ par mois ;
  • Sonnet 5 au tarif de lancement : 0,028 $ par appel, soit 280 $ par mois.

Même avec près de sept fois plus de jetons d’entrée que de sortie, la sortie représente ici 43 % de la facture. Les jetons de sortie coûtent cinq fois plus cher et incluent les jetons de réflexion. Comme la réflexion adaptative est activée par défaut dans Opus 5, surveillez ce poste en priorité.

Exemple 2 : session agentique longue avec cache de prompt

Prenons un agent de code avec :

  • un préfixe stable de 120 000 jetons : invite système et contexte du dépôt ;
  • 40 tours ;
  • 1 500 nouveaux jetons de conversation par tour ;
  • 2 500 jetons de sortie par tour.

Sans cache

Vous retransmettez le contexte complet à chaque tour.

Poste Jetons Tarif Coût
Entrée — 120 000 × 40 + 60 000 nouveaux 4 860 000 5,00 $ 24,30 $
Sortie — 2 500 × 40 100 000 25,00 $ 2,50 $
Total 26,80 $

Avec un cache de prompt de 5 minutes

Poste Jetons Tarif Coût
Écriture du cache, une fois 120 000 6,25 $ 0,75 $
Lectures de cache — 39 tours 4 680 000 0,50 $ 2,34 $
Nouvelle entrée — 1 500 × 40 60 000 5,00 $ 0,30 $
Sortie — 2 500 × 40 100 000 25,00 $ 2,50 $
Total 5,89 $

Le cache réduit ici le coût de 78 %.

Pour l’implémenter, placez le contenu stable au début de votre requête et marquez ce préfixe comme point de contrôle de cache. Vérifiez ensuite que les réponses remontent des valeurs non nulles dans cache_read_input_tokens.

Attention au TTL :

  • Les lectures de cache le rafraîchissent.
  • Des tours séparés de moins de cinq minutes restent actifs après une seule écriture.
  • Si l’agent peut rester inactif plus longtemps, utilisez un TTL d’une heure.

Dans cet exemple, le TTL d’une heure fait passer l’écriture de 0,75 $ à 1,20 $, pour un coût total de 6,34 $. Cela reste 76 % moins cher qu’une exécution sans cache.

Exemple 3 : réduire de 50 % les traitements asynchrones avec Batch

Utilisez l’API Batch dès qu’une réponse synchrone n’est pas nécessaire. Par exemple, pour 50 000 documents avec :

  • 1 200 jetons d’entrée chacun ;
  • 150 jetons de sortie chacun.
Mode Coût entrée Coût sortie Total
Standard 60 M × 5,00 $ = 300,00 $ 7,5 M × 25,00 $ = 187,50 $ 487,50 $
Batch 60 M × 2,50 $ = 150,00 $ 7,5 M × 12,50 $ = 93,75 $ 243,75 $

Même modèle, même volume de jetons : 243,75 $ économisés.

Réservez le mode standard aux flux où l’utilisateur attend une réponse immédiate. Pour la classification, l’évaluation, l’enrichissement de données, les résumés nocturnes et les rétrocomptages, Batch doit être votre option par défaut.

Exemple 4 : évaluer le surcoût du mode rapide

Le mode rapide facture 10 $ / MTok en entrée et 50 $ / MTok en sortie.

Reprenons la requête de l’exemple 1 :

Entrée : 8 000 / 1 000 000 × 10,00 $ = 0,080 $
Sortie : 1 200 / 1 000 000 × 50,00 $ = 0,060 $
Total : 0,140 $ par appel
Enter fullscreen mode Exit fullscreen mode

Le coût est exactement doublé. Ce mode correspond donc au prix standard de Fable 5 : vous payez la latence, pas une capacité supplémentaire.

Utilisez-le pour les expériences interactives où l’utilisateur voit les jetons défiler. Évitez-le pour les traitements de fond. Il ne se combine pas avec Batch : les deux stratégies sont volontairement exclusives.

Les quatre leviers qui impactent réellement votre facture

1. Mettre en cache les préfixes de 512 jetons ou plus

Le minimum de cache est passé de 1 024 jetons sur Opus 4.8 à 512 jetons sur Opus 5. Vous pouvez donc mettre en cache davantage d’invites système, de consignes métier et de contexte stable.

Le seuil de rentabilité est faible :

  • TTL 5 minutes : rentable à partir d’environ 1,3 requête, donc dès le deuxième appel ;
  • TTL 1 heure : rentable à partir d’environ 2,1 requêtes, donc dès le troisième appel.

Exemple : une invite système de 700 jetons réutilisée sur 1 000 appels.

Sans cache :
700 000 jetons × 5 $ / MTok = 3,50 $

Avec cache :
Écriture : 700 × 6,25 $ / MTok = 0,0044 $
999 lectures : 699 300 × 0,50 $ / MTok = 0,34965 $
Total : environ 0,354 $
Enter fullscreen mode Exit fullscreen mode

Cette invite n’était pas éligible au cache sur Opus 4.8.

2. Envoyer les travaux non urgents à l’API Batch

Le gain est systématique : 50 % sur l’entrée et la sortie.

Avant d’utiliser l’endpoint standard, posez-vous une question simple : un utilisateur attend-il réellement ce résultat maintenant ?

Si la réponse est non, envoyez le travail en lot. C’est souvent le bon choix pour :

  • les évaluations ;
  • les migrations ou rétrocomptages ;
  • les résumés planifiés ;
  • la modération et la classification ;
  • l’enrichissement de contenu.

3. Mesurer le bon niveau d’effort

output_config.effort contrôle la quantité de réflexion générée. Ces jetons sont facturés comme des jetons de sortie, à 25 $ par million.

Opus 5 recalibre les niveaux d’effort. Anthropic indique que low et medium sont plus performants que sur les anciens modèles Opus. Le niveau par défaut est high, tandis que xhigh reste le point de départ recommandé pour le code et les tâches agentiques.

Testez les niveaux sur vos propres évaluations :

{
  "model": "claude-opus-5",
  "max_tokens": 12000,
  "output_config": {
    "effort": "medium"
  }
}
Enter fullscreen mode Exit fullscreen mode

Si une tâche consomme 8 000 jetons de réflexion en xhigh et 1 500 en low, l’écart est :

6 500 jetons × 25 $ / MTok = 0,1625 $ économisé par tâche
Enter fullscreen mode Exit fullscreen mode

Sur 100 000 tâches, cela représente 16 250 $. Cet exemple est illustratif : mesurez les résultats, la qualité et le volume réel de jetons. Le guide des paramètres d’effort explique cette démarche.

Réduire l’effort diminue les jetons de réflexion, mais ne raccourcit pas forcément la réponse visible. Si vous voulez des réponses plus concises, imposez une limite explicite dans votre prompt.

4. Tenir compte de la surcharge des outils

Les définitions d’outils entraînent une invite système injectée par l’API, que vous payez. Sur Opus 5, cette surcharge est de 286 jetons lorsque tool_choice vaut auto ou none.

Comparaison :

  • Opus 5 : 286 jetons ;
  • Opus 4.8 : 290 jetons ;
  • Opus 4.7 : 675 jetons.

Le gain face à Opus 4.8 est négligeable : quatre jetons, soit environ 20 $ sur un million de requêtes. Face à Opus 4.7, la différence est de 389 jetons par requête, soit environ 1 945 $ par million de requêtes.

Pour les optimisations applicables à tous les modèles Claude, consultez le guide pour réduire votre facture API Claude.

Deux postes souvent oubliés

Le multiplicateur inference_geo: "us"

Définir :

{
  "inference_geo": "us"
}
Enter fullscreen mode Exit fullscreen mode

applique un multiplicateur de 1,1× à toutes les catégories de jetons :

  • entrée : 5,50 $ / MTok ;
  • sortie : 27,50 $ / MTok ;
  • lecture de cache : 0,55 $ / MTok ;
  • Batch : 2,75 $ / 13,75 $ par MTok.

Dans l’exemple 1, une facture de 700 $ mensuels passe à 770 $. Sur une facture de 50 000 $, cela représente 5 000 $ supplémentaires. Activez cet épinglage uniquement si vos contraintes de conformité ou de résidence des données l’exigent.

Priority Tier n’est pas disponible sur Opus 5

Le niveau de priorité reste disponible sur Opus 4.8, mais n’est pas pris en charge par Opus 5. Si votre planification dépend de ces garanties de capacité, prenez ce point en compte avant la migration. Le guide de migration d’Opus 4.8 vers Opus 5 détaille ce changement et les autres différences d’API.

Les changements de comportement qui augmentent le volume de jetons

Le prix par jeton ne représente qu’une partie de la facture. Surveillez également le volume généré.

  1. La réflexion est activée par défaut. Avec Opus 4.8, une requête sans champ thinking s’exécutait sans réflexion. Avec Opus 5, la réflexion adaptative est active et ses jetons sont facturés comme de la sortie. Comme max_tokens limite la réflexion et la réponse visible ensemble, certaines sorties peuvent aussi être tronquées.

  2. Opus 5 délègue plus facilement à des sous-agents. Chaque sous-agent génère ses propres jetons facturables. Limitez la délégation ou définissez son périmètre pour les charges sensibles au coût.

  3. Opus 5 vérifie davantage son travail. Si vos prompts contiennent encore des instructions comme « vérifiez votre travail », la documentation de prompt engineering d’Anthropic recommande de les supprimer. La sur-vérification ajoute des jetons.

Aucun de ces changements ne modifie les tarifs unitaires. Tous peuvent modifier votre facture.

Confirmer vos dépenses réelles avec Apidog

Ne vous fiez pas uniquement aux estimations : inspectez l’objet usage renvoyé par chaque réponse. Il expose notamment :

{
  "usage": {
    "input_tokens": 0,
    "output_tokens": 0,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0
  }
}
Enter fullscreen mode Exit fullscreen mode

Cette ventilation permet de vérifier séparément l’entrée, la sortie, les écritures de cache et les lectures de cache.

Inspection de l’usage dans Apidog

Apidog est une plateforme de développement et de test d’API. Configurez une requête vers l’endpoint Messages avec "model": "claude-opus-5", puis appliquez cette checklist :

  1. Dupliquez la requête pour chaque niveau d’effort et comparez les jetons de réflexion sur des prompts identiques.
  2. Ajoutez une assertion pour vérifier que usage.cache_read_input_tokens > 0. Un cache défaillant doit provoquer un test en erreur, pas une facture imprévue.
  3. Stockez vos clés dans des variables d’environnement plutôt que dans le corps de la requête.
  4. Surveillez le flux SSE afin d’observer où partent les jetons de sortie lors des générations longues.
  5. Exportez ou journalisez les blocs usage afin de suivre les dérives de coût après une modification de prompt ou de modèle.

Téléchargez Apidog pour tester ces scénarios, puis consultez le guide API Claude Opus 5 pour les détails d’intégration.

Ce que vous achetez réellement à 5 $ / 25 $

Opus 5 propose un bon ratio prix-capacité, mais ce n’est pas le modèle Claude le plus haut de gamme. Fable 5 reste le modèle largement diffusé le plus performant d’Anthropic. Opus 5 reste également en retrait de Mythos 5 pour l’exploitation de cybersécurité et la recherche autonome en biologie, selon Anthropic.

Le positionnement pratique est donc : une capacité de pointe à la moitié du tarif de pointe, avec un modèle supérieur clairement identifié. L’explication du modèle de classe Mythos décrit ce niveau supérieur.

Pour la plupart des équipes, la vraie décision est souvent : avez-vous réellement besoin d’Opus ? Sonnet 5, à 2 $ / 10 $ puis 3 $ / 15 $ à partir du 1er septembre 2026, peut suffire pour environ 40 % du prix.

Exécutez les deux modèles sur vos propres évaluations avant de réserver un budget. Consultez l’aperçu de Claude Opus 5 ainsi que l’aperçu des modèles Anthropic pour les spécifications et disponibilités.

FAQ

Combien coûte Claude Opus 5 ?

L’API standard coûte 5 $ par million de jetons d’entrée et 25 $ par million de jetons de sortie. Les lectures de cache coûtent 0,50 $ / MTok, Batch coûte 2,50 $ / 12,50 $ et le mode rapide coûte 10 $ / 50 $.

Claude Opus 5 est-il plus cher qu’Opus 4.8 ?

Non, les tarifs par jeton sont identiques. En revanche, votre facture peut augmenter parce que la réflexion est activée par défaut et que les réponses peuvent être plus longues. Mesurez les jetons consommés au lieu de supposer une parité de coût.

Y a-t-il une majoration pour les contextes longs sur la fenêtre de 1 million de jetons ?

Non. La fenêtre de 1 million de jetons est la valeur par défaut et le maximum ; les longues entrées restent au tarif standard.

Quelle est la manière la moins chère d’exécuter Claude Opus 5 ?

Mettez en cache les préfixes réutilisés de 512 jetons ou plus, utilisez Batch pour les travaux non urgents et testez les niveaux d’effort afin de choisir le plus faible qui passe vos évaluations. Le guide de la voie gratuite et la moins chère fournit plus de détails.

L’épinglage régional coûte-t-il plus cher ?

Oui. Définir inference_geo: "us" applique un multiplicateur de 1,1× à chaque catégorie de jetons, y compris les lectures de cache et les traitements Batch.

Top comments (0)