DEV Community

Cover image for GPT-6.1 Sol vs Claude Sonnet 5.5 : Même prix 2$/10$, lancés à un jour d'intervalle, aucun benchmark commun
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

GPT-6.1 Sol vs Claude Sonnet 5.5 : Même prix 2$/10$, lancés à un jour d'intervalle, aucun benchmark commun

GPT-6.1 Sol et Claude Sonnet 5.5 affichent le même prix catalogue : 2 $ par million de tokens d’entrée et 10 $ par million de tokens de sortie. Lancés à un jour d’intervalle — Sonnet 5.5 le 28 septembre 2026, GPT-6.1 Sol le 29 septembre — ils n’ont pas encore fait l’objet d’une comparaison directe par leurs fournisseurs. Pour choisir, ne vous arrêtez pas au prix par token : exécutez les deux modèles sur vos tâches réelles et mesurez le coût par tâche réussie.

Essayez Apidog dès aujourd’hui

Ce guide réunit les spécifications, les tarifs, les benchmarks publiés et une procédure reproductible dans Apidog. Pour les détails de chaque modèle, consultez qu’est-ce que GPT-6.1 Sol et qu’est-ce que Claude Sonnet 5.5.

GPT-6.1 Sol vs Claude Sonnet 5.5 : spécifications et tarifs

Sources : tarification OpenAI, aperçu de Sonnet 5.5 et tarification Anthropic.

GPT-6.1 Sol Claude Sonnet 5.5
ID du modèle gpt-6.1-sol claude-sonnet-5-5 — Bedrock : anthropic.claude-sonnet-5-5
Lancé le 29 sept. 2026 28 sept. 2026
Entrée / sortie par 1M 2 $ / 10 $ 2 $ / 10 $
Lectures de cache par 1M 0,10 $ 0,20 $
Écritures de cache par 1M 2,50 $ 2,50 $ sur 5 min, 4 $ sur 1 h
Traitement par lots par 1M 1 $ / 5 $ 1 $ / 5 $
Prompts de plus de 272K tokens d’entrée 4 $ entrée, 0,20 $ cache, 15 $ sortie pour toute la requête Pas de surcoût sur la fenêtre de 1M
Niveau plus rapide Fast : 4 $ / 20 $ ; Ultra-fast annoncé « bientôt disponible » Aucun mode rapide
Fenêtre de contexte 1 050 000 tokens, dont 922 000 en entrée max 1M
Sortie maximale 128 000 128K ; 300K en batch avec un en-tête bêta
Date limite de connaissance 30 avr. 2026 Juin 2026
Niveaux d’effort low, medium par défaut, high, xhigh, max ; pas de none low, medium, high par défaut API, xhigh, max ; réflexion non désactivable
API Responses avec outils, Chat Completions sans outils, Batch Messages, Batch
Autres plateformes OpenRouter : openai/gpt-6.1-sol Bedrock, Google Cloud, Microsoft Foundry, Claude Platform sur AWS
Accès gratuit Aucun niveau API gratuit Chat disponible sur Claude.ai, API facturée au token

Ce qui change réellement votre facture

Deux variables doivent guider votre choix :

  1. Prompts système longs et fortement réutilisés

    Les lectures de cache de GPT-6.1 Sol coûtent 0,10 $ par million de tokens, contre 0,20 $ pour Sonnet 5.5. Si vous réutilisez souvent un long contexte système, GPT-6.1 Sol est avantagé.

  2. Très grands contextes sans cache

    Au-delà de 272K tokens d’entrée, GPT-6.1 Sol applique une tarification supérieure sur l’ensemble de la requête. Selon la page du modèle GPT-6.1 Sol, un prompt de 400 000 tokens suivi d’une réponse de 5 000 tokens coûte environ :

    • 1,68 $ avec GPT-6.1 Sol ;
    • 0,85 $ avec Claude Sonnet 5.5.

Le prix catalogue identique ne garantit donc pas un coût identique par tâche.

Ce que chaque fournisseur déclare

OpenAI sur GPT-6.1 Sol Anthropic sur Claude Sonnet 5.5
Comparé à GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 Sonnet 5, Opus 5.5, GPT-6 Sol
Comparaison directe avec l’autre modèle Non Non : GPT-6.1 Sol n’existait pas encore
Positionnement Intelligence proche d’Astra à un cinquième du prix standard d’Astra Plus de 30 % plus rapide que Sonnet 5, jusqu’à 30 % de moins par tâche
Origine des chiffres OpenAI ; résultats concurrents issus de rapports publics selon une note de bas de page Anthropic, Cognition, Cursor, Artificial Analysis et Surge AI selon les benchmarks

Le post de lancement de GPT-6.1 Sol rapporte notamment :

  • AutomationBench 1.0.6, effort moyen : +2,2 points face à Opus 5.5 pour environ un tiers du coût, et +4,8 points face à GPT-6 Sol.
  • Terminal-Bench Science 0.1, effort maximal : 5,47 $ par tâche, contre 23,21 $ pour Opus 5.5.
  • OSWorld 2.0 hors ligne, effort maximal : +7 points face à GPT-6 Sol pour moins de la moitié du coût.

Le post de lancement de Sonnet 5.5 inclut GPT-6 Sol dans ses comparaisons :

  • FrontierCode 1.1, par Cognition : Sonnet 5.5 atteint 52,1 % à xhigh, contre 49,3 % pour GPT-6 Sol.
  • GDPval-AA v2.1 et AA-Briefcase v1.1, par Artificial Analysis : 1844 contre 1487, puis 1811 contre 1483.

Pour les autres résultats publiés par Anthropic, voir le détail des benchmarks de Sonnet 5.5.

Pourquoi il ne faut pas fusionner ces benchmarks

Les graphiques des fournisseurs ne mesurent pas toujours les mêmes conditions :

  • OpenAI rapporte AutomationBench 1.0.6 à effort moyen.
  • Anthropic exécute ses modèles Claude à effort maximal dans sa fiche système.
  • OpenAI utilise OSWorld 2.0 hors ligne.
  • Anthropic utilise OSWorld 2.1.
  • Anthropic donne un score Terminal-Bench Science à Sonnet 5.5, mais OpenAI ne publie pas de score brut équivalent pour GPT-6.1 Sol.

Vous ne pouvez donc pas déduire un classement fiable de GPT-6.1 Sol vs Sonnet 5.5 en reliant des résultats indirects. La comparaison GPT-6 Sol vs Claude Opus 5.5 rencontre le même problème méthodologique.

Mesures tierces : GPT-6 Sol, pas GPT-6.1 Sol

Les comparaisons tierces disponibles associent encore Sonnet 5.5 à GPT-6 Sol, et non à GPT-6.1 Sol.

La comparaison la plus large est celle d’Artificial Analysis, dont l’Intelligence Index v4.3.2 combine 10 évaluations.

Effort Indice Sonnet 5.5 Coût/tâche Sonnet 5.5 Indice GPT-6 Sol Coût/tâche GPT-6 Sol
Moyen 41 0,59 $ 40 0,25 $
Élevé 47 1,08 $ 43 0,38 $
Très élevé 52 2,74 $ 44 0,52 $
Max 56 7,60 $ 48 1,05 $

À effort maximal, Artificial Analysis mesure :

  • Sonnet 5.5 : 138 tokens de sortie/s
  • GPT-6 Sol : 76 tokens de sortie/s

Sonnet 5.5 obtient des scores supérieurs dans ce tableau, mais avec un coût par tâche plus élevé. L’écart vient de la consommation effective de tokens, pas du prix catalogue.

Exemple intéressant : Sonnet 5.5 à effort élevé atteint un indice de 47 pour 1,08 $ par tâche, tandis que GPT-6 Sol à effort maximal atteint 48 pour 1,05 $.

Ces données ne sont pas directement transposables à GPT-6.1 Sol. OpenAI affirme que GPT-6.1 Sol dépasse GPT-6 Sol à effort égal ou inférieur sur plusieurs benchmarks ; attendez des mesures tierces avant de tirer une conclusion définitive.

Cas d’usage : où tester chaque modèle en priorité

GPT-6.1 Sol

D’après le positionnement d’OpenAI, commencez par GPT-6.1 Sol si vous travaillez sur :

  • du codage complexe ;
  • des agents et automatisations ;
  • de l’utilisation informatique ;
  • des tâches scientifiques ou professionnelles ;
  • des prompts système longs réutilisés via le cache ;
  • des besoins de latence plus faible avec le niveau Fast.

Claude Sonnet 5.5

D’après le positionnement d’Anthropic, commencez par Sonnet 5.5 si vous travaillez sur :

  • des tâches quotidiennes bien définies ;
  • des corrections de bugs ;
  • des documents, diapositives ou feuilles de calcul ;
  • du codage agentique ;
  • des charges avec plus de 272K tokens d’entrée ;
  • des déploiements sur Bedrock, Google Cloud ou Microsoft Foundry.

Anthropic précise qu’Opus 5.5 reste plus adapté aux travaux complexes et ouverts. Voir Sonnet 5.5 vs Opus 5.5.

Évitez les faux comparatifs

Avant de lancer votre benchmark, contrôlez ces deux points.

1. Alignez les niveaux d’effort

Les niveaux ne sont pas calibrés de manière identique :

  • GPT-6.1 Sol utilise medium par défaut ;
  • Sonnet 5.5 utilise high par défaut dans l’API.

Testez au minimum medium et high sur les deux fournisseurs. Ne supposez pas que deux réglages portant le même nom consomment le même budget de raisonnement.

2. Ne modifiez pas arbitrairement les paramètres d’échantillonnage

Sonnet 5.5 retourne une erreur 400 si temperature, top_p ou top_k ne sont pas définis à leur valeur par défaut.

Les directives GPT-6 recommandent aussi de réduire temperature et top_p lorsque l’effort n’est pas none.

Pour limiter la variance, exécutez chaque tâche plusieurs fois et comparez les taux de réussite, les tokens et le coût médian.

Comparez les deux modèles dans Apidog

L’objectif est de calculer :

coût par tâche réussie = dépenses totales / nombre de tâches réussies
Enter fullscreen mode Exit fullscreen mode

1. Constituez un jeu de test réaliste

Sélectionnez 20 à 50 tâches issues de votre trafic réel. Chaque tâche doit avoir un résultat vérifiable :

  • un JSON valide ;
  • une valeur dans une colonne ;
  • une étiquette ;
  • une réponse contenant une information attendue ;
  • un test sur votre dépôt ou votre suite CI.

2. Créez l’environnement

Dans Apidog, ajoutez ces variables secrètes :

OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
Enter fullscreen mode Exit fullscreen mode

Ajoutez aussi une variable prompt alimentée depuis votre fichier CSV.

3. Enregistrez la requête OpenAI

Consultez la référence Responses.

POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{
  "model": "gpt-6.1-sol",
  "reasoning": {
    "effort": "{{EFFORT}}"
  },
  "max_output_tokens": 25000,
  "input": "{{prompt}}"
}
Enter fullscreen mode Exit fullscreen mode

4. Enregistrez la requête Anthropic

Consultez la référence Messages.

POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 25000,
  "output_config": {
    "effort": "{{EFFORT}}"
  },
  "messages": [
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Les deux APIs n’utilisent pas la même structure. La comparaison des formats d’API explique les différences de forme entre fournisseurs.

5. Ajoutez les assertions de transport et de contenu

Vérification OpenAI Responses Anthropic Messages
Requête terminée $.status est égal à completed $.stop_reason est égal à end_turn
Réponse présente $.output[*].type contient message $.content[*].type contient text
Tokens de sortie $.usage.output_tokens $.usage.output_tokens
Lectures de cache $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
Écritures de cache $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens

Ajoutez ensuite une assertion métier : JSON conforme au schéma, champ égal à expected, test unitaire réussi ou classification correcte.

6. Calculez le coût réel à partir de l’usage retourné

Pour OpenAI :

  • input_tokens inclut les tokens lus depuis le cache et ceux utilisés pour écrire le cache ;
  • soustrayez-les avant d’appliquer le tarif standard d’entrée ;
  • appliquez le tarif de lecture et d’écriture de cache séparément ;
  • appliquez la règle de surcoût dès que l’entrée dépasse 272K tokens.

Référence : mise en cache des prompts OpenAI.

Pour Anthropic :

  • input_tokens ne représente que les tokens après le dernier point de rupture du cache ;
  • utilisez séparément les compteurs de lecture et de création de cache.

Référence : mise en cache des prompts Anthropic.

7. Exécutez un scénario depuis la CLI

Préparez un fichier prompts.csv avec vos prompts sur une seule ligne et sans guillemets superflus.

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Exécutez le scénario au moins avec :

EFFORT=medium
EFFORT=high
Enter fullscreen mode Exit fullscreen mode

Conservez pour chaque ligne :

  • le fournisseur ;
  • le modèle ;
  • le niveau d’effort ;
  • le statut de réussite ;
  • les tokens d’entrée ;
  • les tokens de sortie ;
  • les lectures et écritures de cache ;
  • le coût calculé ;
  • la latence ;
  • le résultat métier.

Pour les implémentations complètes, consultez le guide de l’API GPT-6.1 Sol et comment utiliser l’API Claude Sonnet 5.5.

FAQ

GPT-6.1 Sol est-il moins cher que Claude Sonnet 5.5 ?

Le prix catalogue est identique : 2 $ par million de tokens d’entrée et 10 $ par million de tokens de sortie.

GPT-6.1 Sol est moins cher sur les lectures de cache. Claude Sonnet 5.5 est moins cher lorsque l’entrée dépasse 272K tokens. Le coût final dépend surtout de la consommation de tokens par tâche.

Lequel est le meilleur pour le codage ?

Il n’existe pas encore de benchmark commun entre GPT-6.1 Sol et Sonnet 5.5.

Anthropic rapporte que Sonnet 5.5 dépasse GPT-6 Sol sur FrontierCode. OpenAI rapporte que GPT-6.1 Sol dépasse le meilleur score DeepSWE de GPT-6 Sol de 6,4 points. Testez les deux sur votre dépôt, vos bugs et votre CI.

Lequel est le plus rapide ?

Artificial Analysis a mesuré Sonnet 5.5 à 138 tokens par seconde et GPT-6 Sol à 76 tokens par seconde, tous deux à effort maximal. Il n’existe pas encore de mesure tierce équivalente pour GPT-6.1 Sol.

L’un des deux est-il gratuit ?

GPT-6.1 Sol ne dispose pas de niveau gratuit. Sonnet 5.5 est accessible dans les applications de chat Claude.ai, mais l’API est facturée par token.

Voir aussi : comment utiliser Claude Sonnet 5.5 gratuitement.

Choisissez en exécutant les deux

Prenez dix tâches de votre backlog, exécutez GPT-6.1 Sol et Claude Sonnet 5.5 avec medium puis high, puis comparez :

  1. le taux de réussite ;
  2. la latence ;
  3. le volume de tokens ;
  4. le coût par tâche réussie ;
  5. les erreurs qualitatives importantes pour votre produit.

Téléchargez Apidog pour conserver ce comparatif sous forme de scénario réexécutable lorsque des mesures tierces de GPT-6.1 Sol seront disponibles ou lorsqu’un fournisseur publiera un nouveau snapshot.

Top comments (0)