DEV Community

Cover image for Claude Haiku 5.5 Benchmarks
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

Claude Haiku 5.5 Benchmarks

Claude Haiku 5.5 obtient 72,4 % sur OSWorld 2.1, 1620 sur GDPval-AA v2.1, 46,4 % sur FrontierCode 1.1 et 39,2 % sur Terminal-Bench 4.0. Haiku 4.5 a obtenu 15,7 %, 735 et 0,0 % sur trois de ces benchmarks. Ces résultats utilisent tous l’effort maximal ; avec l’effort medium par défaut, GDPval-AA descend à 1277. Aucun laboratoire indépendant n’a encore publié de résultats pour Haiku 5.5.

Essayez Apidog dès aujourd’hui

Voici les benchmarks de Claude Haiku 5.5, leurs conditions d’exécution, l’impact de l’effort sur le score et le coût, ainsi qu’une méthode pour tester le modèle sur votre trafic dans Apidog. Pour les spécifications et tarifs, consultez d’abord qu’est-ce que Claude Haiku 5.5.

Le tableau de lancement

Les résultats Haiku 5.5 utilisent une réflexion adaptative à effort maximal, généralement moyennée sur cinq essais. Terminal-Bench utilise dix essais par tâche. n/r signifie qu’aucun résultat n’a été publié.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, sous-ensemble hors ligne 72,4 % 15,7 % 48,9 % 83,9 %
Humanity’s Last Exam, sans outils 45,9 % 10,2 % n/r 56,9 %
Humanity’s Last Exam, avec outils 57,4 % 18,7 % n/r 64,5 %
Terminal-Bench 4.0 39,2 % 0,0 % 16,4 % 70,6 %
FrontierCode 1.1 (Main) 46,4 % n/r 42,4 % 52,1 % (xhigh)
Chartography, sans outils 46,4 % 6,4 % 29,1 % 61,6 %

Qui a exécuté chaque benchmark ?

Ne comparez pas uniquement les noms de benchmarks : les fournisseurs peuvent utiliser des harnais, des outils et des niveaux d’effort différents.

Benchmark Exécuté par Conditions
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, indépendamment GDPval-AA : 220 tâches, 44 métiers, Elo ancré à DeepSeek V4.1 Flash (max) à 1600 ; Briefcase : projets de plusieurs semaines
FrontierCode 1.1 Cognition Claude dans Claude Code, GPT dans Codex ; Main = 100 tâches les plus difficiles sur 150
Chartography Anthropic, sur le benchmark de Surge AI Évaluateur Gemini 3.5 Flash ; score Luna provenant de Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tâches, 10 essais par tâche, protections activées
OSWorld 2.1 Anthropic 82 tâches sur 108, 1080p, jusqu’à 500 étapes
Humanity’s Last Exam Anthropic Budget de 980K tokens par tâche, évaluateur Opus 4.6

Deux résultats GPT-6 Luna nécessitent un contexte :

  • Anthropic a exécuté OSWorld de Luna via l’API OpenAI sur les mêmes 82 tâches.
  • Le score Terminal-Bench de Luna, 16,4 %, provient du classement public avec Codex CLI à effort maximal.
  • Sur Terminal-Bench, les protections ont arrêté 1,8 % des essais Haiku 5.5, soit 12 essais sur 660. Chaque arrêt a été compté comme un échec.

Le piège FrontierCode

Le tableau de lancement compare Haiku 5.5 à effort maximal, 46,4 %, avec Sonnet 5.5 à xhigh, 52,1 %. Ce ne sont pas les mêmes réglages.

La fiche système fournit une comparaison directe :

FrontierCode 1.1 Main Extended
Haiku 5.5, max 46,4 % 58,4 %
Haiku 5.5, xhigh 45,8 % n/r
Sonnet 5.5, max 46,2 % 59,1 %
Sonnet 5.5, xhigh 52,1 % 64,4 %

À effort maximal identique, Haiku 5.5 devance légèrement Sonnet 5.5 sur Main : 46,4 % contre 46,2 %.

En revanche, au meilleur réglage de chaque modèle, Sonnet 5.5 mène de 5,7 points. Indiquez donc toujours le niveau d’effort lorsque vous citez un score FrontierCode.

Résultats supplémentaires de la fiche système

La fiche système inclut des résultats absents de la publication de lancement. Tous utilisent l’effort maximal, sauf indication contraire.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64,8 n/r 81,3
SWE-bench Multilingual 83,7 67,4 90,3
SWE-bench Multimodal 30,7 19,8 54,3
OSWorld 2.1, taux de réussite strict 37,1 % n/r 48,8 %
Chartography, avec outils 86,2 % 8,8 % 90,2 %
OfficeQA / OfficeQA Pro 73,5 % / 60,3 % 63,0 % / 47,1 % 76,9 % / 65,6 %
HealthBench Professional, ajusté à la longueur 64,8 % 32,2 % 69,2 %

Deux implications pratiques :

  • Les 72,4 % d’OSWorld représentent du crédit partiel : seulement 37,1 % des tâches sont totalement réussies.
  • Chartography passe de 46,4 % sans outils à 86,2 % avec outils. Pour les tâches graphiques, fournissez donc les outils nécessaires à Haiku 5.5.

L’effort par défaut produit des scores inférieurs

Haiku 5.5 utilise medium par défaut dans l’API Claude et Claude Code.

Benchmark medium par défaut max Note
GDPval-AA v2.1 1277 1620 medium utilise environ un dixième des tokens de sortie de max
AA-Briefcase v1.1 1372 1578 medium utilise moins d’un quart des tokens de sortie de max
HealthBench Professional 59,9 % 64,8 % low : 57,9 % ; high : 61,3 %

Si vous appelez l’API sans output_config.effort, attendez-vous aux scores de la colonne medium.

La documentation sur l’effort décrit les cinq niveaux disponibles.

Score et coût selon l’effort

Les valeurs suivantes proviennent des graphiques de lancement. Les coûts OSWorld et Terminal-Bench sont par tentative ; ceux de GDPval-AA sont par tâche.

OSWorld 2.1

Modèle Faible Medium Élevé Xhigh Max
Haiku 5.5 42,0 % (0,07 $) 53,3 % (0,13 $) 61,3 % (0,18 $) 67,6 % (0,28 $) 72,4 % (0,61 $)
Sonnet 5.5 57,9 % (0,68 $) 66,0 % (0,93 $) 73,2 % (1,38 $) 81,1 % (2,22 $) 83,9 % (5,73 $)
GPT-6 Luna 19,2 % (0,04 $) 37,5 % (0,13 $) 42,3 % (0,14 $) 44,8 % (0,17 $) 48,9 % (0,21 $)

GDPval-AA v2.1

Modèle Faible Medium Élevé Xhigh Max
Haiku 5.5 1125 (0,012 $) 1277 (0,030 $) 1420 (0,089 $) 1513 (0,27 $) 1620 (0,87 $)
Sonnet 5.5 1179 (0,22 $) 1324 (0,27 $) 1551 (0,62 $) 1731 (1,88 $) 1840 (6,78 $)
GPT-6 Luna 1036 (0,004 $) 1262 (0,02 $) 1344 (0,03 $) 1364 (0,05 $) 1437 (0,09 $)

Terminal-Bench 4.0

Modèle Faible Medium Élevé Xhigh Max
Haiku 5.5 12,7 % (0,42 $) 20,3 % (0,68 $) 24,8 % (1,04 $) 31,5 % (1,75 $) 39,2 % (2,64 $)
Sonnet 5.5 20,0 % (0,62 $) 28,8 % (0,68 $) 43,0 % (1,46 $) 61,5 % (4,34 $) 70,6 % (10,44 $)

À retenir :

  • Le dernier palier vers max est coûteux. Sur GDPval-AA, max coûte environ 28 fois plus que medium pour 343 points Elo supplémentaires. Sur OSWorld, max coûte plus de deux fois xhigh pour seulement 4,8 points.
  • Haiku 5.5 en medium dépasse Luna en max sur OSWorld : 53,3 % pour 0,13 $, contre 48,9 % pour 0,21 $.
  • Haiku 5.5 en max dépasse Sonnet 5.5 en medium sur OSWorld : 72,4 % pour 0,61 $, contre 66,0 % pour 0,93 $.
  • Terminal-Bench est l’exception. Sonnet 5.5 en high, 43,0 % pour 1,46 $, dépasse Haiku 5.5 en max, 39,2 % pour 2,64 $.

Luna est moins cher aux niveaux d’effort correspondants, sauf en medium sur OSWorld où les coûts sont proches. Consultez Haiku 5.5 vs GPT-6 Luna pour le détail.

Les coûts reposent sur les prix catalogue : 0,10 $ / 0,50 $ par million de tokens pour les prompts jusqu’à 100K tokens, avec des tarifs plus élevés au-delà. Voir le détail des prix.

Là où Haiku 5.5 reste en retrait

Sonnet 5.5 est en tête de toutes les lignes du tableau de lancement. Haiku 5.5 ne le dépasse que sur FrontierCode à effort maximal identique.

Les écarts notables sont :

  • Terminal-Bench 4.0 : 39,2 % pour Haiku 5.5 contre 70,6 % pour Sonnet 5.5.
  • SWE-Bench Pro : 64,8 contre 81,3.
  • SWE-bench Multimodal : 30,7 contre 54,3.

Anthropic indique que Sonnet 5.5 et Opus 5.5 restent de meilleurs choix pour les tâches complexes de codage agentique.

Utilisez plutôt Haiku 5.5 pour des charges étroites et répétables :

  • compaction de contexte ;
  • résumé ;
  • classification ;
  • utilisation de navigateur ;
  • sous-agents pilotés par un modèle plus puissant.

Le scénario de sous-agent à coût réduit est présenté dans Haiku 5.5 dans Claude Code.

Résultats indépendants : aucun pour l’instant

Au 8 octobre 2026, aucun laboratoire indépendant n’a publié de résultats pour Haiku 5.5.

La page Haiku 5.5 d’Artificial Analysis renvoie une erreur 404, et son classement ne liste que Claude 4.5 Haiku. Vals, LMArena, SWE-bench et Aider n’ont pas non plus publié de résultat.

Il n’existe pas de chiffre de vitesse tiers. Anthropic décrit Haiku 5.5 comme son modèle le plus rapide à vitesse standard, mais plus lent qu’Opus en mode rapide.

Le résultat externe le plus proche vient de Cursor. Sa documentation du modèle indique :

  • 48,4 % sur CursorBench à effort maximal ;
  • 30,9 % à effort faible ;
  • avec la réflexion désactivée, entre 22,1 % et 26,2 % aux mêmes niveaux où la réflexion activée atteint 30,9 % à 42,3 %.

Ce que les clients rapportent

Les chiffres suivants proviennent de la publication de lancement d’Anthropic et ne sont pas vérifiés indépendamment :

  • HubSpot : 92,8 % en moyenne sur trois exécutions de sa suite de portail CRM simulée.
  • AlphaSense : 0,84 contre 0,76 pour Haiku 4.5 sur 400 requêtes « Ask in Document ».
  • Box : 11 points de plus que Haiku 4.5 avec environ la moitié de la latence lors des premiers tests.
  • Asana : plus de 30 % de latence en moins pour l’achèvement des tâches par rapport à son modèle actuel.
  • Cognition : Devin Fusion atteint 66,2 sur FrontierCode avec Haiku 5.5 comme acolyte et Opus 5.5 comme leader. Il s’agit d’un système à deux modèles, pas d’un score Haiku seul.

Exécutez votre propre évaluation

Les benchmarks ne représentent pas forcément votre trafic de production.

Le guide de prompt d’Anthropic recommande d’utiliser xhigh ou max uniquement si vos propres évaluations démontrent un gain. Exécutez aussi les mêmes cas avec Sonnet 5.5.

Procédure dans Apidog

  1. Stockez ANTHROPIC_API_KEY comme variable d’environnement.
  2. Créez une collection de 20 à 50 prompts réels sous forme de requêtes Messages.
  3. Ajoutez des assertions :
    • statut HTTP 200 ;
    • stop_reason différent de "max_tokens" et "refusal" ;
    • présence des éléments attendus dans une réponse correcte.
  4. Exécutez la collection en low, medium et high.
  5. Enregistrez le taux de réussite, usage.input_tokens et usage.output_tokens.
  6. Dupliquez la collection, remplacez le modèle par claude-sonnet-5-5, puis comparez les résultats dans le même projet.

Modifier l’effort invalide le cache des prompts. Le nouveau tokenizer produit aussi environ 30 % de tokens supplémentaires par rapport à Haiku 4.5 pour le même texte.

Exemple de requête Messages :

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug or feature request: ..."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

N’envoyez pas temperature, top_p, top_k ni de préremplissage assistant : chacun provoque une erreur 400 avec Haiku 5.5.

Sélectionnez également les blocs de réponse selon leur champ type, car un bloc thinking peut apparaître avant le bloc de texte final.

Consultez le guide de l’API et le guide sur le test des applications LLM.

FAQ

Claude Haiku 5.5 est-il meilleur que Sonnet 5.5 ?

Pas selon les chiffres d’Anthropic. Sonnet 5.5 mène toutes les lignes du tableau de lancement. Haiku ne le dépasse que sur FrontierCode lorsque les deux modèles utilisent max : 46,4 % contre 46,2 %. Consultez Haiku 5.5 vs Haiku 4.5 pour comparer les générations.

Quel est le score SWE-bench de Haiku 5.5 ?

64,8 sur SWE-Bench Pro, 83,7 sur SWE-bench Multilingual et 30,7 sur SWE-bench Multimodal, tous à effort maximal.

À quel niveau d’effort les benchmarks ont-ils été exécutés ?

À effort maximal, généralement avec une moyenne de cinq essais. Le réglage API par défaut est medium, où GDPval-AA atteint 1277 au lieu de 1620.

Existe-t-il des benchmarks indépendants pour Haiku 5.5 ?

Pas encore. Artificial Analysis a exécuté GDPval-AA et AA-Briefcase indépendamment, mais Anthropic a publié les scores et Artificial Analysis ne dispose pas encore d’une page Haiku 5.5.

GPT-6 Luna est-il moins cher ?

Généralement, oui. Luna coûte moins cher à chaque niveau sur GDPval-AA et OSWorld, sauf au niveau medium où les coûts sont proches. Haiku 5.5 obtient toutefois de meilleurs scores sur ces deux benchmarks.

Étape suivante

Commencez avec medium. N’augmentez l’effort que si le gain de taux de réussite justifie le coût sur vos propres cas d’usage.

Téléchargez Apidog, créez la collection d’évaluation ci-dessus et conservez les résultats dans Apidog, à côté de votre référence Sonnet 5.5, avant de déplacer du trafic de production.

Top comments (0)