Claude Haiku 5.5 obtient 72,4 % sur OSWorld 2.1, 1620 sur GDPval-AA v2.1, 46,4 % sur FrontierCode 1.1 et 39,2 % sur Terminal-Bench 4.0. Haiku 4.5 a obtenu 15,7 %, 735 et 0,0 % sur trois de ces benchmarks. Ces résultats utilisent tous l’effort maximal ; avec l’effort medium par défaut, GDPval-AA descend à 1277. Aucun laboratoire indépendant n’a encore publié de résultats pour Haiku 5.5.
Essayez Apidog dès aujourd’hui
Voici les benchmarks de Claude Haiku 5.5, leurs conditions d’exécution, l’impact de l’effort sur le score et le coût, ainsi qu’une méthode pour tester le modèle sur votre trafic dans Apidog. Pour les spécifications et tarifs, consultez d’abord qu’est-ce que Claude Haiku 5.5.
Le tableau de lancement
Les résultats Haiku 5.5 utilisent une réflexion adaptative à effort maximal, généralement moyennée sur cinq essais. Terminal-Bench utilise dix essais par tâche. n/r signifie qu’aucun résultat n’a été publié.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, sous-ensemble hors ligne | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, sans outils | 45,9 % | 10,2 % | n/r | 56,9 % |
| Humanity’s Last Exam, avec outils | 57,4 % | 18,7 % | n/r | 64,5 % |
| Terminal-Bench 4.0 | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| FrontierCode 1.1 (Main) | 46,4 % | n/r | 42,4 % | 52,1 % (xhigh) |
| Chartography, sans outils | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Qui a exécuté chaque benchmark ?
Ne comparez pas uniquement les noms de benchmarks : les fournisseurs peuvent utiliser des harnais, des outils et des niveaux d’effort différents.
| Benchmark | Exécuté par | Conditions |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, indépendamment | GDPval-AA : 220 tâches, 44 métiers, Elo ancré à DeepSeek V4.1 Flash (max) à 1600 ; Briefcase : projets de plusieurs semaines |
| FrontierCode 1.1 | Cognition | Claude dans Claude Code, GPT dans Codex ; Main = 100 tâches les plus difficiles sur 150 |
| Chartography | Anthropic, sur le benchmark de Surge AI | Évaluateur Gemini 3.5 Flash ; score Luna provenant de Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tâches, 10 essais par tâche, protections activées |
| OSWorld 2.1 | Anthropic | 82 tâches sur 108, 1080p, jusqu’à 500 étapes |
| Humanity’s Last Exam | Anthropic | Budget de 980K tokens par tâche, évaluateur Opus 4.6 |
Deux résultats GPT-6 Luna nécessitent un contexte :
- Anthropic a exécuté OSWorld de Luna via l’API OpenAI sur les mêmes 82 tâches.
- Le score Terminal-Bench de Luna, 16,4 %, provient du classement public avec Codex CLI à effort maximal.
- Sur Terminal-Bench, les protections ont arrêté 1,8 % des essais Haiku 5.5, soit 12 essais sur 660. Chaque arrêt a été compté comme un échec.
Le piège FrontierCode
Le tableau de lancement compare Haiku 5.5 à effort maximal, 46,4 %, avec Sonnet 5.5 à xhigh, 52,1 %. Ce ne sont pas les mêmes réglages.
La fiche système fournit une comparaison directe :
| FrontierCode 1.1 | Main | Extended |
|---|---|---|
Haiku 5.5, max
|
46,4 % | 58,4 % |
Haiku 5.5, xhigh
|
45,8 % | n/r |
Sonnet 5.5, max
|
46,2 % | 59,1 % |
Sonnet 5.5, xhigh
|
52,1 % | 64,4 % |
À effort maximal identique, Haiku 5.5 devance légèrement Sonnet 5.5 sur Main : 46,4 % contre 46,2 %.
En revanche, au meilleur réglage de chaque modèle, Sonnet 5.5 mène de 5,7 points. Indiquez donc toujours le niveau d’effort lorsque vous citez un score FrontierCode.
Résultats supplémentaires de la fiche système
La fiche système inclut des résultats absents de la publication de lancement. Tous utilisent l’effort maximal, sauf indication contraire.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64,8 | n/r | 81,3 |
| SWE-bench Multilingual | 83,7 | 67,4 | 90,3 |
| SWE-bench Multimodal | 30,7 | 19,8 | 54,3 |
| OSWorld 2.1, taux de réussite strict | 37,1 % | n/r | 48,8 % |
| Chartography, avec outils | 86,2 % | 8,8 % | 90,2 % |
| OfficeQA / OfficeQA Pro | 73,5 % / 60,3 % | 63,0 % / 47,1 % | 76,9 % / 65,6 % |
| HealthBench Professional, ajusté à la longueur | 64,8 % | 32,2 % | 69,2 % |
Deux implications pratiques :
- Les
72,4 %d’OSWorld représentent du crédit partiel : seulement37,1 %des tâches sont totalement réussies. - Chartography passe de
46,4 %sans outils à86,2 %avec outils. Pour les tâches graphiques, fournissez donc les outils nécessaires à Haiku 5.5.
L’effort par défaut produit des scores inférieurs
Haiku 5.5 utilise medium par défaut dans l’API Claude et Claude Code.
| Benchmark |
medium par défaut |
max |
Note |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 |
medium utilise environ un dixième des tokens de sortie de max
|
| AA-Briefcase v1.1 | 1372 | 1578 |
medium utilise moins d’un quart des tokens de sortie de max
|
| HealthBench Professional | 59,9 % | 64,8 % |
low : 57,9 % ; high : 61,3 % |
Si vous appelez l’API sans output_config.effort, attendez-vous aux scores de la colonne medium.
La documentation sur l’effort décrit les cinq niveaux disponibles.
Score et coût selon l’effort
Les valeurs suivantes proviennent des graphiques de lancement. Les coûts OSWorld et Terminal-Bench sont par tentative ; ceux de GDPval-AA sont par tâche.
OSWorld 2.1
| Modèle | Faible | Medium | Élevé | Xhigh | Max |
|---|---|---|---|---|---|
| Haiku 5.5 | 42,0 % (0,07 $) | 53,3 % (0,13 $) | 61,3 % (0,18 $) | 67,6 % (0,28 $) | 72,4 % (0,61 $) |
| Sonnet 5.5 | 57,9 % (0,68 $) | 66,0 % (0,93 $) | 73,2 % (1,38 $) | 81,1 % (2,22 $) | 83,9 % (5,73 $) |
| GPT-6 Luna | 19,2 % (0,04 $) | 37,5 % (0,13 $) | 42,3 % (0,14 $) | 44,8 % (0,17 $) | 48,9 % (0,21 $) |
GDPval-AA v2.1
| Modèle | Faible | Medium | Élevé | Xhigh | Max |
|---|---|---|---|---|---|
| Haiku 5.5 | 1125 (0,012 $) | 1277 (0,030 $) | 1420 (0,089 $) | 1513 (0,27 $) | 1620 (0,87 $) |
| Sonnet 5.5 | 1179 (0,22 $) | 1324 (0,27 $) | 1551 (0,62 $) | 1731 (1,88 $) | 1840 (6,78 $) |
| GPT-6 Luna | 1036 (0,004 $) | 1262 (0,02 $) | 1344 (0,03 $) | 1364 (0,05 $) | 1437 (0,09 $) |
Terminal-Bench 4.0
| Modèle | Faible | Medium | Élevé | Xhigh | Max |
|---|---|---|---|---|---|
| Haiku 5.5 | 12,7 % (0,42 $) | 20,3 % (0,68 $) | 24,8 % (1,04 $) | 31,5 % (1,75 $) | 39,2 % (2,64 $) |
| Sonnet 5.5 | 20,0 % (0,62 $) | 28,8 % (0,68 $) | 43,0 % (1,46 $) | 61,5 % (4,34 $) | 70,6 % (10,44 $) |
À retenir :
-
Le dernier palier vers
maxest coûteux. Sur GDPval-AA,maxcoûte environ 28 fois plus quemediumpour 343 points Elo supplémentaires. Sur OSWorld,maxcoûte plus de deux foisxhighpour seulement 4,8 points. -
Haiku 5.5 en
mediumdépasse Luna enmaxsur OSWorld :53,3 %pour0,13 $, contre48,9 %pour0,21 $. -
Haiku 5.5 en
maxdépasse Sonnet 5.5 enmediumsur OSWorld :72,4 %pour0,61 $, contre66,0 %pour0,93 $. -
Terminal-Bench est l’exception. Sonnet 5.5 en
high,43,0 %pour1,46 $, dépasse Haiku 5.5 enmax,39,2 %pour2,64 $.
Luna est moins cher aux niveaux d’effort correspondants, sauf en medium sur OSWorld où les coûts sont proches. Consultez Haiku 5.5 vs GPT-6 Luna pour le détail.
Les coûts reposent sur les prix catalogue : 0,10 $ / 0,50 $ par million de tokens pour les prompts jusqu’à 100K tokens, avec des tarifs plus élevés au-delà. Voir le détail des prix.
Là où Haiku 5.5 reste en retrait
Sonnet 5.5 est en tête de toutes les lignes du tableau de lancement. Haiku 5.5 ne le dépasse que sur FrontierCode à effort maximal identique.
Les écarts notables sont :
- Terminal-Bench 4.0 :
39,2 %pour Haiku 5.5 contre70,6 %pour Sonnet 5.5. - SWE-Bench Pro :
64,8contre81,3. - SWE-bench Multimodal :
30,7contre54,3.
Anthropic indique que Sonnet 5.5 et Opus 5.5 restent de meilleurs choix pour les tâches complexes de codage agentique.
Utilisez plutôt Haiku 5.5 pour des charges étroites et répétables :
- compaction de contexte ;
- résumé ;
- classification ;
- utilisation de navigateur ;
- sous-agents pilotés par un modèle plus puissant.
Le scénario de sous-agent à coût réduit est présenté dans Haiku 5.5 dans Claude Code.
Résultats indépendants : aucun pour l’instant
Au 8 octobre 2026, aucun laboratoire indépendant n’a publié de résultats pour Haiku 5.5.
La page Haiku 5.5 d’Artificial Analysis renvoie une erreur 404, et son classement ne liste que Claude 4.5 Haiku. Vals, LMArena, SWE-bench et Aider n’ont pas non plus publié de résultat.
Il n’existe pas de chiffre de vitesse tiers. Anthropic décrit Haiku 5.5 comme son modèle le plus rapide à vitesse standard, mais plus lent qu’Opus en mode rapide.
Le résultat externe le plus proche vient de Cursor. Sa documentation du modèle indique :
-
48,4 %sur CursorBench à effort maximal ; -
30,9 %à effort faible ; - avec la réflexion désactivée, entre
22,1 %et26,2 %aux mêmes niveaux où la réflexion activée atteint30,9 %à42,3 %.
Ce que les clients rapportent
Les chiffres suivants proviennent de la publication de lancement d’Anthropic et ne sont pas vérifiés indépendamment :
-
HubSpot :
92,8 %en moyenne sur trois exécutions de sa suite de portail CRM simulée. -
AlphaSense :
0,84contre0,76pour Haiku 4.5 sur 400 requêtes « Ask in Document ». - Box : 11 points de plus que Haiku 4.5 avec environ la moitié de la latence lors des premiers tests.
- Asana : plus de 30 % de latence en moins pour l’achèvement des tâches par rapport à son modèle actuel.
-
Cognition : Devin Fusion atteint
66,2sur FrontierCode avec Haiku 5.5 comme acolyte et Opus 5.5 comme leader. Il s’agit d’un système à deux modèles, pas d’un score Haiku seul.
Exécutez votre propre évaluation
Les benchmarks ne représentent pas forcément votre trafic de production.
Le guide de prompt d’Anthropic recommande d’utiliser xhigh ou max uniquement si vos propres évaluations démontrent un gain. Exécutez aussi les mêmes cas avec Sonnet 5.5.
Procédure dans Apidog
- Stockez
ANTHROPIC_API_KEYcomme variable d’environnement. - Créez une collection de 20 à 50 prompts réels sous forme de requêtes Messages.
- Ajoutez des assertions :
- statut HTTP
200; -
stop_reasondifférent de"max_tokens"et"refusal"; - présence des éléments attendus dans une réponse correcte.
- statut HTTP
- Exécutez la collection en
low,mediumethigh. - Enregistrez le taux de réussite,
usage.input_tokensetusage.output_tokens. - Dupliquez la collection, remplacez le modèle par
claude-sonnet-5-5, puis comparez les résultats dans le même projet.
Modifier l’effort invalide le cache des prompts. Le nouveau tokenizer produit aussi environ 30 % de tokens supplémentaires par rapport à Haiku 4.5 pour le même texte.
Exemple de requête Messages :
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Classify this support ticket as billing, bug or feature request: ..."
}
]
}'
N’envoyez pas temperature, top_p, top_k ni de préremplissage assistant : chacun provoque une erreur 400 avec Haiku 5.5.
Sélectionnez également les blocs de réponse selon leur champ type, car un bloc thinking peut apparaître avant le bloc de texte final.
Consultez le guide de l’API et le guide sur le test des applications LLM.
FAQ
Claude Haiku 5.5 est-il meilleur que Sonnet 5.5 ?
Pas selon les chiffres d’Anthropic. Sonnet 5.5 mène toutes les lignes du tableau de lancement. Haiku ne le dépasse que sur FrontierCode lorsque les deux modèles utilisent max : 46,4 % contre 46,2 %. Consultez Haiku 5.5 vs Haiku 4.5 pour comparer les générations.
Quel est le score SWE-bench de Haiku 5.5 ?
64,8 sur SWE-Bench Pro, 83,7 sur SWE-bench Multilingual et 30,7 sur SWE-bench Multimodal, tous à effort maximal.
À quel niveau d’effort les benchmarks ont-ils été exécutés ?
À effort maximal, généralement avec une moyenne de cinq essais. Le réglage API par défaut est medium, où GDPval-AA atteint 1277 au lieu de 1620.
Existe-t-il des benchmarks indépendants pour Haiku 5.5 ?
Pas encore. Artificial Analysis a exécuté GDPval-AA et AA-Briefcase indépendamment, mais Anthropic a publié les scores et Artificial Analysis ne dispose pas encore d’une page Haiku 5.5.
GPT-6 Luna est-il moins cher ?
Généralement, oui. Luna coûte moins cher à chaque niveau sur GDPval-AA et OSWorld, sauf au niveau medium où les coûts sont proches. Haiku 5.5 obtient toutefois de meilleurs scores sur ces deux benchmarks.
Étape suivante
Commencez avec medium. N’augmentez l’effort que si le gain de taux de réussite justifie le coût sur vos propres cas d’usage.
Téléchargez Apidog, créez la collection d’évaluation ci-dessus et conservez les résultats dans Apidog, à côté de votre référence Sonnet 5.5, avant de déplacer du trafic de production.
Top comments (0)