Claude Haiku 5.5 pontua 72,4% no OSWorld 2.1, 1620 no GDPval-AA v2.1, 46,4% no FrontierCode 1.1 e 39,2% no Terminal-Bench 4.0. Haiku 4.5 pontuou 15,7%, 735 e 0,0% em três desses testes. Esses são resultados de esforço máximo; no esforço padrão medium, o GDPval-AA cai para 1277. Nenhum laboratório independente publicou resultados do Haiku 5.5 ainda.
A seguir, veja cada benchmark do Claude Haiku 5.5, quem o executou, como o esforço altera pontuação e custo, e como validar o modelo no seu próprio tráfego com o Apidog. Para especificações e preços, comece por o que é Claude Haiku 5.5.
A tabela de lançamento
Cada resultado do Haiku 5.5 usa pensamento adaptativo no esforço máximo, normalmente com média de cinco tentativas. O Terminal-Bench usou dez tentativas por tarefa. “n/r” significa que nenhum resultado foi publicado.
| Benchmark | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, subconjunto offline | 72,4% | 15,7% | 48,9% | 83,9% |
| Humanity’s Last Exam, sem ferramentas | 45,9% | 10,2% | n/r | 56,9% |
| Humanity’s Last Exam, com ferramentas | 57,4% | 18,7% | n/r | 64,5% |
| Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| FrontierCode 1.1 (Main) | 46,4% | n/r | 42,4% | 52,1% (xhigh) |
| Chartography, sem ferramentas | 46,4% | 6,4% | 29,1% | 61,6% |
Quem executou cada benchmark
A Anthropic executou a maior parte dos testes. Benchmarks com o mesmo nome podem usar ambientes, ferramentas e níveis de esforço diferentes entre fornecedores.
| Benchmark | Quem executou | Condições |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, de forma independente | GDPval-AA: 220 tarefas, 44 ocupações, Elo ancorado no DeepSeek V4.1 Flash (max) em 1600; Briefcase: projetos de várias semanas |
| FrontierCode 1.1 | Cognition | Claude no Claude Code, GPT no Codex; Main = as 100 tarefas mais difíceis de 150 |
| Chartography | Anthropic, no benchmark da Surge AI | Avaliador Gemini 3.5 Flash; pontuação Luna da Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tarefas, 10 tentativas cada, salvaguardas ativadas |
| OSWorld 2.1 | Anthropic | 82 de 108 tarefas, 1080p, até 500 passos |
| Humanity’s Last Exam | Anthropic | Orçamento de 980K tokens por tarefa, avaliador Opus 4.6 |
Duas células do GPT-6 Luna exigem contexto:
- A Anthropic executou a pontuação OSWorld da Luna pela API da OpenAI, nas mesmas 82 tarefas.
- Os 16,4% da Luna no Terminal-Bench vêm do placar público, com Codex CLI e esforço máximo.
- No Terminal-Bench, as salvaguardas interromperam 1,8% das tentativas do Haiku 5.5 — 12 de 660 — e todas foram contabilizadas como falha.
A armadilha do FrontierCode
A tabela de lançamento compara Haiku 5.5 em max (46,4%) com Sonnet 5.5 em xhigh (52,1%), que é a melhor pontuação do Sonnet. O cartão do sistema traz os resultados diretamente comparáveis:
| FrontierCode 1.1 | Main | Extended |
|---|---|---|
Haiku 5.5, max
|
46,4% | 58,4% |
Haiku 5.5, xhigh
|
45,8% | n/r |
Sonnet 5.5, max
|
46,2% | 59,1% |
Sonnet 5.5, xhigh
|
52,1% | 64,4% |
No esforço máximo, o Haiku 5.5 supera o Sonnet 5.5 no conjunto Main: 46,4% contra 46,2%.
Na melhor configuração de cada modelo, o Sonnet lidera por 5,7 pontos. Ao citar esse benchmark, informe sempre o nível de esforço.
Extras do cartão do sistema
O cartão do sistema inclui benchmarks ausentes da publicação de lançamento. Todos usam esforço máximo, salvo indicação contrária.
| Benchmark | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64,8 | n/r | 81,3 |
| SWE-bench Multilingual | 83,7 | 67,4 | 90,3 |
| SWE-bench Multimodal | 30,7 | 19,8 | 54,3 |
| OSWorld 2.1, taxa de aprovação estrita | 37,1% | n/r | 48,8% |
| Chartography, com ferramentas | 86,2% | 8,8% | 90,2% |
| OfficeQA / OfficeQA Pro | 73,5% / 60,3% | 63,0% / 47,1% | 76,9% / 65,6% |
| HealthBench Professional, ajustado por comprimento | 64,8% | 32,2% | 69,2% |
Os 72,4% no OSWorld representam crédito parcial; apenas 37,1% das tarefas passam diretamente.
No Chartography, o uso de ferramentas quase dobra a pontuação do Haiku 5.5, de 46,4% para 86,2%. Para fluxos que criam ou manipulam gráficos, forneça ferramentas ao modelo.
Esforço padrão pontua mais baixo
O Haiku 5.5 usa medium como padrão na API do Claude e no Claude Code. O cartão do sistema registra os seguintes resultados nesse nível:
| Benchmark | Médio, padrão | Max | Nota |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Médio usou cerca de um décimo dos tokens de saída do máximo |
| AA-Briefcase v1.1 | 1372 | 1578 | Médio usou menos de um quarto dos tokens de saída do máximo |
| HealthBench Professional | 59,9% | 64,8% | Baixo: 57,9%; alto: 61,3% |
Se você chamar a API sem output_config.effort, espere os resultados da coluna medium, não da coluna max. Consulte a documentação de esforço para os cinco níveis disponíveis.
Pontuação e custo por esforço
Os valores abaixo vêm dos gráficos de lançamento e são apresentados como pontuação seguida de custo. OSWorld e Terminal-Bench usam custo por tentativa; GDPval-AA usa custo por tarefa.
| Modelo | Baixo | Médio | Alto | Xhigh | Max |
|---|---|---|---|---|---|
| OSWorld 2.1 | |||||
| Haiku 5.5 | 42,0% (US$ 0,07) | 53,3% (US$ 0,13) | 61,3% (US$ 0,18) | 67,6% (US$ 0,28) | 72,4% (US$ 0,61) |
| Sonnet 5.5 | 57,9% (US$ 0,68) | 66,0% (US$ 0,93) | 73,2% (US$ 1,38) | 81,1% (US$ 2,22) | 83,9% (US$ 5,73) |
| GPT-6 Luna | 19,2% (US$ 0,04) | 37,5% (US$ 0,13) | 42,3% (US$ 0,14) | 44,8% (US$ 0,17) | 48,9% (US$ 0,21) |
| GDPval-AA v2.1 | |||||
| Haiku 5.5 | 1125 (US$ 0,012) | 1277 (US$ 0,030) | 1420 (US$ 0,089) | 1513 (US$ 0,27) | 1620 (US$ 0,87) |
| Sonnet 5.5 | 1179 (US$ 0,22) | 1324 (US$ 0,27) | 1551 (US$ 0,62) | 1731 (US$ 1,88) | 1840 (US$ 6,78) |
| GPT-6 Luna | 1036 (US$ 0,004) | 1262 (US$ 0,02) | 1344 (US$ 0,03) | 1364 (US$ 0,05) | 1437 (US$ 0,09) |
| Terminal-Bench 4.0 | |||||
| Haiku 5.5 | 12,7% (US$ 0,42) | 20,3% (US$ 0,68) | 24,8% (US$ 1,04) | 31,5% (US$ 1,75) | 39,2% (US$ 2,64) |
| Sonnet 5.5 | 20,0% (US$ 0,62) | 28,8% (US$ 0,68) | 43,0% (US$ 1,46) | 61,5% (US$ 4,34) | 70,6% (US$ 10,44) |
Pontos práticos para decidir o esforço:
-
maxé caro para o ganho final. No GDPval-AA,maxcusta cerca de 28 vezes mais quemediumpara adicionar 343 pontos Elo. No OSWorld,maxcusta mais que o dobro dexhighpor 4,8 pontos. -
Haiku 5.5 em
mediumsupera Luna emmaxno OSWorld: 53,3% por US$ 0,13 contra 48,9% por US$ 0,21. -
Haiku 5.5 em
maxsupera Sonnet 5.5 emmediumno OSWorld: 72,4% por US$ 0,61 contra 66,0% por US$ 0,93. -
Terminal-Bench é a exceção. Sonnet 5.5 em
high— 43,0% por US$ 1,46 — supera Haiku 5.5 emmax— 39,2% por US$ 2,64.
Luna é mais barato nos demais níveis correspondentes. Para a comparação detalhada, veja Haiku 5.5 vs GPT-6 Luna.
Os custos usam preços de tabela: US$ 0,10/US$ 0,50 por milhão de tokens para prompts de até 100K tokens, com preço maior acima desse limite. Veja o detalhamento de preços.
Onde o Haiku 5.5 ainda está atrás
Sonnet 5.5 lidera todas as linhas da tabela de lançamento. A única vitória direta do Haiku ocorre no FrontierCode com ambos os modelos em esforço máximo.
As maiores diferenças aparecem em tarefas de codificação agentic:
- Terminal-Bench 4.0: 39,2% para Haiku 5.5 contra 70,6% para Sonnet 5.5.
- SWE-Bench Pro: 64,8 contra 81,3.
- SWE-bench Multimodal: 30,7 contra 54,3.
A Anthropic afirma que Sonnet 5.5 e Opus 5.5 continuam sendo opções melhores para tarefas complexas de codificação agentic.
Use Haiku 5.5 para trabalhos de escopo limitado, como:
- compactação;
- sumarização;
- classificação;
- uso de navegador;
- subagentes coordenados por um modelo maior.
Veja como adotá-lo como subagente em Haiku 5.5 no Claude Code.
Resultados independentes: nenhum ainda
Em 8 de outubro de 2026, nenhum laboratório independente publicou resultados do Haiku 5.5.
A página da Artificial Analysis para Haiku 5.5 retorna 404, e seu ranking lista apenas o Claude 4.5 Haiku. Vals, LMArena, SWE-bench e Aider também não exibiram resultados.
Também não há dados de velocidade de terceiros. A Anthropic chama o Haiku 5.5 de seu “modelo mais rápido até o momento” na velocidade padrão, embora seja mais lento que Opus no Modo Rápido.
O número externo mais próximo vem do Cursor. A documentação do modelo informa que Haiku 5.5 pontua 48,4% no CursorBench com esforço máximo, acima dos 30,9% em low.
Com pensamento desativado, o Cursor relata de 22,1% a 26,2% nos mesmos níveis de esforço em que o pensamento ativado alcançou de 30,9% a 42,3%.
O que os clientes relatam
Os dados abaixo vêm da publicação de lançamento da Anthropic e não foram verificados independentemente:
- HubSpot: 92,8% em média em três execuções na suíte de portal CRM simulado; a melhor pontuação observada nessa suíte.
- AlphaSense: 0,84 contra 0,76 do Haiku 4.5 em 400 consultas de “Perguntar no Documento”, diferença considerada estatisticamente significativa.
- Box: 11 pontos acima do Haiku 4.5 com aproximadamente metade da latência, em testes iniciais.
- Asana: mais de 30% menos latência para conclusão de tarefas em comparação ao modelo atual.
- Cognition: Devin Fusion alcança 66,2 no FrontierCode usando Haiku 5.5 como auxiliar e Opus 5.5 como líder. É um sistema de dois modelos, não um resultado do Haiku isoladamente.
Execute sua própria avaliação
Benchmarks não representam necessariamente o seu tráfego. O guia de prompts da Anthropic recomenda usar xhigh ou max apenas quando suas avaliações mostrarem ganho e executar o mesmo conjunto contra Sonnet 5.5.
Use este processo no Apidog:
- Armazene
ANTHROPIC_API_KEYcomo variável de ambiente. - Salve de 20 a 50 prompts reais como requisições da API Messages.
- Adicione asserções para:
- status HTTP
200; -
stop_reasondiferente de"max_tokens"e"refusal"; - conteúdo obrigatório para considerar a resposta correta.
- status HTTP
- Execute a coleção em
low,mediumehigh. - Registre taxa de aprovação e contagem de tokens em
usage. - Duplique a coleção, altere o modelo para
claude-sonnet-5-5e compare ambos no mesmo projeto.
Alterar o esforço invalida o cache de prompts.
Exemplo de requisição:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Classify this support ticket as billing, bug or feature request: ..."
}
]
}'
Não envie temperature, top_p, top_k nem preenchimento inicial do assistente: cada um retorna HTTP 400 no Haiku 5.5.
Ao processar a resposta, selecione os blocos pelo campo type, porque um bloco thinking pode aparecer antes do conteúdo final.
Veja também o guia da API e este guia sobre testar aplicativos LLM.
Perguntas frequentes
O Claude Haiku 5.5 é melhor que o Sonnet 5.5?
Não pelos números da Anthropic. Sonnet 5.5 lidera todas as linhas da tabela de lançamento. Haiku só o supera no FrontierCode quando ambos usam max: 46,4% contra 46,2%.
Veja Haiku 5.5 vs Haiku 4.5 para a comparação de atualização.
Qual é a pontuação SWE-bench do Haiku 5.5?
- SWE-Bench Pro: 64,8
- SWE-bench Multilingual: 83,7
- SWE-bench Multimodal: 30,7
Todos os resultados usam esforço máximo.
Com qual esforço os benchmarks foram executados?
Em max, geralmente com média de cinco tentativas. O padrão da API é medium, no qual o GDPval-AA pontua 1277 em vez de 1620.
Existem benchmarks independentes para o Haiku 5.5?
Ainda não. A Artificial Analysis executou o GDPval-AA e o AA-Briefcase de forma independente, mas a Anthropic publicou essas pontuações. A Artificial Analysis não tem uma página para Haiku 5.5.
O GPT-6 Luna é mais barato?
Geralmente, sim. Luna custa menos em todos os níveis de esforço do GDPval-AA e em todos os níveis do OSWorld, exceto em medium, onde os dois custam aproximadamente o mesmo. Haiku 5.5 pontua mais alto nos dois benchmarks.
Próximo passo
Comece em medium e aumente o esforço apenas quando o ganho na taxa de aprovação justificar o custo.
Baixe o Apidog, crie a coleção de avaliação e mantenha os resultados no Apidog ao lado da linha de base do Sonnet 5.5 antes de alterar o tráfego de produção.
Top comments (0)