DEV Community

Cover image for Claude Haiku 5.5 Benchmarks
Lucas
Lucas

Posted on Originally published at apidog.com

Claude Haiku 5.5 Benchmarks

Claude Haiku 5.5 pontua 72,4% no OSWorld 2.1, 1620 no GDPval-AA v2.1, 46,4% no FrontierCode 1.1 e 39,2% no Terminal-Bench 4.0. Haiku 4.5 pontuou 15,7%, 735 e 0,0% em três desses testes. Esses são resultados de esforço máximo; no esforço padrão medium, o GDPval-AA cai para 1277. Nenhum laboratório independente publicou resultados do Haiku 5.5 ainda.

Experimente o Apidog hoje

A seguir, veja cada benchmark do Claude Haiku 5.5, quem o executou, como o esforço altera pontuação e custo, e como validar o modelo no seu próprio tráfego com o Apidog. Para especificações e preços, comece por o que é Claude Haiku 5.5.

A tabela de lançamento

Cada resultado do Haiku 5.5 usa pensamento adaptativo no esforço máximo, normalmente com média de cinco tentativas. O Terminal-Bench usou dez tentativas por tarefa. “n/r” significa que nenhum resultado foi publicado.

Benchmark Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, subconjunto offline 72,4% 15,7% 48,9% 83,9%
Humanity’s Last Exam, sem ferramentas 45,9% 10,2% n/r 56,9%
Humanity’s Last Exam, com ferramentas 57,4% 18,7% n/r 64,5%
Terminal-Bench 4.0 39,2% 0,0% 16,4% 70,6%
FrontierCode 1.1 (Main) 46,4% n/r 42,4% 52,1% (xhigh)
Chartography, sem ferramentas 46,4% 6,4% 29,1% 61,6%

Quem executou cada benchmark

A Anthropic executou a maior parte dos testes. Benchmarks com o mesmo nome podem usar ambientes, ferramentas e níveis de esforço diferentes entre fornecedores.

Benchmark Quem executou Condições
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, de forma independente GDPval-AA: 220 tarefas, 44 ocupações, Elo ancorado no DeepSeek V4.1 Flash (max) em 1600; Briefcase: projetos de várias semanas
FrontierCode 1.1 Cognition Claude no Claude Code, GPT no Codex; Main = as 100 tarefas mais difíceis de 150
Chartography Anthropic, no benchmark da Surge AI Avaliador Gemini 3.5 Flash; pontuação Luna da Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 tarefas, 10 tentativas cada, salvaguardas ativadas
OSWorld 2.1 Anthropic 82 de 108 tarefas, 1080p, até 500 passos
Humanity’s Last Exam Anthropic Orçamento de 980K tokens por tarefa, avaliador Opus 4.6

Duas células do GPT-6 Luna exigem contexto:

  • A Anthropic executou a pontuação OSWorld da Luna pela API da OpenAI, nas mesmas 82 tarefas.
  • Os 16,4% da Luna no Terminal-Bench vêm do placar público, com Codex CLI e esforço máximo.
  • No Terminal-Bench, as salvaguardas interromperam 1,8% das tentativas do Haiku 5.5 — 12 de 660 — e todas foram contabilizadas como falha.

A armadilha do FrontierCode

A tabela de lançamento compara Haiku 5.5 em max (46,4%) com Sonnet 5.5 em xhigh (52,1%), que é a melhor pontuação do Sonnet. O cartão do sistema traz os resultados diretamente comparáveis:

FrontierCode 1.1 Main Extended
Haiku 5.5, max 46,4% 58,4%
Haiku 5.5, xhigh 45,8% n/r
Sonnet 5.5, max 46,2% 59,1%
Sonnet 5.5, xhigh 52,1% 64,4%

No esforço máximo, o Haiku 5.5 supera o Sonnet 5.5 no conjunto Main: 46,4% contra 46,2%.

Na melhor configuração de cada modelo, o Sonnet lidera por 5,7 pontos. Ao citar esse benchmark, informe sempre o nível de esforço.

Extras do cartão do sistema

O cartão do sistema inclui benchmarks ausentes da publicação de lançamento. Todos usam esforço máximo, salvo indicação contrária.

Benchmark Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64,8 n/r 81,3
SWE-bench Multilingual 83,7 67,4 90,3
SWE-bench Multimodal 30,7 19,8 54,3
OSWorld 2.1, taxa de aprovação estrita 37,1% n/r 48,8%
Chartography, com ferramentas 86,2% 8,8% 90,2%
OfficeQA / OfficeQA Pro 73,5% / 60,3% 63,0% / 47,1% 76,9% / 65,6%
HealthBench Professional, ajustado por comprimento 64,8% 32,2% 69,2%

Os 72,4% no OSWorld representam crédito parcial; apenas 37,1% das tarefas passam diretamente.

No Chartography, o uso de ferramentas quase dobra a pontuação do Haiku 5.5, de 46,4% para 86,2%. Para fluxos que criam ou manipulam gráficos, forneça ferramentas ao modelo.

Esforço padrão pontua mais baixo

O Haiku 5.5 usa medium como padrão na API do Claude e no Claude Code. O cartão do sistema registra os seguintes resultados nesse nível:

Benchmark Médio, padrão Max Nota
GDPval-AA v2.1 1277 1620 Médio usou cerca de um décimo dos tokens de saída do máximo
AA-Briefcase v1.1 1372 1578 Médio usou menos de um quarto dos tokens de saída do máximo
HealthBench Professional 59,9% 64,8% Baixo: 57,9%; alto: 61,3%

Se você chamar a API sem output_config.effort, espere os resultados da coluna medium, não da coluna max. Consulte a documentação de esforço para os cinco níveis disponíveis.

Pontuação e custo por esforço

Os valores abaixo vêm dos gráficos de lançamento e são apresentados como pontuação seguida de custo. OSWorld e Terminal-Bench usam custo por tentativa; GDPval-AA usa custo por tarefa.

Modelo Baixo Médio Alto Xhigh Max
OSWorld 2.1
Haiku 5.5 42,0% (US$ 0,07) 53,3% (US$ 0,13) 61,3% (US$ 0,18) 67,6% (US$ 0,28) 72,4% (US$ 0,61)
Sonnet 5.5 57,9% (US$ 0,68) 66,0% (US$ 0,93) 73,2% (US$ 1,38) 81,1% (US$ 2,22) 83,9% (US$ 5,73)
GPT-6 Luna 19,2% (US$ 0,04) 37,5% (US$ 0,13) 42,3% (US$ 0,14) 44,8% (US$ 0,17) 48,9% (US$ 0,21)
GDPval-AA v2.1
Haiku 5.5 1125 (US$ 0,012) 1277 (US$ 0,030) 1420 (US$ 0,089) 1513 (US$ 0,27) 1620 (US$ 0,87)
Sonnet 5.5 1179 (US$ 0,22) 1324 (US$ 0,27) 1551 (US$ 0,62) 1731 (US$ 1,88) 1840 (US$ 6,78)
GPT-6 Luna 1036 (US$ 0,004) 1262 (US$ 0,02) 1344 (US$ 0,03) 1364 (US$ 0,05) 1437 (US$ 0,09)
Terminal-Bench 4.0
Haiku 5.5 12,7% (US$ 0,42) 20,3% (US$ 0,68) 24,8% (US$ 1,04) 31,5% (US$ 1,75) 39,2% (US$ 2,64)
Sonnet 5.5 20,0% (US$ 0,62) 28,8% (US$ 0,68) 43,0% (US$ 1,46) 61,5% (US$ 4,34) 70,6% (US$ 10,44)

Pontos práticos para decidir o esforço:

  • max é caro para o ganho final. No GDPval-AA, max custa cerca de 28 vezes mais que medium para adicionar 343 pontos Elo. No OSWorld, max custa mais que o dobro de xhigh por 4,8 pontos.
  • Haiku 5.5 em medium supera Luna em max no OSWorld: 53,3% por US$ 0,13 contra 48,9% por US$ 0,21.
  • Haiku 5.5 em max supera Sonnet 5.5 em medium no OSWorld: 72,4% por US$ 0,61 contra 66,0% por US$ 0,93.
  • Terminal-Bench é a exceção. Sonnet 5.5 em high — 43,0% por US$ 1,46 — supera Haiku 5.5 em max — 39,2% por US$ 2,64.

Luna é mais barato nos demais níveis correspondentes. Para a comparação detalhada, veja Haiku 5.5 vs GPT-6 Luna.

Os custos usam preços de tabela: US$ 0,10/US$ 0,50 por milhão de tokens para prompts de até 100K tokens, com preço maior acima desse limite. Veja o detalhamento de preços.

Onde o Haiku 5.5 ainda está atrás

Sonnet 5.5 lidera todas as linhas da tabela de lançamento. A única vitória direta do Haiku ocorre no FrontierCode com ambos os modelos em esforço máximo.

As maiores diferenças aparecem em tarefas de codificação agentic:

  • Terminal-Bench 4.0: 39,2% para Haiku 5.5 contra 70,6% para Sonnet 5.5.
  • SWE-Bench Pro: 64,8 contra 81,3.
  • SWE-bench Multimodal: 30,7 contra 54,3.

A Anthropic afirma que Sonnet 5.5 e Opus 5.5 continuam sendo opções melhores para tarefas complexas de codificação agentic.

Use Haiku 5.5 para trabalhos de escopo limitado, como:

  • compactação;
  • sumarização;
  • classificação;
  • uso de navegador;
  • subagentes coordenados por um modelo maior.

Veja como adotá-lo como subagente em Haiku 5.5 no Claude Code.

Resultados independentes: nenhum ainda

Em 8 de outubro de 2026, nenhum laboratório independente publicou resultados do Haiku 5.5.

A página da Artificial Analysis para Haiku 5.5 retorna 404, e seu ranking lista apenas o Claude 4.5 Haiku. Vals, LMArena, SWE-bench e Aider também não exibiram resultados.

Também não há dados de velocidade de terceiros. A Anthropic chama o Haiku 5.5 de seu “modelo mais rápido até o momento” na velocidade padrão, embora seja mais lento que Opus no Modo Rápido.

O número externo mais próximo vem do Cursor. A documentação do modelo informa que Haiku 5.5 pontua 48,4% no CursorBench com esforço máximo, acima dos 30,9% em low.

Com pensamento desativado, o Cursor relata de 22,1% a 26,2% nos mesmos níveis de esforço em que o pensamento ativado alcançou de 30,9% a 42,3%.

O que os clientes relatam

Os dados abaixo vêm da publicação de lançamento da Anthropic e não foram verificados independentemente:

  • HubSpot: 92,8% em média em três execuções na suíte de portal CRM simulado; a melhor pontuação observada nessa suíte.
  • AlphaSense: 0,84 contra 0,76 do Haiku 4.5 em 400 consultas de “Perguntar no Documento”, diferença considerada estatisticamente significativa.
  • Box: 11 pontos acima do Haiku 4.5 com aproximadamente metade da latência, em testes iniciais.
  • Asana: mais de 30% menos latência para conclusão de tarefas em comparação ao modelo atual.
  • Cognition: Devin Fusion alcança 66,2 no FrontierCode usando Haiku 5.5 como auxiliar e Opus 5.5 como líder. É um sistema de dois modelos, não um resultado do Haiku isoladamente.

Execute sua própria avaliação

Benchmarks não representam necessariamente o seu tráfego. O guia de prompts da Anthropic recomenda usar xhigh ou max apenas quando suas avaliações mostrarem ganho e executar o mesmo conjunto contra Sonnet 5.5.

Use este processo no Apidog:

  1. Armazene ANTHROPIC_API_KEY como variável de ambiente.
  2. Salve de 20 a 50 prompts reais como requisições da API Messages.
  3. Adicione asserções para:
    • status HTTP 200;
    • stop_reason diferente de "max_tokens" e "refusal";
    • conteúdo obrigatório para considerar a resposta correta.
  4. Execute a coleção em low, medium e high.
  5. Registre taxa de aprovação e contagem de tokens em usage.
  6. Duplique a coleção, altere o modelo para claude-sonnet-5-5 e compare ambos no mesmo projeto.

Alterar o esforço invalida o cache de prompts.

Exemplo de requisição:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug or feature request: ..."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Não envie temperature, top_p, top_k nem preenchimento inicial do assistente: cada um retorna HTTP 400 no Haiku 5.5.

Ao processar a resposta, selecione os blocos pelo campo type, porque um bloco thinking pode aparecer antes do conteúdo final.

Veja também o guia da API e este guia sobre testar aplicativos LLM.

Perguntas frequentes

O Claude Haiku 5.5 é melhor que o Sonnet 5.5?

Não pelos números da Anthropic. Sonnet 5.5 lidera todas as linhas da tabela de lançamento. Haiku só o supera no FrontierCode quando ambos usam max: 46,4% contra 46,2%.

Veja Haiku 5.5 vs Haiku 4.5 para a comparação de atualização.

Qual é a pontuação SWE-bench do Haiku 5.5?

  • SWE-Bench Pro: 64,8
  • SWE-bench Multilingual: 83,7
  • SWE-bench Multimodal: 30,7

Todos os resultados usam esforço máximo.

Com qual esforço os benchmarks foram executados?

Em max, geralmente com média de cinco tentativas. O padrão da API é medium, no qual o GDPval-AA pontua 1277 em vez de 1620.

Existem benchmarks independentes para o Haiku 5.5?

Ainda não. A Artificial Analysis executou o GDPval-AA e o AA-Briefcase de forma independente, mas a Anthropic publicou essas pontuações. A Artificial Analysis não tem uma página para Haiku 5.5.

O GPT-6 Luna é mais barato?

Geralmente, sim. Luna custa menos em todos os níveis de esforço do GDPval-AA e em todos os níveis do OSWorld, exceto em medium, onde os dois custam aproximadamente o mesmo. Haiku 5.5 pontua mais alto nos dois benchmarks.

Próximo passo

Comece em medium e aumente o esforço apenas quando o ganho na taxa de aprovação justificar o custo.

Baixe o Apidog, crie a coleção de avaliação e mantenha os resultados no Apidog ao lado da linha de base do Sonnet 5.5 antes de alterar o tráfego de produção.

Top comments (0)