DEV Community

Cover image for Claude Opus 5 Benchmarks: O Que os Números Realmente Dizem
Lucas
Lucas

Posted on • Originally published at apidog.com

Claude Opus 5 Benchmarks: O Que os Números Realmente Dizem

A Anthropic lançou o Claude Opus 5 em 24 de julho de 2026 com alegações de benchmark muito fortes: mais que o dobro da pontuação do Opus 4.8 em uma avaliação, cerca de 3x o próximo melhor modelo em outra e vantagem sobre o Fable 5 com menor custo em uma terceira.

Experimente o Apidog hoje

Essas alegações não são necessariamente incorretas. Mas devem ser lidas como qualquer benchmark publicado por fornecedor: verificando o que foi medido, qual configuração foi usada, contra qual baseline e quais dados ficaram de fora. Este guia reúne as alegações publicadas para o Opus 5, explica como interpretá-las e mostra como reproduzir uma avaliação prática no Apidog.

Para o modelo em si — claude-opus-5, contexto de 1M, saída máxima de 128k e corte de conhecimento em maio de 2026 — comece por o que é o Claude Opus 5. A fonte primária das alegações é o post de lançamento do Claude Opus 5 da Anthropic.

Todas as alegações publicadas em uma tabela

A tabela abaixo consolida as alegações de benchmark divulgadas no lançamento. Observe especialmente a coluna Declarado como: uma proporção ou posição relativa normalmente fornece menos informação do que uma pontuação absoluta.

Benchmark Alegação da Anthropic Declarado como Comparado com
Frontier-Bench v0.1 Supera todos os outros modelos; mais que o dobro da pontuação do Opus 4.8, a um custo menor por tarefa Proporção + custo Opus 4.8 e outros modelos
ARC-AGI 3 Aproximadamente 3x a pontuação do próximo melhor modelo Proporção Próximo melhor modelo não nomeado
OSWorld 2.0 Supera o Fable 5 a um terço do custo Posição + custo Fable 5
CursorBench 3.2 Dentro de 0.5% do pico do Fable 5, pela metade do preço Lacuna + custo Fable 5
Zapier AutomationBench Taxa de aprovação aproximadamente 1.5x a do próximo melhor modelo Proporção Próximo melhor modelo não nomeado
Química orgânica +10.2 pontos sobre o Opus 4.8 Delta absoluto Opus 4.8
Análise de proteínas +7.7 pontos sobre o Opus 4.8 Delta absoluto Opus 4.8
Exploração de segurança cibernética Atrás do Mythos 5 Posição Mythos 5
Pesquisa biológica autônoma Atrás do Mythos 5 Posição Mythos 5

A fonte dessas declarações é o post de lançamento e a documentação da Anthropic. No momento da escrita, nenhuma terceira parte publicou uma reprodução independente desses resultados.

Resumo visual dos benchmarks do Claude Opus 5

Antes de analisar cada benchmark, há dois sinais importantes:

  1. Apenas duas das nove alegações apresentam variação absoluta em pontos.
  2. A própria Anthropic informa os cenários nos quais o Opus 5 fica atrás de outro modelo.

Como interpretar alegações em proporção

Quatro alegações — Frontier-Bench, ARC-AGI 3, AutomationBench e parcialmente CursorBench — são apresentadas como proporções ou lacunas. Isso limita o que você consegue concluir.

1. Uma proporção esconde o denominador

No ARC-AGI 3, “aproximadamente 3x a pontuação do próximo melhor modelo” pode representar situações muito diferentes:

  • Se o concorrente marcou 8%, 3x equivale a 24%.
  • Se o concorrente marcou 25%, 3x equivale a 75%.

As duas afirmações podem ser descritas como “3x melhor”, mas têm impactos práticos completamente distintos. Sem a pontuação de base, não é possível avaliar a magnitude absoluta do avanço.

2. Dobrar uma pontuação é mais fácil em escalas baixas

A afirmação de que o Opus 5 obteve “mais que o dobro” do Opus 4.8 no Frontier-Bench v0.1 também exige contexto.

Se o Opus 4.8 estava em uma faixa de um dígito, dobrar a pontuação pode ser um avanço absoluto moderado. Se já estivesse perto de 40%, dobrar seria um salto extraordinário. Como se trata da versão v0.1 de um benchmark sem histórico público consolidado, ainda não há uma referência de saturação ou reproduções da comunidade.

3. “Próximo melhor modelo” não identifica o baseline

Nas alegações para ARC-AGI 3 e AutomationBench, o concorrente não é nomeado. Pode ser Fable 5, Mythos 5 ou outro modelo.

Sem saber qual foi o modelo de comparação, você não consegue responder perguntas essenciais:

  • O Opus 5 superou o modelo mais forte disponível?
  • A comparação usou a mesma configuração?
  • O concorrente teve acesso às mesmas ferramentas?
  • O resultado foi obtido com o mesmo orçamento de tokens?

4. Lacunas precisam de unidade e configuração

No CursorBench 3.2, “dentro de 0.5% do pico do Fable 5” deixa duas ambiguidades:

  • 0.5% significa 0.5 ponto percentual ou 0.5% relativo?
  • “Pico” representa uma execução padrão ou uma configuração maximizada?

Em benchmarks de código, parâmetros como esforço, orçamento de tokens e número de tentativas podem mudar bastante o resultado. A análise dos benchmarks do Fable 5 mostra por que a configuração importa tanto quanto a pontuação.

As alegações científicas são mais fáceis de interpretar:

  • +10.2 pontos em química orgânica;
  • +7.7 pontos em análise de proteínas.

São deltas absolutos contra um baseline nomeado: o Opus 4.8. Ainda faltam as pontuações iniciais, mas pelo menos o tamanho do avanço está explicitamente definido.

Alegações de custo por tarefa dependem da configuração

Três resultados combinam capacidade e custo:

  • menor custo por tarefa no Frontier-Bench;
  • um terço do custo no OSWorld 2.0;
  • metade do preço no CursorBench 3.2.

O preço de tabela é simples de verificar. Segundo a página de preços da Anthropic, o Opus 5 custa:

Tipo de token Preço por milhão
Entrada US$ 5
Saída US$ 25

Isso é igual ao Opus 4.8 e corresponde à metade dos US$ 10/US$ 50 atribuídos ao Fable 5. Para detalhes sobre cache, processamento em lote e modo rápido, consulte a análise de preços do Opus 5.

Mas custo por tarefa resolvida não é igual ao preço por token.

Ele depende de fatores como:

  • tokens de entrada e saída;
  • leituras e gravações de cache;
  • nível de effort;
  • uso de pensamento;
  • número de turnos no loop agêntico;
  • quantidade de subagentes;
  • quantidade de chamadas de ferramentas;
  • número de tentativas até a tarefa passar.

A orientação de prompt da Anthropic indica que o Opus 5 pode gerar respostas padrão mais longas, delegar mais para subagentes e expandir o escopo das tarefas com maior frequência. Todos esses fatores podem elevar o consumo em produção.

Comparação visual de custo e desempenho entre modelos

A conclusão prática é direta: preço de tabela é uma informação útil, mas não substitui a medição do seu custo por tarefa concluída. A comparação Opus 5 vs Fable 5 detalha onde a diferença de preço pode compensar.

O teto que a Anthropic declara

A parte mais útil do material de lançamento é uma que não representa vitória: a Anthropic afirma que o Opus 5 ainda fica atrás do Mythos 5 em:

  • exploração de segurança cibernética;
  • pesquisa biológica autônoma.

O Fable 5 também mantém a designação de “modelo amplamente lançado mais capaz”.

Posicionamento do Opus 5 em relação a outros modelos

Portanto, o resumo correto não é “Opus 5 é o melhor modelo da Anthropic”. É:

O Opus 5 oferece capacidade de classe de fronteira por um preço de tabela menor, mas há um teto nomeado acima dele para segurança de fronteira e pesquisa científica autônoma.

Para esses casos, consulte o explicador de modelo de classe Mythos e a comparação Fable 5 vs Mythos 5.

Há também uma consequência operacional. A Anthropic disponibilizou fallbacks: "default" por trás do cabeçalho beta server-side-fallback-2026-07-01, que faz fallback automático para o Opus 4.8 quando o Opus 5 recusa solicitações relacionadas a categorias cibernéticas.

Se sua aplicação processa esse tipo de carga, trate o fallback como requisito de arquitetura e teste-o explicitamente.

O que benchmarks não medem

Benchmarks normalmente avaliam conclusão de tarefa. Eles não avaliam vários fatores que afetam diretamente uma integração de produção.

Variação de comportamento na migração

O Opus 5 verifica o próprio trabalho sem ser solicitado. Se seus prompts herdados do Opus 4.8 incluem instruções como “verifique sua resposta antes de responder”, você pode induzir verificações redundantes e aumentar o uso de tokens.

O guia de prompt da Anthropic para Opus 5 recomenda remover esse tipo de instrução redundante.

Comprimento da saída

As respostas e os entregáveis escritos podem ser maiores do que no Opus 4.8. Reduzir effort reduz tokens de raciocínio, mas não garante uma resposta visível mais curta.

Se a sua UI, API ou pipeline exige respostas compactas, declare isso no prompt:

Responda em no máximo 5 bullets.
Não repita o contexto.
Forneça somente o patch e uma explicação de até 2 frases.
Enter fullscreen mode Exit fullscreen mode

Falhas quando o pensamento está desabilitado

Com:

{
  "thinking": {
    "type": "disabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

podem ocorrer comportamentos que benchmarks não mostram, como:

  • chamadas de ferramenta aparecendo como texto simples;
  • chamadas não executadas contaminando turnos posteriores de um loop agêntico;
  • tags XML internas vazando para a saída visível.

Teste esses casos com suas ferramentas reais conectadas.

Recalibração de esforço

Os níveis de esforço foram recalibrados no Opus 5. Não copie automaticamente os parâmetros usados no Opus 4.8.

Faça uma nova varredura entre:

low
medium
high
xhigh
Enter fullscreen mode Exit fullscreen mode

O guia do parâmetro de esforço detalha essa configuração.

Erro 400 em combinações inválidas

A combinação abaixo retorna erro 400 por solicitação:

{
  "thinking": {
    "type": "disabled"
  },
  "output_config": {
    "effort": "xhigh"
  }
}
Enter fullscreen mode Exit fullscreen mode

O mesmo vale para effort: "max" quando usado com pensamento desabilitado. Esse é um detalhe de migração, tratado no guia de migração do Opus 4.8 para o Opus 5.

O que testar no seu ambiente

Use benchmarks de fornecedor como hipótese inicial, não como critério final. Você pode executar a avaliação abaixo em uma tarde.

1. Monte um conjunto de tarefas reais

Selecione entre 20 e 50 tarefas do seu histórico:

  • tickets fechados;
  • pull requests mesclados;
  • incidentes resolvidos;
  • conversas de suporte;
  • bugs reproduzíveis;
  • tarefas de automação.

Evite depender apenas de prompts sintéticos. Dados reais carregam ambiguidade, formatação inconsistente e casos extremos que aparecem em produção.

2. Fixe a configuração

Registre todos os parâmetros usados:

{
  "model": "claude-opus-5",
  "max_tokens": 8192,
  "output_config": {
    "effort": "medium"
  },
  "thinking": {
    "type": "enabled"
  }
}
Enter fullscreen mode Exit fullscreen mode

Você precisa controlar pelo menos:

  • ID exato do modelo;
  • output_config.effort;
  • configuração de pensamento;
  • max_tokens;
  • ferramentas disponíveis;
  • prompt de sistema;
  • número máximo de turnos;
  • regra de aceitação.

Sem isso, comparações posteriores não serão confiáveis.

3. Meça custo por tarefa resolvida

Não compare apenas custo por token. Compare:

custo por tarefa resolvida =
gasto total / número de tarefas aprovadas
Enter fullscreen mode Exit fullscreen mode

Para cada execução, registre os campos do bloco usage:

{
  "usage": {
    "input_tokens": 0,
    "output_tokens": 0,
    "cache_read_input_tokens": 0,
    "cache_creation_input_tokens": 0
  }
}
Enter fullscreen mode Exit fullscreen mode

Depois, associe o custo ao resultado da validação da tarefa.

Uma planilha simples já é suficiente:

Tarefa Modelo Effort Aprovada Tokens de entrada Tokens de saída Cache Custo estimado
Corrigir teste Opus 5 medium Sim ... ... ... ...
Corrigir teste Opus 4.8 medium Sim ... ... ... ...

4. Execute uma varredura de esforço

Execute exatamente as mesmas tarefas usando:

low
medium
high
xhigh
Enter fullscreen mode Exit fullscreen mode

Mantenha todo o resto fixo. Compare:

  • taxa de aprovação;
  • custo;
  • latência;
  • número de turnos;
  • número de chamadas de ferramenta;
  • tamanho da saída;
  • taxa de recusa.

O objetivo não é encontrar o maior score. É encontrar o menor nível de esforço que passa com consistência aceitável para sua carga de trabalho.

5. Teste loops agênticos, não só prompts únicos

OSWorld, CursorBench e AutomationBench são avaliações agênticas. Um único prompt não reproduz esse tipo de cenário.

Teste fluxos completos:

  1. o modelo recebe uma tarefa;
  2. consulta uma ferramenta;
  3. interpreta o resultado;
  4. chama outra ferramenta;
  5. executa uma alteração;
  6. valida o resultado;
  7. responde com um resumo.

Registre o número de turnos e a taxa de sucesso por execução. Não avalie apenas a melhor tentativa.

6. Compare com seu modelo atual

Execute o mesmo harness com o modelo que você usa hoje, como Opus 4.8, Sonnet 5 ou outro.

A comparação relevante é:

Opus 5 no seu backlog
vs.
modelo atual no mesmo backlog
Enter fullscreen mode Exit fullscreen mode

Esse resultado será mais útil para uma decisão de migração do que uma pontuação em um dataset externo.

7. Registre recusas separadamente

Se você processa tarefas ligadas a segurança cibernética, conte recusas como uma categoria própria:

Tarefa Modelo Resultado Recusa Fallback acionado
Análise de log Opus 5 Não concluída Sim Sim
Análise de log Opus 4.8 Concluída Não Não

Isso permite decidir se o fallback deve ser configurado e qual impacto ele terá em custo, comportamento e rastreabilidade.

Para uma metodologia semelhante, veja o artigo sobre os benchmarks do Sonnet 5. Para os formatos de requisição, consulte o guia da API do Opus 5.

Executando a avaliação no Apidog

A avaliação é composta por requisições HTTP, headers de autenticação, payloads JSON, respostas em streaming e leitura do bloco usage. Esse é exatamente o tipo de fluxo que o Apidog ajuda a organizar e repetir.

Exemplo de execução e inspeção de API no Apidog

Use esta configuração:

  1. Crie uma requisição para o endpoint Messages da Anthropic.
  2. Armazene a chave em uma variável de ambiente, nunca diretamente no body.
  3. Duplique a requisição para cada nível de effort.
  4. Mantenha o prompt, as ferramentas e max_tokens fixos.
  5. Habilite streaming quando precisar inspecionar eventos SSE.
  6. Adicione asserções para registrar os campos de usage.
  7. Salve tudo em uma collection para reutilizar no próximo lançamento de modelo.

Requisição base:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {
      "effort": "medium"
    },
    "messages": [
      {
        "role": "user",
        "content": "Fix the failing test in this diff."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Em cada execução, altere apenas um campo. Por exemplo, para comparar esforço:

{
  "output_config": {
    "effort": "low"
  }
}
Enter fullscreen mode Exit fullscreen mode

Depois:

{
  "output_config": {
    "effort": "medium"
  }
}
Enter fullscreen mode Exit fullscreen mode

E então:

{
  "output_config": {
    "effort": "high"
  }
}
Enter fullscreen mode Exit fullscreen mode

Para validar o formato de uso, adicione uma asserção que confirme a presença de tokens na resposta:

pm.test("A resposta contém usage", function () {
  const body = pm.response.json();

  pm.expect(body).to.have.property("usage");
  pm.expect(body.usage).to.have.property("input_tokens");
  pm.expect(body.usage).to.have.property("output_tokens");
});
Enter fullscreen mode Exit fullscreen mode

Em fluxos com ferramentas, valide também se o modelo emitiu uma chamada estruturada, em vez de descrevê-la em texto:

pm.test("A resposta contém conteúdo estruturado", function () {
  const body = pm.response.json();

  pm.expect(body).to.have.property("content");
  pm.expect(body.content).to.be.an("array");
});
Enter fullscreen mode Exit fullscreen mode

Baixe o Apidog para montar esse harness com ambientes, collections e asserções reutilizáveis.

Resumo honesto

A história de benchmark do Opus 5 é forte: a Anthropic afirma um salto relevante sobre o Opus 4.8 mantendo o mesmo preço de tabela.

Mas os resultados:

  • são publicados pelo próprio fornecedor;
  • não tinham reprodução independente até 25 de julho de 2026;
  • são apresentados principalmente como proporções;
  • não revelam todos os denominadores, configurações e baselines;
  • não substituem testes de comportamento, custo e falhas no seu ambiente.

Trate a tabela como a hipótese da Anthropic sobre o modelo. Em seguida, execute o mesmo tipo de avaliação nas tarefas que definem sua operação. A decisão de migração acontece na diferença entre o gráfico de lançamento e sua carga de trabalho real.

Para o restante das mudanças do modelo, consulte o guia principal do Opus 5.

FAQ

Os benchmarks do Claude Opus 5 são verificados independentemente?

Não. Em 25 de julho de 2026, todos os resultados de benchmark publicados do Opus 5 vinham da Anthropic. Nenhum laboratório de terceiros ou avaliador independente havia divulgado uma reprodução.

Qual é a maior alegação de benchmark do Opus 5?

É o Frontier-Bench v0.1. A Anthropic afirma que o Opus 5 mais que dobra a pontuação do Opus 4.8 com menor custo por tarefa. As pontuações subjacentes não foram publicadas, apenas a proporção.

O Claude Opus 5 é o modelo Claude mais capaz?

Não. O Fable 5 mantém a designação de modelo amplamente lançado mais capaz, e a Anthropic declara que o Opus 5 fica atrás do Mythos 5 em exploração de segurança cibernética e pesquisa biológica autônoma.

Quanto melhor é o Opus 5 em tarefas científicas?

A Anthropic relata +10.2 pontos em química orgânica e +7.7 pontos em análise de proteínas contra o Opus 4.8. Essas são as alegações mais fáceis de interpretar porque usam deltas absolutos.

O Opus 5 vence o Fable 5?

Segundo os números da Anthropic, o Opus 5 supera o Fable 5 no OSWorld 2.0 a um terço do custo e fica dentro de 0.5% do pico do Fable 5 no CursorBench 3.2 pela metade do preço. O Fable 5 ainda mantém a designação de capacidade geral. Veja a comparação completa.

O que devo testar por conta própria?

Teste custo por tarefa resolvida em 20 a 50 tarefas reais do seu backlog, usando múltiplos níveis de esforço, ferramentas reais, loops multi-turn e o mesmo harness para o Opus 5 e seu modelo atual.

Top comments (0)