DEV Community

Cover image for Claude Opus 5 Preços: Detalhamento Completo de Custos (2026)
Lucas
Lucas

Posted on • Originally published at apidog.com

Claude Opus 5 Preços: Detalhamento Completo de Custos (2026)

Claude Opus 5 foi lançado em 24 de julho de 2026 por US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. Essa é a mesma taxa do Opus 4.8 e exatamente metade do custo do Fable 5.

Experimente o Apidog hoje

O preço de entrada e saída é só parte da fatura. Escritas e leituras de cache, lotes, modo rápido, multiplicador regional e mudanças no comportamento do modelo podem alterar significativamente o custo final.

Antes de estimar um orçamento, envie solicitações reais pelo Apidog e analise o bloco usage de cada resposta.

A tabela de preços completa do Claude Opus 5

As taxas abaixo vêm da documentação de preços da Anthropic e se aplicam ao modelo claude-opus-5.

Categoria de token Preço por milhão de tokens
Entrada padrão US$ 5,00
Saída padrão US$ 25,00
Escrita de cache de prompt, TTL de 5 minutos US$ 6,25
Escrita de cache de prompt, TTL de 1 hora US$ 10,00
Acertos e atualizações de cache US$ 0,50
Entrada da API em lote US$ 2,50
Saída da API em lote US$ 12,50
Entrada em modo rápido US$ 10,00
Saída em modo rápido US$ 50,00

Pontos importantes:

  • Acertos de cache custam um décimo da entrada padrão. É a maior alavanca de economia disponível.
  • A escrita de cache de 5 minutos custa 1,25x a entrada padrão; a escrita de 1 hora custa 2x.
  • A API em lote reduz entrada e saída em 50%.
  • O modo rápido custa 2x o preço padrão para aproximadamente 2,5x a velocidade de saída. É uma prévia de pesquisa, disponível apenas na API de primeira parte, não funciona com Bedrock, Google Cloud ou Microsoft Foundry e não pode ser combinado com lote.
  • Não há sobretaxa para contexto longo. A janela de contexto de 1 milhão de tokens já é o padrão e o máximo.

Tabela visual de preços do Claude Opus 5

Isso também define o teto de custo por solicitação. Uma chamada da API de Mensagens com 1 milhão de tokens de entrada e 128 mil de saída custa:

Entrada: 1.000.000 × US$ 5 / 1.000.000 = US$ 5,00
Saída:    128.000 × US$ 25 / 1.000.000 = US$ 3,20
Total: US$ 8,20
Enter fullscreen mode Exit fullscreen mode

Na API em lote, a saída máxima pode chegar a 300 mil tokens com o cabeçalho beta output-300k-2026-03-24. Nesse cenário, o custo máximo de saída é US$ 3,75.

Referência: Opus 4.8, Fable 5 e Sonnet 5

Modelo Entrada / MTok Saída / MTok
Claude Opus 5 US$ 5,00 US$ 25,00
Claude Opus 4.8 US$ 5,00 US$ 25,00
Claude Fable 5 US$ 10,00 US$ 50,00
Claude Sonnet 5, até 31 de agosto de 2026 US$ 2,00 US$ 10,00
Claude Sonnet 5, a partir de 1º de setembro de 2026 US$ 3,00 US$ 15,00

A migração do Opus 4.8 para o Opus 5 não muda o preço por token. O custo unitário permanece igual para as versões 4.5, 4.6, 4.7, 4.8 e 5.

Porém, não assuma que sua fatura será idêntica: o Opus 5 pode mudar o volume de tokens consumidos, especialmente por causa do pensamento adaptativo ativado por padrão.

O detalhamento de preços do Opus 4.8 continua útil para workloads que ainda usam o ID do modelo anterior.

O Opus 5 custa metade do Fable 5. Segundo a Anthropic, ele fica dentro de 0,5% do pico do Fable 5 no CursorBench 3.2 e o supera no OSWorld 2.0 com aproximadamente um terço do custo por tarefa. Esses números são declarações do fornecedor presentes na publicação de lançamento do Opus 5 e não haviam sido reproduzidos independentemente até 25 de julho de 2026.

Para decidir entre os dois, consulte a comparação entre Opus 5 e Fable 5 e a página de preços do Fable 5.

Exemplo 1: custo de uma solicitação simples

Considere uma chamada de sumarização com:

  • 8.000 tokens de entrada
  • 1.200 tokens de saída
Entrada: 8.000 / 1.000.000 × US$ 5,00 = US$ 0,040
Saída:  1.200 / 1.000.000 × US$ 25,00 = US$ 0,030
Total: US$ 0,070 por chamada
Enter fullscreen mode Exit fullscreen mode

Em 10.000 chamadas mensais:

10.000 × US$ 0,070 = US$ 700/mês
Enter fullscreen mode Exit fullscreen mode

Comparação para o mesmo volume:

Modelo Custo por chamada Custo mensal em 10.000 chamadas
Opus 5 US$ 0,070 US$ 700
Fable 5 US$ 0,140 US$ 1.400
Sonnet 5, preço introdutório US$ 0,028 US$ 280

Mesmo com quase sete vezes mais tokens de entrada do que de saída, a saída representa 43% da fatura. Isso ocorre porque tokens de saída custam cinco vezes mais.

No Opus 5, tokens de pensamento também são cobrados como saída. Portanto, monitore output_tokens ao ajustar prompts, limites de saída e níveis de esforço.

Exemplo 2: sessão agêntica longa com cache

Considere um agente de codificação com:

  • prompt de sistema e contexto de repositório: 120.000 tokens;
  • sessão de 40 turnos;
  • 1.500 tokens de nova conversa por turno;
  • 2.500 tokens de saída por turno.

Sem cache de prompt

Sem cache, o contexto inteiro é reenviado a cada turno.

Item Tokens Taxa Custo
Entrada: 120.000 × 40 + 60.000 4.860.000 US$ 5,00 US$ 24,30
Saída: 2.500 × 40 100.000 US$ 25,00 US$ 2,50
Total US$ 26,80

Com cache de prompt de 5 minutos

Agora, armazene em cache o prefixo estável de 120.000 tokens.

Item Tokens Taxa Custo
Escrita de cache, uma vez 120.000 US$ 6,25 US$ 0,75
Leituras de cache, 39 turnos 4.680.000 US$ 0,50 US$ 2,34
Nova entrada: 1.500 × 40 60.000 US$ 5,00 US$ 0,30
Saída: 2.500 × 40 100.000 US$ 25,00 US$ 2,50
Total US$ 5,89

O cache reduz o custo de US$ 26,80 para US$ 5,89: uma redução de 78%.

Depois de resolver a repetição de contexto com cache, a saída passa a ser a principal categoria para otimizar.

Leituras de cache atualizam o TTL. Se os turnos ocorrerem em intervalos menores que cinco minutos, uma única escrita mantém o cache ativo.

Se o agente pode ficar inativo por mais de cinco minutos, use TTL de uma hora:

Escrita de cache de 1 hora: 120.000 × US$ 10 / 1.000.000 = US$ 1,20
Custo total da sessão: US$ 6,34
Enter fullscreen mode Exit fullscreen mode

Ainda é 76% mais barato que executar a sessão sem cache.

Exemplo 3: processamento em lote

Use a API em Lote para tarefas sem necessidade de resposta síncrona, como:

  • classificação;
  • enriquecimento de dados;
  • avaliações;
  • sumarizações noturnas;
  • backfills.

Considere 50.000 documentos, cada um com:

  • 1.200 tokens de entrada;
  • 150 tokens de saída.
Caminho Custo de entrada Custo de saída Total
Padrão 60 MTok × US$ 5,00 = US$ 300,00 7,5 MTok × US$ 25,00 = US$ 187,50 US$ 487,50
Lote 60 MTok × US$ 2,50 = US$ 150,00 7,5 MTok × US$ 12,50 = US$ 93,75 US$ 243,75

Os tokens e o modelo são os mesmos. A diferença é de US$ 243,75, em troca de processamento assíncrono.

Antes de enviar uma carga ao endpoint padrão, pergunte: isso precisa mesmo de uma resposta imediata?

Exemplo 4: custo do modo rápido

O modo rápido dobra as taxas:

Entrada: US$ 10 / MTok
Saída:  US$ 50 / MTok
Enter fullscreen mode Exit fullscreen mode

Para a solicitação do primeiro exemplo:

Entrada: 8.000 / 1.000.000 × US$ 10 = US$ 0,080
Saída:  1.200 / 1.000.000 × US$ 50 = US$ 0,060
Total: US$ 0,140 por chamada
Enter fullscreen mode Exit fullscreen mode

É exatamente o dobro do caminho padrão.

Use modo rápido em experiências interativas nas quais a latência é visível ao usuário. Para jobs em segundo plano, o custo adicional costuma ser difícil de justificar.

O modo rápido e a API em lote são alavancas mutuamente exclusivas:

  • precisa de menor custo? Use lote;
  • precisa de menor latência? Avalie o modo rápido;
  • não é possível usar ambos na mesma solicitação.

As quatro alavancas que mais movem sua fatura

1. Cache de prompt a partir de 512 tokens

O Opus 5 aceita cache de prompt com um mínimo de 512 tokens. No Opus 4.8, o mínimo era 1.024.

Isso permite armazenar em cache prompts de sistema menores sem alterar a lógica do aplicativo, além de configurar o bloco de controle de cache.

O ponto de equilíbrio é baixo:

  • TTL de 5 minutos: o cache compensa a partir de 1,3 solicitações; você economiza a partir da segunda chamada.
  • TTL de 1 hora: o cache compensa a partir de 2,1 solicitações; você economiza a partir da terceira chamada.

Exemplo: um prompt de sistema de 700 tokens reutilizado em 1.000 chamadas.

Sem cache:
700.000 tokens × US$ 5 / 1.000.000 = US$ 3,50
Enter fullscreen mode Exit fullscreen mode
Com cache de 5 minutos:
Escrita: 700 × US$ 6,25 / 1.000.000 = US$ 0,0044
999 leituras: 699.300 × US$ 0,50 / 1.000.000 = US$ 0,34965
Total: aproximadamente US$ 0,354
Enter fullscreen mode Exit fullscreen mode

Esse prompt era curto demais para cache no Opus 4.8.

2. API em Lote com 50% de desconto

Audite seus workloads e separe caminhos síncronos de caminhos assíncronos.

Uma implementação prática:

Solicitações interativas → endpoint padrão
Avaliações e backfills → API em Lote
Processamento noturno → API em Lote
Classificação em massa → API em Lote
Enter fullscreen mode Exit fullscreen mode

Não envie tarefas tolerantes a latência pelo endpoint padrão por conveniência. Isso dobra o custo de entrada e saída sem melhorar a qualidade do resultado.

3. Avalie output_config.effort

O parâmetro output_config.effort controla a quantidade de pensamento usada pelo modelo. Como tokens de pensamento são cobrados como saída, o impacto financeiro pode ser relevante.

O Opus 5 recalibrou os níveis de esforço:

  • low
  • medium
  • high — padrão
  • xhigh — recomendado como ponto de partida para codificação e trabalho agêntico

A Anthropic afirma que low e medium são mais fortes no Opus 5 do que em modelos Opus anteriores.

Não copie a configuração do Opus 4.8 sem medir. Execute uma varredura de esforço em suas próprias avaliações.

Exemplo ilustrativo:

Pensamento em xhigh: 8.000 tokens
Pensamento em low:   1.500 tokens
Economia:            6.500 tokens de saída por tarefa

6.500 / 1.000.000 × US$ 25 = US$ 0,1625 por tarefa
100.000 tarefas = US$ 16.250
Enter fullscreen mode Exit fullscreen mode

Os valores reais dependem de prompts e tarefas. O guia de parâmetros de esforço mostra como estruturar essa avaliação.

Reduzir esforço diminui tokens de pensamento, não necessariamente o tamanho da resposta visível. Para respostas menores, instrua explicitamente o modelo a ser conciso e defina limites adequados de saída.

4. Menor sobrecarga de ferramentas

Ao enviar definições de ferramentas, a API injeta um prompt de sistema pelo qual você paga.

No Opus 5, essa sobrecarga é de 286 tokens para escolha de ferramenta auto ou none.

Modelo Sobrecarga de ferramentas
Opus 5 286 tokens
Opus 4.8 290 tokens
Opus 4.7 675 tokens

Em relação ao Opus 4.8, a economia é de apenas quatro tokens por solicitação: cerca de US$ 20 por milhão de chamadas.

Em relação ao Opus 4.7, a diferença é de 389 tokens:

389 / 1.000.000 × US$ 5 = US$ 0,001945 por solicitação
1.000.000 solicitações = US$ 1.945
Enter fullscreen mode Exit fullscreen mode

Para outras estratégias aplicáveis a toda a linha Claude, consulte o guia sobre como reduzir sua fatura da API Claude.

Dois custos frequentemente esquecidos

Multiplicador regional inference_geo: "us"

Fixar a inferência à infraestrutura dos Estados Unidos aplica um multiplicador de 1,1x a cada categoria de token.

Categoria Preço padrão Com inference_geo: "us"
Entrada US$ 5,00 US$ 5,50
Saída US$ 25,00 US$ 27,50
Acerto de cache US$ 0,50 US$ 0,55
Entrada em lote US$ 2,50 US$ 2,75
Saída em lote US$ 12,50 US$ 13,75

No exemplo de US$ 700 mensais, o custo passa para US$ 770.

Em uma fatura de US$ 50.000, o impacto é de US$ 5.000. Configure fixação regional apenas quando houver uma necessidade real de conformidade ou residência de dados.

Priority Tier não é suportado no Opus 5

O Nível de Prioridade continua disponível no Opus 4.8, mas não é suportado no Opus 5.

Se seu planejamento de capacidade depende de compromissos do Priority Tier, trate isso como uma restrição de migração. O guia de migração do Opus 4.8 para o Opus 5 cobre essa diferença e outras mudanças incompatíveis na API.

Mudanças de comportamento que afetam a fatura

Preço por token é apenas metade do custo. O volume de tokens consumidos é a outra metade.

1. Pensamento adaptativo é ativado por padrão

No Opus 4.8, uma solicitação sem o campo thinking era executada sem pensamento.

No Opus 5, a mesma solicitação pode executar pensamento adaptativo. Esses tokens são cobrados como saída.

Além disso, max_tokens limita tanto o pensamento quanto a resposta visível. Workloads migrados podem passar a truncar respostas se esse limite não for revisado.

2. O modelo delega mais facilmente a subagentes

Cada subagente tem sua própria contagem de tokens faturáveis.

Para workloads sensíveis a custo:

  • limite a delegação;
  • defina escopo de tarefas;
  • restrinja ferramentas disponíveis;
  • monitore aumentos em output_tokens;
  • compare resultados com e sem delegação.

3. O modelo verifica o próprio trabalho

O Opus 5 pode verificar seu trabalho sem instruções explícitas.

Se seus prompts ainda incluem frases como “verifique seu trabalho” ou “revise várias vezes antes de responder”, avalie removê-las. O guia de prompting da Anthropic recomenda evitar instruções redundantes.

Mais verificação significa mais tokens.

Como confirmar seu gasto real com Apidog

Pare de estimar apenas com exemplos. Meça o tráfego da sua aplicação.

O objeto usage da resposta informa:

{
  "usage": {
    "input_tokens": 8000,
    "output_tokens": 1200,
    "cache_creation_input_tokens": 120000,
    "cache_read_input_tokens": 4680000
  }
}
Enter fullscreen mode Exit fullscreen mode

Esses campos correspondem diretamente às categorias de cobrança:

  • input_tokens: entrada padrão;
  • output_tokens: saída e, quando aplicável, pensamento;
  • cache_creation_input_tokens: escrita de cache;
  • cache_read_input_tokens: leituras de cache.

Exemplo de análise de uso de tokens no Apidog

O Apidog é uma plataforma de desenvolvimento e teste de APIs. Para validar seus custos:

  1. Crie uma solicitação para o endpoint Messages com "model": "claude-opus-5".
  2. Duplique a solicitação para cada nível de output_config.effort.
  3. Execute os testes com prompts idênticos.
  4. Compare output_tokens e a qualidade das respostas.
  5. Verifique se usage.cache_read_input_tokens é maior que zero quando espera usar cache.
  6. Armazene chaves de API em variáveis de ambiente, não no corpo da solicitação.
  7. Acompanhe o fluxo SSE para visualizar o consumo de saída em gerações longas.

Você pode baixar o Apidog e usar este processo junto com o guia da API do Opus 5.

O que você compra por US$ 5 / US$ 25

O Opus 5 tem uma posição forte de preço por capacidade, mas não é o topo da linha Claude.

O Fable 5 continua sendo o modelo mais capaz da Anthropic amplamente lançado. Segundo a Anthropic, o Opus 5 também fica atrás do Mythos 5 em exploração de cibersegurança e pesquisa autônoma em biologia.

A decisão prática não é apenas “Opus 5 versus o modelo mais capaz”. Para a maioria das equipes, a pergunta é:

Esta carga precisa de Opus ou o Sonnet 5 resolve o problema por um custo menor?

O Sonnet 5 custa US$ 2 / US$ 10 durante o período introdutório e US$ 3 / US$ 15 a partir de 1º de setembro de 2026. Execute ambos nos seus próprios conjuntos de avaliação antes de comprometer o orçamento.

Consulte:

FAQ

Quanto custa o Claude Opus 5?

Na API padrão, custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. Acertos de cache custam US$ 0,50 por milhão, lote custa US$ 2,50 / US$ 12,50 e o modo rápido custa US$ 10 / US$ 50.

O Claude Opus 5 é mais caro que o Opus 4.8?

Por token, não. As taxas são idênticas. Porém, sua fatura pode subir porque o pensamento é ativado por padrão e as respostas padrão podem ser mais longas. Meça os tokens reais antes e depois da migração.

Há sobretaxa para contexto longo na janela de 1 milhão de tokens?

Não. A janela de 1 milhão de tokens é o padrão e o máximo, sem nível premium para entradas longas.

Qual é a forma mais barata de usar o Claude Opus 5?

Combine três práticas:

  1. Armazene prefixos reutilizados em cache.
  2. Envie trabalhos não urgentes pela API em Lote.
  3. Avalie níveis de esforço para encontrar o menor que mantém sua qualidade mínima.

O guia de caminho mais barato e gratuito tem mais detalhes.

A fixação regional custa mais?

Sim. Definir inference_geo: "us" aplica um multiplicador de 1,1x a todas as categorias, incluindo acertos de cache e processamento em lote.

Top comments (0)