Claude Opus 5 foi lançado em 24 de julho de 2026 por US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. Essa é a mesma taxa do Opus 4.8 e exatamente metade do custo do Fable 5.
O preço de entrada e saída é só parte da fatura. Escritas e leituras de cache, lotes, modo rápido, multiplicador regional e mudanças no comportamento do modelo podem alterar significativamente o custo final.
Antes de estimar um orçamento, envie solicitações reais pelo Apidog e analise o bloco usage de cada resposta.
A tabela de preços completa do Claude Opus 5
As taxas abaixo vêm da documentação de preços da Anthropic e se aplicam ao modelo claude-opus-5.
| Categoria de token | Preço por milhão de tokens |
|---|---|
| Entrada padrão | US$ 5,00 |
| Saída padrão | US$ 25,00 |
| Escrita de cache de prompt, TTL de 5 minutos | US$ 6,25 |
| Escrita de cache de prompt, TTL de 1 hora | US$ 10,00 |
| Acertos e atualizações de cache | US$ 0,50 |
| Entrada da API em lote | US$ 2,50 |
| Saída da API em lote | US$ 12,50 |
| Entrada em modo rápido | US$ 10,00 |
| Saída em modo rápido | US$ 50,00 |
Pontos importantes:
- Acertos de cache custam um décimo da entrada padrão. É a maior alavanca de economia disponível.
- A escrita de cache de 5 minutos custa 1,25x a entrada padrão; a escrita de 1 hora custa 2x.
- A API em lote reduz entrada e saída em 50%.
- O modo rápido custa 2x o preço padrão para aproximadamente 2,5x a velocidade de saída. É uma prévia de pesquisa, disponível apenas na API de primeira parte, não funciona com Bedrock, Google Cloud ou Microsoft Foundry e não pode ser combinado com lote.
- Não há sobretaxa para contexto longo. A janela de contexto de 1 milhão de tokens já é o padrão e o máximo.
Isso também define o teto de custo por solicitação. Uma chamada da API de Mensagens com 1 milhão de tokens de entrada e 128 mil de saída custa:
Entrada: 1.000.000 × US$ 5 / 1.000.000 = US$ 5,00
Saída: 128.000 × US$ 25 / 1.000.000 = US$ 3,20
Total: US$ 8,20
Na API em lote, a saída máxima pode chegar a 300 mil tokens com o cabeçalho beta output-300k-2026-03-24. Nesse cenário, o custo máximo de saída é US$ 3,75.
Referência: Opus 4.8, Fable 5 e Sonnet 5
| Modelo | Entrada / MTok | Saída / MTok |
|---|---|---|
| Claude Opus 5 | US$ 5,00 | US$ 25,00 |
| Claude Opus 4.8 | US$ 5,00 | US$ 25,00 |
| Claude Fable 5 | US$ 10,00 | US$ 50,00 |
| Claude Sonnet 5, até 31 de agosto de 2026 | US$ 2,00 | US$ 10,00 |
| Claude Sonnet 5, a partir de 1º de setembro de 2026 | US$ 3,00 | US$ 15,00 |
A migração do Opus 4.8 para o Opus 5 não muda o preço por token. O custo unitário permanece igual para as versões 4.5, 4.6, 4.7, 4.8 e 5.
Porém, não assuma que sua fatura será idêntica: o Opus 5 pode mudar o volume de tokens consumidos, especialmente por causa do pensamento adaptativo ativado por padrão.
O detalhamento de preços do Opus 4.8 continua útil para workloads que ainda usam o ID do modelo anterior.
O Opus 5 custa metade do Fable 5. Segundo a Anthropic, ele fica dentro de 0,5% do pico do Fable 5 no CursorBench 3.2 e o supera no OSWorld 2.0 com aproximadamente um terço do custo por tarefa. Esses números são declarações do fornecedor presentes na publicação de lançamento do Opus 5 e não haviam sido reproduzidos independentemente até 25 de julho de 2026.
Para decidir entre os dois, consulte a comparação entre Opus 5 e Fable 5 e a página de preços do Fable 5.
Exemplo 1: custo de uma solicitação simples
Considere uma chamada de sumarização com:
- 8.000 tokens de entrada
- 1.200 tokens de saída
Entrada: 8.000 / 1.000.000 × US$ 5,00 = US$ 0,040
Saída: 1.200 / 1.000.000 × US$ 25,00 = US$ 0,030
Total: US$ 0,070 por chamada
Em 10.000 chamadas mensais:
10.000 × US$ 0,070 = US$ 700/mês
Comparação para o mesmo volume:
| Modelo | Custo por chamada | Custo mensal em 10.000 chamadas |
|---|---|---|
| Opus 5 | US$ 0,070 | US$ 700 |
| Fable 5 | US$ 0,140 | US$ 1.400 |
| Sonnet 5, preço introdutório | US$ 0,028 | US$ 280 |
Mesmo com quase sete vezes mais tokens de entrada do que de saída, a saída representa 43% da fatura. Isso ocorre porque tokens de saída custam cinco vezes mais.
No Opus 5, tokens de pensamento também são cobrados como saída. Portanto, monitore output_tokens ao ajustar prompts, limites de saída e níveis de esforço.
Exemplo 2: sessão agêntica longa com cache
Considere um agente de codificação com:
- prompt de sistema e contexto de repositório: 120.000 tokens;
- sessão de 40 turnos;
- 1.500 tokens de nova conversa por turno;
- 2.500 tokens de saída por turno.
Sem cache de prompt
Sem cache, o contexto inteiro é reenviado a cada turno.
| Item | Tokens | Taxa | Custo |
|---|---|---|---|
Entrada: 120.000 × 40 + 60.000
|
4.860.000 | US$ 5,00 | US$ 24,30 |
Saída: 2.500 × 40
|
100.000 | US$ 25,00 | US$ 2,50 |
| Total | US$ 26,80 |
Com cache de prompt de 5 minutos
Agora, armazene em cache o prefixo estável de 120.000 tokens.
| Item | Tokens | Taxa | Custo |
|---|---|---|---|
| Escrita de cache, uma vez | 120.000 | US$ 6,25 | US$ 0,75 |
| Leituras de cache, 39 turnos | 4.680.000 | US$ 0,50 | US$ 2,34 |
Nova entrada: 1.500 × 40
|
60.000 | US$ 5,00 | US$ 0,30 |
Saída: 2.500 × 40
|
100.000 | US$ 25,00 | US$ 2,50 |
| Total | US$ 5,89 |
O cache reduz o custo de US$ 26,80 para US$ 5,89: uma redução de 78%.
Depois de resolver a repetição de contexto com cache, a saída passa a ser a principal categoria para otimizar.
Leituras de cache atualizam o TTL. Se os turnos ocorrerem em intervalos menores que cinco minutos, uma única escrita mantém o cache ativo.
Se o agente pode ficar inativo por mais de cinco minutos, use TTL de uma hora:
Escrita de cache de 1 hora: 120.000 × US$ 10 / 1.000.000 = US$ 1,20
Custo total da sessão: US$ 6,34
Ainda é 76% mais barato que executar a sessão sem cache.
Exemplo 3: processamento em lote
Use a API em Lote para tarefas sem necessidade de resposta síncrona, como:
- classificação;
- enriquecimento de dados;
- avaliações;
- sumarizações noturnas;
- backfills.
Considere 50.000 documentos, cada um com:
- 1.200 tokens de entrada;
- 150 tokens de saída.
| Caminho | Custo de entrada | Custo de saída | Total |
|---|---|---|---|
| Padrão | 60 MTok × US$ 5,00 = US$ 300,00 | 7,5 MTok × US$ 25,00 = US$ 187,50 | US$ 487,50 |
| Lote | 60 MTok × US$ 2,50 = US$ 150,00 | 7,5 MTok × US$ 12,50 = US$ 93,75 | US$ 243,75 |
Os tokens e o modelo são os mesmos. A diferença é de US$ 243,75, em troca de processamento assíncrono.
Antes de enviar uma carga ao endpoint padrão, pergunte: isso precisa mesmo de uma resposta imediata?
Exemplo 4: custo do modo rápido
O modo rápido dobra as taxas:
Entrada: US$ 10 / MTok
Saída: US$ 50 / MTok
Para a solicitação do primeiro exemplo:
Entrada: 8.000 / 1.000.000 × US$ 10 = US$ 0,080
Saída: 1.200 / 1.000.000 × US$ 50 = US$ 0,060
Total: US$ 0,140 por chamada
É exatamente o dobro do caminho padrão.
Use modo rápido em experiências interativas nas quais a latência é visível ao usuário. Para jobs em segundo plano, o custo adicional costuma ser difícil de justificar.
O modo rápido e a API em lote são alavancas mutuamente exclusivas:
- precisa de menor custo? Use lote;
- precisa de menor latência? Avalie o modo rápido;
- não é possível usar ambos na mesma solicitação.
As quatro alavancas que mais movem sua fatura
1. Cache de prompt a partir de 512 tokens
O Opus 5 aceita cache de prompt com um mínimo de 512 tokens. No Opus 4.8, o mínimo era 1.024.
Isso permite armazenar em cache prompts de sistema menores sem alterar a lógica do aplicativo, além de configurar o bloco de controle de cache.
O ponto de equilíbrio é baixo:
- TTL de 5 minutos: o cache compensa a partir de 1,3 solicitações; você economiza a partir da segunda chamada.
- TTL de 1 hora: o cache compensa a partir de 2,1 solicitações; você economiza a partir da terceira chamada.
Exemplo: um prompt de sistema de 700 tokens reutilizado em 1.000 chamadas.
Sem cache:
700.000 tokens × US$ 5 / 1.000.000 = US$ 3,50
Com cache de 5 minutos:
Escrita: 700 × US$ 6,25 / 1.000.000 = US$ 0,0044
999 leituras: 699.300 × US$ 0,50 / 1.000.000 = US$ 0,34965
Total: aproximadamente US$ 0,354
Esse prompt era curto demais para cache no Opus 4.8.
2. API em Lote com 50% de desconto
Audite seus workloads e separe caminhos síncronos de caminhos assíncronos.
Uma implementação prática:
Solicitações interativas → endpoint padrão
Avaliações e backfills → API em Lote
Processamento noturno → API em Lote
Classificação em massa → API em Lote
Não envie tarefas tolerantes a latência pelo endpoint padrão por conveniência. Isso dobra o custo de entrada e saída sem melhorar a qualidade do resultado.
3. Avalie output_config.effort
O parâmetro output_config.effort controla a quantidade de pensamento usada pelo modelo. Como tokens de pensamento são cobrados como saída, o impacto financeiro pode ser relevante.
O Opus 5 recalibrou os níveis de esforço:
lowmedium-
high— padrão -
xhigh— recomendado como ponto de partida para codificação e trabalho agêntico
A Anthropic afirma que low e medium são mais fortes no Opus 5 do que em modelos Opus anteriores.
Não copie a configuração do Opus 4.8 sem medir. Execute uma varredura de esforço em suas próprias avaliações.
Exemplo ilustrativo:
Pensamento em xhigh: 8.000 tokens
Pensamento em low: 1.500 tokens
Economia: 6.500 tokens de saída por tarefa
6.500 / 1.000.000 × US$ 25 = US$ 0,1625 por tarefa
100.000 tarefas = US$ 16.250
Os valores reais dependem de prompts e tarefas. O guia de parâmetros de esforço mostra como estruturar essa avaliação.
Reduzir esforço diminui tokens de pensamento, não necessariamente o tamanho da resposta visível. Para respostas menores, instrua explicitamente o modelo a ser conciso e defina limites adequados de saída.
4. Menor sobrecarga de ferramentas
Ao enviar definições de ferramentas, a API injeta um prompt de sistema pelo qual você paga.
No Opus 5, essa sobrecarga é de 286 tokens para escolha de ferramenta auto ou none.
| Modelo | Sobrecarga de ferramentas |
|---|---|
| Opus 5 | 286 tokens |
| Opus 4.8 | 290 tokens |
| Opus 4.7 | 675 tokens |
Em relação ao Opus 4.8, a economia é de apenas quatro tokens por solicitação: cerca de US$ 20 por milhão de chamadas.
Em relação ao Opus 4.7, a diferença é de 389 tokens:
389 / 1.000.000 × US$ 5 = US$ 0,001945 por solicitação
1.000.000 solicitações = US$ 1.945
Para outras estratégias aplicáveis a toda a linha Claude, consulte o guia sobre como reduzir sua fatura da API Claude.
Dois custos frequentemente esquecidos
Multiplicador regional inference_geo: "us"
Fixar a inferência à infraestrutura dos Estados Unidos aplica um multiplicador de 1,1x a cada categoria de token.
| Categoria | Preço padrão | Com inference_geo: "us"
|
|---|---|---|
| Entrada | US$ 5,00 | US$ 5,50 |
| Saída | US$ 25,00 | US$ 27,50 |
| Acerto de cache | US$ 0,50 | US$ 0,55 |
| Entrada em lote | US$ 2,50 | US$ 2,75 |
| Saída em lote | US$ 12,50 | US$ 13,75 |
No exemplo de US$ 700 mensais, o custo passa para US$ 770.
Em uma fatura de US$ 50.000, o impacto é de US$ 5.000. Configure fixação regional apenas quando houver uma necessidade real de conformidade ou residência de dados.
Priority Tier não é suportado no Opus 5
O Nível de Prioridade continua disponível no Opus 4.8, mas não é suportado no Opus 5.
Se seu planejamento de capacidade depende de compromissos do Priority Tier, trate isso como uma restrição de migração. O guia de migração do Opus 4.8 para o Opus 5 cobre essa diferença e outras mudanças incompatíveis na API.
Mudanças de comportamento que afetam a fatura
Preço por token é apenas metade do custo. O volume de tokens consumidos é a outra metade.
1. Pensamento adaptativo é ativado por padrão
No Opus 4.8, uma solicitação sem o campo thinking era executada sem pensamento.
No Opus 5, a mesma solicitação pode executar pensamento adaptativo. Esses tokens são cobrados como saída.
Além disso, max_tokens limita tanto o pensamento quanto a resposta visível. Workloads migrados podem passar a truncar respostas se esse limite não for revisado.
2. O modelo delega mais facilmente a subagentes
Cada subagente tem sua própria contagem de tokens faturáveis.
Para workloads sensíveis a custo:
- limite a delegação;
- defina escopo de tarefas;
- restrinja ferramentas disponíveis;
- monitore aumentos em
output_tokens; - compare resultados com e sem delegação.
3. O modelo verifica o próprio trabalho
O Opus 5 pode verificar seu trabalho sem instruções explícitas.
Se seus prompts ainda incluem frases como “verifique seu trabalho” ou “revise várias vezes antes de responder”, avalie removê-las. O guia de prompting da Anthropic recomenda evitar instruções redundantes.
Mais verificação significa mais tokens.
Como confirmar seu gasto real com Apidog
Pare de estimar apenas com exemplos. Meça o tráfego da sua aplicação.
O objeto usage da resposta informa:
{
"usage": {
"input_tokens": 8000,
"output_tokens": 1200,
"cache_creation_input_tokens": 120000,
"cache_read_input_tokens": 4680000
}
}
Esses campos correspondem diretamente às categorias de cobrança:
-
input_tokens: entrada padrão; -
output_tokens: saída e, quando aplicável, pensamento; -
cache_creation_input_tokens: escrita de cache; -
cache_read_input_tokens: leituras de cache.
O Apidog é uma plataforma de desenvolvimento e teste de APIs. Para validar seus custos:
- Crie uma solicitação para o endpoint Messages com
"model": "claude-opus-5". - Duplique a solicitação para cada nível de
output_config.effort. - Execute os testes com prompts idênticos.
- Compare
output_tokense a qualidade das respostas. - Verifique se
usage.cache_read_input_tokensé maior que zero quando espera usar cache. - Armazene chaves de API em variáveis de ambiente, não no corpo da solicitação.
- Acompanhe o fluxo SSE para visualizar o consumo de saída em gerações longas.
Você pode baixar o Apidog e usar este processo junto com o guia da API do Opus 5.
O que você compra por US$ 5 / US$ 25
O Opus 5 tem uma posição forte de preço por capacidade, mas não é o topo da linha Claude.
O Fable 5 continua sendo o modelo mais capaz da Anthropic amplamente lançado. Segundo a Anthropic, o Opus 5 também fica atrás do Mythos 5 em exploração de cibersegurança e pesquisa autônoma em biologia.
A decisão prática não é apenas “Opus 5 versus o modelo mais capaz”. Para a maioria das equipes, a pergunta é:
Esta carga precisa de Opus ou o Sonnet 5 resolve o problema por um custo menor?
O Sonnet 5 custa US$ 2 / US$ 10 durante o período introdutório e US$ 3 / US$ 15 a partir de 1º de setembro de 2026. Execute ambos nos seus próprios conjuntos de avaliação antes de comprometer o orçamento.
Consulte:
- Visão geral do Claude Opus 5
- Preços do Claude Sonnet 5
- Explicador de modelos de classe Mythos
- Visão geral de modelos da Anthropic
FAQ
Quanto custa o Claude Opus 5?
Na API padrão, custa US$ 5 por milhão de tokens de entrada e US$ 25 por milhão de tokens de saída. Acertos de cache custam US$ 0,50 por milhão, lote custa US$ 2,50 / US$ 12,50 e o modo rápido custa US$ 10 / US$ 50.
O Claude Opus 5 é mais caro que o Opus 4.8?
Por token, não. As taxas são idênticas. Porém, sua fatura pode subir porque o pensamento é ativado por padrão e as respostas padrão podem ser mais longas. Meça os tokens reais antes e depois da migração.
Há sobretaxa para contexto longo na janela de 1 milhão de tokens?
Não. A janela de 1 milhão de tokens é o padrão e o máximo, sem nível premium para entradas longas.
Qual é a forma mais barata de usar o Claude Opus 5?
Combine três práticas:
- Armazene prefixos reutilizados em cache.
- Envie trabalhos não urgentes pela API em Lote.
- Avalie níveis de esforço para encontrar o menor que mantém sua qualidade mínima.
O guia de caminho mais barato e gratuito tem mais detalhes.
A fixação regional custa mais?
Sim. Definir inference_geo: "us" aplica um multiplicador de 1,1x a todas as categorias, incluindo acertos de cache e processamento em lote.


Top comments (0)