DEV Community

Cover image for Claude Fable 5.1: Preço, Custos e Análise Detalhada (2026)
Lucas
Lucas

Posted on Originally published at apidog.com

Claude Fable 5.1: Preço, Custos e Análise Detalhada (2026)

Preços do Claude Fable 5.1: cache, custos e exemplos práticos

O Claude Fable 5.1 custa US$10 por milhão de tokens de entrada e US$50 por milhão de tokens de saída — exatamente os mesmos valores do Fable 5. A principal mudança está nas leituras de cache de prompt, que passaram a custar US$0,25 por milhão de tokens, contra US$1 no Fable 5 e US$0,50 no Opus 5. Segundo a Anthropic, isso torna cargas típicas cerca de 25% mais baratas que no Fable 5 e cargas altamente agentivas até 45% mais baratas. Para uma visão geral do modelo, leia o que é o Claude Fable 5.1.

Experimente o Apidog hoje

Claude Fable 5.1

Este guia resume os preços oficiais, reproduz as estimativas de economia com diferentes taxas de acerto de cache, calcula o custo de três tarefas reais e mostra quais configurações mais influenciam a conta.

Tabela de preços do Claude Fable 5.1

Consulte a página oficial de preços para atualizações.

Item Claude Fable 5.1
Entrada base US$10 por milhão de tokens
Saída US$50 por milhão de tokens
Escrita de cache de 5 minutos US$12,50 por milhão (1,25× a entrada)
Escrita de cache de 1 hora US$20 por milhão (2× a entrada)
Leitura de cache (acerto ou atualização) US$0,25 por milhão (0,025× a entrada)
Entrada da API em lote US$5 por milhão
Saída da API em lote US$25 por milhão
Prêmio por contexto longo Nenhum; a janela completa de 1M é cobrada pelas taxas padrão
inference_geo: "us" 1,1× em todas as categorias de token
Modo rápido Não disponível; somente Opus 5 e Opus 4.8
Nível de Prioridade Não suportado
Pesquisa na web US$10 por 1.000 pesquisas, mais os tokens

O Claude Mythos 5.1 tem as mesmas taxas. Os descontos de lote e os multiplicadores de cache são cumulativos: uma leitura de cache em lote custa US$0,125 por milhão de tokens.

Como a leitura de cache se compara

Modelo Entrada base Leitura de cache Cache como parcela da entrada
Claude Fable 5.1 US$10 US$0,25 2,5%
Claude Fable 5 US$10 US$1,00 10%
Claude Opus 5 US$5 US$0,50 10%
Claude Opus 4.8 US$5 US$0,50 10%
Claude Sonnet 5 US$2 US$0,20 10%
Claude Haiku 4.5 US$1 US$0,10 10%

Todos os outros modelos Claude cobram uma leitura de cache equivalente a 10% da entrada base. No Fable 5.1, o valor é 2,5%.

Na prática, uma leitura de cache do Fable 5.1 custa menos que uma do Opus 5, mesmo que a entrada sem cache custe o dobro. Em cargas nas quais a maior parte dos tokens de entrada vem de prefixos armazenados, a taxa efetiva de entrada do Fable 5.1 pode ficar abaixo da do Opus 5.

Uma observação sobre o Sonnet 5: a comparação entre Opus 5 e Sonnet 5 apontou um possível aumento de preço em setembro, mas a Anthropic cancelou a mudança. O Sonnet 5 continua custando US$2 por milhão de tokens de entrada e US$10 por milhão de saída.

Reproduzindo as estimativas de 25% e 45%

A Anthropic não publicou a combinação de cargas usada nas estimativas. Portanto, os cálculos abaixo são uma reconstrução para mostrar qual taxa de acerto de cache elas pressupõem, não uma reprodução do modelo exato da empresa.

Considere uma solicitação com:

  • U: tokens de entrada sem cache;
  • C: tokens de entrada armazenados em cache;
  • O: tokens de saída.

Com os valores expressos em milhões de tokens:

Custo no Fable 5   = 10U + 1.0C + 50O
Custo no Fable 5.1 = 10U + 0.25C + 50O
Economia           = 0.75C
Percentual         = 0.75C / (10U + C + 50O)
Enter fullscreen mode Exit fullscreen mode

Carga típica de chat

Suponha:

  • 20.000 tokens armazenados em cache;
  • 2.000 tokens de entrada sem cache;
  • 1.500 tokens de saída.

No Fable 5:

10(0,002) + 1,0(0,02) + 50(0,0015)
= US$0,02 + US$0,02 + US$0,075
= US$0,115
Enter fullscreen mode Exit fullscreen mode

No Fable 5.1:

US$0,02 + US$0,005 + US$0,075
= US$0,100
Enter fullscreen mode Exit fullscreen mode

A economia é de 13%. Para chegar aos 25% estimados pela Anthropic, a parcela em cache precisa ser maior em relação à saída. Com 60.000 tokens em cache e os mesmos 1.500 tokens de saída:

Fable 5:   US$0,155
Fable 5.1: US$0,110
Economia:  29%
Enter fullscreen mode Exit fullscreen mode

Loop agentivo

Considere um agente que:

  • relê um prefixo de 150.000 tokens em cache em cada uma de 40 chamadas de ferramenta;
  • adiciona 1.000 tokens sem cache por chamada;
  • produz 800 tokens de saída por chamada.

Por chamada, no Fable 5:

10(0,001) + 1,0(0,15) + 50(0,0008)
= US$0,01 + US$0,15 + US$0,04
= US$0,20
Enter fullscreen mode Exit fullscreen mode

No Fable 5.1:

US$0,01 + US$0,0375 + US$0,04
= US$0,0875
Enter fullscreen mode Exit fullscreen mode

A economia é de 56% por chamada, antes da escrita inicial do cache. Em 40 chamadas:

Fable 5:   US$8,00
Fable 5.1: US$3,50
Enter fullscreen mode Exit fullscreen mode

A estimativa de “até 45%” da Anthropic se encaixa nessa faixa depois de considerar as escritas de cache e as chamadas sem cache presentes em agentes reais.

A regra prática é simples: a economia aumenta conforme cresce a proporção entre entrada armazenada em cache e saída.

  • Cargas pesadas em saída: gerações longas a partir de prompts curtos percebem pouca diferença.
  • Cargas pesadas em prefixo: agentes, RAG com contexto estável e suporte mult turno aproveitam melhor o preço reduzido das leituras.

Três exemplos de custo por tarefa

Os exemplos usam as taxas padrão do Fable 5.1 e consideram uma escrita de cache de 5 minutos paga uma vez.

1. Uma revisão de código

  • 30.000 tokens de entrada, incluindo o prompt do sistema;
  • 4.000 tokens de saída;
  • sem cache.
Entrada: US$0,30
Saída:   US$0,20
Total:   US$0,50
Enter fullscreen mode Exit fullscreen mode

A mesma revisão no Opus 5 custa US$0,25. Sem cache, o Fable 5.1 é simplesmente o dobro do preço.

2. Uma conversa de suporte com 25 turnos

Suponha:

  • prompt de sistema estável com 12.000 tokens;
  • uma escrita de cache de US$0,15;
  • 25 turnos;
  • 300 tokens de entrada sem cache por turno;
  • 250 tokens de saída por turno;
  • prefixo servido do cache.

Cálculo:

Entrada sem cache: 25 × 300 = 7.500 tokens = US$0,075
Leituras de cache: 25 × 12.000 = 300.000 tokens = US$0,075
Saída:            25 × 250 = 6.250 tokens = US$0,3125
Escrita de cache:                              US$0,15

Total: aproximadamente US$0,61
Enter fullscreen mode Exit fullscreen mode

No Fable 5, somente as leituras de cache custariam US$0,30, levando o total para aproximadamente US$0,84.

3. Uma construção agentiva de duas horas

Considere:

  • 120 turnos de chamadas de ferramenta;
  • prefixo crescendo de 20.000 para 200.000 tokens, com média de 110.000 tokens em cache;
  • 1.500 tokens sem cache por turno;
  • 1.200 tokens de saída por turno;
  • aproximadamente seis atualizações de cache conforme o prefixo cresce.
Leituras de cache:
120 × 110.000 = 13,2 milhões de tokens = US$3,30

Entrada sem cache:
120 × 1.500 = 180.000 tokens = US$1,80

Saída:
120 × 1.200 = 144.000 tokens = US$7,20

Escritas de cache:
aproximadamente 660.000 tokens × US$12,50 = US$8,25

Total: aproximadamente US$20,55
Enter fullscreen mode Exit fullscreen mode

No Fable 5, as leituras custariam US$13,20 em vez de US$3,30, elevando o total para aproximadamente US$30,45. Isso representa uma economia de 33%, mesmo com a saída permanecendo como o maior componente individual.

Nesse cenário, as escritas de cache se tornam o segundo maior custo. Uma perda de cache custa 40 vezes mais que um acerto. Por isso, reconstruir o cache durante a sessão — por exemplo, recriando o prompt do sistema, editando um turno anterior ou alterando o array de ferramentas — é muito mais caro em relação a um estado estável do que era no Fable 5.

Alavancas que mais influenciam a conta

Ajuste o esforço

output_config.effort é a principal alavanca sobre os tokens de saída, e a saída custa US$50 por milhão de tokens.

A orientação da Anthropic para o Fable 5.1 é começar em high. Segundo a empresa:

  • medium se aproxima da qualidade do Fable 5 a um custo menor;
  • low costuma competir com Opus e Sonnet em custo por tarefa.

Valide essas afirmações com suas próprias avaliações. O beta de esforço por mensagem permite usar low em turnos rotineiros e aumentar o esforço nos turnos difíceis sem redefinir o cache.

Mantenha o cache aquecido

O armazenamento em cache de prompt é o principal desconto do Fable 5.1. Com leituras a US$0,25 e escritas a US$12,50, um único acerto já pode justificar o TTL de 5 minutos.

Para intervalos ociosos entre cinco e 60 minutos, reenviar max_tokens: 0 para manter o TTL de 5 minutos ativo geralmente custa menos que pagar o dobro pela escrita do TTL de uma hora. Consulte a documentação de prompt caching antes de implementar essa estratégia.

Use também uma estrutura append-only:

  • não reconstrua system ou tools no meio da sessão;
  • use mensagens de sistema no meio da conversa para mudanças;
  • use mensagens com escopo de turno para lembretes específicos.

A mesma disciplina que preserva blocos de pensamento também preserva o cache.

Envie para lote o que puder esperar

A API em Lote reduz os preços pela metade:

  • entrada: US$5 por milhão;
  • saída: US$25 por milhão.

Assim, uma solicitação em lote do Fable 5.1 custa o mesmo que uma solicitação síncrona do Opus 5. Use lotes para avaliações, preenchimentos retroativos e processamento noturno de documentos.

fallbacks são rejeitados em lotes. Itens recusados precisam ser reenviados manualmente.

Escolha o modelo por rota

A documentação da Anthropic sugere começar com o Opus 5 e migrar para o Fable 5.1 quando o Opus 5, mesmo com maior esforço, não for suficiente. Para rotas em que o Opus 5 já passa nas avaliações, usar o Fable 5.1 pode significar pagar o dobro sem benefício.

A comparação entre Fable 5.1 e Opus 5 ajuda a avaliar essa decisão por carga de trabalho.

Meça a sobrecarga das ferramentas

Cada solicitação com ferramentas inclui um prompt de sistema oculto para uso de ferramentas. A Anthropic publica 286 tokens para o Opus 5, mas ainda não divulgou o valor correspondente do Fable 5.1. Meça-o com o endpoint de contagem de tokens.

Como referência:

  • conjunto de ferramentas de navegador: aproximadamente 6.600 tokens por solicitação;
  • conjunto de ferramentas de computador: aproximadamente 4.500 tokens por solicitação.

Depois do primeiro envio, esses tokens ficam armazenados em cache.

Diferencie recusas de retentativas

Uma recusa do classificador antes de qualquer saída não é faturada. Retentativas, porém, são cobradas.

Um fallback no lado do servidor cobra as taxas do modelo de fallback na nova tentativa. O crédito de fallback da Anthropic reembolsa o custo do cache causado pela mudança de modelo. Monitore as recusas como uma métrica separada para saber quanto do gasto com Fable 5.1 está sendo atendido pelo Opus 5.

A maioria das técnicas do guia para reduzir a conta da API Claude continua válida; a diferença é que a matemática das leituras de cache agora favorece o Fable 5.1.

O que não está disponível no Fable 5.1

  • Modo rápido: disponível apenas para Opus 5 e Opus 4.8, a US$10 e US$50. Não há uma opção para pagar por uma saída mais rápida do Fable 5.1.
  • Nível de Prioridade: não é suportado no Fable 5.1 ou no Mythos 5.1. O Fable 5 mantém esse recurso, portanto o planejamento de capacidade empresarial que depende dele precisa permanecer no Fable 5 ou migrar para o Opus 5.
  • Retenção zero de dados: não está disponível, a menos que a Anthropic autorize expressamente. Uma organização ZDR recebe erro 400 em todas as solicitações.

Verifique seu gasto real no Apidog

A única forma confiável de saber o custo de uma solicitação é consultar o objeto usage. A forma mais rápida de automatizar essa medição é criar uma coleção de testes:

  1. Salve o prompt de sistema de produção como uma solicitação com cache_control ativado.
  2. Envie a solicitação duas vezes.
  3. Adicione uma asserção para usage.cache_creation_input_tokens no primeiro envio.
  4. Adicione uma asserção para usage.cache_read_input_tokens no segundo.
  5. Crie um script pós-resposta que multiplique cada campo pela respectiva taxa.
  6. Registre o custo final por solicitação.

Execute a coleção sempre que alterar o prompt ou a definição de uma ferramenta. Assim, uma edição que quebre o cache será detectada antes de afetar a conta.

Você pode baixar o Apidog e seguir o passo a passo da API, que mostra as solicitações exatas.

Preços do Fable 5.1 nos aplicativos Claude

Na API, o preço é calculado por token. Nos aplicativos Claude, o Fable 5.1 é medido por plano:

  • planos Max incluem modelos Fable em até 50% do limite semanal de uso sem custo adicional; depois, continuam usando créditos;
  • assentos Pro e padrão de Equipe usam créditos desde a primeira mensagem;
  • assentos empresariais padrão precisam de créditos habilitados para uso além dos limites do plano;
  • contas empresariais baseadas em uso cobram as taxas padrão da API;
  • solicitações redirecionadas para outro modelo pelas salvaguardas não são cobradas com os preços do Fable.

O guia de caminhos gratuitos e mais baratos detalha essas opções.

FAQ

Quanto custa o Claude Fable 5.1 por milhão de tokens?

A entrada custa US$10 e a saída, US$50 — os mesmos preços do Fable 5. Leituras de cache custam US$0,25 por milhão; escritas custam US$12,50 para cinco minutos e US$20 para uma hora. Na API em Lote, entrada e saída custam US$5 e US$25.

O Claude Fable 5.1 é mais barato que o Fable 5?

Por token sem cache, não. Na prática, ele é mais barato em qualquer carga que use cache de prompt, porque as leituras caíram de US$1 para US$0,25 por milhão. A Anthropic estima uma redução de 25% em cargas típicas e de até 45% em cargas agentivas. Cargas pesadas em saída percebem pouca mudança.

O Claude Fable 5.1 é mais barato que o Opus 5?

Sem cache, não: o preço é exatamente o dobro. Com cache, o cenário muda. Uma leitura no Fable 5.1 custa US$0,25, metade dos US$0,50 do Opus 5.

A saída, entretanto, custa US$50 no Fable 5.1 contra US$25 no Opus 5. Por isso, o Opus 5 continua levando vantagem em rotas pesadas em saída.

O Fable 5.1 tem modo rápido ou Nível de Prioridade?

Não para nenhum dos dois recursos. O modo rápido é exclusivo do Opus 5 e do Opus 4.8. O Nível de Prioridade existe no Fable 5, mas não no Fable 5.1.

Existe um prêmio por contexto longo no Claude Fable 5.1?

Não. A janela completa de 1 milhão de tokens é cobrada pelas taxas padrão. Os descontos de cache e de lote também se aplicam a ela.

Quanto custa o Claude Fable 5.1 no Bedrock ou no Google Cloud?

Essas plataformas definem seus próprios preços e adicionam um prêmio de 10% para endpoints regionais. O Claude Platform na AWS e o Microsoft Foundry cobram as taxas padrão da API por meio das Unidades de Consumo Claude.

Consulte o guia de disponibilidade em nuvem para ver a configuração em cada plataforma.

Top comments (0)