DEV Community

Cover image for Preços Kimi K3: Custos da API e o Cálculo do Cache-Hit
Lucas
Lucas

Posted on • Originally published at apidog.com

Preços Kimi K3: Custos da API e o Cálculo do Cache-Hit

Kimi K3 foi lançado em 16 de julho de 2026, e sua tabela de preços parece simples até você notar dois valores para tokens de entrada: US$ 0,30 por milhão de tokens com acerto de cache (cache hit), US$ 3,00 por milhão com erro de cache (cache miss) e US$ 15,00 por milhão de tokens de saída. O número que determina sua fatura mensal, porém, é a taxa efetiva de entrada — e, em cargas de trabalho de codificação com cache reutilizado, ela tende a ficar muito mais próxima de US$ 0,30 do que de US$ 3,00. Neste guia, você vai calcular esse custo efetivo, estimar o valor de uma tarefa de agente e comparar o Kimi K3 com Claude Opus 4.8, GPT-5.6 Sol e DeepSeek V4.

Experimente o Apidog hoje

TL;DR

O Kimi K3 cobra:

  • US$ 0,30 / 1M tokens de entrada com acerto de cache
  • US$ 3,00 / 1M tokens de entrada com erro de cache
  • US$ 15,00 / 1M tokens de saída

A Moonshot atende o modelo pela arquitetura de inferência desagregada Mooncake e reporta mais de 90% de acertos de cache em cargas de trabalho de codificação. Nessa condição, o custo efetivo de entrada fica próximo de US$ 0,57 por milhão de tokens, não de US$ 3,00.

A entrada pode ser barata quando o cache funciona. A saída é a parte premium da fatura. Para reduzir custos, preserve prefixos de prompt estáveis e limite respostas desnecessariamente longas.

Você pode validar a divisão entre cache hit e cache miss inspecionando o uso de tokens de cada resposta no Apidog.

Os preços de tabela

A Moonshot publica os seguintes preços para o modelo kimi-k3:

Tipo de token Preço por 1M de tokens
Entrada com acerto de cache US$ 0,30
Entrada com erro de cache US$ 3,00
Saída US$ 15,00

A diferença entre essas taxas define a estratégia de custo:

  • Entrada com erro de cache custa 10x mais que entrada com acerto.
  • Saída custa 5x mais que entrada sem cache.
  • Saída custa 50x mais que entrada com cache.

Se você estimar todos os tokens de entrada a US$ 3,00, provavelmente superestimará a fatura em cargas com alto reaproveitamento de contexto. Se tratar a saída como irrelevante, subestimará o componente que pode dominar o custo.

Para entender o modelo e seu posicionamento, consulte o que é o Kimi K3. Para URLs base, configuração de requisições e SDKs, veja o guia da API Kimi K3.

Tabela de preços do Kimi K3

Por que o cache muda a matemática

O cache de prompts separa o preço de tabela do preço efetivamente pago.

Quando você envia uma requisição, o provedor pode armazenar o prefixo tokenizado do prompt. Se uma requisição posterior reutiliza esse mesmo prefixo, os tokens reaproveitados são lidos do cache e cobrados na faixa de cache hit, em vez da faixa de cache miss.

A Moonshot afirma que a arquitetura Mooncake separa as etapas de pré-preenchimento e decodificação, permitindo reutilizar prefixos em cache. Para cargas de trabalho de codificação, a empresa reporta uma taxa de acerto acima de 90%.

Calcule sua taxa efetiva de entrada

Use esta fórmula:

taxa_efetiva_entrada =
  (taxa_de_acerto × preço_cache_hit) +
  ((1 - taxa_de_acerto) × preço_cache_miss)
Enter fullscreen mode Exit fullscreen mode

Com 90% de acerto de cache:

(0,90 × US$ 0,30) + (0,10 × US$ 3,00)
= US$ 0,27 + US$ 0,30
= US$ 0,57 por 1M de tokens de entrada
Enter fullscreen mode Exit fullscreen mode

Com 95% de acerto:

(0,95 × US$ 0,30) + (0,05 × US$ 3,00)
= US$ 0,435 por 1M de tokens de entrada
Enter fullscreen mode Exit fullscreen mode

A taxa real depende da estabilidade dos seus prompts. Um agente que reutiliza o mesmo repositório, prompt de sistema e definições de ferramentas tende a obter mais acertos do que um chatbot com contexto altamente variável.

Não use 90% como garantia. Meça o comportamento do seu tráfego antes de projetar gastos.

Exemplo prático: custo de uma tarefa de agente

Considere uma sessão de codificação com agente em um repositório de tamanho médio.

Ao longo da sessão, o modelo processa:

  • 2.000.000 tokens de entrada
  • 200.000 tokens de saída

O volume de entrada pode ser alto porque o contexto é reenviado em múltiplas interações.

Cenário 1: sem cache

Entrada:
2.000.000 × US$ 3,00 / 1.000.000 = US$ 6,00

Saída:
200.000 × US$ 15,00 / 1.000.000 = US$ 3,00

Total = US$ 9,00
Enter fullscreen mode Exit fullscreen mode

Cenário 2: 90% de acerto de cache

Entrada com cache:
1.800.000 × US$ 0,30 / 1.000.000 = US$ 0,54

Entrada sem cache:
200.000 × US$ 3,00 / 1.000.000 = US$ 0,60

Subtotal de entrada = US$ 1,14

Saída:
200.000 × US$ 15,00 / 1.000.000 = US$ 3,00

Total = US$ 4,14
Enter fullscreen mode Exit fullscreen mode

Nesse exemplo:

  • O cache reduz a entrada de US$ 6,00 para US$ 1,14.
  • O custo total cai de US$ 9,00 para US$ 4,14.
  • A economia total é de aproximadamente 54%.
  • O custo de saída continua em US$ 3,00 nos dois cenários.

O cache não reduz tokens de saída: ele só reduz o custo de tokens que o modelo já processou anteriormente.

Estratégia de custo: preserve entrada, controle saída

Com Kimi K3, a principal alavanca de custo não é necessariamente reduzir o prompt. É evitar saídas longas demais.

O que fazer

  • Defina max_tokens quando possível. Evite deixar o modelo gerar explicações extensas quando você precisa apenas de código ou um diff.
  • Peça formatos objetivos. Por exemplo: “Retorne somente o patch unificado” ou “Liste apenas os arquivos alterados e o código final”.
  • Mantenha o prefixo estável. Não reordene sem necessidade o prompt de sistema, o esquema de ferramentas ou o bloco de contexto compartilhado.
  • Agrupe chamadas relacionadas. Execute tarefas que usam o mesmo contexto enquanto o prefixo ainda pode ser reaproveitado.
  • Envie contexto útil. Cortar contexto apenas para economizar entrada pode reduzir a qualidade e gerar mais perguntas, retrabalho e saída adicional.

Exemplo de instrução para conter a saída

Implemente a correção.

Responda somente com:
1. arquivos alterados;
2. patch unificado;
3. comandos para executar os testes.

Não explique decisões de implementação.
Enter fullscreen mode Exit fullscreen mode

Essa abordagem reduz tokens de saída sem sacrificar o contexto que ajuda o modelo a gerar uma resposta correta.

Como o Kimi K3 se compara

Os preços de concorrentes mudam, então confirme as taxas atuais antes de tomar uma decisão de produção.

Modelo Entrada (por 1M) Saída (por 1M) Observações
Kimi K3 US$ 0,30 com cache / US$ 3,00 sem cache US$ 15,00 Contexto de 1M; pesos abertos previstos perto de 27 de julho
Claude Opus 4.8 US$ 5,00 US$ 25,00 Camada premium; confirme preços atuais
GPT-5.6 Sol ~US$ 5,00 ~US$ 30,00 Camada principal; há camadas GPT-5.6 mais baratas
DeepSeek V4 Camada de valor Camada de valor Confirme as taxas atuais

Contra Claude Opus 4.8

Pelos preços de tabela, o Kimi K3 é mais barato em entrada e saída:

  • Entrada sem cache do Kimi K3: US$ 3,00 / 1M
  • Entrada do Opus 4.8: US$ 5,00 / 1M
  • Saída do Kimi K3: US$ 15,00 / 1M
  • Saída do Opus 4.8: US$ 25,00 / 1M

Na tarefa de exemplo com 2M de entrada e 200K de saída:

Claude Opus 4.8:
Entrada: 2M × US$ 5,00 / 1M = US$ 10,00
Saída: 200K × US$ 25,00 / 1M = US$ 5,00
Total aproximado = US$ 15,00
Enter fullscreen mode Exit fullscreen mode

Isso se compara a US$ 4,14 para Kimi K3 com 90% de acerto de cache.

A Anthropic também oferece cache de prompt, que pode reduzir o custo efetivo do Opus. Ainda assim, a comparação de tabela mostra a direção: Kimi K3 é a opção de menor preço.

Veja os preços do Claude Opus 4.8.

Contra GPT-5.6 Sol

De acordo com a cobertura disponível, o GPT-5.6 Sol custa aproximadamente:

  • US$ 5,00 por 1M tokens de entrada
  • US$ 30,00 por 1M tokens de saída

Nesse recorte, Kimi K3 é mais barato. Porém, o GPT-5.6 também oferece as camadas Terra e Luna, que podem ter preços menores com uma troca de capacidade.

Consulte os preços do GPT-5.6 antes de comparar custos reais.

Contra DeepSeek V4

Kimi K3 e DeepSeek V4 se posicionam como opções de valor com pesos abertos.

O DeepSeek pode superar o Kimi K3 no preço bruto de saída. Por outro lado, o Kimi K3 oferece contexto de 1M e um desconto profundo para entradas que atingem o cache.

Se sua carga é intensiva em entrada e reutiliza prefixos estáveis, a vantagem de custo pode diminuir ou inverter.

Veja os preços do DeepSeek V4.

Como medir o uso real de tokens com Apidog

A fórmula só é útil se você medir seus próprios números.

Cada resposta do Kimi K3 retorna um objeto de uso com contagens de tokens de entrada, saída e a parcela atendida pelo cache. É esse objeto que permite calcular sua taxa combinada real.

Uso de tokens no Apidog

Passo a passo

  1. Configure uma requisição para o endpoint do Kimi K3 no Apidog.
  2. Informe a URL base, o token de portador e o ID do modelo kimi-k3.
  3. Envie uma requisição representativa da sua aplicação.
  4. Repita a mesma requisição com o prefixo idêntico.
  5. Compare os dados de uso das duas respostas.
  6. Calcule a taxa de acerto observada e aplique-a à fórmula de custo.

Como o Kimi K3 é compatível com o OpenAI SDK, a configuração segue o padrão de uma API no estilo OpenAI.

Para uma estimativa prática, registre:

taxa_de_acerto =
tokens_de_entrada_com_cache / tokens_totais_de_entrada
Enter fullscreen mode Exit fullscreen mode

Em seguida:

custo_de_entrada =
(tokens_com_cache × US$ 0,30 / 1M) +
(tokens_sem_cache × US$ 3,00 / 1M)
Enter fullscreen mode Exit fullscreen mode

Você também pode salvar a mesma requisição para kimi-k3 e para seu modelo atual, executar ambas e comparar:

  • qualidade da resposta;
  • tokens de entrada;
  • tokens de saída;
  • divisão de cache;
  • custo estimado por tarefa.

Se você trabalha no editor, veja como usar o Apidog dentro do VS Code. Para começar, baixe o Apidog.

Veredito

Kimi K3 é barato para alimentar e premium para conversar.

A taxa de US$ 0,30 para entrada com cache, combinada com a taxa de acerto acima de 90% reportada pela Moonshot para cargas de codificação, pode reduzir significativamente o custo efetivo de entrada. Em contrapartida, a saída a US$ 15,00 por milhão é onde a disciplina de tokens mais importa.

Na prática:

  1. Reutilize prompts de sistema, definições de ferramentas e contexto estável.
  2. Meça sua taxa real de acerto de cache.
  3. Limite max_tokens.
  4. Peça respostas curtas e estruturadas.
  5. Compare custo e qualidade com dados do seu tráfego.

Em preço, Kimi K3 supera Claude Opus 4.8 nas taxas de tabela e é mais barato que GPT-5.6 Sol. A comparação com DeepSeek V4 depende da intensidade de entrada e do comportamento do cache.

Para estimar seu custo antes de comprometer orçamento, baixe o Apidog, envie requisições representativas para kimi-k3 e leia a divisão de cache diretamente no objeto de uso.

FAQ

Quanto custa a API Kimi K3?

A API direta da Moonshot cobra:

  • US$ 0,30 por milhão de tokens de entrada com acerto de cache;
  • US$ 3,00 por milhão de tokens de entrada com erro de cache;
  • US$ 15,00 por milhão de tokens de saída.

Listagens de terceiros, como OpenRouter, podem mostrar uma entrada fixa de US$ 3,00 e saída de US$ 15,00 sem uma camada separada de acerto de cache. Consulte o guia da API Kimi K3 para a configuração da requisição.

O que é taxa de acerto de cache e por que ela importa?

A taxa de acerto de cache representa a proporção dos tokens de entrada reutilizados a partir de um prefixo previamente processado.

Ela importa porque tokens com cache custam US$ 0,30 por milhão, enquanto tokens sem cache custam US$ 3,00 por milhão. Com 90% de acerto, a taxa combinada de entrada fica em torno de US$ 0,57 por milhão.

O Kimi K3 é mais barato que Claude Opus 4.8?

Sim, pelos preços de tabela.

O Kimi K3 cobra US$ 15,00 por milhão de tokens de saída, contra US$ 25,00 do Claude Opus 4.8. A entrada também é mais barata no Kimi K3.

Na tarefa de exemplo com 2M de entrada e 200K de saída, o Kimi K3 com cache custa aproximadamente US$ 4,14, contra cerca de US$ 15,00 para o Opus com preços de tabela. A Anthropic oferece cache próprio, então use essa comparação como direção, não como valor final.

Veja os preços do Claude Opus 4.8 e a comparação Kimi K3 vs Claude Opus 4.8.

Como o preço do Kimi K3 se compara ao GPT-5.6 e DeepSeek V4?

Kimi K3 é mais barato que GPT-5.6 Sol, cuja camada principal custa aproximadamente US$ 5,00 de entrada e US$ 30,00 de saída. Porém, GPT-5.6 oferece camadas Terra e Luna mais baratas.

DeepSeek V4 é outra opção de valor e pode vencer o Kimi K3 no preço bruto de saída. A comparação depende do preço atual e da proporção de entrada com cache da sua carga.

Confirme as taxas nos preços do GPT-5.6 e nos preços do DeepSeek V4.

Como reduzir minha conta do Kimi K3?

Concentre-se principalmente na saída:

  • limite max_tokens;
  • solicite respostas concisas;
  • use formatos de saída estruturados;
  • mantenha o prompt de sistema e o prefixo de contexto idênticos em bytes;
  • agrupe tarefas que compartilham o mesmo contexto.

Reduzir entrada nem sempre ajuda: quando o cache funciona, a entrada já é barata. Cortar contexto útil pode reduzir qualidade e provocar respostas mais longas.

Como verificar minha taxa real de acerto de cache?

Inspecione o objeto de uso retornado em cada resposta do Kimi K3. Ele informa tokens de entrada, saída e acertos de cache.

Envie a mesma requisição duas vezes pelo Apidog, compare as contagens de cache e calcule a proporção observada. Use esse número, e não apenas a taxa reportada pela Moonshot, para projetar seu custo combinado.

Top comments (0)