Kimi K3 foi lançado em 16 de julho de 2026, e sua tabela de preços parece simples até você notar dois valores para tokens de entrada: US$ 0,30 por milhão de tokens com acerto de cache (cache hit), US$ 3,00 por milhão com erro de cache (cache miss) e US$ 15,00 por milhão de tokens de saída. O número que determina sua fatura mensal, porém, é a taxa efetiva de entrada — e, em cargas de trabalho de codificação com cache reutilizado, ela tende a ficar muito mais próxima de US$ 0,30 do que de US$ 3,00. Neste guia, você vai calcular esse custo efetivo, estimar o valor de uma tarefa de agente e comparar o Kimi K3 com Claude Opus 4.8, GPT-5.6 Sol e DeepSeek V4.
TL;DR
O Kimi K3 cobra:
- US$ 0,30 / 1M tokens de entrada com acerto de cache
- US$ 3,00 / 1M tokens de entrada com erro de cache
- US$ 15,00 / 1M tokens de saída
A Moonshot atende o modelo pela arquitetura de inferência desagregada Mooncake e reporta mais de 90% de acertos de cache em cargas de trabalho de codificação. Nessa condição, o custo efetivo de entrada fica próximo de US$ 0,57 por milhão de tokens, não de US$ 3,00.
A entrada pode ser barata quando o cache funciona. A saída é a parte premium da fatura. Para reduzir custos, preserve prefixos de prompt estáveis e limite respostas desnecessariamente longas.
Você pode validar a divisão entre cache hit e cache miss inspecionando o uso de tokens de cada resposta no Apidog.
Os preços de tabela
A Moonshot publica os seguintes preços para o modelo kimi-k3:
| Tipo de token | Preço por 1M de tokens |
|---|---|
| Entrada com acerto de cache | US$ 0,30 |
| Entrada com erro de cache | US$ 3,00 |
| Saída | US$ 15,00 |
A diferença entre essas taxas define a estratégia de custo:
- Entrada com erro de cache custa 10x mais que entrada com acerto.
- Saída custa 5x mais que entrada sem cache.
- Saída custa 50x mais que entrada com cache.
Se você estimar todos os tokens de entrada a US$ 3,00, provavelmente superestimará a fatura em cargas com alto reaproveitamento de contexto. Se tratar a saída como irrelevante, subestimará o componente que pode dominar o custo.
Para entender o modelo e seu posicionamento, consulte o que é o Kimi K3. Para URLs base, configuração de requisições e SDKs, veja o guia da API Kimi K3.
Por que o cache muda a matemática
O cache de prompts separa o preço de tabela do preço efetivamente pago.
Quando você envia uma requisição, o provedor pode armazenar o prefixo tokenizado do prompt. Se uma requisição posterior reutiliza esse mesmo prefixo, os tokens reaproveitados são lidos do cache e cobrados na faixa de cache hit, em vez da faixa de cache miss.
A Moonshot afirma que a arquitetura Mooncake separa as etapas de pré-preenchimento e decodificação, permitindo reutilizar prefixos em cache. Para cargas de trabalho de codificação, a empresa reporta uma taxa de acerto acima de 90%.
Calcule sua taxa efetiva de entrada
Use esta fórmula:
taxa_efetiva_entrada =
(taxa_de_acerto × preço_cache_hit) +
((1 - taxa_de_acerto) × preço_cache_miss)
Com 90% de acerto de cache:
(0,90 × US$ 0,30) + (0,10 × US$ 3,00)
= US$ 0,27 + US$ 0,30
= US$ 0,57 por 1M de tokens de entrada
Com 95% de acerto:
(0,95 × US$ 0,30) + (0,05 × US$ 3,00)
= US$ 0,435 por 1M de tokens de entrada
A taxa real depende da estabilidade dos seus prompts. Um agente que reutiliza o mesmo repositório, prompt de sistema e definições de ferramentas tende a obter mais acertos do que um chatbot com contexto altamente variável.
Não use 90% como garantia. Meça o comportamento do seu tráfego antes de projetar gastos.
Exemplo prático: custo de uma tarefa de agente
Considere uma sessão de codificação com agente em um repositório de tamanho médio.
Ao longo da sessão, o modelo processa:
- 2.000.000 tokens de entrada
- 200.000 tokens de saída
O volume de entrada pode ser alto porque o contexto é reenviado em múltiplas interações.
Cenário 1: sem cache
Entrada:
2.000.000 × US$ 3,00 / 1.000.000 = US$ 6,00
Saída:
200.000 × US$ 15,00 / 1.000.000 = US$ 3,00
Total = US$ 9,00
Cenário 2: 90% de acerto de cache
Entrada com cache:
1.800.000 × US$ 0,30 / 1.000.000 = US$ 0,54
Entrada sem cache:
200.000 × US$ 3,00 / 1.000.000 = US$ 0,60
Subtotal de entrada = US$ 1,14
Saída:
200.000 × US$ 15,00 / 1.000.000 = US$ 3,00
Total = US$ 4,14
Nesse exemplo:
- O cache reduz a entrada de US$ 6,00 para US$ 1,14.
- O custo total cai de US$ 9,00 para US$ 4,14.
- A economia total é de aproximadamente 54%.
- O custo de saída continua em US$ 3,00 nos dois cenários.
O cache não reduz tokens de saída: ele só reduz o custo de tokens que o modelo já processou anteriormente.
Estratégia de custo: preserve entrada, controle saída
Com Kimi K3, a principal alavanca de custo não é necessariamente reduzir o prompt. É evitar saídas longas demais.
O que fazer
-
Defina
max_tokensquando possível. Evite deixar o modelo gerar explicações extensas quando você precisa apenas de código ou um diff. - Peça formatos objetivos. Por exemplo: “Retorne somente o patch unificado” ou “Liste apenas os arquivos alterados e o código final”.
- Mantenha o prefixo estável. Não reordene sem necessidade o prompt de sistema, o esquema de ferramentas ou o bloco de contexto compartilhado.
- Agrupe chamadas relacionadas. Execute tarefas que usam o mesmo contexto enquanto o prefixo ainda pode ser reaproveitado.
- Envie contexto útil. Cortar contexto apenas para economizar entrada pode reduzir a qualidade e gerar mais perguntas, retrabalho e saída adicional.
Exemplo de instrução para conter a saída
Implemente a correção.
Responda somente com:
1. arquivos alterados;
2. patch unificado;
3. comandos para executar os testes.
Não explique decisões de implementação.
Essa abordagem reduz tokens de saída sem sacrificar o contexto que ajuda o modelo a gerar uma resposta correta.
Como o Kimi K3 se compara
Os preços de concorrentes mudam, então confirme as taxas atuais antes de tomar uma decisão de produção.
| Modelo | Entrada (por 1M) | Saída (por 1M) | Observações |
|---|---|---|---|
| Kimi K3 | US$ 0,30 com cache / US$ 3,00 sem cache | US$ 15,00 | Contexto de 1M; pesos abertos previstos perto de 27 de julho |
| Claude Opus 4.8 | US$ 5,00 | US$ 25,00 | Camada premium; confirme preços atuais |
| GPT-5.6 Sol | ~US$ 5,00 | ~US$ 30,00 | Camada principal; há camadas GPT-5.6 mais baratas |
| DeepSeek V4 | Camada de valor | Camada de valor | Confirme as taxas atuais |
Contra Claude Opus 4.8
Pelos preços de tabela, o Kimi K3 é mais barato em entrada e saída:
- Entrada sem cache do Kimi K3: US$ 3,00 / 1M
- Entrada do Opus 4.8: US$ 5,00 / 1M
- Saída do Kimi K3: US$ 15,00 / 1M
- Saída do Opus 4.8: US$ 25,00 / 1M
Na tarefa de exemplo com 2M de entrada e 200K de saída:
Claude Opus 4.8:
Entrada: 2M × US$ 5,00 / 1M = US$ 10,00
Saída: 200K × US$ 25,00 / 1M = US$ 5,00
Total aproximado = US$ 15,00
Isso se compara a US$ 4,14 para Kimi K3 com 90% de acerto de cache.
A Anthropic também oferece cache de prompt, que pode reduzir o custo efetivo do Opus. Ainda assim, a comparação de tabela mostra a direção: Kimi K3 é a opção de menor preço.
Veja os preços do Claude Opus 4.8.
Contra GPT-5.6 Sol
De acordo com a cobertura disponível, o GPT-5.6 Sol custa aproximadamente:
- US$ 5,00 por 1M tokens de entrada
- US$ 30,00 por 1M tokens de saída
Nesse recorte, Kimi K3 é mais barato. Porém, o GPT-5.6 também oferece as camadas Terra e Luna, que podem ter preços menores com uma troca de capacidade.
Consulte os preços do GPT-5.6 antes de comparar custos reais.
Contra DeepSeek V4
Kimi K3 e DeepSeek V4 se posicionam como opções de valor com pesos abertos.
O DeepSeek pode superar o Kimi K3 no preço bruto de saída. Por outro lado, o Kimi K3 oferece contexto de 1M e um desconto profundo para entradas que atingem o cache.
Se sua carga é intensiva em entrada e reutiliza prefixos estáveis, a vantagem de custo pode diminuir ou inverter.
Veja os preços do DeepSeek V4.
Como medir o uso real de tokens com Apidog
A fórmula só é útil se você medir seus próprios números.
Cada resposta do Kimi K3 retorna um objeto de uso com contagens de tokens de entrada, saída e a parcela atendida pelo cache. É esse objeto que permite calcular sua taxa combinada real.
Passo a passo
- Configure uma requisição para o endpoint do Kimi K3 no Apidog.
- Informe a URL base, o token de portador e o ID do modelo
kimi-k3. - Envie uma requisição representativa da sua aplicação.
- Repita a mesma requisição com o prefixo idêntico.
- Compare os dados de uso das duas respostas.
- Calcule a taxa de acerto observada e aplique-a à fórmula de custo.
Como o Kimi K3 é compatível com o OpenAI SDK, a configuração segue o padrão de uma API no estilo OpenAI.
Para uma estimativa prática, registre:
taxa_de_acerto =
tokens_de_entrada_com_cache / tokens_totais_de_entrada
Em seguida:
custo_de_entrada =
(tokens_com_cache × US$ 0,30 / 1M) +
(tokens_sem_cache × US$ 3,00 / 1M)
Você também pode salvar a mesma requisição para kimi-k3 e para seu modelo atual, executar ambas e comparar:
- qualidade da resposta;
- tokens de entrada;
- tokens de saída;
- divisão de cache;
- custo estimado por tarefa.
Se você trabalha no editor, veja como usar o Apidog dentro do VS Code. Para começar, baixe o Apidog.
Veredito
Kimi K3 é barato para alimentar e premium para conversar.
A taxa de US$ 0,30 para entrada com cache, combinada com a taxa de acerto acima de 90% reportada pela Moonshot para cargas de codificação, pode reduzir significativamente o custo efetivo de entrada. Em contrapartida, a saída a US$ 15,00 por milhão é onde a disciplina de tokens mais importa.
Na prática:
- Reutilize prompts de sistema, definições de ferramentas e contexto estável.
- Meça sua taxa real de acerto de cache.
- Limite
max_tokens. - Peça respostas curtas e estruturadas.
- Compare custo e qualidade com dados do seu tráfego.
Em preço, Kimi K3 supera Claude Opus 4.8 nas taxas de tabela e é mais barato que GPT-5.6 Sol. A comparação com DeepSeek V4 depende da intensidade de entrada e do comportamento do cache.
Para estimar seu custo antes de comprometer orçamento, baixe o Apidog, envie requisições representativas para kimi-k3 e leia a divisão de cache diretamente no objeto de uso.
FAQ
Quanto custa a API Kimi K3?
A API direta da Moonshot cobra:
- US$ 0,30 por milhão de tokens de entrada com acerto de cache;
- US$ 3,00 por milhão de tokens de entrada com erro de cache;
- US$ 15,00 por milhão de tokens de saída.
Listagens de terceiros, como OpenRouter, podem mostrar uma entrada fixa de US$ 3,00 e saída de US$ 15,00 sem uma camada separada de acerto de cache. Consulte o guia da API Kimi K3 para a configuração da requisição.
O que é taxa de acerto de cache e por que ela importa?
A taxa de acerto de cache representa a proporção dos tokens de entrada reutilizados a partir de um prefixo previamente processado.
Ela importa porque tokens com cache custam US$ 0,30 por milhão, enquanto tokens sem cache custam US$ 3,00 por milhão. Com 90% de acerto, a taxa combinada de entrada fica em torno de US$ 0,57 por milhão.
O Kimi K3 é mais barato que Claude Opus 4.8?
Sim, pelos preços de tabela.
O Kimi K3 cobra US$ 15,00 por milhão de tokens de saída, contra US$ 25,00 do Claude Opus 4.8. A entrada também é mais barata no Kimi K3.
Na tarefa de exemplo com 2M de entrada e 200K de saída, o Kimi K3 com cache custa aproximadamente US$ 4,14, contra cerca de US$ 15,00 para o Opus com preços de tabela. A Anthropic oferece cache próprio, então use essa comparação como direção, não como valor final.
Veja os preços do Claude Opus 4.8 e a comparação Kimi K3 vs Claude Opus 4.8.
Como o preço do Kimi K3 se compara ao GPT-5.6 e DeepSeek V4?
Kimi K3 é mais barato que GPT-5.6 Sol, cuja camada principal custa aproximadamente US$ 5,00 de entrada e US$ 30,00 de saída. Porém, GPT-5.6 oferece camadas Terra e Luna mais baratas.
DeepSeek V4 é outra opção de valor e pode vencer o Kimi K3 no preço bruto de saída. A comparação depende do preço atual e da proporção de entrada com cache da sua carga.
Confirme as taxas nos preços do GPT-5.6 e nos preços do DeepSeek V4.
Como reduzir minha conta do Kimi K3?
Concentre-se principalmente na saída:
- limite
max_tokens; - solicite respostas concisas;
- use formatos de saída estruturados;
- mantenha o prompt de sistema e o prefixo de contexto idênticos em bytes;
- agrupe tarefas que compartilham o mesmo contexto.
Reduzir entrada nem sempre ajuda: quando o cache funciona, a entrada já é barata. Cortar contexto útil pode reduzir qualidade e provocar respostas mais longas.
Como verificar minha taxa real de acerto de cache?
Inspecione o objeto de uso retornado em cada resposta do Kimi K3. Ele informa tokens de entrada, saída e acertos de cache.
Envie a mesma requisição duas vezes pelo Apidog, compare as contagens de cache e calcule a proporção observada. Use esse número, e não apenas a taxa reportada pela Moonshot, para projetar seu custo combinado.


Top comments (0)