Se você já usa o Kimi, o lançamento do Kimi K3 em 16 de julho de 2026 traz uma decisão prática: migrar agora ou manter o Kimi K2.7 Code? O K2.7 Code é a variante da linha K2 focada em codificação e já foi integrada por muitas equipes em agentes e pipelines de CI. O K3 é um modelo diferente: o novo carro-chefe da Moonshot, construído em escala maior, com um novo design de atenção e uma janela de contexto de 1 milhão de tokens. Este guia mostra o que mudou e como validar a migração na sua carga de trabalho.
Como os dois modelos expõem uma API compatível com OpenAI, você pode enviar a mesma solicitação para kimi-k3 e kimi-k2-7-code lado a lado no Apidog. Compare a qualidade das respostas, a latência e o uso de tokens antes de alterar qualquer fluxo de produção.
TL;DR
- K3 é maior e mais generalista. É um modelo MoE com 2,8T de parâmetros, aproximadamente três vezes a escala da linha K2 de ~1T. O K2.7 Code é especializado em código; o K3 é um carro-chefe geral que também é forte em codificação agêntica de longo prazo.
- O contexto chega a 1M de tokens. O K3 suporta 1.048.576 tokens, o que muda a viabilidade de enviar grandes partes de um repositório, testes e logs na mesma chamada.
- A arquitetura mudou. Kimi Delta Attention, Attention Residuals e Stable LatentMoE são mudanças de engenharia, não apenas aumento de escala.
- O preço é de carro-chefe. K3 custa US$ 0,30/M em entrada com acerto de cache, US$ 3/M em entrada sem cache e US$ 15/M em saída.
- Não é o líder absoluto da fronteira. A própria Moonshot afirma que o K3 ainda está atrás de Claude Fable 5 e GPT-5.6 Sol.
- Migre se você precisa de contexto maior, raciocínio geral ou agentes de longa duração. Permaneça no K2.7 Code se sua carga é focada em código, o modelo atual atende à qualidade esperada e o custo importa.
K2.7 Code e K3 resolvem problemas diferentes
Antes de comparar números, trate os modelos como produtos com objetivos distintos.
O Kimi K2.7 Code pertence à linhagem K2 — K2, K2 Thinking, K2.5, K2.6 e K2.7 Code — e foi direcionado para geração, edição e correção de código, além de tarefas de desenvolvimento agêntico. Se seu caso de uso é “escrever e corrigir código via API”, ele foi ajustado para isso.
Para parâmetros, contexto e preços exatos do modelo, consulte o guia O que é Kimi K2.7 Code.
O Kimi K3 não é apenas uma nova versão do modelo de código. Ele é o novo modelo geral carro-chefe da Moonshot, com codificação como uma capacidade importante dentro de um conjunto mais amplo. Na prática, a decisão é entre:
- um especialista em codificação;
- um generalista maior que também trabalha bem com código e agentes.
O que mudou no K3
Escala: aproximadamente 3x mais parâmetros totais
O K3 é um modelo de mistura de especialistas, ou MoE (Mixture of Experts), com 2,8T de parâmetros totais. A linha K2, que originou o K2.7 Code, está na classe de aproximadamente 1T.
Esse número não representa diretamente o custo por requisição. Em modelos MoE, apenas uma fração dos pesos é ativada para cada token. A Moonshot não publicou a contagem de parâmetros ativos do K3, mas publicou o padrão de ativação: 16 de 896 especialistas por token.
Não interprete “2,8T” como “todos os 2,8T parâmetros são executados em cada chamada”.
Arquitetura: não é apenas um K2 maior
O K3 introduz três componentes principais:
- Kimi Delta Attention: mecanismo de atenção linear híbrida. A atenção linear escala melhor com sequências longas do que a atenção quadrática convencional.
- Attention Residuals: substituição direta das conexões residuais padrão, segundo a Moonshot.
- Stable LatentMoE: estrutura MoE que ativa 16 dos 896 especialistas por token.
A Moonshot reporta cerca de 2,5x de melhoria na eficiência de escalonamento em relação ao Kimi K2. Isso significa mais capacidade por unidade de computação, e não apenas mais computação bruta.
Contexto: 1.048.576 tokens
O K3 suporta uma janela de contexto de 1.048.576 tokens.
Para fluxos de desenvolvimento, isso permite incluir mais arquivos, testes, documentação, logs e histórico do agente na mesma sessão. Se seu principal problema com o K2.7 Code é truncamento de contexto em monorepos, refatorações grandes ou investigações longas, esta é a mudança mais relevante.
Posicionamento: de especialista para carro-chefe geral
O K2.7 Code é voltado para programação. O K3 é o modelo “mais capaz” da Moonshot, com foco também em raciocínio generalista e tarefas agênticas de longa duração.
A Moonshot cita execuções autônomas em problemas difíceis e multi-etapas, incluindo uma execução de 48 horas em uma tarefa de design de chip. Trate isso como uma indicação de objetivo do modelo, não como prova de desempenho no seu produto. Valide com seus próprios prompts e critérios de sucesso.
Preço: o cache muda a matemática
O K3 tem os seguintes preços listados:
| Tipo de token | Preço |
|---|---|
| Entrada com acerto de cache | US$ 0,30 por milhão |
| Entrada sem cache | US$ 3 por milhão |
| Saída | US$ 15 por milhão |
A diferença de 10x na entrada é importante.
Se seu agente reutiliza um prompt de sistema grande e o mesmo contexto de repositório em várias chamadas, uma taxa alta de acerto de cache pode aproximar o custo de entrada de US$ 0,30/M. Em chamadas isoladas, com contexto sempre novo, a entrada custa US$ 3/M.
Veja a matemática completa no guia de preços do Kimi K3 e confirme as taxas do K2.7 Code antes de concluir que o K3 é necessariamente mais caro por tarefa.
Kimi K3 vs. Kimi K2.7 Code
| Dimensão | Kimi K2.7 Code | Kimi K3 |
|---|---|---|
| Posicionamento | Versão focada em código da linha K2 | Modelo geral carro-chefe, forte em codificação agêntica |
| Geração | Linhagem K2 | Nova geração K3 |
| Parâmetros totais | ~1T na linha K2 | 2,8T total, MoE |
| Parâmetros ativos | Consulte a documentação do K2.7 Code | Não publicado; 16 de 896 especialistas ativos |
| Design de atenção | Atenção da geração K2 | Kimi Delta Attention + Attention Residuals |
| Estrutura MoE | MoE da geração K2 | Stable LatentMoE, 16/896 especialistas |
| Janela de contexto | Consulte a documentação do K2.7 Code | 1.048.576 tokens |
| ID do modelo | kimi-k2-7-code |
kimi-k3 |
| Compatibilidade de API | Compatível com OpenAI SDK | Compatível com OpenAI SDK |
| Preço | Consulte os preços atuais do K2.7 Code | US$ 0,30/US$ 3 de entrada e US$ 15 de saída por M |
| Pesos abertos | Consulte a cobertura do K2.7 Code | Esperados por volta de 27 de julho de 2026 |
| Melhor cenário | Código específico com custo conhecido | Contexto grande, agentes longos e tarefas gerais + código |
Para especificações exatas do K2.7 Code, use o artigo O que é Kimi K2.7 Code e o guia da API do Kimi K2.7 Code.
Onde o K3 se posiciona na fronteira
“Carro-chefe de 2,8T” não significa automaticamente “melhor modelo disponível”.
No post de lançamento, a própria Moonshot afirma que o K3 ainda está atrás de Claude Fable 5 e GPT-5.6 Sol em desempenho geral. O modelo é competitivo em benchmarks específicos, mas não reivindica a liderança absoluta.
A Artificial Analysis classifica o K3 com Índice de Inteligência 57, na posição #4 entre 189 modelos, com velocidade de saída em torno de 62 tokens por segundo. Isso o posiciona no lado mais lento da faixa de preço.
Nos benchmarks divulgados pela Moonshot:
- no DeepSWE, K3 registra 67,5 contra 70,0 do Fable 5;
- no Terminal-Bench 2.1, K3 registra 88,3 contra 84,6 do Fable 5.
O K3 vence em alguns cenários e perde em outros. Isso é forte para um modelo de pesos abertos, mas não justifica exagerar suas capacidades.
Leia as afirmações completas da Moonshot no post oficial de lançamento do Kimi K3 e consulte a análise de benchmarks do Kimi K3.
Quando migrar para o K3
Migre se uma ou mais condições forem verdadeiras:
Você atinge limites de contexto
Se o K2.7 Code trunca informações em repositórios grandes, refatorações entre serviços ou transcrições extensas de agentes, a janela de 1M do K3 é uma razão concreta para testar a migração.Você executa agentes multi-etapas e de longa duração
Se seu agente mantém estado entre chamadas de ferramentas e trabalha em tarefas extensas, valide se o K3 mantém melhor o contexto e a coerência da execução.Você precisa de raciocínio geral além de código
Produtos que combinam planejamento, análise, investigação e implementação podem se beneficiar mais de um generalista do que de um especialista exclusivamente voltado para código.Sua taxa de acerto de cache é alta
Reutilizar contexto compartilhado e prompts de sistema extensos pode reduzir significativamente o custo efetivo de entrada do K3.
Quando permanecer no K2.7 Code
Mantenha o K2.7 Code se estas condições se aplicarem:
Sua carga é específica de programação e já atende aos requisitos
Se as respostas são boas, os testes passam e o custo é previsível, não há motivo técnico para migrar apenas porque existe um modelo maior.Seu cache tem baixa reutilização
Chamadas únicas, com contexto sempre novo, pagam a entrada sem cache de US$ 3/M e a saída de US$ 15/M do K3.A latência é mais importante do que qualidade máxima
Com aproximadamente 62 tokens por segundo no dado independente citado, o K3 pode não ser a melhor escolha para experiências interativas sensíveis a tempo de resposta.Você depende de pesos abertos ou auto-hospedagem
Os pesos do K3 eram esperados por volta de 27 de julho de 2026. Verifique o lançamento real da Moonshot no Hugging Face antes de planejar auto-hospedagem.
Cenários práticos
Bot de correção de código no CI para um repositório médio
Se o bot já corrige problemas, passa nos testes e permanece barato usando K2.7 Code, provavelmente não há motivo para migrar.
Nesse caso:
- o contexto já cabe;
- a tarefa é específica;
- o custo por execução importa;
- a qualidade atual já é suficiente.
Mantenha o K2.7 Code e reavalie apenas se aumentarem as falhas, os limites de contexto ou a complexidade das tarefas.
Agente de refatoração autônoma em um monorepo grande
Este é um caso mais favorável ao K3.
A janela de 1M de tokens pode acomodar mais arquivos, testes e logs em uma única sessão. Isso reduz a necessidade de resumir contexto agressivamente ou reenviar informações essenciais em várias etapas.
Antes de migrar, execute um teste controlado com tarefas como:
- mover um módulo entre pacotes;
- atualizar chamadas em múltiplos serviços;
- corrigir uma falha que exige leitura de logs e testes;
- refatorar uma API interna com impacto em vários arquivos.
Para implementar o fluxo, consulte o guia de codificação com Kimi K3, a API do Kimi K3 e, para contexto histórico, o explicador do K2.6.
Como executar um teste A/B antes de migrar
A melhor forma de decidir é executar a mesma solicitação nos dois modelos.
Mantenha fixos:
- prompt de sistema;
- mensagem do usuário;
- temperatura;
- ferramentas disponíveis;
- limite de saída;
- contexto enviado;
- critérios de avaliação.
Altere apenas o ID do modelo:
from openai import OpenAI
import os
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url=os.environ["MOONSHOT_BASE_URL"],
)
messages = [
{
"role": "system",
"content": "Você é um agente de código. Explique as alterações e gere uma solução testável.",
},
{
"role": "user",
"content": "Analise este erro, proponha uma correção e indique os testes necessários.",
},
]
for model in ["kimi-k2-7-code", "kimi-k3"]:
response = client.chat.completions.create(
model=model,
messages=messages,
temperature=0,
)
print(f"\nModelo: {model}")
print(response.choices[0].message.content)
print(response.usage)
Compare três dimensões:
Qualidade da saída
Use critérios próximos dos de produção: testes aprovados, precisão da alteração, número de regressões, necessidade de intervenção humana e aderência ao formato esperado.Latência
Meça tempo até o primeiro token e tempo total da resposta. Não assuma que o modelo maior será mais rápido.Custo efetivo
Registre tokens de entrada, tokens de saída e taxa de acerto de cache. O preço listado por milhão de tokens não substitui a medição do seu fluxo real.
O Apidog simplifica esse teste lado a lado:
- salve as duas requisições no mesmo projeto;
- crie uma variável de ambiente para o ID do modelo;
- duplique a requisição e altere apenas
model; - acompanhe respostas SSE em streaming;
- inspecione payloads de chamadas de ferramentas;
- registre o uso de tokens por chamada.
Baixe o Apidog para montar o teste. Se você trabalha no editor, a integração do Apidog no VS Code permite manter as requisições próximas do código.
Conclusão
O K3 é um salto geracional real em relação ao K2.7 Code: aproximadamente triplica o total de parâmetros para 2,8T, introduz Kimi Delta Attention, Attention Residuals e Stable LatentMoE, além de ampliar o contexto para 1M de tokens.
Mas a atualização não é automática.
Migre para o K3 se seu produto precisa de contexto amplo, raciocínio generalista ou agentes que executam tarefas longas. Permaneça no K2.7 Code se ele já entrega a qualidade necessária em tarefas focadas em código com um custo que faz sentido.
A decisão correta não vem do benchmark de um fornecedor. Execute os dois modelos com prompts, repositórios, testes e métricas do seu ambiente.
Perguntas frequentes
Qual é melhor para codificação?
O K2.7 Code foi ajustado especificamente para programação e é uma escolha forte para tarefas de código bem definidas. O K3 é um generalista carro-chefe, também capaz em codificação agêntica de longa duração, com uma janela de contexto muito maior.
Para agentes multi-etapas em repositórios grandes, o K3 tem vantagem estrutural. Para tarefas de código específicas que o K2.7 Code já resolve bem, o K2.7 pode ser a opção mais econômica.
O Kimi K3 é mais caro que o K2.7 Code?
O K3 lista US$ 0,30/M para entrada com acerto de cache, US$ 3/M para entrada sem cache e US$ 15/M para saída.
O custo por tarefa depende da sua taxa de acerto de cache, do tamanho do contexto e da verbosidade da resposta. Como ambos são compatíveis com OpenAI SDK, a troca começa com uma alteração no ID do modelo, seguida por revalidação de prompts e custos.
O Kimi K3 é de código aberto?
Não no dia do lançamento. A Moonshot informou que os pesos completos eram esperados por volta de 27 de julho de 2026. Até o lançamento efetivo, trate qualquer plano de auto-hospedagem como dependente da disponibilidade desses pesos.
O K3 é melhor que Claude Fable 5 ou GPT-5.6 Sol?
Segundo o próprio blog da Moonshot, não no desempenho geral. O K3 é competitivo — e pode superar esses modelos em benchmarks específicos —, mas não é apresentado como líder absoluto da fronteira.
A Artificial Analysis o posiciona com Índice de Inteligência 57, em #4 entre 189 modelos. É um concorrente forte de pesos abertos, não o líder geral.

Top comments (0)