A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026, chamando-o de “o primeiro modelo de classe 3T aberto do mundo”. Na prática, o K3 é um modelo Mixture-of-Experts (MoE) de 2,8 trilhões de parâmetros, com contexto de 1 milhão de tokens, uma nova pilha de atenção e preços voltados a fluxos de codificação. Ele chegou no mesmo dia ao Kimi.com, Kimi Work, Kimi Code e à Kimi API. A Moonshot também prometeu disponibilizar os pesos completos até 27 de julho de 2026.
TL;DR: o que é o Kimi K3?
O Kimi K3 é o principal LLM da Moonshot AI. Seus pontos principais são:
- 2,8 trilhões de parâmetros totais
- Arquitetura Mixture-of-Experts
- 16 de 896 especialistas ativos por token
- Janela de contexto de 1.048.576 tokens
- ID de modelo da API:
kimi-k3 - API compatível com o SDK da OpenAI
- Pesos completos esperados por volta de 27 de julho de 2026
Preços informados:
| Tipo de token | Preço |
|---|---|
| Entrada com cache-hit | US$ 0,30 / 1M tokens |
| Entrada com cache-miss | US$ 3,00 / 1M tokens |
| Saída | US$ 15,00 / 1M tokens |
No Índice de Inteligência da Artificial Analysis, o K3 obteve 57 pontos e ficou em 4º lugar entre 189 modelos. A própria Moonshot afirma que ele ainda está atrás de Claude Fable 5 e GPT-5.6 Sol. Portanto, trate-o como um modelo aberto próximo à fronteira, não como o líder absoluto.
Por que o Kimi K3 importa
O ponto mais relevante não é apenas o benchmark. É a combinação de:
- Qualidade próxima à fronteira.
- Contexto de 1M de tokens.
- Preço de cache-hit 10 vezes menor que o cache-miss.
- Compatibilidade com clientes OpenAI existentes.
- Promessa de pesos abertos para execução própria.
Para quem já usa APIs de LLM, o teste inicial é simples: aponte um cliente compatível com OpenAI para o endpoint da Moonshot, use kimi-k3 como modelo e valide streaming, chamadas de ferramentas e saída estruturada.
Você também pode testar a API antes de escrever a integração. O Apidog permite enviar requisições a endpoints compatíveis com OpenAI, acompanhar eventos SSE token a token e inspecionar payloads de chamadas de ferramentas.
Para detalhes específicos, consulte:
Arquitetura: o que mudou em relação ao K2
O Kimi K3 não é apenas uma versão maior do K2. A Moonshot descreve uma reconstrução da pilha principal do modelo.
Kimi Delta Attention (KDA)
O KDA é um mecanismo híbrido de atenção linear. O objetivo é controlar o crescimento de memória e computação em contextos longos, tornando a janela de 1M de tokens viável para inferência.
Attention Residuals (AttnRes)
O AttnRes substitui conexões residuais convencionais para recuperar seletivamente representações ao longo da profundidade da rede. Em termos práticos, a proposta é preservar melhor informações de camadas anteriores.
Stable LatentMoE
A camada MoE do K3 possui 896 especialistas, dos quais 16 são ativados por token. Essa ativação esparsa permite que o modelo tenha 2,8T parâmetros totais sem executar todos eles a cada token.
A Moonshot também cita:
- Per-Head Muon
- Sigmoid Tanh Unit (SiTU)
- Gated MLA
- Pesos MXFP4
- Ativações MXFP8
Especificações do Kimi K3
| Especificação | Kimi K3 |
|---|---|
| Desenvolvedor | Moonshot AI |
| Data de lançamento | 16 de julho de 2026 |
| Parâmetros totais | 2,8 trilhões (MoE) |
| Especialistas ativos | 16 de 896 por token |
| Janela de contexto | 1.048.576 tokens (1M) |
| ID do modelo na API | kimi-k3 |
| Slug no OpenRouter | moonshotai/kimi-k3 |
| Compatibilidade | OpenAI SDK |
| Entrada com cache-hit | US$ 0,30 / 1M tokens |
| Entrada com cache-miss | US$ 3,00 / 1M tokens |
| Saída | US$ 15,00 / 1M tokens |
| Velocidade de saída | ~62 tokens/s |
| Tempo para primeiro token | ~1,99 s |
| Índice de Inteligência | 57, posição #4 de 189 |
| Pesos abertos | Esperados por volta de 27 de julho de 2026 |
Para estimar custo por volume de tokens e padrão de cache, consulte o guia de preços do Kimi K3.
Contexto de 1M: como aproveitar o cache-hit
Uma janela de 1.048.576 tokens é útil para cenários como:
- Repositórios grandes.
- Árvores de arquivos compartilhadas entre etapas de um agente.
- Documentação interna extensa.
- Transcrições longas.
- Corpus de pesquisa.
- Instruções de sistema e políticas reutilizadas.
A diferença de preço entre cache-hit e cache-miss é importante:
Cache-hit: US$ 0,30 / 1M tokens
Cache-miss: US$ 3,00 / 1M tokens
Isso representa uma diferença de 10x na entrada.
Para aproveitar esse modelo de cobrança:
- Mantenha o prompt de sistema estável.
- Reutilize o mesmo contexto de repositório quando possível.
- Evite reorganizar blocos grandes de contexto a cada chamada.
- Separe dados mutáveis de instruções ou arquivos compartilhados.
- Meça o custo real com cargas de trabalho repetitivas.
A Moonshot relata taxa de cache-hit acima de 90% em cargas de trabalho de codificação usando sua inferência Mooncake. Esse dado é especialmente relevante para agentes que reenviam contexto de código em várias etapas.
Há uma contrapartida: a Artificial Analysis mediu cerca de 62 tokens por segundo, abaixo da mediana de 72,7 tokens/s para modelos comparáveis na faixa de preço. O tempo para o primeiro token, de aproximadamente 1,99 s, é um pouco melhor que a mediana.
Se sua prioridade for baixa latência, compare o K3 com alternativas mais rápidas antes de adotá-lo como padrão.
Posicionamento: forte, aberto, mas não o líder absoluto
A Moonshot afirma no post oficial de lançamento do Kimi K3 que o modelo ainda está atrás de Claude Fable 5 e GPT-5.6 Sol.
Os dados independentes seguem essa leitura: no Índice de Inteligência da Artificial Analysis, o K3 marcou 57 pontos e ficou em 4º lugar entre 189 modelos.
Use o Kimi K3 quando você precisar de:
- Qualidade próxima à fronteira.
- Caminho potencial para auto-hospedagem.
- Contexto muito longo.
- Uso intensivo de contexto reutilizável.
- Compatibilidade com integrações no padrão OpenAI.
Para comparações diretas:
Onde usar o Kimi K3
O K3 foi disponibilizado nas superfícies de produto da Moonshot no lançamento.
| Superfície | Uso |
|---|---|
| Kimi.com | Aplicativo de chat web, com K3 como modelo padrão |
| Kimi Work | Espaço de trabalho para equipes |
| Kimi Code | Agente de codificação baseado em terminal |
| Kimi API | Acesso programático com kimi-k3
|
| Aplicativos móveis | iOS, Android e HarmonyOS |
| Desktop | Kimi Work 3.1.0 ou posterior |
| OpenRouter | Acesso via moonshotai/kimi-k3
|
Se você usa terminal e agentes de código, consulte o guia de Kimi Code CLI.
Para comparar com a geração anterior:
Recursos expostos pela API
A API do K3 suporta recursos esperados em integrações agenticas:
- Cache de contexto.
- Chamadas de ferramentas.
- Restrições de escolha de ferramenta.
- Modo JSON.
- Saída estruturada.
- Modo parcial para conclusões controladas.
- Pesquisa na internet.
- Carregamento dinâmico de ferramentas.
- Esforço de raciocínio configurável, incluindo modo máximo.
A Moonshot informa compatibilidade com o OpenAI SDK. Antes de codificar a integração, confirme a URL base atual no platform.kimi.ai.
Implementação: chamada básica com SDK da OpenAI
Use o cliente OpenAI apontando para o endpoint compatível da Moonshot. Substitua KIMI_BASE_URL pela URL confirmada no console e armazene a chave em variável de ambiente.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["KIMI_API_KEY"],
base_url=os.environ["KIMI_BASE_URL"],
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "Você é um assistente técnico. Responda de forma objetiva."
},
{
"role": "user",
"content": "Explique como implementar cache de contexto em um agente de código."
}
],
)
print(response.choices[0].message.content)
Implementação: validar streaming
Antes de ligar o modelo ao seu frontend ou agente, valide como os chunks chegam.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["KIMI_API_KEY"],
base_url=os.environ["KIMI_BASE_URL"],
)
stream = client.chat.completions.create(
model="kimi-k3",
stream=True,
messages=[
{
"role": "user",
"content": "Liste três riscos de usar contexto de 1M de tokens."
}
],
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Teste pelo menos estes casos antes do deploy:
- Prompt curto sem streaming.
- Prompt longo com contexto reutilizado.
- Streaming com reconexão ou cancelamento.
- Saída JSON.
- Chamada de ferramenta.
- Resposta parcial.
- Erros de autenticação e limites de requisição.
Implementação: testar chamadas de ferramentas
Defina ferramentas e valide o payload de tool_calls antes de executar ações reais.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["KIMI_API_KEY"],
base_url=os.environ["KIMI_BASE_URL"],
)
tools = [
{
"type": "function",
"function": {
"name": "get_file_content",
"description": "Obtém o conteúdo de um arquivo do repositório.",
"parameters": {
"type": "object",
"properties": {
"path": {
"type": "string",
"description": "Caminho relativo do arquivo."
}
},
"required": ["path"],
"additionalProperties": False
}
}
}
]
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": "Leia o arquivo package.json e identifique os scripts disponíveis."
}
],
tools=tools,
)
message = response.choices[0].message
print(message.tool_calls)
Durante a avaliação, não execute uma ferramenta diretamente com argumentos retornados pelo modelo. Primeiro:
- Valide o JSON.
- Verifique permissões.
- Restrinja caminhos de arquivo e comandos permitidos.
- Registre a decisão.
- Execute somente após passar pelas validações.
Você pode reproduzir esses testes no Apidog:
- Crie uma requisição
POSTpara o endpoint compatível com OpenAI da Moonshot. - Salve
KIMI_API_KEYcomo variável de ambiente. - Defina
modelcomokimi-k3. - Envie uma requisição com
"stream": true. - Inspecione os eventos SSE.
- Adicione
toolsao corpo da requisição. - Valide o formato retornado em
tool_calls.
Perguntas frequentes
O que é o Kimi K3?
Kimi K3 é o principal modelo de linguagem da Moonshot AI, lançado em 16 de julho de 2026. É um modelo MoE de 2,8 trilhões de parâmetros, com janela de contexto de 1M de tokens e ID de API kimi-k3.
Quantos parâmetros o Kimi K3 possui?
O K3 possui 2,8 trilhões de parâmetros totais. Ele ativa 16 de 896 especialistas por token. A Moonshot não publicou uma contagem exata de parâmetros ativos; portanto, evite citar um valor específico como fato.
Quanto custa a API do Kimi K3?
- US$ 0,30 por milhão de tokens de entrada com cache-hit.
- US$ 3,00 por milhão de tokens de entrada com cache-miss.
- US$ 15,00 por milhão de tokens de saída.
Veja o detalhamento de preços para mais contexto.
O Kimi K3 é open source?
Não no dia do lançamento. A Moonshot prometeu liberar os pesos completos até 27 de julho de 2026. Até essa data, o modelo está disponível por produtos hospedados e API paga.
O Kimi K3 é melhor que Claude Fable 5 ou GPT-5.6 Sol?
Não, segundo a própria Moonshot. O K3 é descrito como próximo à fronteira, mas ainda atrás desses modelos proprietários.
Posso usar o Kimi K3 com o OpenAI SDK?
Sim. A API da Moonshot é compatível com o OpenAI SDK. Confirme a URL base no platform.kimi.ai, use kimi-k3 como modelo e teste a integração antes de publicar.
Você também pode validar requisições e respostas no Apidog.
Qual é a velocidade do Kimi K3?
A Artificial Analysis mediu aproximadamente 62 tokens de saída por segundo e cerca de 1,99 s até o primeiro token. O modelo prioriza profundidade de raciocínio em vez de velocidade máxima.
Como o Kimi K3 se compara ao Kimi K2.7 Code?
O K3 é o carro-chefe da próxima geração da linha K2, com uma pilha de atenção reconstruída. A Moonshot afirma eficiência de escalonamento aproximadamente 2,5 vezes superior ao K2. Para a comparação detalhada, veja Kimi K3 vs Kimi K2.7 Code.



Top comments (0)