DEV Community

Cover image for Kimi K3: O que é? O Modelo Aberto Carro-Chefe de 2.8T da Moonshot
Lucas
Lucas

Posted on • Originally published at apidog.com

Kimi K3: O que é? O Modelo Aberto Carro-Chefe de 2.8T da Moonshot

A Moonshot AI lançou o Kimi K3 em 16 de julho de 2026, chamando-o de “o primeiro modelo de classe 3T aberto do mundo”. Na prática, o K3 é um modelo Mixture-of-Experts (MoE) de 2,8 trilhões de parâmetros, com contexto de 1 milhão de tokens, uma nova pilha de atenção e preços voltados a fluxos de codificação. Ele chegou no mesmo dia ao Kimi.com, Kimi Work, Kimi Code e à Kimi API. A Moonshot também prometeu disponibilizar os pesos completos até 27 de julho de 2026.

Experimente o Apidog hoje

TL;DR: o que é o Kimi K3?

O Kimi K3 é o principal LLM da Moonshot AI. Seus pontos principais são:

  • 2,8 trilhões de parâmetros totais
  • Arquitetura Mixture-of-Experts
  • 16 de 896 especialistas ativos por token
  • Janela de contexto de 1.048.576 tokens
  • ID de modelo da API: kimi-k3
  • API compatível com o SDK da OpenAI
  • Pesos completos esperados por volta de 27 de julho de 2026

Preços informados:

Tipo de token Preço
Entrada com cache-hit US$ 0,30 / 1M tokens
Entrada com cache-miss US$ 3,00 / 1M tokens
Saída US$ 15,00 / 1M tokens

No Índice de Inteligência da Artificial Analysis, o K3 obteve 57 pontos e ficou em 4º lugar entre 189 modelos. A própria Moonshot afirma que ele ainda está atrás de Claude Fable 5 e GPT-5.6 Sol. Portanto, trate-o como um modelo aberto próximo à fronteira, não como o líder absoluto.

Por que o Kimi K3 importa

O ponto mais relevante não é apenas o benchmark. É a combinação de:

  1. Qualidade próxima à fronteira.
  2. Contexto de 1M de tokens.
  3. Preço de cache-hit 10 vezes menor que o cache-miss.
  4. Compatibilidade com clientes OpenAI existentes.
  5. Promessa de pesos abertos para execução própria.

Kimi K3

Para quem já usa APIs de LLM, o teste inicial é simples: aponte um cliente compatível com OpenAI para o endpoint da Moonshot, use kimi-k3 como modelo e valide streaming, chamadas de ferramentas e saída estruturada.

Você também pode testar a API antes de escrever a integração. O Apidog permite enviar requisições a endpoints compatíveis com OpenAI, acompanhar eventos SSE token a token e inspecionar payloads de chamadas de ferramentas.

Para detalhes específicos, consulte:

Visão geral do Kimi K3

Arquitetura: o que mudou em relação ao K2

O Kimi K3 não é apenas uma versão maior do K2. A Moonshot descreve uma reconstrução da pilha principal do modelo.

Kimi Delta Attention (KDA)

O KDA é um mecanismo híbrido de atenção linear. O objetivo é controlar o crescimento de memória e computação em contextos longos, tornando a janela de 1M de tokens viável para inferência.

Attention Residuals (AttnRes)

O AttnRes substitui conexões residuais convencionais para recuperar seletivamente representações ao longo da profundidade da rede. Em termos práticos, a proposta é preservar melhor informações de camadas anteriores.

Stable LatentMoE

A camada MoE do K3 possui 896 especialistas, dos quais 16 são ativados por token. Essa ativação esparsa permite que o modelo tenha 2,8T parâmetros totais sem executar todos eles a cada token.

A Moonshot também cita:

  • Per-Head Muon
  • Sigmoid Tanh Unit (SiTU)
  • Gated MLA
  • Pesos MXFP4
  • Ativações MXFP8

Especificações do Kimi K3

Especificação Kimi K3
Desenvolvedor Moonshot AI
Data de lançamento 16 de julho de 2026
Parâmetros totais 2,8 trilhões (MoE)
Especialistas ativos 16 de 896 por token
Janela de contexto 1.048.576 tokens (1M)
ID do modelo na API kimi-k3
Slug no OpenRouter moonshotai/kimi-k3
Compatibilidade OpenAI SDK
Entrada com cache-hit US$ 0,30 / 1M tokens
Entrada com cache-miss US$ 3,00 / 1M tokens
Saída US$ 15,00 / 1M tokens
Velocidade de saída ~62 tokens/s
Tempo para primeiro token ~1,99 s
Índice de Inteligência 57, posição #4 de 189
Pesos abertos Esperados por volta de 27 de julho de 2026

Para estimar custo por volume de tokens e padrão de cache, consulte o guia de preços do Kimi K3.

Contexto de 1M: como aproveitar o cache-hit

Uma janela de 1.048.576 tokens é útil para cenários como:

  • Repositórios grandes.
  • Árvores de arquivos compartilhadas entre etapas de um agente.
  • Documentação interna extensa.
  • Transcrições longas.
  • Corpus de pesquisa.
  • Instruções de sistema e políticas reutilizadas.

A diferença de preço entre cache-hit e cache-miss é importante:

Cache-hit:  US$ 0,30 / 1M tokens
Cache-miss: US$ 3,00 / 1M tokens
Enter fullscreen mode Exit fullscreen mode

Isso representa uma diferença de 10x na entrada.

Para aproveitar esse modelo de cobrança:

  1. Mantenha o prompt de sistema estável.
  2. Reutilize o mesmo contexto de repositório quando possível.
  3. Evite reorganizar blocos grandes de contexto a cada chamada.
  4. Separe dados mutáveis de instruções ou arquivos compartilhados.
  5. Meça o custo real com cargas de trabalho repetitivas.

A Moonshot relata taxa de cache-hit acima de 90% em cargas de trabalho de codificação usando sua inferência Mooncake. Esse dado é especialmente relevante para agentes que reenviam contexto de código em várias etapas.

Há uma contrapartida: a Artificial Analysis mediu cerca de 62 tokens por segundo, abaixo da mediana de 72,7 tokens/s para modelos comparáveis na faixa de preço. O tempo para o primeiro token, de aproximadamente 1,99 s, é um pouco melhor que a mediana.

Se sua prioridade for baixa latência, compare o K3 com alternativas mais rápidas antes de adotá-lo como padrão.

Posicionamento: forte, aberto, mas não o líder absoluto

A Moonshot afirma no post oficial de lançamento do Kimi K3 que o modelo ainda está atrás de Claude Fable 5 e GPT-5.6 Sol.

Os dados independentes seguem essa leitura: no Índice de Inteligência da Artificial Analysis, o K3 marcou 57 pontos e ficou em 4º lugar entre 189 modelos.

Use o Kimi K3 quando você precisar de:

  • Qualidade próxima à fronteira.
  • Caminho potencial para auto-hospedagem.
  • Contexto muito longo.
  • Uso intensivo de contexto reutilizável.
  • Compatibilidade com integrações no padrão OpenAI.

Para comparações diretas:

Onde usar o Kimi K3

O K3 foi disponibilizado nas superfícies de produto da Moonshot no lançamento.

Superfície Uso
Kimi.com Aplicativo de chat web, com K3 como modelo padrão
Kimi Work Espaço de trabalho para equipes
Kimi Code Agente de codificação baseado em terminal
Kimi API Acesso programático com kimi-k3
Aplicativos móveis iOS, Android e HarmonyOS
Desktop Kimi Work 3.1.0 ou posterior
OpenRouter Acesso via moonshotai/kimi-k3

Se você usa terminal e agentes de código, consulte o guia de Kimi Code CLI.

Para comparar com a geração anterior:

Recursos expostos pela API

A API do K3 suporta recursos esperados em integrações agenticas:

  • Cache de contexto.
  • Chamadas de ferramentas.
  • Restrições de escolha de ferramenta.
  • Modo JSON.
  • Saída estruturada.
  • Modo parcial para conclusões controladas.
  • Pesquisa na internet.
  • Carregamento dinâmico de ferramentas.
  • Esforço de raciocínio configurável, incluindo modo máximo.

A Moonshot informa compatibilidade com o OpenAI SDK. Antes de codificar a integração, confirme a URL base atual no platform.kimi.ai.

Implementação: chamada básica com SDK da OpenAI

Use o cliente OpenAI apontando para o endpoint compatível da Moonshot. Substitua KIMI_BASE_URL pela URL confirmada no console e armazene a chave em variável de ambiente.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["KIMI_API_KEY"],
    base_url=os.environ["KIMI_BASE_URL"],
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "Você é um assistente técnico. Responda de forma objetiva."
        },
        {
            "role": "user",
            "content": "Explique como implementar cache de contexto em um agente de código."
        }
    ],
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Implementação: validar streaming

Antes de ligar o modelo ao seu frontend ou agente, valide como os chunks chegam.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["KIMI_API_KEY"],
    base_url=os.environ["KIMI_BASE_URL"],
)

stream = client.chat.completions.create(
    model="kimi-k3",
    stream=True,
    messages=[
        {
            "role": "user",
            "content": "Liste três riscos de usar contexto de 1M de tokens."
        }
    ],
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Teste pelo menos estes casos antes do deploy:

  1. Prompt curto sem streaming.
  2. Prompt longo com contexto reutilizado.
  3. Streaming com reconexão ou cancelamento.
  4. Saída JSON.
  5. Chamada de ferramenta.
  6. Resposta parcial.
  7. Erros de autenticação e limites de requisição.

Implementação: testar chamadas de ferramentas

Defina ferramentas e valide o payload de tool_calls antes de executar ações reais.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["KIMI_API_KEY"],
    base_url=os.environ["KIMI_BASE_URL"],
)

tools = [
    {
        "type": "function",
        "function": {
            "name": "get_file_content",
            "description": "Obtém o conteúdo de um arquivo do repositório.",
            "parameters": {
                "type": "object",
                "properties": {
                    "path": {
                        "type": "string",
                        "description": "Caminho relativo do arquivo."
                    }
                },
                "required": ["path"],
                "additionalProperties": False
            }
        }
    }
]

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": "Leia o arquivo package.json e identifique os scripts disponíveis."
        }
    ],
    tools=tools,
)

message = response.choices[0].message
print(message.tool_calls)
Enter fullscreen mode Exit fullscreen mode

Durante a avaliação, não execute uma ferramenta diretamente com argumentos retornados pelo modelo. Primeiro:

  1. Valide o JSON.
  2. Verifique permissões.
  3. Restrinja caminhos de arquivo e comandos permitidos.
  4. Registre a decisão.
  5. Execute somente após passar pelas validações.

Teste da API Kimi K3

Você pode reproduzir esses testes no Apidog:

  1. Crie uma requisição POST para o endpoint compatível com OpenAI da Moonshot.
  2. Salve KIMI_API_KEY como variável de ambiente.
  3. Defina model como kimi-k3.
  4. Envie uma requisição com "stream": true.
  5. Inspecione os eventos SSE.
  6. Adicione tools ao corpo da requisição.
  7. Valide o formato retornado em tool_calls.

Perguntas frequentes

O que é o Kimi K3?

Kimi K3 é o principal modelo de linguagem da Moonshot AI, lançado em 16 de julho de 2026. É um modelo MoE de 2,8 trilhões de parâmetros, com janela de contexto de 1M de tokens e ID de API kimi-k3.

Quantos parâmetros o Kimi K3 possui?

O K3 possui 2,8 trilhões de parâmetros totais. Ele ativa 16 de 896 especialistas por token. A Moonshot não publicou uma contagem exata de parâmetros ativos; portanto, evite citar um valor específico como fato.

Quanto custa a API do Kimi K3?

  • US$ 0,30 por milhão de tokens de entrada com cache-hit.
  • US$ 3,00 por milhão de tokens de entrada com cache-miss.
  • US$ 15,00 por milhão de tokens de saída.

Veja o detalhamento de preços para mais contexto.

O Kimi K3 é open source?

Não no dia do lançamento. A Moonshot prometeu liberar os pesos completos até 27 de julho de 2026. Até essa data, o modelo está disponível por produtos hospedados e API paga.

O Kimi K3 é melhor que Claude Fable 5 ou GPT-5.6 Sol?

Não, segundo a própria Moonshot. O K3 é descrito como próximo à fronteira, mas ainda atrás desses modelos proprietários.

Posso usar o Kimi K3 com o OpenAI SDK?

Sim. A API da Moonshot é compatível com o OpenAI SDK. Confirme a URL base no platform.kimi.ai, use kimi-k3 como modelo e teste a integração antes de publicar.

Você também pode validar requisições e respostas no Apidog.

Qual é a velocidade do Kimi K3?

A Artificial Analysis mediu aproximadamente 62 tokens de saída por segundo e cerca de 1,99 s até o primeiro token. O modelo prioriza profundidade de raciocínio em vez de velocidade máxima.

Como o Kimi K3 se compara ao Kimi K2.7 Code?

O K3 é o carro-chefe da próxima geração da linha K2, com uma pilha de atenção reconstruída. A Moonshot afirma eficiência de escalonamento aproximadamente 2,5 vezes superior ao K2. Para a comparação detalhada, veja Kimi K3 vs Kimi K2.7 Code.

Top comments (0)