DEV Community

Cover image for Qwen 3.8 vs Kimi K3: Os Dois Gigantes de Pesos Abertos da China, Comparados
Lucas
Lucas

Posted on Originally published at apidog.com

Qwen 3.8 vs Kimi K3: Os Dois Gigantes de Pesos Abertos da China, Comparados

Julho de 2026 trouxe dois modelos de fronteira de pesos abertos da China: o Kimi K3, lançado pela Moonshot AI em 16 de julho, e o Qwen 3.8-Max, pré-visualizado pela Alibaba três dias depois e disponibilizado no início de agosto. Ambos usam arquitetura MoE (Mixture of Experts), têm parâmetros na escala de trilhões, funcionam com harnesses de agentes no estilo Claude Code e oferecem preços abaixo dos laboratórios de fronteira dos EUA.

Experimente o Apidog hoje

Na prática, a escolha depende de quatro perguntas: você precisa baixar os pesos agora? Precisa processar imagens? Seu fluxo gera muito texto de saída? E qual modelo resolve melhor as tarefas reais do seu produto? Para detalhes da especificação da Alibaba, consulte o explicador do Qwen 3.8-Max.

Nota sobre benchmarks: não havia, em 3 de agosto de 2026, uma avaliação independente direta entre Qwen 3.8-Max e Kimi K3. Os números citados neste artigo vêm das tabelas dos próprios fornecedores. Use-os como sinal, não como veredito.

Linha do tempo: disponibilidade dos pesos

A diferença mais importante, hoje, é o significado prático de “aberto”.

  • Kimi K3: lançado em 16 de julho de 2026. Os pesos foram publicados no Hugging Face em 27 de julho, em formato MXFP4 com download de 594 GB.
  • Qwen 3.8-Max: pré-visualizado em 19 de julho e disponibilizado no Alibaba Cloud Model Studio no início de agosto, segundo a publicação oficial do Qwen. Os pesos foram prometidos para Hugging Face e ModelScope “na próxima semana”, aproximadamente em 10 de agosto.

Isso leva a uma decisão simples:

  • Se você precisa de auto-hospedagem agora, escolha o Kimi K3.
  • Se API hospedada atende ao seu caso, compare modalidade, contexto, custo e resultados do seu teste.

Parâmetros e custo de inferência

Os dois modelos são MoE: a quantidade total de parâmetros não é igual à quantidade ativada em cada token.

Especificação Qwen 3.8-Max Kimi K3
Parâmetros totais 2,4T 2,8T
Parâmetros ativos por token 95B 104B
Taxa de ativação ~4% ~3,7%
Base da arquitetura Fundação Qwen 3.5, MoE MoE
Pesos abertos Prometidos (~10 de agosto) MXFP4, 594 GB no Hugging Face

O Qwen 3.8-Max ativa cerca de 9B parâmetros a menos por token. Isso não prova que ele seja melhor, mas é relevante para custo de serviço: mantendo o restante constante, menos parâmetros ativos tendem a significar inferência mais barata.

Para auto-hospedagem, o dado crítico é o pacote MXFP4 de 594 GB do Kimi K3. Isso já coloca a operação em território de múltiplos nós antes de considerar o cache KV para contextos longos. O Qwen 3.8-Max, com 2,4T de parâmetros totais, provavelmente exigirá infraestrutura de classe semelhante quando seus pesos forem publicados.

Abertura: pesos disponíveis vs. promessa

Hoje, o Kimi K3 é o único modelo realmente aberto na prática.

Com os pesos do K3 disponíveis, você pode:

  1. Baixar e inspecionar o repositório.
  2. Verificar a licença.
  3. Executar quantizações adicionais.
  4. Fazer fine-tuning.
  5. Fixar uma versão do modelo para evitar substituições silenciosas.
  6. Hospedar internamente por requisitos de auditoria ou conformidade.

O Qwen 3.8-Max pode se tornar o primeiro modelo da linha Qwen-Max com pesos abertos, mudando a estratégia anterior da Alibaba para modelos Max. Mas, até que os arquivos estejam disponíveis, ele continua sendo um modelo acessado por API.

Decisão atual: ponto para o Kimi K3. Reavalie quando os pesos do Qwen forem publicados.

Modalidade: imagens fazem diferença

Aqui, o Qwen 3.8-Max tem uma vantagem clara.

Segundo a configuração oficial do modelo, ele aceita texto e imagem:

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

A Alibaba também demonstra compreensão de PDFs longos e vídeo em suas publicações. No entanto, trate essas demonstrações como exemplos de blog, não como confirmação de tipos de entrada de API além de texto e imagem.

O suporte a imagem é útil para fluxos como:

  • OCR e extração de dados em documentos digitalizados;
  • análise de capturas de tela;
  • agentes que operam interfaces;
  • entendimento de dashboards;
  • revisão visual de UI;
  • classificação de documentos com layout complexo.

O Kimi K3 é um modelo de texto. Para processar imagens, você precisará acoplar um modelo de visão ao pipeline, lidar com serialização entre componentes e absorver a latência adicional.

Escolha rápida:

  • Fluxo somente textual: ambos são candidatos.
  • Documentos, screenshots, OCR ou agentes de computador: Qwen 3.8-Max.

Contexto, saída e protocolos de API

O Qwen 3.8-Max oferece:

  • janela de contexto fixa de 1.000.000 de tokens;
  • saída máxima de 65.536 tokens;
  • parâmetro reasoning_effort com níveis low, medium e xhigh;
  • saída de pensamento preservada por padrão;
  • cobrança igual para os modos de pensamento e não pensamento.

O acesso ocorre pelo Alibaba Cloud Model Studio, com URLs base regionais em Pequim, Cingapura e Virgínia, nos EUA. A plataforma disponibiliza dois formatos de protocolo:

  • endpoint compatível com OpenAI;
  • endpoint compatível com Anthropic.

Isso permite usar o Qwen 3.8-Max em ferramentas no estilo Claude Code mudando a configuração:

export ANTHROPIC_BASE_URL="https://SEU_ENDPOINT_ANTHROPIC"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Consulte as regiões e linhas de modelo na página de modelos do Model Studio. Se você trabalha com múltiplas regiões, o Apidog permite salvar cada URL base como um ambiente e alternar sem editar cada requisição.

O Kimi K3 também funciona via protocolo Anthropic e pode ser usado por harnesses compatíveis com Claude Code. Para endpoints e limites atualizados, consulte o explicador do Kimi K3.

Preços: compare entrada, saída e cache

Taxas publicadas por milhão de tokens:

Taxa Qwen 3.8-Max Kimi K3
Entrada US$ 2,00 US$ 3,00
Saída US$ 6,00 US$ 15,00
Entrada com acerto de cache US$ 0,20 US$ 0,30
Nivelamento Fixo em todo o contexto de 1M Conforme cronograma da Moonshot

O Qwen 3.8-Max custa US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, segundo a página de preços do Model Studio. A criação explícita de cache custa 125% da entrada, enquanto acertos de cache custam 10% da taxa de entrada.

Também há uma cota gratuita de 1M tokens na região de Cingapura, válida por 90 dias.

Como estimar o custo

Use esta fórmula:

custo = (tokens_entrada / 1_000_000 × taxa_entrada)
      + (tokens_saida / 1_000_000 × taxa_saida)
      + (tokens_cache / 1_000_000 × taxa_cache)
Enter fullscreen mode Exit fullscreen mode

Exemplo: um fluxo mensal com 20M de tokens de entrada, 5M de saída e 10M de entrada atendida por cache.

Qwen 3.8-Max:

20M × US$ 2,00 + 5M × US$ 6,00 + 10M × US$ 0,20
= US$ 40 + US$ 30 + US$ 2
= US$ 72
Enter fullscreen mode Exit fullscreen mode

Kimi K3:

20M × US$ 3,00 + 5M × US$ 15,00 + 10M × US$ 0,30
= US$ 60 + US$ 75 + US$ 3
= US$ 138
Enter fullscreen mode Exit fullscreen mode

O exemplo mostra por que o Qwen tende a ser mais barato em fluxos de agentes: esses fluxos geralmente produzem muito código, raciocínio e texto de saída.

Há uma ressalva importante: o reasoning_effort do Qwen usa xhigh como padrão, e tokens de pensamento são cobrados como saída. Portanto, estimativas simples de entrada e saída podem subestimar a fatura real. Veja a análise de preços do Qwen 3.8 para exemplos por tarefa.

Benchmarks: o que os números realmente dizem

Não compare tabelas de fornecedores como se fossem uma avaliação única.

O que existe

  • A Alibaba publicou benchmarks do Qwen 3.8-Max contra Claude Opus 4.8, Fable 5, GPT-5.6 Sol e Qwen 3.7-Max.
  • A Moonshot publicou benchmarks do Kimi K3 contra modelos de fronteira semelhantes.
  • Ambas as tabelas foram executadas pelos respectivos fornecedores.

O que não existe

  • Um confronto independente entre Qwen 3.8-Max e Kimi K3 no mesmo harness.
  • Uma tabela comum com a mesma configuração, scaffolding e parâmetros de amostragem.
  • Dados da Artificial Analysis para o Qwen 3.8-Max no momento da redação.

A tabela da Alibaba afirma os seguintes resultados:

Benchmark Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86,6 84,6 84,6 88,8
SWE-bench Pro 67,7 69,2 80,0 64,6
PaperBench 93,0 80,3 88,8 90,5
GPQA Diamond 92,6 92,0 92,6 94,1
HLE 43,6 45,7 53,3 47,2

A própria tabela mostra limitações: o Qwen 3.8-Max fica atrás do Fable 5 no SWE-bench Pro e atrás de todos os modelos listados no HLE. Seus destaques incluem PaperBench, seguimento de instruções e benchmarks multimodais.

Do lado da Moonshot, a tabela de lançamento do K3 afirma que ele supera o Claude Opus 4.8 nas linhas principais da avaliação da empresa, embora fique atrás de Fable 5 e GPT-5.6 Sol no resultado geral. Veja a análise em Kimi K3 vs Claude Opus 4.8.

O resumo honesto é simples: ambos parecem competitivos em tarefas de agente, mas nenhuma tabela determina qual modelo é melhor para o seu produto. Para mais detalhes, consulte a análise de benchmarks do Qwen 3.8.

Execute um confronto direto no Apidog

A forma mais útil de escolher é testar os dois modelos com tarefas reais do seu produto.

Como ambos oferecem endpoints compatíveis com OpenAI, você pode montar um teste A/B repetível no Apidog.

1. Crie dois ambientes

Configure um ambiente por fornecedor.

Ambiente Qwen

BASE_URL=https://SEU_ENDPOINT_DASHSCOPE
MODEL=qwen3.8-max
API_KEY=SUA_CHAVE_QWEN
Enter fullscreen mode Exit fullscreen mode

Ambiente Kimi

BASE_URL=https://SEU_ENDPOINT_MOONSHOT
MODEL=kimi-k3
API_KEY=SUA_CHAVE_KIMI
Enter fullscreen mode Exit fullscreen mode

2. Salve uma requisição comum

Use o mesmo payload e alterne apenas o ambiente:

POST {{BASE_URL}}/chat/completions
Authorization: Bearer {{API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode
{
  "model": "{{MODEL}}",
  "messages": [
    {
      "role": "system",
      "content": "Você é um assistente de engenharia de software. Responda de forma objetiva."
    },
    {
      "role": "user",
      "content": "Analise este erro de produção e proponha uma correção com testes."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

3. Teste tarefas reais, não charadas

Monte uma suíte com casos do seu produto:

  • corrigir um bug real do repositório;
  • gerar testes para uma função existente;
  • revisar um PR;
  • extrair dados de um documento;
  • explicar um log de produção;
  • propor uma migração de banco;
  • chamar ferramentas no seu agente;
  • analisar uma captura de tela, se visão for relevante.

4. Adicione critérios objetivos

Avalie mais do que “a resposta parece boa”:

  • validade do JSON;
  • aderência ao esquema esperado;
  • latência máxima;
  • presença de trechos obrigatórios;
  • compilação do código gerado;
  • aprovação de testes;
  • quantidade de tentativas do agente;
  • custo por tarefa concluída.

Exemplo de critério:

A resposta deve:
- retornar JSON válido;
- incluir uma causa provável;
- propor uma correção;
- incluir pelo menos um teste;
- terminar em menos de 30 segundos.
Enter fullscreen mode Exit fullscreen mode

O Apidog permite visualizar status, latência, corpo da resposta e comportamento de streaming. Isso ajuda especialmente quando sua interface renderiza tokens de raciocínio via SSE. Baixe o Apidog gratuitamente e execute ao menos dez prompts representativos em cada endpoint antes de tomar uma decisão.

Placar

Eixo Vencedor hoje Observação
Parâmetros totais/ativos Qwen 3.8-Max Mais enxuto: 2,4T/95B vs. 2,8T/104B; indica principalmente custo de serviço
Pesos abertos hoje Kimi K3 Pesos MXFP4 de 594 GB disponíveis no Hugging Face
Modalidade Qwen 3.8-Max Entrada de texto e imagem
Janela de contexto Qwen 3.8-Max Contexto fixo de 1M e saída máxima de 65.536 tokens
Preço Qwen 3.8-Max US$ 2/US$ 6 vs. US$ 3/US$ 15
Benchmarks Indeterminado Não há confronto independente direto
Ecossistema de harness Empate Ambos funcionam com endpoints compatíveis com Anthropic
Histórico de promessas Kimi K3 Pesos publicados 11 dias após o lançamento

Qual escolher

Escolha o Kimi K3 se

  • você precisa baixar e executar os pesos no seu hardware agora;
  • sua política de conformidade exige um modelo fixado e auditável;
  • você depende de auto-hospedagem;
  • sua carga é exclusivamente textual;
  • você tem grande reutilização de contexto e acertos de cache.

Escolha o Qwen 3.8-Max se

  • sua carga inclui imagens, documentos ou screenshots;
  • você gera muitos tokens de saída;
  • você executa agentes de código;
  • você precisa de contexto de 1M de tokens;
  • você quer preços fixos em toda a janela de contexto;
  • você usa infraestrutura compatível com OpenAI ou Anthropic.

Espere se

Pesos abertos forem o único critério. Caso a Alibaba publique os pesos do Qwen por volta de 10 de agosto, a decisão passa a depender principalmente de licença, suporte da comunidade, modalidade, custo e resultados da sua avaliação.

A recomendação final é operacional: não escolha com base apenas em benchmarks de fornecedores. Execute seus próprios prompts, use o mesmo harness, registre latência, custo, taxa de sucesso e qualidade da saída.

FAQ

O Kimi K3 é mais aberto que o Qwen 3.8-Max?

Hoje, sim. Os pesos do K3 estão no Hugging Face desde 27 de julho de 2026, em MXFP4 e com 594 GB. Os pesos do Qwen 3.8-Max foram prometidos para aproximadamente 10 de agosto, mas ainda não estavam disponíveis para download em 3 de agosto.

Quando os pesos do Qwen forem publicados, compare licença, formatos de quantização e suporte da comunidade. Até lá, apenas o K3 pode ser auto-hospedado. Veja o guia local do K3.

Qual é melhor para codificação?

Ainda não é possível responder com segurança. Os dois fornecedores divulgam resultados fortes em tarefas de agentes de código, mas não existe um confronto independente usando o mesmo harness.

Teste ambos no seu repositório com bugs, testes, PRs e tarefas reais. Meça taxa de conclusão, qualidade do patch, cobertura de testes, latência e custo.

Posso usar os dois no Claude Code?

Sim. Ambos oferecem endpoints compatíveis com Anthropic.

Para o Qwen 3.8-Max, use o endpoint Anthropic do DashScope:

export ANTHROPIC_BASE_URL="https://SEU_ENDPOINT_DASHSCOPE"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

O Kimi K3 segue o mesmo padrão por meio do endpoint da Moonshot. Essa compatibilidade facilita testes A/B usando o mesmo harness.

Qual é mais barato para um agente típico?

Pelo preço de tabela, o Qwen 3.8-Max:

  • entrada: US$ 2 vs. US$ 3 por milhão de tokens;
  • saída: US$ 6 vs. US$ 15 por milhão de tokens;
  • cache: US$ 0,20 vs. US$ 0,30 por milhão de tokens.

A diferença de saída é relevante porque agentes de código e fluxos com raciocínio normalmente geram muitos tokens. Ainda assim, calcule usando seu perfil real de tráfego: o cache do K3 mantém cargas com muita entrada competitivas, enquanto o modo xhigh do Qwen pode elevar custos por gerar mais tokens de pensamento.

Top comments (0)