Julho de 2026 trouxe dois modelos de fronteira de pesos abertos da China: o Kimi K3, lançado pela Moonshot AI em 16 de julho, e o Qwen 3.8-Max, pré-visualizado pela Alibaba três dias depois e disponibilizado no início de agosto. Ambos usam arquitetura MoE (Mixture of Experts), têm parâmetros na escala de trilhões, funcionam com harnesses de agentes no estilo Claude Code e oferecem preços abaixo dos laboratórios de fronteira dos EUA.
Na prática, a escolha depende de quatro perguntas: você precisa baixar os pesos agora? Precisa processar imagens? Seu fluxo gera muito texto de saída? E qual modelo resolve melhor as tarefas reais do seu produto? Para detalhes da especificação da Alibaba, consulte o explicador do Qwen 3.8-Max.
Nota sobre benchmarks: não havia, em 3 de agosto de 2026, uma avaliação independente direta entre Qwen 3.8-Max e Kimi K3. Os números citados neste artigo vêm das tabelas dos próprios fornecedores. Use-os como sinal, não como veredito.
Linha do tempo: disponibilidade dos pesos
A diferença mais importante, hoje, é o significado prático de “aberto”.
- Kimi K3: lançado em 16 de julho de 2026. Os pesos foram publicados no Hugging Face em 27 de julho, em formato MXFP4 com download de 594 GB.
- Qwen 3.8-Max: pré-visualizado em 19 de julho e disponibilizado no Alibaba Cloud Model Studio no início de agosto, segundo a publicação oficial do Qwen. Os pesos foram prometidos para Hugging Face e ModelScope “na próxima semana”, aproximadamente em 10 de agosto.
Isso leva a uma decisão simples:
- Se você precisa de auto-hospedagem agora, escolha o Kimi K3.
- Se API hospedada atende ao seu caso, compare modalidade, contexto, custo e resultados do seu teste.
Parâmetros e custo de inferência
Os dois modelos são MoE: a quantidade total de parâmetros não é igual à quantidade ativada em cada token.
| Especificação | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Parâmetros totais | 2,4T | 2,8T |
| Parâmetros ativos por token | 95B | 104B |
| Taxa de ativação | ~4% | ~3,7% |
| Base da arquitetura | Fundação Qwen 3.5, MoE | MoE |
| Pesos abertos | Prometidos (~10 de agosto) | MXFP4, 594 GB no Hugging Face |
O Qwen 3.8-Max ativa cerca de 9B parâmetros a menos por token. Isso não prova que ele seja melhor, mas é relevante para custo de serviço: mantendo o restante constante, menos parâmetros ativos tendem a significar inferência mais barata.
Para auto-hospedagem, o dado crítico é o pacote MXFP4 de 594 GB do Kimi K3. Isso já coloca a operação em território de múltiplos nós antes de considerar o cache KV para contextos longos. O Qwen 3.8-Max, com 2,4T de parâmetros totais, provavelmente exigirá infraestrutura de classe semelhante quando seus pesos forem publicados.
Abertura: pesos disponíveis vs. promessa
Hoje, o Kimi K3 é o único modelo realmente aberto na prática.
Com os pesos do K3 disponíveis, você pode:
- Baixar e inspecionar o repositório.
- Verificar a licença.
- Executar quantizações adicionais.
- Fazer fine-tuning.
- Fixar uma versão do modelo para evitar substituições silenciosas.
- Hospedar internamente por requisitos de auditoria ou conformidade.
O Qwen 3.8-Max pode se tornar o primeiro modelo da linha Qwen-Max com pesos abertos, mudando a estratégia anterior da Alibaba para modelos Max. Mas, até que os arquivos estejam disponíveis, ele continua sendo um modelo acessado por API.
Decisão atual: ponto para o Kimi K3. Reavalie quando os pesos do Qwen forem publicados.
Modalidade: imagens fazem diferença
Aqui, o Qwen 3.8-Max tem uma vantagem clara.
Segundo a configuração oficial do modelo, ele aceita texto e imagem:
{
"input_modalities": ["text", "image"]
}
A Alibaba também demonstra compreensão de PDFs longos e vídeo em suas publicações. No entanto, trate essas demonstrações como exemplos de blog, não como confirmação de tipos de entrada de API além de texto e imagem.
O suporte a imagem é útil para fluxos como:
- OCR e extração de dados em documentos digitalizados;
- análise de capturas de tela;
- agentes que operam interfaces;
- entendimento de dashboards;
- revisão visual de UI;
- classificação de documentos com layout complexo.
O Kimi K3 é um modelo de texto. Para processar imagens, você precisará acoplar um modelo de visão ao pipeline, lidar com serialização entre componentes e absorver a latência adicional.
Escolha rápida:
- Fluxo somente textual: ambos são candidatos.
- Documentos, screenshots, OCR ou agentes de computador: Qwen 3.8-Max.
Contexto, saída e protocolos de API
O Qwen 3.8-Max oferece:
- janela de contexto fixa de 1.000.000 de tokens;
- saída máxima de 65.536 tokens;
- parâmetro
reasoning_effortcom níveislow,mediumexhigh; - saída de pensamento preservada por padrão;
- cobrança igual para os modos de pensamento e não pensamento.
O acesso ocorre pelo Alibaba Cloud Model Studio, com URLs base regionais em Pequim, Cingapura e Virgínia, nos EUA. A plataforma disponibiliza dois formatos de protocolo:
- endpoint compatível com OpenAI;
- endpoint compatível com Anthropic.
Isso permite usar o Qwen 3.8-Max em ferramentas no estilo Claude Code mudando a configuração:
export ANTHROPIC_BASE_URL="https://SEU_ENDPOINT_ANTHROPIC"
export ANTHROPIC_MODEL="qwen3.8-max"
Consulte as regiões e linhas de modelo na página de modelos do Model Studio. Se você trabalha com múltiplas regiões, o Apidog permite salvar cada URL base como um ambiente e alternar sem editar cada requisição.
O Kimi K3 também funciona via protocolo Anthropic e pode ser usado por harnesses compatíveis com Claude Code. Para endpoints e limites atualizados, consulte o explicador do Kimi K3.
Preços: compare entrada, saída e cache
Taxas publicadas por milhão de tokens:
| Taxa | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Entrada | US$ 2,00 | US$ 3,00 |
| Saída | US$ 6,00 | US$ 15,00 |
| Entrada com acerto de cache | US$ 0,20 | US$ 0,30 |
| Nivelamento | Fixo em todo o contexto de 1M | Conforme cronograma da Moonshot |
O Qwen 3.8-Max custa US$ 2 por milhão de tokens de entrada e US$ 6 por milhão de tokens de saída, segundo a página de preços do Model Studio. A criação explícita de cache custa 125% da entrada, enquanto acertos de cache custam 10% da taxa de entrada.
Também há uma cota gratuita de 1M tokens na região de Cingapura, válida por 90 dias.
Como estimar o custo
Use esta fórmula:
custo = (tokens_entrada / 1_000_000 × taxa_entrada)
+ (tokens_saida / 1_000_000 × taxa_saida)
+ (tokens_cache / 1_000_000 × taxa_cache)
Exemplo: um fluxo mensal com 20M de tokens de entrada, 5M de saída e 10M de entrada atendida por cache.
Qwen 3.8-Max:
20M × US$ 2,00 + 5M × US$ 6,00 + 10M × US$ 0,20
= US$ 40 + US$ 30 + US$ 2
= US$ 72
Kimi K3:
20M × US$ 3,00 + 5M × US$ 15,00 + 10M × US$ 0,30
= US$ 60 + US$ 75 + US$ 3
= US$ 138
O exemplo mostra por que o Qwen tende a ser mais barato em fluxos de agentes: esses fluxos geralmente produzem muito código, raciocínio e texto de saída.
Há uma ressalva importante: o reasoning_effort do Qwen usa xhigh como padrão, e tokens de pensamento são cobrados como saída. Portanto, estimativas simples de entrada e saída podem subestimar a fatura real. Veja a análise de preços do Qwen 3.8 para exemplos por tarefa.
Benchmarks: o que os números realmente dizem
Não compare tabelas de fornecedores como se fossem uma avaliação única.
O que existe
- A Alibaba publicou benchmarks do Qwen 3.8-Max contra Claude Opus 4.8, Fable 5, GPT-5.6 Sol e Qwen 3.7-Max.
- A Moonshot publicou benchmarks do Kimi K3 contra modelos de fronteira semelhantes.
- Ambas as tabelas foram executadas pelos respectivos fornecedores.
O que não existe
- Um confronto independente entre Qwen 3.8-Max e Kimi K3 no mesmo harness.
- Uma tabela comum com a mesma configuração, scaffolding e parâmetros de amostragem.
- Dados da Artificial Analysis para o Qwen 3.8-Max no momento da redação.
A tabela da Alibaba afirma os seguintes resultados:
| Benchmark | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal Bench 2.1 | 86,6 | 84,6 | 84,6 | 88,8 |
| SWE-bench Pro | 67,7 | 69,2 | 80,0 | 64,6 |
| PaperBench | 93,0 | 80,3 | 88,8 | 90,5 |
| GPQA Diamond | 92,6 | 92,0 | 92,6 | 94,1 |
| HLE | 43,6 | 45,7 | 53,3 | 47,2 |
A própria tabela mostra limitações: o Qwen 3.8-Max fica atrás do Fable 5 no SWE-bench Pro e atrás de todos os modelos listados no HLE. Seus destaques incluem PaperBench, seguimento de instruções e benchmarks multimodais.
Do lado da Moonshot, a tabela de lançamento do K3 afirma que ele supera o Claude Opus 4.8 nas linhas principais da avaliação da empresa, embora fique atrás de Fable 5 e GPT-5.6 Sol no resultado geral. Veja a análise em Kimi K3 vs Claude Opus 4.8.
O resumo honesto é simples: ambos parecem competitivos em tarefas de agente, mas nenhuma tabela determina qual modelo é melhor para o seu produto. Para mais detalhes, consulte a análise de benchmarks do Qwen 3.8.
Execute um confronto direto no Apidog
A forma mais útil de escolher é testar os dois modelos com tarefas reais do seu produto.
Como ambos oferecem endpoints compatíveis com OpenAI, você pode montar um teste A/B repetível no Apidog.
1. Crie dois ambientes
Configure um ambiente por fornecedor.
Ambiente Qwen
BASE_URL=https://SEU_ENDPOINT_DASHSCOPE
MODEL=qwen3.8-max
API_KEY=SUA_CHAVE_QWEN
Ambiente Kimi
BASE_URL=https://SEU_ENDPOINT_MOONSHOT
MODEL=kimi-k3
API_KEY=SUA_CHAVE_KIMI
2. Salve uma requisição comum
Use o mesmo payload e alterne apenas o ambiente:
POST {{BASE_URL}}/chat/completions
Authorization: Bearer {{API_KEY}}
Content-Type: application/json
{
"model": "{{MODEL}}",
"messages": [
{
"role": "system",
"content": "Você é um assistente de engenharia de software. Responda de forma objetiva."
},
{
"role": "user",
"content": "Analise este erro de produção e proponha uma correção com testes."
}
]
}
3. Teste tarefas reais, não charadas
Monte uma suíte com casos do seu produto:
- corrigir um bug real do repositório;
- gerar testes para uma função existente;
- revisar um PR;
- extrair dados de um documento;
- explicar um log de produção;
- propor uma migração de banco;
- chamar ferramentas no seu agente;
- analisar uma captura de tela, se visão for relevante.
4. Adicione critérios objetivos
Avalie mais do que “a resposta parece boa”:
- validade do JSON;
- aderência ao esquema esperado;
- latência máxima;
- presença de trechos obrigatórios;
- compilação do código gerado;
- aprovação de testes;
- quantidade de tentativas do agente;
- custo por tarefa concluída.
Exemplo de critério:
A resposta deve:
- retornar JSON válido;
- incluir uma causa provável;
- propor uma correção;
- incluir pelo menos um teste;
- terminar em menos de 30 segundos.
O Apidog permite visualizar status, latência, corpo da resposta e comportamento de streaming. Isso ajuda especialmente quando sua interface renderiza tokens de raciocínio via SSE. Baixe o Apidog gratuitamente e execute ao menos dez prompts representativos em cada endpoint antes de tomar uma decisão.
Placar
| Eixo | Vencedor hoje | Observação |
|---|---|---|
| Parâmetros totais/ativos | Qwen 3.8-Max | Mais enxuto: 2,4T/95B vs. 2,8T/104B; indica principalmente custo de serviço |
| Pesos abertos hoje | Kimi K3 | Pesos MXFP4 de 594 GB disponíveis no Hugging Face |
| Modalidade | Qwen 3.8-Max | Entrada de texto e imagem |
| Janela de contexto | Qwen 3.8-Max | Contexto fixo de 1M e saída máxima de 65.536 tokens |
| Preço | Qwen 3.8-Max | US$ 2/US$ 6 vs. US$ 3/US$ 15 |
| Benchmarks | Indeterminado | Não há confronto independente direto |
| Ecossistema de harness | Empate | Ambos funcionam com endpoints compatíveis com Anthropic |
| Histórico de promessas | Kimi K3 | Pesos publicados 11 dias após o lançamento |
Qual escolher
Escolha o Kimi K3 se
- você precisa baixar e executar os pesos no seu hardware agora;
- sua política de conformidade exige um modelo fixado e auditável;
- você depende de auto-hospedagem;
- sua carga é exclusivamente textual;
- você tem grande reutilização de contexto e acertos de cache.
Escolha o Qwen 3.8-Max se
- sua carga inclui imagens, documentos ou screenshots;
- você gera muitos tokens de saída;
- você executa agentes de código;
- você precisa de contexto de 1M de tokens;
- você quer preços fixos em toda a janela de contexto;
- você usa infraestrutura compatível com OpenAI ou Anthropic.
Espere se
Pesos abertos forem o único critério. Caso a Alibaba publique os pesos do Qwen por volta de 10 de agosto, a decisão passa a depender principalmente de licença, suporte da comunidade, modalidade, custo e resultados da sua avaliação.
A recomendação final é operacional: não escolha com base apenas em benchmarks de fornecedores. Execute seus próprios prompts, use o mesmo harness, registre latência, custo, taxa de sucesso e qualidade da saída.
FAQ
O Kimi K3 é mais aberto que o Qwen 3.8-Max?
Hoje, sim. Os pesos do K3 estão no Hugging Face desde 27 de julho de 2026, em MXFP4 e com 594 GB. Os pesos do Qwen 3.8-Max foram prometidos para aproximadamente 10 de agosto, mas ainda não estavam disponíveis para download em 3 de agosto.
Quando os pesos do Qwen forem publicados, compare licença, formatos de quantização e suporte da comunidade. Até lá, apenas o K3 pode ser auto-hospedado. Veja o guia local do K3.
Qual é melhor para codificação?
Ainda não é possível responder com segurança. Os dois fornecedores divulgam resultados fortes em tarefas de agentes de código, mas não existe um confronto independente usando o mesmo harness.
Teste ambos no seu repositório com bugs, testes, PRs e tarefas reais. Meça taxa de conclusão, qualidade do patch, cobertura de testes, latência e custo.
Posso usar os dois no Claude Code?
Sim. Ambos oferecem endpoints compatíveis com Anthropic.
Para o Qwen 3.8-Max, use o endpoint Anthropic do DashScope:
export ANTHROPIC_BASE_URL="https://SEU_ENDPOINT_DASHSCOPE"
export ANTHROPIC_MODEL="qwen3.8-max"
O Kimi K3 segue o mesmo padrão por meio do endpoint da Moonshot. Essa compatibilidade facilita testes A/B usando o mesmo harness.
Qual é mais barato para um agente típico?
Pelo preço de tabela, o Qwen 3.8-Max:
- entrada: US$ 2 vs. US$ 3 por milhão de tokens;
- saída: US$ 6 vs. US$ 15 por milhão de tokens;
- cache: US$ 0,20 vs. US$ 0,30 por milhão de tokens.
A diferença de saída é relevante porque agentes de código e fluxos com raciocínio normalmente geram muitos tokens. Ainda assim, calcule usando seu perfil real de tráfego: o cache do K3 mantém cargas com muita entrada competitivas, enquanto o modo xhigh do Qwen pode elevar custos por gerar mais tokens de pensamento.
Top comments (0)