A Alibaba soltou nesta semana o Qwen3.8-Flash-Next, novo modelo open-source da Qwen Team. O lançamento tem um peso a mais: segundo a equipe, ele é uma prévia da arquitetura que vai sustentar o Qwen4, liberada antes da família completa justamente pra comunidade testar e adaptar tooling.
As specs
- MoE multimodal com 125B de parâmetros totais e apenas 6B ativos por token
- Mais 51B de N-gram embeddings
- Custo de treinamento estimado em cerca de 1/9 do Qwen3.7-Plus (TechNode)
- Pesos sem restrição de uso no Hugging Face desde 24/08, com versão padrão e FP8 (também no ModelScope)
Por que importa pra quem desenvolve
Dois pontos práticos se destacam:
- API compatível com as specs da OpenAI e da Anthropic. Se sua stack já fala com GPT ou Claude, dá pra apontar o endpoint pro Qwen3.8-Flash-Next e comparar custo e qualidade sem reescrever integração.
- Inferência local viável. Com só 6B ativos por token, o modelo roda em hardware bem mais modesto do que um denso de 100B+ pediria. Os GGUF quantizados já começaram a aparecer no Hugging Face, o que abre a porta pra llama.cpp e afins.
Pra quem constrói produto com LLM no Brasil, é mais uma opção de flash-tier aberto pra colocar no benchmark interno, principalmente em tarefas de alto volume onde o custo por token manda.
Escrevi uma análise completa em português, com specs detalhadas, como baixar e comparação com o flash-tier de GPT, Claude e Gemini: https://www.techknow.com.br/post/qwen-3-8-flash-next
Top comments (0)