Originally published on NextFuture
Trong bốn ngày của tháng 8/2026, hai phòng lab lớn cùng thả model multimodal dense cỡ 30B kèm weights tải về được dưới giấy phép Apache 2.0 thuần: Muse Glimmer 30B của Meta ra ngày 10/8 và Qwen3.8-27B của Alibaba ra ngày 14/8. Cả hai được thiết kế để chạy trên một GPU workstation 24 GB — RTX 3090 hoặc 4090 — và cả máy Apple Silicon dùng bộ nhớ hợp nhất. Nếu bạn đang cầm đúng phần cứng đó, đây là cách chọn.
Khác nhau ở đâu
Thông sốQwen3.8-27BMuse Glimmer 30B
Tham số27 tỉ (dense)29,6 tỉ (dense)
Ngày phát hành14/8/202610/8/2026
Đầu vàoText, ảnh, videoText, ảnh
Context gốc262.144 token131.072 token
Giấy phépApache 2.0Apache 2.0
Runtime chínhvLLM, SGLang, llama.cppPyTorch/Transformers, DFlash
Qwen dùng vision encoder gốc xử lý được ảnh và video nhiều khung hình. Muse Glimmer chưng cất từ nền tảng Muse Spark lớn hơn, với encoder thị giác đông cứng ViT-G/14 khoảng 1,8 tỉ tham số, và theo bài viết là nhắm vào workflow agent tự vận hành ở máy cục bộ.
Bài toán VRAM trên card 24 GB
Ở FP16/BF16 chưa lượng tử hoá, cả hai cần khoảng 54–60 GB VRAM, tức bắt buộc nhiều GPU. Lượng tử 4-bit (AWQ, EXL2, GGUF Q4_K_M) kéo trọng số xuống còn 16–18 GB, chừa 6–8 GB cho KV cache và tensor thị giác trên card 24 GB.
Hai lưu ý vận hành đáng chép vào checklist. Muốn chạy chuỗi dài quá 32.768 token trên một card 24 GB thì phải bật FlashAttention-2 và lượng tử KV cache theo trang (FP8 hoặc INT4). Còn nếu định cho Qwen đọc video, bài viết khuyến nghị chừa thêm ít nhất 4 GB đệm vì trích đặc trưng hình ảnh làm bộ nhớ vọt lên từng lúc.
Điều khoản thương mại: điểm dễ bỏ sót
Đây là phần quan trọng nhất nếu bạn nhúng model vào sản phẩm bán được tiền. Bài viết chỉ ra Qwen3.8-Max — bản flagship công bố ngày 3/8 — kèm giấy phép riêng, buộc thoả thuận rõ ràng khi doanh nghiệp model-as-a-service hoặc trợ lý AI vượt 50 triệu USD doanh thu năm; Kimi K3 của Moonshot AI đặt ngưỡng ở 20 triệu USD. Hai model 30B nói trên thì không gắn ngưỡng doanh thu nào. Với team Việt làm tooling on-premise hay bán appliance, Apache 2.0 thuần nghĩa là bớt hẳn phần rà soát pháp lý về sau.
Chọn cái nào
Chọn Qwen3.8-27B nếu bạn cần đọc video hoặc tài liệu bố cục phức tạp, cần context dài để nuốt cả repo và bộ tài liệu kỹ thuật, hoặc muốn cắm thẳng vào vLLM và SGLang qua endpoint tương thích OpenAI.
Chọn Muse Glimmer 30B nếu trọng tâm là agent gọi tool và chạy lệnh terminal có phục hồi lỗi, hoặc bạn muốn gói triển khai dựng sẵn theo mức 24 GB, 32 GB và 64 GB thay vì tự dò cấu hình. Bài viết cũng nhắc đường speculative decoding DFlash còn ở dạng thử nghiệm — đừng đưa vào kế hoạch production khi chưa tự đo.
Việc nên làm trước tiên không phải tải weights, mà là đếm xem workload của bạn có thật sự vượt 32.768 token hay không. Nếu không, phần lớn lợi thế context 262K của Qwen là thứ bạn trả tiền VRAM để giữ mà không dùng tới.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)