Alibaba đã chính thức phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026. Đây là mô hình Mixture-of-Experts (MoE) với 2,4 nghìn tỷ tham số, nhưng chỉ kích hoạt 95 tỷ tham số cho mỗi token. Mô hình hỗ trợ ngữ cảnh 1M token, có giá cố định $2/$6 cho mỗi triệu token đầu vào/đầu ra, và Alibaba cho biết trọng số sẽ được công khai trên Hugging Face và ModelScope trong vòng một tuần. Đây sẽ là mô hình Qwen cấp Max đầu tiên có trọng số mở.
Thông báo chính thức gọi đây là mô hình Qwen mạnh nhất cho đến nay. Theo các benchmark do nhà cung cấp công bố, Qwen 3.8-Max có kết quả mạnh ở đa phương thức, xử lý tài liệu và một số tác vụ tác tử, nhưng vẫn có điểm yếu ở các benchmark mã hóa cốt lõi. Bài viết này tập trung vào cách đánh giá, truy cập và kiểm thử Qwen 3.8-Max qua API tương thích OpenAI lẫn Anthropic. Nếu bạn cần kiểm tra cả hai giao thức với cùng một khóa API, một client nhận biết giao thức như Apidog sẽ hữu ích.
Tổng quan Qwen 3.8-Max
| Thông số | Qwen 3.8-Max |
|---|---|
| Nhà phát triển | Alibaba (nhóm Qwen) |
| Phát hành | Đầu tháng 8 năm 2026 (GA trên Model Studio, ngày 3 tháng 8) |
| Kiến trúc | MoE, xây dựng trên nền tảng Qwen 3.5 |
| Tổng tham số | 2,4T |
| Tham số hoạt động | 95B (~4% kích hoạt) |
| Cửa sổ ngữ cảnh | 1.000.000 token |
| Đầu ra tối đa | 65.536 token |
| Phương thức | Đầu vào văn bản + hình ảnh, đầu ra văn bản |
| Điều khiển lập luận |
reasoning_effort: xhigh (mặc định), medium, low
|
| ID mô hình API | qwen3.8-max |
| Giá | $2 đầu vào / $6 đầu ra cho mỗi 1 triệu token, cố định trên toàn bộ ngữ cảnh |
| Trọng số mở | Đã hứa trong tuần tới (~10 tháng 8); chưa thể tải xuống tính đến đầu tháng 8 năm 2026 |
| Giao thức API | Tương thích OpenAI và tương thích Anthropic |
Thông tin trong bảng đến từ tài liệu phát hành của Alibaba và trang giá Model Studio.
Qwen 3.8-Max là gì?
Qwen 3.8-Max là flagship mới của dòng Qwen, xây dựng trên nền tảng Qwen 3.5 và thay thế Qwen3.7-Max ở phân khúc cao nhất.
Theo bảng benchmark của Alibaba, Qwen 3.8-Max cải thiện đáng kể so với phiên bản tiền nhiệm:
- Terminal Bench 2.1: từ 74.5 lên 86.6
- PaperBench: từ 64.8 lên 93.0
Nếu bạn đang cân nhắc nâng cấp từ mô hình trước đó, xem thêm so sánh Qwen 3.8 và Qwen 3.7 Max.
Điểm đáng chú ý nhất là thiết kế MoE:
- Tổng số tham số: 2,4T
- Tham số được kích hoạt trên mỗi forward pass: 95B
- Tỷ lệ kích hoạt: khoảng 4%
Thiết kế này là lý do Alibaba có thể cung cấp mô hình ở mức giá $2/$6 cho mỗi triệu token. Để so sánh, Kimi K3 có 2,8T tham số tổng cộng và 104B tham số hoạt động, nên Qwen 3.8-Max nhỏ hơn ở cả hai chỉ số.
Về đầu vào, API hỗ trợ văn bản và hình ảnh. Alibaba cũng trình diễn khả năng hiểu PDF hơn 200 trang và video 100 giờ thông qua cơ chế “biểu đồ bộ nhớ”, nhưng cấu hình API đã công bố chỉ liệt kê văn bản và hình ảnh là phương thức đầu vào.
Bạn có thể điều chỉnh mức lập luận bằng:
{
"reasoning_effort": "xhigh"
}
Các giá trị hợp lệ:
-
xhigh: mặc định, dùng nhiều token suy nghĩ hơn mediumlow
Ngoài ra còn có enable_thinking và preserve_thinking; suy nghĩ được bảo toàn theo mặc định. Dù chế độ suy nghĩ và không suy nghĩ có cùng đơn giá, token suy nghĩ được tính là token đầu ra. Vì vậy, chi phí thực tế ở chế độ xhigh có thể cao hơn đáng kể so với phép tính token đầu vào/đầu ra cơ bản.
Qwen Max-class đầu tiên với trọng số mở
Đây là thay đổi chiến lược quan trọng của bản phát hành. Alibaba đã mở mã nguồn nhiều mô hình Qwen trong nhiều năm, nhưng chưa từng phát hành trọng số mở cho dòng Max.
Alibaba cho biết trọng số Qwen 3.8-Max sẽ có trên Hugging Face và ModelScope “trong tuần tới”, tức khoảng ngày 10 tháng 8.
Trước khi lên kế hoạch tự lưu trữ, cần lưu ý hai điểm:
Trọng số chưa thể tải xuống. Tính đến đầu tháng 8 năm 2026, đây vẫn là cam kết phát hành. Kimi K3 từng mất 11 ngày sau khi ra mắt để công bố trọng số, nên chậm trễ nhỏ là khả năng có thể xảy ra.
Tự host mô hình 2,4T là bài toán đa node. Ngay cả khi lượng tử hóa mạnh, đây không phải mô hình phù hợp để chạy trên một máy trạm đơn lẻ. Với đa số nhóm phát triển, “trọng số mở” có thể thực tế hơn dưới dạng dịch vụ lưu trữ từ nhà cung cấp bên thứ ba thay vì triển khai cục bộ.
Nếu mục tiêu của bạn là thử mô hình mà chưa trả giá niêm yết, hãy dùng Qwen Chat hoặc hạn mức miễn phí của Model Studio. Xem cách sử dụng Qwen 3.8 miễn phí.
Benchmark nói gì, bao gồm cả điểm yếu?
Alibaba công bố benchmark so sánh Qwen 3.8-Max với Claude Opus 4.8, Fable 5, GPT-5.6 Sol và Qwen3.7-Max.
Trước khi dùng các số liệu này để chọn mô hình, cần đặt chúng trong đúng bối cảnh:
- Đây là kết quả do nhà cung cấp tự thực hiện.
- Phần lớn benchmark mã hóa chạy qua Claude Code cho tất cả mô hình.
- Một số benchmark, gồm QwenSWEBench, QwenQoderBench, CoWorkBench và RecreationBench, do Alibaba tự tạo.
- Chưa có số liệu độc lập từ các tổ chức như Artificial Analysis tại thời điểm viết bài.
Điểm mạnh theo số liệu của Alibaba
- PaperBench: 93.0 — cao hơn GPT-5.6 Sol (90.5), Fable 5 (88.8) và Opus 4.8 (80.3).
- IFBench: 82.8 — cao nhất trong hàng, vượt 72.7 của Sol.
- Terminal Bench 2.1: 86.6 — vượt Opus 4.8 và Fable 5 (cùng 84.6), chỉ sau Sol (88.8).
- Đa phương thức — MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1 và các benchmark OCR dẫn đầu phần lớn bảng.
Điểm yếu theo số liệu của Alibaba
- SWE-bench Pro: 67.7 — thấp hơn Fable 5 (80.0) và Opus 4.8 (69.2), nhưng cao hơn Sol (64.6).
- HLE: 43.6 — thấp nhất trong nhóm flagship; Fable 5 đạt 53.3, Sol đạt 47.2 và Opus 4.8 đạt 45.7.
Tóm tắt thực tế: theo số liệu của Alibaba, Qwen 3.8-Max vượt Opus 4.8 ở một số benchmark tác tử, nhưng kém Fable 5 ở nhiều tác vụ mã hóa cốt lõi. Điểm mạnh nổi bật là đa phương thức, OCR và xử lý tài liệu.
Trên GPQA Diamond, mô hình đạt 92.6, ngang Fable 5 và chỉ sau 94.1 của Sol. Điều này cho thấy khả năng lập luận khoa học vẫn cạnh tranh. Xem phân tích benchmark Qwen 3.8 để xem chi tiết bảng, thiết lập công cụ và các điểm cần xác minh độc lập.
Alibaba cũng công bố các demo gồm:
- Phiên mã hóa tự động kéo dài 16 ngày trên kho lưu trữ công khai, với 265 commit và 127 pull request.
- Tái tạo bài báo với kết quả vượt điểm AIME24 của bài báo gốc.
- Bài dự thi Tianchi vượt 458 trong số 526 đội người trong 24 giờ.
Đây là demo do nhà cung cấp thực hiện, không phải đánh giá có kiểm soát. Nếu bạn quan tâm đến thiết lập coding agent, xem Qwen 3.8 cho mã hóa.
So sánh với Kimi K3, Fable 5 và GPT-5.6 Sol
So với Kimi K3
Đây là cặp so sánh trực tiếp nhất: hai phòng thí nghiệm Trung Quốc, hai mô hình MoE lớn và được phát hành cách nhau vài tuần.
| Tiêu chí | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| Tổng tham số | 2,4T | 2,8T |
| Tham số hoạt động | 95B | 104B |
| Phương thức | Văn bản + hình ảnh | Chỉ văn bản |
| Giá đầu vào | $2 / 1M token | $3 / 1M token |
| Giá đầu ra | $6 / 1M token | $15 / 1M token |
| Trọng số | Đã hứa phát hành | Đã công bố |
Chưa có benchmark đối đầu độc lập. Mỗi nhà cung cấp hiện công bố bảng kết quả riêng. Xem Qwen 3.8 vs Kimi K3 để xem so sánh từng hàng. Nếu bạn chưa quen với mô hình của Moonshot, bắt đầu với Kimi K3 là gì.
So với Fable 5
Fable 5 vẫn là chuẩn cần vượt qua ở mã hóa cốt lõi. Theo bảng của Alibaba:
- SWE-bench Pro: Qwen 67.7, Fable 5 80.0
- HLE: Qwen 43.6, Fable 5 53.3
Đổi lại, Qwen 3.8-Max có giá thấp hơn đáng kể, ngữ cảnh 1M token, trọng số mở đang được hứa phát hành và kết quả đa phương thức mạnh hơn.
So với GPT-5.6 Sol
GPT-5.6 Sol dẫn đầu ở:
- Terminal Bench: 88.8 so với 86.6
- GPQA: 94.1 so với 92.6
- HLE: 47.2 so với 43.6
Qwen 3.8-Max dẫn đầu ở:
- PaperBench: 93.0 so với 90.5
- IFBench: 82.8 so với 72.7
Về giá, Qwen có giá $2/$6, thấp hơn $2/$12 của GPT-5.6 Terra ở token đầu ra; quyền truy cập cấp Sol còn đắt hơn.
Một tham chiếu giá khác: Claude Opus 5 có giá niêm yết $5/$25. Dù đánh giá benchmark của nhà cung cấp ở mức thận trọng, mức giá Qwen vẫn làm thay đổi đáng kể bài toán chi phí ở khối lượng lớn.
Giá: $2/$6 cố định trên 1 triệu token
Giá niêm yết của Qwen 3.8-Max:
- $2 cho mỗi 1 triệu token đầu vào
- $6 cho mỗi 1 triệu token đầu ra
- Cùng một mức giá từ token đầu tiên đến ngữ cảnh 1M token
- Áp dụng cho cả chế độ suy nghĩ và không suy nghĩ
Điểm khác biệt là giá không tăng khi prompt dài hơn. Nhiều mô hình ngữ cảnh dài tăng giá sau một ngưỡng token; Qwen 3.8-Max không áp dụng cách này.
Mô hình cũng ra mắt rẻ hơn mức giá niêm yết $2.5/$7.5 của Qwen3.7-Max. Tuy nhiên, Qwen3.7-Max đang có khuyến mãi 50% ở mức $1.25/$3.75, nên vẫn đáng cân nhắc nếu ưu tiên chi phí.
Với workload có tiền tố lặp lại:
- Cache hit được tính bằng 10% giá token đầu vào.
- Tạo cache rõ ràng có giá 125%.
- Có hạn mức miễn phí 1 triệu token tại khu vực Singapore, hiệu lực 90 ngày.
Để ước lượng ngân sách, đừng chỉ tính token prompt và câu trả lời cuối cùng. Hãy đo cả token suy nghĩ khi dùng reasoning_effort: "xhigh". Xem hướng dẫn giá Qwen 3.8 để xem ví dụ chi phí theo tác vụ.
Cách truy cập Qwen 3.8-Max
Có năm cách chính để dùng mô hình.
1. Qwen Chat
Qwen Chat phù hợp để thử nhanh mà không cần khóa API. Đây là cách đơn giản nhất để đánh giá chất lượng câu trả lời trước khi tích hợp vào ứng dụng.
2. API Alibaba Cloud Model Studio (DashScope)
Lấy khóa tại home.qwencloud.com, sau đó cấu hình biến môi trường:
export DASHSCOPE_API_KEY="your-api-key"
Dùng model ID:
qwen3.8-max
Các base URL tương thích OpenAI đang hoạt động:
# Bắc Kinh
https://dashscope.aliyuncs.com/compatible-mode/v1
# Singapore
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
# US-Virginia
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Trang Model Studio Models liệt kê Qwen 3.8-Max trong nhóm mô hình được đề xuất.
3. Endpoint tương thích Anthropic
DashScope cũng có endpoint tương thích Anthropic Messages:
https://dashscope-intl.aliyuncs.com/apps/anthropic
Đây là lựa chọn hữu ích nếu công cụ hiện tại của bạn đã được xây dựng cho Claude. Thay vì viết lại client, bạn có thể đổi base URL, API key và model ID.
4. Coding harnesses
Alibaba công bố cấu hình cho:
- Claude Code
- Codex
- Qoder
- Qwen Code
- OpenClaw
Ví dụ với Claude Code, cấu hình chính dùng:
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Alibaba cho biết phần lớn benchmark mã hóa của họ chạy trong Claude Code, nên đây cũng là cấu hình gần với thiết lập được dùng để tạo các con số benchmark của họ.
5. Trọng số mở
Alibaba hứa phát hành trên Hugging Face và ModelScope trong tuần sau khi ra mắt. Tính đến đầu tháng 8 năm 2026, trọng số vẫn chưa thể tải xuống.
Để xem hướng dẫn cài đặt chi tiết hơn, bao gồm Python và cURL, xem hướng dẫn API Qwen 3.8.
Kiểm tra API trên cả hai giao thức
Cùng một mô hình có thể trả lời qua giao thức OpenAI và Anthropic, vì vậy bạn nên kiểm tra hành vi thực tế thay vì giả định hai đường gọi hoàn toàn giống nhau.
Quy trình kiểm thử nên gồm:
- Tạo môi trường riêng cho Bắc Kinh, Singapore và US-Virginia.
- Gửi cùng một prompt tới endpoint tương thích OpenAI.
- Gửi lại prompt đó tới endpoint Anthropic Messages.
- So sánh nội dung trả lời, độ trễ, lỗi schema và usage token.
- Kiểm tra SSE stream để xem
reasoning_contentxuất hiện trước phản hồi cuối cùng như thế nào. - Đo token đầu ra thực tế khi dùng
reasoning_effort: "xhigh".
Trong Apidog, bạn có thể lưu base URL theo môi trường, chuyển vùng mà không sửa request và chạy A/B cùng một prompt trên nhiều model. Điều này đặc biệt hữu ích khi so sánh:
qwen3.8-max
qwen3.7-max
kimi-k3
Bạn có thể tải xuống Apidog miễn phí để tổ chức request, kiểm tra streaming và so sánh phản hồi trước khi đưa workload vào production.
Vị trí của Qwen 3.8-Max trong danh mục sản phẩm
Qwen 3.8-Max hiện đứng trên Qwen3.7-Max và các model cấp plus.
Cách chọn nhanh:
- Chọn Qwen 3.8-Max khi cần khả năng đa phương thức, xử lý tài liệu hoặc tác tử ở mức cao nhất.
- Chọn Qwen3.7-Max khi ưu đãi 50% vẫn còn hiệu lực và chi phí là ưu tiên chính.
- Chọn các model plus cho workload thường ngày cần giá thấp hơn.
Xem thêm hướng dẫn các mô hình Qwen tốt nhất để chọn model theo loại tác vụ.
Câu hỏi thường gặp
Qwen 3.8 có phải là mã nguồn mở không?
Chưa, nhưng Alibaba cho biết trọng số sẽ có trên Hugging Face và ModelScope trong tuần sau khi ra mắt vào đầu tháng 8 năm 2026. Hiện chưa có trọng số để tải xuống.
Trong lúc chờ, bạn có thể truy cập qua API hoặc Qwen Chat. Xem cách sử dụng Qwen 3.8 miễn phí.
Qwen 3.8-Max có giá bao nhiêu?
$2 cho mỗi triệu token đầu vào và $6 cho mỗi triệu token đầu ra, với giá cố định trên toàn bộ ngữ cảnh 1M token.
Cache hit có giá bằng 10% giá đầu vào. Token suy nghĩ được tính là token đầu ra, và reasoning_effort mặc định là xhigh, nên cần dự trù chi phí cao hơn cho tác vụ yêu cầu lập luận dài.
Qwen 3.8-Max có tốt hơn Kimi K3 không?
Chưa có đánh giá đối đầu độc lập. Trên thông số công bố:
- Qwen nhỏ hơn: 2,4T/95B hoạt động so với 2,8T/104B.
- Qwen hỗ trợ đa phương thức, Kimi K3 chỉ xử lý văn bản.
- Qwen rẻ hơn ở token đầu ra: $6 so với $15.
- Kimi K3 hiện có lợi thế vì trọng số đã được công bố.
Tôi có thể dùng Qwen 3.8-Max trong Claude Code không?
Có. Alibaba đã công bố cấu hình chính thức: trỏ ANTHROPIC_BASE_URL tới endpoint DashScope tương thích Anthropic và đặt:
export ANTHROPIC_MODEL="qwen3.8-max"
Codex, Qoder, Qwen Code và OpenClaw cũng có cấu hình chính thức.
Những việc cần làm tiếp theo
Qwen 3.8-Max là một bản phát hành flagship đã GA trên ba khu vực API, có giá niêm yết rõ ràng, benchmark đầy đủ do nhà cung cấp thực hiện và kế hoạch phát hành trọng số mở.
Nhận định thực tế:
- Mô hình chưa vượt Fable 5 ở mã hóa cốt lõi.
- Mô hình có kết quả mạnh ở tác vụ tác tử, tài liệu và đa phương thức.
- Giá $2/$6 đáng chú ý cho workload lớn.
- Kết quả benchmark nên được xác minh trên dữ liệu và prompt của chính bạn.
Bước tiếp theo nên là chạy thử trên workload thực tế: lấy hạn mức miễn phí, cấu hình cả endpoint OpenAI và Anthropic, sau đó so sánh đầu ra, latency và token usage trên những prompt bạn thực sự dùng. Bắt đầu với hướng dẫn thiết lập API, rồi kiểm tra lại khoảng ngày 10 tháng 8 để xác nhận trọng số có được phát hành đúng lịch trình hay không.

Top comments (0)