Alibaba phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026. Nếu đang chạy qwen3.7-max trong production, bạn cần đánh giá lại lựa chọn model: Qwen 3.8-Max cải thiện mạnh các tác vụ agentic và nghiên cứu, hỗ trợ đầu vào hình ảnh, có giá niêm yết thấp hơn và là model Max đầu tiên được Alibaba hứa hẹn phát hành open weights.
Tuy nhiên, đây không đơn giản là trường hợp “model mới luôn tốt hơn”. qwen3.7-max đang được giảm giá 50% trong thời gian giới hạn, khiến chi phí thực tế thấp hơn Qwen 3.8-Max. Một số benchmark tăng rất mạnh, trong khi các benchmark khác gần như không đổi. Bài viết này tập trung vào cách đánh giá, thử nghiệm và chuyển đổi model trước khi thay đổi cấu hình production.
Nếu cần tìm hiểu tổng quan trước, hãy đọc bài giải thích Qwen 3.8-Max. Để xem nền tảng của flagship cũ, hãy xem những gì Qwen 3.7 đã mang lại.
Lưu ý về dữ liệu benchmark: Tất cả số liệu dưới đây đến từ bảng công bố của Alibaba trong bài đăng phát hành Qwen 3.8 chính thức. Hai model được đánh giá trong cùng một lần chạy của nhà cung cấp, nên có thể so sánh chênh lệch nội bộ. Tuy nhiên, kết quả vẫn cần được xác minh độc lập. Phần lớn benchmark lập trình được chạy trên bộ công cụ Claude Code; một số benchmark do Qwen tự xây dựng.
Tóm tắt quyết định
| Thay đổi | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| Giá niêm yết / 1 triệu token | $2.5 vào / $7.5 ra | $2 vào / $6 ra |
| Giá hiện tại | $1.25 vào / $3.75 ra | $2 vào / $6 ra |
| Đầu vào hình ảnh | Không | Có |
| Kiến trúc công bố | Không công bố | 2.4T tổng, 95B MoE hoạt động |
| Open weights | Chưa từng phát hành | Hứa hẹn phát hành “tuần tới” (~10/8) |
| Context window | 1 triệu token | 1 triệu token |
Benchmark: khi nào Qwen 3.8-Max đáng nâng cấp?
Các cải tiến đáng kể nhất nằm ở tác vụ agentic: model cần lập kế hoạch, thực thi nhiều bước, dùng công cụ và tự sửa lỗi.
Terminal Bench 2.1: 74.5 → 86.6
Qwen 3.8-Max tăng hơn 12 điểm trên các tác vụ agent điều khiển terminal. Trong bảng của Alibaba, điểm số này cao hơn Claude Opus 4.8 và Fable 5, cùng đạt 84.6; GPT-5.6 Sol dẫn đầu với 88.8.
Nên ưu tiên nâng cấp nếu bạn đang xây dựng:
- Agent chạy lệnh shell hoặc terminal.
- Quy trình sửa lỗi và kiểm tra code nhiều bước.
- Agent CI/CD hoặc automation cần tự kiểm tra kết quả.
- Công cụ lập trình cần thao tác filesystem, repository hoặc command-line tool.
SWE-bench Pro: 60.6 → 67.7
Điểm số tăng 7 điểm trên tác vụ kỹ thuật phần mềm thực tế. Đây là cải thiện có ý nghĩa, nhưng chưa phải dẫn đầu: Fable 5 đạt 80.0 trong cùng bảng.
Nếu SWE-bench Pro là tiêu chí quan trọng nhất, Qwen 3.8-Max là bước tiến so với 3.7-Max, nhưng chưa đủ để kết luận rằng nó tốt hơn mọi lựa chọn khác.
PaperBench: 64.8 → 93.0
Đây là mức tăng lớn nhất: hơn 28 điểm trên tác vụ tái tạo bài báo nghiên cứu AI. Qwen 3.8-Max cũng dẫn đầu toàn bộ nhóm model trong bảng so sánh của Alibaba.
Đây là tín hiệu đáng chú ý nếu workload của bạn gồm:
- Tái tạo hoặc kiểm tra quy trình nghiên cứu.
- Đọc và tổng hợp tài liệu kỹ thuật dài.
- Lập kế hoạch thử nghiệm nhiều bước.
- Suy luận khoa học hoặc phân tích có cấu trúc.
IFBench: 79.1 → 82.8
Khả năng tuân thủ chỉ dẫn tăng gần 4 điểm. Qwen 3.7-Max vốn đã mạnh ở benchmark này, nên Qwen 3.8-Max chủ yếu mở rộng lợi thế hiện có.
GPQA Diamond: 92.4 → 92.6
Gần như không đổi. Nếu workload của bạn chủ yếu là hỏi đáp kiến thức chuyên môn, nâng cấp từ 3.7-Max sang 3.8-Max có thể không đem lại khác biệt chất lượng rõ rệt.
HLE: 41.4 → 43.6
Humanity’s Last Exam tăng khoảng 2 điểm, nhưng Qwen 3.8-Max vẫn thấp hơn Fable 5 (53.3) và GPT-5.6 Sol (47.2) trong cùng bảng.
Kết luận từ benchmark
Qwen 3.8-Max có cải thiện lớn ở agentic work và nghiên cứu, cải thiện vừa phải về tuân thủ chỉ dẫn, gần như không thay đổi ở benchmark kiến thức đã bão hòa, và vẫn còn khoảng cách ở các bài đánh giá suy luận khó nhất.
Xem thêm phân tích benchmark Qwen 3.8 để xem đầy đủ bảng điểm, công cụ đánh giá và các benchmark nội bộ.
Kiến trúc: đã có thông số để lập kế hoạch hạ tầng
Qwen 3.8-Max là model mixture-of-experts (MoE) với:
- 2.4 nghìn tỷ tham số tổng cộng
- 95 tỷ tham số hoạt động trên mỗi lần forward
- Xây dựng trên kiến trúc Qwen 3.5
- Tỷ lệ kích hoạt khoảng 4%
Tỷ lệ kích hoạt quan trọng khi ước lượng chi phí phục vụ: mức tính toán liên quan đến 95B tham số hoạt động, không phải toàn bộ 2.4T tham số.
Alibaba chưa từng công bố thông số quy mô tương đương cho Qwen 3.7-Max. Với Qwen 3.8-Max, tài liệu model của Model Studio và bài phát hành đã công bố kiến trúc rõ ràng hơn, giúp nhóm kỹ thuật dự báo năng lực và chi phí ít phụ thuộc vào phỏng đoán.
Để so sánh trong cuộc đua open weights: Kimi K3 có 2.8T tham số tổng và 104B tham số hoạt động. Qwen 3.8-Max nhỏ hơn ở cả hai chỉ số.
Đa phương thức: khả năng mới mà Qwen 3.7-Max không có
Qwen 3.7-Max là text-only model. Qwen 3.8-Max hỗ trợ đầu vào hình ảnh và Alibaba đã công bố bảng benchmark đa phương thức riêng, trong đó model này dẫn đầu phần lớn hàng so với Gemini 3.1 Pro và GPT-5.6 Sol.
Một số điểm đáng chú ý trong bảng của Alibaba:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1 cho tác vụ sử dụng máy tính
Không có cột Qwen 3.7-Max trong bảng đa phương thức vì model cũ không nhận hình ảnh.
Trong implementation thực tế, điều này cho phép bạn hợp nhất một số pipeline trước đây cần model vision riêng:
- Phân tích screenshot.
- Đọc ảnh tài liệu.
- Trích xuất thông tin từ biểu đồ.
- Hỗ trợ automation giao diện người dùng.
Bài phát hành cũng minh họa khả năng hiểu tài liệu dài và video. Tuy nhiên, đây là khả năng được trình bày trong blog, không nhất thiết là kiểu đầu vào API riêng; hãy kiểm tra tài liệu API trước khi đưa vào production.
Giá: Qwen 3.8-Max rẻ hơn ở giá niêm yết, nhưng không rẻ hơn hôm nay
Qwen 3.8-Max có giá niêm yết:
- $2 input / $6 output cho mỗi 1 triệu token
- Một mức giá cố định trên toàn bộ context window 1 triệu token
Qwen 3.7-Max có giá niêm yết:
- $2.5 input / $7.5 output cho mỗi 1 triệu token
Ở giá niêm yết, Qwen 3.8-Max rẻ hơn 20% dù có nhiều khả năng hơn.
Tuy nhiên, Qwen 3.7-Max đang được giảm giá 50% trong thời gian giới hạn:
- $1.25 input / $3.75 output cho mỗi 1 triệu token
Ở mức giá hiện tại, Qwen 3.7-Max rẻ hơn Qwen 3.8-Max khoảng 38%. Kiểm tra giá mới nhất trên trang giá chính thức của Model Studio.
Hai điểm cần đưa vào cost model
- Khuyến mãi có thể kết thúc
Alibaba chỉ ghi đây là ưu đãi giới hạn thời gian và chưa công bố ngày kết thúc. Nếu kiến trúc hoặc ngân sách của bạn phụ thuộc vào giá $1.25 / $3.75, hãy chuẩn bị phương án khi giá quay lại mức niêm yết.
- Thinking token được tính phí như output token
Qwen 3.8-Max mặc định dùng reasoning_effort: xhigh. Token suy luận được tính như token đầu ra, nên chi phí thực tế có thể cao hơn đáng kể so với phép tính input/output cơ bản.
Xem hướng dẫn định giá Qwen 3.8 để xem chi phí lưu trữ và chi phí theo tác vụ.
Nếu cả hai model Max đều vượt ngân sách, qwen3.7-plus với giá $0.4 / $1.6 — hiện giảm giá 20% — vẫn là lựa chọn giá trị. Đọc so sánh Qwen 3.7-Plus và Max để xác định khi nào Plus là đủ.
Open weights: thay đổi lớn đầu tiên cho dòng Max
Chưa có model Qwen-Max nào từng phát hành open weights. Qwen 3.7-Max không có và Alibaba cũng chưa từng gợi ý rằng model này sẽ được mở.
Qwen 3.8-Max là ngoại lệ: bài phát hành hứa hẹn cung cấp weights trên Hugging Face và ModelScope vào “tuần tới”, tức khoảng ngày 10 tháng 8 năm 2026.
Tại thời điểm bài viết được xuất bản, ngày 3 tháng 8 năm 2026, weights chưa thể tải xuống. Vì vậy, hãy xem đây là cam kết công bố, không phải khả năng đã sẵn sàng để triển khai.
Ngay cả khi weights được phát hành, việc tự host model 2.4T tham số là dự án đa nút, kể cả đã lượng tử hóa. Với đa số team, tác động thực tế có thể là:
- Có thêm lựa chọn nhà cung cấp hosting.
- Có thêm đòn bẩy khi đàm phán giá.
- Có thêm lựa chọn phục vụ qua bên thứ ba.
Nếu yêu cầu mua sắm hoặc tuân thủ của bạn bắt buộc phải có open weights, điều này có thể tự quyết định lựa chọn giữa 3.7-Max và 3.8-Max.
Những gì không thay đổi
Context window vẫn là 1 triệu token
Cả hai model đều hỗ trợ context window 1 triệu token. Nếu chọn 3.7-Max vì cần context dài, bạn không nhận thêm dung lượng context khi chuyển sang 3.8-Max.
Đường dẫn API cơ bản vẫn giống nhau
Cả hai model được phục vụ qua Alibaba Cloud Model Studio với endpoint tương thích OpenAI. Với luồng sử dụng cơ bản, migration chủ yếu là đổi model ID:
- "model": "qwen3.7-max"
+ "model": "qwen3.8-max"
Qwen 3.8-Max cũng bổ sung bề mặt API tương thích Anthropic. Bạn có thể kiểm tra cả hai giao thức trong client như Apidog nếu toolchain của bạn hỗ trợ.
Có kiểm soát reasoning rõ ràng hơn
Qwen 3.8-Max hỗ trợ các tham số:
reasoning_effortenable_thinkingpreserve_thinking
reasoning_effort có ba mức:
-
xhigh— mặc định mediumlow
Đặt rõ tham số này trong request để kiểm soát trade-off chất lượng, độ trễ và chi phí thay vì phụ thuộc vào hành vi reasoning mặc định.
Ví dụ payload theo kiểu OpenAI-compatible API:
{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "Phân tích lỗi trong đoạn mã này và đề xuất bản vá."
}
],
"reasoning_effort": "medium"
}
Có nên nâng cấp? Chọn một trong ba hướng
1. Nâng cấp ngay nếu workload là agentic hoặc nghiên cứu
Ưu tiên Qwen 3.8-Max nếu bạn cần:
- Agent vận hành terminal.
- Tự động hóa quy trình nhiều bước.
- Tái tạo hoặc phân tích công việc kỹ thuật.
- Xử lý screenshot hay ảnh tài liệu.
- Suy luận trên nội dung nghiên cứu dài.
Mức tăng ở Terminal Bench (74.5 → 86.6) và PaperBench (64.8 → 93.0) là các cải thiện có khả năng thể hiện rõ trong workload thực tế.
2. Tiếp tục dùng Qwen 3.7-Max trong thời gian khuyến mãi nếu chi phí là ưu tiên
Giữ qwen3.7-max nếu:
- Workload chủ yếu là hỏi đáp, tóm tắt hoặc chat thông thường.
- Chất lượng hiện tại đã đạt yêu cầu.
- Bạn không cần đầu vào hình ảnh.
- Giá mỗi token quan trọng hơn khả năng agentic.
GPQA chỉ thay đổi 0.2 điểm, trong khi mức giá khuyến mãi $1.25 / $3.75 hiện thấp hơn Qwen 3.8-Max.
Hãy đặt lịch kiểm tra lại giá khuyến mãi hàng tháng. Khi ưu đãi kết thúc, giá dự phòng hợp lý hơn có thể là Qwen 3.8-Max ở $2 / $6, thay vì quay lại giá niêm yết Qwen 3.7-Max là $2.5 / $7.5.
3. Chuyển xuống qwen3.7-plus nếu tác vụ đơn giản và cần tối ưu chi phí
Với giá $0.4 / $1.6, qwen3.7-plus rẻ hơn khoảng 5 lần Qwen 3.8-Max ở input token.
Đây thường là lựa chọn hợp lý cho:
- Phân loại.
- Trích xuất dữ liệu.
- Sinh nội dung theo template.
- Chuẩn hóa hoặc chuyển đổi văn bản.
- Tác vụ không cần agentic reasoning phức tạp.
Cách kiểm tra migration trước khi thay đổi production
Benchmark của nhà cung cấp không thể thay thế đánh giá trên prompt, dữ liệu và tiêu chí chất lượng của chính bạn. Cách thực tế nhất là chạy A/B test song song.
Bước 1: Dùng chung một request, chỉ thay model ID
Tạo biến môi trường cho model:
MODEL=qwen3.7-max
Sau đó tạo môi trường thứ hai:
MODEL=qwen3.8-max
Giữ nguyên prompt, tham số generation, dữ liệu đầu vào và tiêu chí đánh giá để tránh làm sai lệch kết quả.
Ví dụ request:
{
"model": "{{MODEL}}",
"messages": [
{
"role": "system",
"content": "Bạn là trợ lý kỹ thuật. Trả lời ngắn gọn, có thể triển khai."
},
{
"role": "user",
"content": "{{PROMPT}}"
}
],
"reasoning_effort": "medium"
}
Bước 2: Chọn tập prompt đại diện cho production
Không chỉ test prompt “đẹp”. Hãy đưa vào:
- Prompt có tỷ lệ lỗi cao.
- Input dài.
- Yêu cầu tool use hoặc workflow nhiều bước.
- Dữ liệu có cấu trúc.
- Các trường hợp cần format output nghiêm ngặt.
- Screenshot hoặc ảnh tài liệu nếu bạn dự định dùng khả năng vision của 3.8-Max.
Bước 3: Đo cả chất lượng, độ trễ và token
Với từng request, ghi lại:
| Chỉ số | Câu hỏi cần trả lời |
|---|---|
| Chất lượng | Output có đúng tiêu chí nghiệp vụ không? |
| Độ ổn định | Có tuân thủ format và instruction nhất quán không? |
| Độ trễ | P50/P95 có phù hợp SLO không? |
| Token đầu vào | Prompt/context có tăng không? |
| Token đầu ra | Thinking token có làm chi phí tăng đáng kể không? |
| Chi phí | Chi phí trên một tác vụ hoàn tất là bao nhiêu? |
Trong Apidog, bạn có thể cấu hình collection trỏ đến endpoint OpenAI-compatible của Model Studio, sau đó tạo hai environment chỉ khác biến model ID. Chạy cùng một request trên cả hai môi trường, so sánh response, latency và token usage, rồi lưu các prompt production đại diện thành test scenario để chạy lại khi Alibaba thay đổi giá hoặc cập nhật model.
Việc này biến câu hỏi “có nên nâng cấp không?” thành một bài kiểm tra có dữ liệu thay vì tranh luận dựa trên benchmark. Tải Apidog miễn phí và chạy so sánh trên workload của riêng bạn trước khi đổi cấu hình production.
Câu hỏi thường gặp
Qwen 3.8-Max có rẻ hơn Qwen 3.7-Max không?
Ở giá niêm yết, có: $2 / $6 so với $2.5 / $7.5 cho mỗi 1 triệu token.
Ở giá hiện tại, không: khuyến mãi 50% của Qwen 3.7-Max đưa giá xuống $1.25 / $3.75, thấp hơn Qwen 3.8-Max khoảng 38%. Alibaba chưa công bố ngày kết thúc ưu đãi. Xem hướng dẫn định giá Qwen 3.8 để biết chi tiết chi phí.
Tôi có cần thay đổi mã nguồn để chuyển từ qwen3.7-max sang qwen3.8-max không?
Với usage cơ bản, không. Cả hai cùng sử dụng endpoint Model Studio tương thích OpenAI, nên thay đổi chính là model ID.
Tuy nhiên, bạn nên đặt rõ reasoning_effort, vì Qwen 3.8-Max mặc định là xhigh và thinking token được tính phí như output token. Nếu gửi hình ảnh, đó là khả năng chỉ có ở Qwen 3.8-Max và yêu cầu dùng định dạng input image tiêu chuẩn.
Qwen 3.7-Max có open weights không?
Không. Alibaba chưa từng phát hành open weights cho Qwen 3.7-Max và không có dấu hiệu cho thấy điều đó sẽ thay đổi.
Qwen 3.8-Max là model Max đầu tiên được hứa hẹn phát hành open weights, dự kiến có trên Hugging Face và ModelScope khoảng ngày 10 tháng 8 năm 2026. Tính đến ngày 3 tháng 8, weights vẫn chưa thể tải xuống.
Qwen 3.8-Max có tốt hơn Claude hoặc GPT hiện tại không?
Điều này phụ thuộc vào benchmark, và các số liệu hiện tại là do Alibaba công bố.
Trong bảng của Alibaba, Qwen 3.8-Max vượt Opus 4.8 và Fable 5 ở Terminal Bench 2.1, đồng thời dẫn đầu PaperBench và IFBench. Nhưng model này vẫn thấp hơn Fable 5 trên SWE-bench Pro (67.7 so với 80.0) và thấp hơn các model hàng đầu trên HLE.
Chưa có benchmark độc lập, vì vậy hãy đánh giá trên workload của bạn trước khi đưa ra quyết định cuối cùng.

Top comments (0)