Trong hai tuần, câu chuyện về Qwen 3.8 có một lỗ hổng: các bản xem trước báo chí vào tháng 7 hứa hẹn một mô hình đẳng cấp tiên phong nhưng không cung cấp điểm số nào, khiến mọi bài viết ban đầu đều dựa trên cảm tính. Điều đó đã thay đổi vào ngày 3 tháng 8 năm 2026, khi bài đăng ra mắt chính thức của Alibaba về Qwen 3.8-Max công bố bảng điểm chuẩn đầy đủ, so sánh với Claude Opus 4.8, Fable 5, GPT-5.6 Sol và Qwen3.7-Max, kèm một bảng đa phương thức so với Gemini 3.1 Pro và GPT-5.6 Sol.
Bảng này có cả chiến thắng, thất bại và các chi tiết phương pháp luận dễ bị bỏ qua. Bài viết tập trung vào cách đọc các kết quả đó, sau đó hướng dẫn bạn tự kiểm tra API bằng workload thực tế thay vì chỉ tin vào benchmark của nhà cung cấp. Nếu cần thông tin nền tảng như tham số, giá và quyền truy cập, hãy đọc bài giải thích về Qwen 3.8-Max trước.
Lưu ý: Mọi điểm số bên dưới đều xuất phát từ bảng do Alibaba công bố, với dữ liệu bảng xếp hạng được chú thích ngày 3 tháng 8 năm 2026. Tại thời điểm viết bài, chưa có đánh giá độc lập.
Bảng điểm chuẩn: tổng quan nhanh
Các hàng nổi bật cho mô hình văn bản theo số liệu Alibaba công bố. Điểm cao hơn là tốt hơn ở mọi tiêu chí.
| Điểm chuẩn | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (Humanity’s Last Exam) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Nguồn: Bảng do Alibaba thực hiện. Đây là benchmark do nhà cung cấp tự chạy, một chi tiết cần được tính đến khi diễn giải kết quả.
Qwen 3.8-Max chiến thắng ở đâu?
PaperBench: kết quả flagship mạnh nhất
Trên PaperBench — bài kiểm tra khả năng tái tạo kết quả nghiên cứu khoa học — Qwen 3.8-Max đạt 93.0, cao hơn GPT-5.6 Sol (90.5), Fable 5 (88.8) và Opus 4.8 (80.3).
Điểm cần chú ý nhất là mức tăng từ 64.8 lên 93.0 so với Qwen3.7-Max. Đây là chênh lệch 28 điểm giữa hai thế hệ. Nếu được các đánh giá độc lập xác nhận, kết quả này sẽ là tín hiệu mạnh về năng lực xử lý nghiên cứu dài hạn.
Khi nào nên thử trong sản phẩm: các luồng cần đọc tài liệu dài, tổng hợp kết quả nghiên cứu, đối chiếu giả thuyết hoặc tạo báo cáo kỹ thuật có cấu trúc.
IFBench: tuân thủ hướng dẫn với khoảng cách lớn
Qwen 3.8-Max đạt 82.8 trên IFBench, trong khi GPT-5.6 Sol đạt 72.7, Fable 5 đạt 63.5 và Opus 4.8 đạt 62.2.
Khoảng cách 10–20 điểm là đáng chú ý. Qwen3.7-Max cũng đã đạt 79.1 trên hàng này, nên khả năng tuân thủ hướng dẫn có vẻ là một điểm mạnh ổn định của dòng Qwen.
Cách kiểm tra thực tế: tạo bộ prompt yêu cầu đầu ra nghiêm ngặt, chẳng hạn JSON có schema cố định, trường bắt buộc và quy tắc định dạng.
{
"task": "Trích xuất thông tin hóa đơn",
"output_format": {
"invoice_number": "string",
"vendor": "string",
"total": "number",
"currency": "string"
},
"rules": [
"Chỉ trả về JSON hợp lệ",
"Không thêm markdown",
"Không tạo trường ngoài schema"
]
}
Sau đó đo tỷ lệ phản hồi hợp lệ, tỷ lệ thiếu trường và số lần cần retry giữa các mô hình.
Terminal Bench 2.1: nhỉnh hơn Claude, nhưng chưa dẫn đầu
Trong lần chạy của Alibaba, Qwen 3.8-Max đạt 86.6, cao hơn Opus 4.8 và Fable 5 (cùng 84.6). Tuy nhiên, GPT-5.6 Sol vẫn dẫn đầu với 88.8.
Đây là vị trí thứ hai, không phải chiến thắng tuyệt đối. Dù vậy, vượt Claude khoảng hai điểm trên benchmark agentic terminal vẫn là một kết quả đáng chú ý nếu workflow của bạn liên quan đến shell, CLI hoặc tự động hóa tác vụ lập trình.
Đa phương thức: điểm sáng tổng thể
Bảng đa phương thức là nơi Qwen 3.8-Max thể hiện mạnh nhất. Alibaba báo cáo:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
- Dẫn đầu phần lớn các hàng OCR trong bảng
Opus 4.8 và Fable 5 không cạnh tranh trực tiếp ở phần này vì bảng so sánh tập trung vào văn bản. So với Gemini 3.1 Pro và GPT-5.6 Sol, các hàng liên quan đến suy luận hình ảnh và xử lý tài liệu là nơi Qwen 3.8-Max tạo khác biệt rõ nhất.
Nếu bạn đang so sánh với một bản phát hành trọng số mở lớn khác trong mùa hè, điểm khác biệt lớn nhất cũng nằm ở đa phương thức: Kimi K3 chỉ tập trung vào văn bản. Xem thêm so sánh Qwen 3.8 và Kimi K3.
Những điểm thất bại cần đọc đúng
Alibaba vẫn hiển thị các hàng mà Qwen 3.8-Max thua đối thủ. Đây là ba điểm quan trọng nhất.
HLE: 43.6, đứng sau các flagship khác
Trên Humanity’s Last Exam:
- Qwen 3.8-Max: 43.6
- Claude Opus 4.8: 45.7
- GPT-5.6 Sol: 47.2
- Fable 5: 53.3
Qwen 3.8-Max đứng cuối trong bốn flagship, dù vẫn cao hơn Qwen3.7-Max (41.4). HLE thường khó tối ưu riêng cho benchmark hơn nhiều đánh giá khác, nên đây là hàng đáng theo dõi.
SWE-bench Pro: 67.7 so với 80.0 của Fable 5
Trên benchmark kỹ thuật phần mềm khó hơn:
- Qwen 3.8-Max: 67.7
- Fable 5: 80.0
- Claude Opus 4.8: 69.2
- GPT-5.6 Sol: 64.6
- Qwen3.7-Max: 60.6
Qwen 3.8-Max cải thiện rõ rệt so với thế hệ trước, nhưng vẫn kém Fable 5 khoảng 12 điểm. Hai nhận định sau đều đúng cùng lúc:
- Qwen 3.8-Max vượt Opus 4.8 trên Terminal Bench.
- Qwen 3.8-Max kém Fable 5 đáng kể trên SWE-bench Pro.
Nếu workload của bạn là sửa lỗi trong repository thực, đừng dùng một benchmark terminal đơn lẻ để suy ra hiệu năng coding tổng thể.
DeepSWE và các tác vụ agentic khó
DeepSWE là một hàng khác mà Qwen 3.8-Max kém các mô hình tiên phong trong bảng Alibaba. Mẫu hình chung là:
- Cạnh tranh trong tác vụ agent dựa trên terminal.
- Yếu hơn trong các đánh giá kỹ thuật phần mềm sâu.
- Mạnh hơn ở trí thông minh tài liệu và đa phương thức.
Tóm lại, Qwen 3.8-Max không phải là chiến thắng toàn diện trên mọi loại benchmark. Đây vẫn là kết quả mạnh đối với mô hình có giá 2 USD đầu vào và 6 USD đầu ra cho mỗi triệu token, theo trang giá chính thức, nhưng cần được kiểm tra trên workload thực tế trước khi thay thế mô hình hiện tại.
Bốn chi tiết phương pháp luận dễ bị bỏ qua
1. Mọi con số đều do nhà cung cấp tự chạy
Alibaba đánh giá cả mô hình của mình lẫn mô hình đối thủ. Đây là thực hành phổ biến trong các bài ra mắt, nhưng luôn có ảnh hưởng từ:
- Phiên bản benchmark được chọn
- Prompt và chiến lược prompting
- Cài đặt sampling
- Chính sách retry
- Toolchain dùng để chạy agent
Điều này không tự động có nghĩa là gian lận. Nhưng một bảng benchmark của nhà cung cấp là một tuyên bố có phương pháp luận, không phải phép đo độc lập.
2. Phần lớn benchmark coding chạy trên Claude Code
Alibaba cho biết nhiều benchmark coding được chạy bằng Claude Code, toolchain agent của Anthropic, kết nối với Qwen 3.8-Max thông qua API tương thích Anthropic.
Điều này có hai mặt:
- Công bằng hơn: các mô hình được chạy trong cùng một công cụ phổ biến.
- Cần thận trọng: điểm số thực tế phản ánh “Qwen trong toolchain của Anthropic”, không chỉ phản ánh bản thân mô hình.
Với các bài test agentic, toolchain có thể thay đổi kết quả vài điểm. Nếu bạn triển khai bằng một framework khác, như SDK riêng, LangGraph hoặc agent nội bộ, hãy chạy lại bằng stack của mình.
3. Một số benchmark do Qwen phát triển
QwenSWEBench, QwenQoderBench, CoWorkBench và RecreationBench được xây dựng bởi nhóm Qwen.
Benchmark nội bộ vẫn có giá trị, đặc biệt khi chúng đo các năng lực mà benchmark công khai chưa bao phủ. Tuy nhiên, điểm số cao trên benchmark do nhà sản xuất xây dựng là loại bằng chứng khác với điểm số cao trên SWE-bench Pro hoặc benchmark công khai được cộng đồng sử dụng rộng rãi.
Khi trích dẫn một hàng, hãy kiểm tra:
- Đây là benchmark công khai hay nội bộ?
- Ai tạo benchmark?
- Có mã nguồn, tập dữ liệu hoặc quy trình đánh giá công khai không?
4. Chú thích về Fable 5
Bảng Alibaba có chú thích: “Kết quả của Fable5 có thể liên quan đến các lần dự phòng.”
Điều đó cho thấy ít nhất một số kết quả của đối thủ có thể không phản ánh một lần chạy “sạch” không retry. Dù nguyên nhân kỹ thuật là gì, đây là lý do để không đọc cột Fable 5 mà không xem chú thích.
Mẫu hình này không chỉ xuất hiện ở Alibaba. Anthropic, OpenAI và Google cũng công bố bảng tự chạy với các lựa chọn phương pháp luận riêng. Chúng tôi đã thấy vấn đề tương tự trong phân tích benchmark Kimi K3.
Checklist đọc benchmark của nhà cung cấp
Dùng checklist này cho Qwen 3.8-Max và bất kỳ bảng benchmark nào khác:
Ai chạy đánh giá?
Kết quả do nhà cung cấp tự báo cáo cần được phân biệt với đánh giá độc lập.Toolchain và cấu hình là gì?
Benchmark agentic đặc biệt nhạy với framework, prompt, quyền công cụ và chính sách retry.Benchmark nào do nhà cung cấp xây dựng?
Benchmark nội bộ có thể hữu ích, nhưng không nên được đánh đồng với benchmark công khai.Đọc chú thích và điều kiện chạy.
Các cụm như “có thể liên quan đến retry” có thể ảnh hưởng lớn đến cách diễn giải kết quả.Kiểm tra các hàng bị thiếu.
Một bảng chỉ công bố các benchmark thuận lợi có thể che mất điểm yếu quan trọng. So sánh với cách thế hệ trước xếp hạng giữa các nhà cung cấp để nhận ra các hàng đã biến mất.Chờ nguồn thứ hai.
Một tuần chờ benchmark độc lập thường đáng giá hơn việc ra quyết định dựa trên bảng ra mắt.
Thay vào đó: tự chạy đánh giá của riêng bạn
Checklist giúp đọc bảng tốt hơn. Nhưng cách tốt nhất là giảm phụ thuộc vào bảng của nhà cung cấp.
Qwen 3.8-Max hiện có trên Alibaba Cloud Model Studio với ID:
qwen3.8-max
Mô hình hỗ trợ cả API tương thích OpenAI và API tương thích Anthropic, theo trang mô hình chính thức. Hãy dùng chính prompt, dữ liệu và tiêu chí thành công của sản phẩm để đánh giá.
Quy trình đánh giá tối thiểu
- Chọn mô hình hiện tại làm baseline, ví dụ Qwen3.7-Max, Kimi K3, Claude hoặc GPT.
- Chuẩn bị 20–30 prompt đại diện cho traffic sản xuất.
- Chạy cùng bộ prompt trên baseline và
qwen3.8-max. - Ghi lại chất lượng, JSON validity, số lần retry, độ trễ và token usage.
- Đánh giá bằng tiêu chí có thể hành động: mô hình nào giảm lỗi hoặc giảm công việc thủ công trong workflow của bạn.
Thiết lập request mẫu
Ví dụ body theo định dạng chat completions:
{
"model": "qwen3.8-max",
"messages": [
{
"role": "system",
"content": "Bạn là trợ lý hỗ trợ kỹ thuật. Chỉ trả về JSON hợp lệ."
},
{
"role": "user",
"content": "Phân loại lỗi sau và đề xuất bước xử lý: API trả về 429 khi tải cao."
}
],
"reasoning_effort": "xhigh"
}
Sau đó tạo request tương đương cho mô hình baseline. Giữ nguyên prompt, nhiệt độ, giới hạn token và quy tắc retry để so sánh công bằng.
Các assertion nên thêm
Với workflow API, không chỉ đánh giá câu trả lời “có vẻ tốt”. Hãy kiểm tra các thuộc tính có thể tự động xác minh:
- Phản hồi là JSON hợp lệ.
- Có đủ trường bắt buộc.
- Không chứa trường ngoài schema.
- Độ trễ dưới ngưỡng chấp nhận được.
- Không vượt ngân sách token hoặc chi phí.
- Nội dung có thể được downstream service xử lý mà không cần sửa tay.
Ví dụ assertion logic:
status_code == 200
response.body is valid JSON
response.body.category exists
response.body.next_steps is an array
response_time < 5000ms
Trong Apidog, bạn có thể lưu các request thành test scenario, đặt assertion cho từng phản hồi và chạy lần lượt hai môi trường mô hình. Báo cáo test sẽ giúp so sánh tỷ lệ thành công và thời gian phản hồi trên chính workload của bạn.
Hai điểm cần kiểm tra riêng với Qwen
Khi chạy đánh giá, hãy đo riêng hai yếu tố sau:
reasoning_effort: xhighlà mặc định
Đo cả chi phí và độ trễ ở mức reasoning effort mà bạn thực sự định triển khai. Một mô hình đạt điểm benchmark tốt có thể không phù hợp nếu latency hoặc token usage vượt ngân sách sản phẩm.API tương thích Anthropic
Nếu bạn định dùng endpoint tương thích Anthropic, hãy kiểm tra riêng protocol này. Đây cũng là protocol mà nhiều benchmark coding của Alibaba chạy qua, nên kết quả có thể khác với luồng triển khai OpenAI-compatible của bạn.
Tải xuống Apidog, cấu hình hai endpoint dưới dạng environment và chạy bộ prompt của bạn. Bạn sẽ có dữ liệu phù hợp với sản phẩm của mình trước khi các bảng xếp hạng độc lập cập nhật.
Các câu hỏi thường gặp
Các con số benchmark Qwen 3.8 có được xác minh độc lập không?
Không. Tính đến ngày 3 tháng 8 năm 2026, mọi con số được công bố đều đến từ bảng của Alibaba. Artificial Analysis và các bảng xếp hạng cộng đồng chưa chấm điểm Qwen 3.8-Max tại thời điểm viết bài.
Hãy xem các số liệu này là tuyên bố của nhà cung cấp cho đến khi có đánh giá độc lập.
Kết quả benchmark tốt nhất của Qwen 3.8-Max là gì?
PaperBench là hàng flagship tốt nhất: Qwen 3.8-Max đạt 93.0, cao hơn GPT-5.6 Sol (90.5), Fable 5 (88.8) và Opus 4.8 (80.3).
Trong bảng đa phương thức, MathVision (95.2) và các hàng OCR là những kết quả mạnh nhất nói chung.
Qwen 3.8-Max thua rõ ràng ở đâu?
Điểm yếu rõ nhất trong bảng Alibaba là:
- HLE: 43.6, thấp nhất trong bốn flagship.
- SWE-bench Pro: 67.7, thấp hơn Fable 5 (80.0).
- DeepSWE: kém các mô hình tiên phong theo bảng của Alibaba.
Các đánh giá kỹ thuật phần mềm sâu và benchmark kiến thức rộng là hai khu vực cần kiểm tra kỹ trước khi dùng mô hình cho coding agent hoặc tác vụ suy luận tổng quát.
Qwen 3.8 tốt hơn Qwen 3.7-Max bao nhiêu?
Theo bảng Alibaba:
- Terminal Bench 2.1: 74.5 → 86.6
- SWE-bench Pro: 60.6 → 67.7
- PaperBench: 64.8 → 93.0
Việc nâng cấp có đáng giá hay không vẫn phụ thuộc vào giá, độ trễ và phương thức API bạn dùng. Xem so sánh Qwen 3.8 và Qwen 3.7 để phân tích sâu hơn.

Top comments (0)