Hầu hết các buổi ra mắt mô hình thường trình bày khả năng viết mã qua điểm HumanEval hoặc một hàm tìm kiếm nhị phân. Alibaba chọn cách khác với Qwen 3.8-Max: thay vì chỉ tuyên bố mô hình “viết hàm tốt”, họ cho rằng nó có thể vận hành một dự án phần mềm trong nhiều tuần — tự mở issue, hợp nhất pull request và triển khai tính năng mà không cần con người can thiệp.
Bài viết này tập trung vào phần có thể kiểm chứng và áp dụng: ba bản demo viết mã mà Alibaba công bố, các chỉ số benchmark liên quan, cách cấu hình qwen3.8-max trong Claude Code, Codex, Qoder, Qwen Code và OpenClaw, cùng quy trình kiểm tra API do mã sinh ra.
Nếu bạn mới tìm hiểu về mô hình này, hãy bắt đầu với Qwen 3.8 là gì: tổng cộng 2,4 nghìn tỷ tham số, 95 tỷ tham số hoạt động, cửa sổ ngữ cảnh 1M token và các trọng số mở được hứa hẹn phát hành vào tuần sau khi ra mắt. Bài này chỉ tập trung vào khả năng viết mã. Mọi thông tin phản ánh tình hình đến ngày 3 tháng 8 năm 2026.
Alibaba thực sự tuyên bố điều gì?
Trong bài đăng chính thức về Qwen 3.8, Alibaba định vị Qwen 3.8-Max là mô hình có thể duy trì một nhiệm vụ kỹ thuật dài hạn: lập kế hoạch, triển khai trong nhiều ngày, tự phục hồi sau lỗi và tạo ra đầu ra có thể review.
Ba điểm khiến tuyên bố này đáng xem xét hơn một chiến dịch ra mắt thông thường:
- Bản demo kéo dài. Mười sáu ngày khác hoàn toàn benchmark tác nhân kéo dài 20 phút. Ở quy mô này, khả năng khôi phục lỗi, quản lý ngữ cảnh và tránh lệch mục tiêu quan trọng hơn nhiều.
- Có repo công khai. Bạn có thể xem commit, issue, PR và tự đánh giá chất lượng thay vì chỉ tin vào số liệu nhà cung cấp.
- Dùng harness của đối thủ. Alibaba cho biết họ chạy phần lớn benchmark viết mã trên harness Claude Code và công bố cấu hình để người dùng tái tạo.
Lưu ý quan trọng: tất cả số liệu trong bài đều đến từ tài liệu ra mắt của Alibaba. Tính đến đầu tháng 8 năm 2026, chưa có xác minh độc lập. Hãy coi đây là demo, không phải kiểm toán độc lập.
Ba minh chứng về khả năng viết mã
oh-my-cli: 16 ngày phát triển tự động
Đây là demo nổi bật nhất. Alibaba cho Qwen 3.8-Max phát triển một công cụ CLI trong chế độ tự động. Tính đến ngày 30 tháng 7, quá trình này kéo dài 16 ngày và tạo ra:
- 265 commit
- 127 pull request
- 151 issue
Theo Alibaba, tất cả đều do mô hình tự tạo, xử lý và đóng.
Repo được công khai tại qwen-code-dev-bot/oh-my-cli. Đây là phần đáng kiểm tra nhất của demo.
Khi đánh giá repo, đừng chỉ nhìn số lượng commit. Hãy kiểm tra theo checklist sau:
- Mỗi PR có giải quyết đúng issue được liên kết không?
- Issue có phản ánh lỗi hoặc nhu cầu thực tế, hay chỉ là công việc được tạo ra để đóng?
- Các thay đổi có kèm kiểm thử không?
- Mô hình xử lý regression do chính nó tạo ra như thế nào?
- Commit có nhỏ, dễ review và có chủ đích rõ ràng không?
Các dấu hiệu này phản ánh độ tin cậy dài hạn tốt hơn bất kỳ điểm benchmark đơn lẻ nào.
Chạy tái tạo bài báo: mã nghiên cứu, không phải mã ứng dụng
Demo thứ hai là tái tạo một bài báo nghiên cứu machine learning từ đầu. Theo Alibaba, quá trình này:
- Mất khoảng 125 giờ
- Tạo khoảng 7.600 dòng mã
- Chạy 33 vòng huấn luyện GPU
Alibaba cho biết mô hình tái tạo được 6 phát hiện của bài báo, sau đó vượt kết quả được báo cáo thêm 2,7 điểm trên AIME24.
Đây là loại nhiệm vụ khó hơn autocomplete thông thường vì môi trường có thể lỗi, hyperparameter có thể bị ẩn trong ghi chú, và một lỗi nhỏ có thể chỉ lộ ra sau nhiều giờ huấn luyện. Khả năng đi qua 33 vòng huấn luyện và thu được kết quả khớp là điểm đáng chú ý, dù vẫn cần xác minh độc lập.
Demo này liên quan trực tiếp đến kết quả PaperBench được đề cập bên dưới.
Cuộc thi Tianchi: 24 giờ đối đầu với các đội người
Demo thứ ba đặt mô hình vào một cuộc thi khoa học dữ liệu trên nền tảng Tianchi của Alibaba với giới hạn 24 giờ.
Theo số liệu được công bố, mô hình:
- Gửi 45 lần trong 24 giờ
- Lặp lại chiến lược sau mỗi điểm số nhận được
- Đạt độ chính xác cuối cùng là
0.853 - Vượt 458 trong số 526 đội người
Mô hình không chiến thắng, nhưng vượt khoảng 87% đối thủ. Điều này cho thấy khả năng lặp nhanh dưới áp lực thời hạn: mỗi lượt gửi tạo dữ liệu để điều chỉnh lượt tiếp theo.
Tuy nhiên, Tianchi là nền tảng của Alibaba. Demo có thể là thật, nhưng nhà cung cấp kiểm soát môi trường thực hiện.
Các điểm benchmark viết mã
Alibaba công bố bảng benchmark sau. Đây đều là kết quả tự chạy của Alibaba.
| Benchmark | Qwen 3.8-Max | Đối thủ tốt nhất theo bảng Alibaba |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 — GPT-5.6 Sol |
| SWE-bench Pro | 67.7 | 80.0 — Fable 5 |
| PaperBench | 93.0 | 90.5 — GPT-5.6 Sol |
Cách đọc các con số này:
Terminal Bench 2.1: 86.6
Qwen 3.8-Max vượt Claude Opus 4.8 và Fable 5, vốn cùng đạt 84.6 trong bảng của Alibaba. Đây là benchmark gần nhất với demooh-my-cli: tác nhân điều khiển terminal, thao tác tệp và thực hiện tác vụ nhiều bước.SWE-bench Pro: 67.7
Đây là điểm yếu tương đối rõ ràng. Fable 5 đạt 80.0 trên cùng bảng, cao hơn hơn 12 điểm. Với bài toán sửa lỗi ở quy mô repository, Qwen 3.8-Max không phải model dẫn đầu theo số liệu này.PaperBench: 93.0
Đây là hàng benchmark mạnh nhất của Qwen 3.8-Max trong bảng so sánh và phù hợp với demo tái tạo bài báo.
Một chi tiết quan trọng: Alibaba cho biết phần lớn benchmark viết mã được chạy bằng harness Claude Code, kể cả các lần chạy mô hình đối thủ. Harness ảnh hưởng trực tiếp đến benchmark tác nhân, vì prompt, tool loop, timeout và fallback đều có thể thay đổi kết quả. Vì vậy, hãy coi bảng này là một điểm dữ liệu, không phải kết luận cuối cùng.
Cách viết mã với Qwen 3.8-Max ngay hôm nay
Qwen 3.8-Max đã có sẵn trên Alibaba Cloud Model Studio. Bạn cần API key DashScope từ home.qwencloud.com.
Theo trang giá Model Studio, giá được nêu là:
- 2 USD / 1 triệu input token
- 6 USD / 1 triệu output token
- Không thay đổi trong toàn bộ ngữ cảnh 1M token
Claude Code
Qwen 3.8-Max hỗ trợ endpoint tương thích Anthropic. Thiết lập các biến môi trường sau:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Sau đó khởi động Claude Code như bình thường.
Để tránh lộ khóa API, không hard-code key vào shell script hoặc commit vào repo. Dùng secret manager, file môi trường được ignore hoặc cơ chế quản lý credential của hệ điều hành.
Ví dụ kiểm tra nhanh:
echo "$ANTHROPIC_BASE_URL"
echo "$ANTHROPIC_MODEL"
Kết quả kỳ vọng:
https://dashscope-intl.aliyuncs.com/apps/anthropic
qwen3.8-max
Codex
Codex sử dụng endpoint tương thích OpenAI. Thêm provider vào cấu hình:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Sau đó export key:
export DASHSCOPE_API_KEY=your-dashscope-api-key
Điểm cần nhớ: Claude Code sử dụng endpoint Anthropic-compatible, còn Codex sử dụng endpoint OpenAI-compatible. Cùng model, cùng API key, nhưng giao thức khác nhau.
Qoder, Qwen Code và OpenClaw
Ba lựa chọn còn lại có thể triển khai nhanh như sau:
-
Qoder CLI: chọn
qwen3.8-maxtrong cấu hình model. -
Qwen Code: đặt
DASHSCOPE_API_KEY, sau đó chọn modelqwen3.8-max. -
OpenClaw: dùng model ID
qwen3.8-maxvà đặtmaxTokenslà65536.
Ví dụ biến môi trường dùng chung cho Qwen Code:
export DASHSCOPE_API_KEY=your-dashscope-api-key
Hãy kiểm tra tài liệu ra mắt để lấy cấu hình mới nhất thay vì sao chép cấu hình cũ từ ảnh chụp blog.
Chọn reasoning_effort theo loại tác vụ
Qwen 3.8-Max hỗ trợ ba mức reasoning_effort:
-
xhigh— mặc định mediumlow
Dùng mức suy luận có chủ đích để kiểm soát chi phí và thời gian phản hồi.
| Loại tác vụ | Mức đề xuất |
|---|---|
| Refactor nhiều tệp | xhigh |
| Gỡ lỗi nhiều bước | xhigh |
| Lập kế hoạch thay đổi kiến trúc | xhigh |
| Đổi tên biến hoặc hàm | low |
| Thêm docstring | low |
| Chỉnh sửa cơ học, lặp lại | low |
Nguyên tắc thực tế:
- Bắt đầu với
lowcho thay đổi nhỏ. - Chuyển sang
mediumnếu model bỏ sót phụ thuộc hoặc cần phân tích nhiều tệp. - Chỉ dùng
xhighcho tác vụ cần lập kế hoạch, gỡ lỗi phức tạp hoặc chạy tác nhân dài.
Token suy luận được tính như output token, với giá 6 USD / 1 triệu token theo thông tin được công bố. Vì xhigh là mặc định, một phiên tác nhân dài có thể tốn đáng kể hơn so với chỉnh sửa đơn giản.
Nếu Qwen 3.8-Max vượt quá nhu cầu, bạn vẫn có thể cân nhắc dòng Qwen3 Coder cho tác vụ viết mã chuyên dụng, hoặc Qwen3 Coder Flash cho phân khúc nhanh và rẻ hơn. Bạn cũng có thể xem cách Kimi K3 xử lý công việc viết mã.
Kiểm tra API mà mã do model tạo ra
Mã biên dịch thành công không có nghĩa là tích hợp API đúng. Một agent có thể tạo hàng nghìn dòng mã nhưng vẫn:
- gọi sai endpoint;
- dùng sai HTTP method;
- xử lý sai mã
429; - gửi request body không hợp lệ;
- bỏ qua retry, timeout hoặc xác thực;
- hiểu sai phản hồi streaming.
Dưới đây là hai bước nên thêm vào workflow.
1. Kiểm tra endpoint mà mã sinh ra gọi
Khi Qwen 3.8-Max tạo API client hoặc service layer, hãy import OpenAPI specification vào Apidog và kiểm thử trực tiếp các endpoint.
Checklist tối thiểu:
- Luồng xác thực thành công và thất bại
- Request thiếu trường bắt buộc
- Payload biên và dữ liệu bất thường
-
400,401,403,404,409,429,500 - Timeout và retry
- Kiểu dữ liệu của response
- Hành vi streaming nếu API hỗ trợ
Nếu đang đánh giá API của model trước khi tích hợp, hướng dẫn API Qwen 3.8 trình bày cách thiết lập cả giao thức OpenAI-compatible và Anthropic-compatible. Apidog giúp kiểm tra song song hai dạng giao thức, bao gồm streaming response và reasoning delta.
2. Dùng mock server trước khi cho agent gọi production
Không nên để một agent chạy tự động trong nhiều ngày gọi thẳng vào production. Rủi ro bao gồm:
- Vượt rate limit
- Làm thay đổi dữ liệu thật
- Tạo chi phí không kiểm soát
- Gửi request lặp do retry sai
- Gây side effect khó khôi phục
Dùng mock server trong Apidog để cung cấp response thực tế mà không chạm vào hệ thống thật.
Workflow đề xuất:
Qwen tạo API client
↓
Trỏ BASE_URL đến mock server
↓
Chạy test và kiểm tra request/response
↓
Review mã và log
↓
Chỉ đổi sang production URL sau khi phê duyệt
Bạn có thể tải Apidog miễn phí để dựng mock server trong vài phút.
Càng trao nhiều quyền tự chủ cho model, API càng trở thành bề mặt kiểm soát quan trọng. Bạn không thể review mọi commit theo thời gian thực, nhưng bạn có thể kiểm soát hệ thống mà mã được phép giao tiếp.
Câu hỏi thường gặp
Qwen 3.8 có tốt cho việc viết mã không?
Theo số liệu Alibaba công bố, model mạnh ở mã hóa tác nhân và tái tạo nghiên cứu:
- Terminal Bench 2.1:
86.6 - PaperBench:
93.0
Nhưng model không dẫn đầu ở sửa lỗi quy mô repository:
- SWE-bench Pro:
67.7 - Fable 5 trong cùng bảng:
80.0
Đánh giá thận trọng: Qwen 3.8-Max đáng chú ý cho công việc tự động dài hạn và tác vụ nghiên cứu, nhưng chưa phải model dẫn đầu trong sửa lỗi repository theo số liệu nhà cung cấp.
Tôi có thể dùng Qwen 3.8 trong Claude Code không?
Có. Thiết lập:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Alibaba công bố chính thức cấu hình này và cho biết họ chạy phần lớn benchmark viết mã trên harness Claude Code.
Chi phí viết mã với Qwen 3.8 là bao nhiêu?
Theo thông tin giá được nêu:
- 2 USD / 1 triệu input token
- 6 USD / 1 triệu output token
- Ngữ cảnh tối đa 1M token
Reasoning token được tính như output token. Vì xhigh là mặc định, hãy dự trù chi phí cao hơn cho các phiên tác nhân dài. Xem thêm phân tích benchmark Qwen 3.8 và thông tin giá liên kết trong bài đó.
Quá trình oh-my-cli kéo dài 16 ngày có thực sự tự động không?
Đó là tuyên bố của Alibaba. Khác với phần lớn demo nhà cung cấp, bạn có thể tự kiểm tra đầu ra qua repo công khai qwen-code-dev-bot/oh-my-cli, với 265 commit, 127 PR và 151 issue tính đến ngày 30 tháng 7 năm 2026.
Điều cần đánh giá không chỉ là số lượng hoạt động, mà là chất lượng: PR có giải quyết issue thật không, test có đầy đủ không, và model có xử lý regression hiệu quả không.



Top comments (0)