DEV Community

Cover image for Qwen 3.8 trong Lập trình: 16 ngày chạy tự động và Liên kết mã Claude
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

Qwen 3.8 trong Lập trình: 16 ngày chạy tự động và Liên kết mã Claude

Hầu hết các buổi ra mắt mô hình thường trình bày khả năng viết mã qua điểm HumanEval hoặc một hàm tìm kiếm nhị phân. Alibaba chọn cách khác với Qwen 3.8-Max: thay vì chỉ tuyên bố mô hình “viết hàm tốt”, họ cho rằng nó có thể vận hành một dự án phần mềm trong nhiều tuần — tự mở issue, hợp nhất pull request và triển khai tính năng mà không cần con người can thiệp.

Dùng thử Apidog ngay hôm nay

Bài viết này tập trung vào phần có thể kiểm chứng và áp dụng: ba bản demo viết mã mà Alibaba công bố, các chỉ số benchmark liên quan, cách cấu hình qwen3.8-max trong Claude Code, Codex, Qoder, Qwen Code và OpenClaw, cùng quy trình kiểm tra API do mã sinh ra.

Nếu bạn mới tìm hiểu về mô hình này, hãy bắt đầu với Qwen 3.8 là gì: tổng cộng 2,4 nghìn tỷ tham số, 95 tỷ tham số hoạt động, cửa sổ ngữ cảnh 1M token và các trọng số mở được hứa hẹn phát hành vào tuần sau khi ra mắt. Bài này chỉ tập trung vào khả năng viết mã. Mọi thông tin phản ánh tình hình đến ngày 3 tháng 8 năm 2026.

Alibaba thực sự tuyên bố điều gì?

Trong bài đăng chính thức về Qwen 3.8, Alibaba định vị Qwen 3.8-Max là mô hình có thể duy trì một nhiệm vụ kỹ thuật dài hạn: lập kế hoạch, triển khai trong nhiều ngày, tự phục hồi sau lỗi và tạo ra đầu ra có thể review.

Qwen 3.8-Max

Ba điểm khiến tuyên bố này đáng xem xét hơn một chiến dịch ra mắt thông thường:

  1. Bản demo kéo dài. Mười sáu ngày khác hoàn toàn benchmark tác nhân kéo dài 20 phút. Ở quy mô này, khả năng khôi phục lỗi, quản lý ngữ cảnh và tránh lệch mục tiêu quan trọng hơn nhiều.
  2. Có repo công khai. Bạn có thể xem commit, issue, PR và tự đánh giá chất lượng thay vì chỉ tin vào số liệu nhà cung cấp.
  3. Dùng harness của đối thủ. Alibaba cho biết họ chạy phần lớn benchmark viết mã trên harness Claude Code và công bố cấu hình để người dùng tái tạo.

Lưu ý quan trọng: tất cả số liệu trong bài đều đến từ tài liệu ra mắt của Alibaba. Tính đến đầu tháng 8 năm 2026, chưa có xác minh độc lập. Hãy coi đây là demo, không phải kiểm toán độc lập.

Ba minh chứng về khả năng viết mã

oh-my-cli: 16 ngày phát triển tự động

Đây là demo nổi bật nhất. Alibaba cho Qwen 3.8-Max phát triển một công cụ CLI trong chế độ tự động. Tính đến ngày 30 tháng 7, quá trình này kéo dài 16 ngày và tạo ra:

  • 265 commit
  • 127 pull request
  • 151 issue

Theo Alibaba, tất cả đều do mô hình tự tạo, xử lý và đóng.

Repo được công khai tại qwen-code-dev-bot/oh-my-cli. Đây là phần đáng kiểm tra nhất của demo.

Khi đánh giá repo, đừng chỉ nhìn số lượng commit. Hãy kiểm tra theo checklist sau:

  1. Mỗi PR có giải quyết đúng issue được liên kết không?
  2. Issue có phản ánh lỗi hoặc nhu cầu thực tế, hay chỉ là công việc được tạo ra để đóng?
  3. Các thay đổi có kèm kiểm thử không?
  4. Mô hình xử lý regression do chính nó tạo ra như thế nào?
  5. Commit có nhỏ, dễ review và có chủ đích rõ ràng không?

Các dấu hiệu này phản ánh độ tin cậy dài hạn tốt hơn bất kỳ điểm benchmark đơn lẻ nào.

Chạy tái tạo bài báo: mã nghiên cứu, không phải mã ứng dụng

Demo thứ hai là tái tạo một bài báo nghiên cứu machine learning từ đầu. Theo Alibaba, quá trình này:

  • Mất khoảng 125 giờ
  • Tạo khoảng 7.600 dòng mã
  • Chạy 33 vòng huấn luyện GPU

Demo tái tạo bài báo

Alibaba cho biết mô hình tái tạo được 6 phát hiện của bài báo, sau đó vượt kết quả được báo cáo thêm 2,7 điểm trên AIME24.

Đây là loại nhiệm vụ khó hơn autocomplete thông thường vì môi trường có thể lỗi, hyperparameter có thể bị ẩn trong ghi chú, và một lỗi nhỏ có thể chỉ lộ ra sau nhiều giờ huấn luyện. Khả năng đi qua 33 vòng huấn luyện và thu được kết quả khớp là điểm đáng chú ý, dù vẫn cần xác minh độc lập.

Demo này liên quan trực tiếp đến kết quả PaperBench được đề cập bên dưới.

Cuộc thi Tianchi: 24 giờ đối đầu với các đội người

Demo thứ ba đặt mô hình vào một cuộc thi khoa học dữ liệu trên nền tảng Tianchi của Alibaba với giới hạn 24 giờ.

Theo số liệu được công bố, mô hình:

  • Gửi 45 lần trong 24 giờ
  • Lặp lại chiến lược sau mỗi điểm số nhận được
  • Đạt độ chính xác cuối cùng là 0.853
  • Vượt 458 trong số 526 đội người

Kết quả Tianchi

Mô hình không chiến thắng, nhưng vượt khoảng 87% đối thủ. Điều này cho thấy khả năng lặp nhanh dưới áp lực thời hạn: mỗi lượt gửi tạo dữ liệu để điều chỉnh lượt tiếp theo.

Tuy nhiên, Tianchi là nền tảng của Alibaba. Demo có thể là thật, nhưng nhà cung cấp kiểm soát môi trường thực hiện.

Các điểm benchmark viết mã

Alibaba công bố bảng benchmark sau. Đây đều là kết quả tự chạy của Alibaba.

Benchmark Qwen 3.8-Max Đối thủ tốt nhất theo bảng Alibaba
Terminal Bench 2.1 86.6 88.8 — GPT-5.6 Sol
SWE-bench Pro 67.7 80.0 — Fable 5
PaperBench 93.0 90.5 — GPT-5.6 Sol

Cách đọc các con số này:

  • Terminal Bench 2.1: 86.6

    Qwen 3.8-Max vượt Claude Opus 4.8 và Fable 5, vốn cùng đạt 84.6 trong bảng của Alibaba. Đây là benchmark gần nhất với demo oh-my-cli: tác nhân điều khiển terminal, thao tác tệp và thực hiện tác vụ nhiều bước.

  • SWE-bench Pro: 67.7

    Đây là điểm yếu tương đối rõ ràng. Fable 5 đạt 80.0 trên cùng bảng, cao hơn hơn 12 điểm. Với bài toán sửa lỗi ở quy mô repository, Qwen 3.8-Max không phải model dẫn đầu theo số liệu này.

  • PaperBench: 93.0

    Đây là hàng benchmark mạnh nhất của Qwen 3.8-Max trong bảng so sánh và phù hợp với demo tái tạo bài báo.

Một chi tiết quan trọng: Alibaba cho biết phần lớn benchmark viết mã được chạy bằng harness Claude Code, kể cả các lần chạy mô hình đối thủ. Harness ảnh hưởng trực tiếp đến benchmark tác nhân, vì prompt, tool loop, timeout và fallback đều có thể thay đổi kết quả. Vì vậy, hãy coi bảng này là một điểm dữ liệu, không phải kết luận cuối cùng.

Cách viết mã với Qwen 3.8-Max ngay hôm nay

Qwen 3.8-Max đã có sẵn trên Alibaba Cloud Model Studio. Bạn cần API key DashScope từ home.qwencloud.com.

Theo trang giá Model Studio, giá được nêu là:

  • 2 USD / 1 triệu input token
  • 6 USD / 1 triệu output token
  • Không thay đổi trong toàn bộ ngữ cảnh 1M token

Claude Code

Qwen 3.8-Max hỗ trợ endpoint tương thích Anthropic. Thiết lập các biến môi trường sau:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Sau đó khởi động Claude Code như bình thường.

Để tránh lộ khóa API, không hard-code key vào shell script hoặc commit vào repo. Dùng secret manager, file môi trường được ignore hoặc cơ chế quản lý credential của hệ điều hành.

Ví dụ kiểm tra nhanh:

echo "$ANTHROPIC_BASE_URL"
echo "$ANTHROPIC_MODEL"
Enter fullscreen mode Exit fullscreen mode

Kết quả kỳ vọng:

https://dashscope-intl.aliyuncs.com/apps/anthropic
qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Codex

Codex sử dụng endpoint tương thích OpenAI. Thêm provider vào cấu hình:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Enter fullscreen mode Exit fullscreen mode

Sau đó export key:

export DASHSCOPE_API_KEY=your-dashscope-api-key
Enter fullscreen mode Exit fullscreen mode

Điểm cần nhớ: Claude Code sử dụng endpoint Anthropic-compatible, còn Codex sử dụng endpoint OpenAI-compatible. Cùng model, cùng API key, nhưng giao thức khác nhau.

Qoder, Qwen Code và OpenClaw

Ba lựa chọn còn lại có thể triển khai nhanh như sau:

  • Qoder CLI: chọn qwen3.8-max trong cấu hình model.
  • Qwen Code: đặt DASHSCOPE_API_KEY, sau đó chọn model qwen3.8-max.
  • OpenClaw: dùng model ID qwen3.8-max và đặt maxTokens65536.

Ví dụ biến môi trường dùng chung cho Qwen Code:

export DASHSCOPE_API_KEY=your-dashscope-api-key
Enter fullscreen mode Exit fullscreen mode

Hãy kiểm tra tài liệu ra mắt để lấy cấu hình mới nhất thay vì sao chép cấu hình cũ từ ảnh chụp blog.

Chọn reasoning_effort theo loại tác vụ

Qwen 3.8-Max hỗ trợ ba mức reasoning_effort:

  • xhigh — mặc định
  • medium
  • low

Dùng mức suy luận có chủ đích để kiểm soát chi phí và thời gian phản hồi.

Loại tác vụ Mức đề xuất
Refactor nhiều tệp xhigh
Gỡ lỗi nhiều bước xhigh
Lập kế hoạch thay đổi kiến trúc xhigh
Đổi tên biến hoặc hàm low
Thêm docstring low
Chỉnh sửa cơ học, lặp lại low

Nguyên tắc thực tế:

  1. Bắt đầu với low cho thay đổi nhỏ.
  2. Chuyển sang medium nếu model bỏ sót phụ thuộc hoặc cần phân tích nhiều tệp.
  3. Chỉ dùng xhigh cho tác vụ cần lập kế hoạch, gỡ lỗi phức tạp hoặc chạy tác nhân dài.

Token suy luận được tính như output token, với giá 6 USD / 1 triệu token theo thông tin được công bố. Vì xhigh là mặc định, một phiên tác nhân dài có thể tốn đáng kể hơn so với chỉnh sửa đơn giản.

Nếu Qwen 3.8-Max vượt quá nhu cầu, bạn vẫn có thể cân nhắc dòng Qwen3 Coder cho tác vụ viết mã chuyên dụng, hoặc Qwen3 Coder Flash cho phân khúc nhanh và rẻ hơn. Bạn cũng có thể xem cách Kimi K3 xử lý công việc viết mã.

Kiểm tra API mà mã do model tạo ra

Mã biên dịch thành công không có nghĩa là tích hợp API đúng. Một agent có thể tạo hàng nghìn dòng mã nhưng vẫn:

  • gọi sai endpoint;
  • dùng sai HTTP method;
  • xử lý sai mã 429;
  • gửi request body không hợp lệ;
  • bỏ qua retry, timeout hoặc xác thực;
  • hiểu sai phản hồi streaming.

Dưới đây là hai bước nên thêm vào workflow.

1. Kiểm tra endpoint mà mã sinh ra gọi

Khi Qwen 3.8-Max tạo API client hoặc service layer, hãy import OpenAPI specification vào Apidog và kiểm thử trực tiếp các endpoint.

Checklist tối thiểu:

  • Luồng xác thực thành công và thất bại
  • Request thiếu trường bắt buộc
  • Payload biên và dữ liệu bất thường
  • 400, 401, 403, 404, 409, 429, 500
  • Timeout và retry
  • Kiểu dữ liệu của response
  • Hành vi streaming nếu API hỗ trợ

Nếu đang đánh giá API của model trước khi tích hợp, hướng dẫn API Qwen 3.8 trình bày cách thiết lập cả giao thức OpenAI-compatible và Anthropic-compatible. Apidog giúp kiểm tra song song hai dạng giao thức, bao gồm streaming response và reasoning delta.

2. Dùng mock server trước khi cho agent gọi production

Không nên để một agent chạy tự động trong nhiều ngày gọi thẳng vào production. Rủi ro bao gồm:

  • Vượt rate limit
  • Làm thay đổi dữ liệu thật
  • Tạo chi phí không kiểm soát
  • Gửi request lặp do retry sai
  • Gây side effect khó khôi phục

Dùng mock server trong Apidog để cung cấp response thực tế mà không chạm vào hệ thống thật.

Workflow đề xuất:

Qwen tạo API client
        ↓
Trỏ BASE_URL đến mock server
        ↓
Chạy test và kiểm tra request/response
        ↓
Review mã và log
        ↓
Chỉ đổi sang production URL sau khi phê duyệt
Enter fullscreen mode Exit fullscreen mode

Bạn có thể tải Apidog miễn phí để dựng mock server trong vài phút.

Càng trao nhiều quyền tự chủ cho model, API càng trở thành bề mặt kiểm soát quan trọng. Bạn không thể review mọi commit theo thời gian thực, nhưng bạn có thể kiểm soát hệ thống mà mã được phép giao tiếp.

Câu hỏi thường gặp

Qwen 3.8 có tốt cho việc viết mã không?

Theo số liệu Alibaba công bố, model mạnh ở mã hóa tác nhân và tái tạo nghiên cứu:

  • Terminal Bench 2.1: 86.6
  • PaperBench: 93.0

Nhưng model không dẫn đầu ở sửa lỗi quy mô repository:

  • SWE-bench Pro: 67.7
  • Fable 5 trong cùng bảng: 80.0

Đánh giá thận trọng: Qwen 3.8-Max đáng chú ý cho công việc tự động dài hạn và tác vụ nghiên cứu, nhưng chưa phải model dẫn đầu trong sửa lỗi repository theo số liệu nhà cung cấp.

Tôi có thể dùng Qwen 3.8 trong Claude Code không?

Có. Thiết lập:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Alibaba công bố chính thức cấu hình này và cho biết họ chạy phần lớn benchmark viết mã trên harness Claude Code.

Chi phí viết mã với Qwen 3.8 là bao nhiêu?

Theo thông tin giá được nêu:

  • 2 USD / 1 triệu input token
  • 6 USD / 1 triệu output token
  • Ngữ cảnh tối đa 1M token

Reasoning token được tính như output token. Vì xhigh là mặc định, hãy dự trù chi phí cao hơn cho các phiên tác nhân dài. Xem thêm phân tích benchmark Qwen 3.8 và thông tin giá liên kết trong bài đó.

Quá trình oh-my-cli kéo dài 16 ngày có thực sự tự động không?

Đó là tuyên bố của Alibaba. Khác với phần lớn demo nhà cung cấp, bạn có thể tự kiểm tra đầu ra qua repo công khai qwen-code-dev-bot/oh-my-cli, với 265 commit, 127 PR và 151 issue tính đến ngày 30 tháng 7 năm 2026.

Điều cần đánh giá không chỉ là số lượng hoạt động, mà là chất lượng: PR có giải quyết issue thật không, test có đầy đủ không, và model có xử lý regression hiệu quả không.

Top comments (0)