DEV Community

Cover image for Cách sử dụng Qwen 3.8 miễn phí
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

Cách sử dụng Qwen 3.8 miễn phí

Alibaba đã phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026, và kết quả tìm kiếm đã nhanh chóng xuất hiện các tuyên bố “miễn phí mãi mãi” không phản ánh đúng điều khoản sử dụng. Bài viết này tổng hợp các lựa chọn dựa trên trang chính thức của Alibaba tính đến ngày 3 tháng 8 năm 2026.

Dùng thử Apidog ngay hôm nay

Có đúng bốn lựa chọn đáng quan tâm:

  • Hai cách dùng được ngay hôm nay.
  • Một cách là cam kết phát hành trong thời gian cụ thể.
  • Một cách là phương án dự phòng với các model Qwen cũ hơn.

Nếu cần nắm nhanh thông số model trước khi bắt đầu — tổng cộng 2,4 nghìn tỷ tham số, 95B tham số hoạt động và ngữ cảnh 1M token — hãy xem tổng quan về Qwen 3.8.

Cách thức Miễn phí? Hoạt động hôm nay? Lưu ý
Qwen Chat Dành cho người dùng, không có API
Hạn mức API Model Studio 1M token Chỉ khu vực Singapore, hết hạn sau 90 ngày
Trọng số mở (tự lưu trữ) Trọng số miễn phí Chưa Hứa “tuần tới”; hạ tầng không miễn phí
Các model Qwen cũ hơn Không phải Qwen 3.8

Cách 1: Dùng Qwen Chat để thử model ngay

Cách nhanh nhất để dùng miễn phí là Qwen Chat. Bạn chỉ cần đăng nhập, chọn model và bắt đầu trò chuyện với Qwen 3.8-Max — không cần thẻ tín dụng hoặc cấu hình cloud. Bài đăng ra mắt chính thức giới thiệu đây là cách mặc định để trải nghiệm model.

Giao diện Qwen Chat

Bạn nhận được:

  • Quyền dùng miễn phí model đầu bảng qua giao diện chat.
  • Khả năng xử lý hình ảnh và tài liệu như trong các demo ra mắt.

Bạn không nhận được:

  • API key.
  • Khả năng tự động hóa.
  • Cách tích hợp trực tiếp vào ứng dụng, agent hoặc bộ kiểm thử.
  • Hành vi API thô tương đương hoàn toàn với giao diện chat.

Qwen Chat có system prompt và cấu hình riêng, vì vậy kết quả trong giao diện chat có thể khác với kết quả khi gọi API. Nếu đang đánh giá Qwen 3.8-Max cho sản phẩm, hãy dùng Qwen Chat để khám phá khả năng model, không dùng nó làm tiêu chuẩn benchmark API.

Kết luận: miễn phí và dùng được ngay, nhưng không phù hợp cho quy trình phát triển cần API.

Cách 2: Dùng hạn mức miễn phí của Model Studio

Nếu bạn viết code, đây là lựa chọn đáng dùng nhất hiện tại. Alibaba Cloud Model Studio cấp cho tài khoản mới hạn mức miễn phí cho qwen3.8-max: 1 triệu token.

Tuy nhiên, cần cấu hình đúng ngay từ đầu. Trang giá Model Studio có ba điều khoản quan trọng.

1. Chỉ miễn phí tại khu vực Singapore

Hạn mức miễn phí chỉ áp dụng cho khu vực Singapore (quốc tế). Dùng URL cơ sở sau:

https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode

Nếu dùng endpoint tại Bắc Kinh hoặc US-Virginia, bạn bị tính phí từ token đầu tiên. Vì vậy, hãy tạo biến môi trường hoặc environment riêng cho từng khu vực thay vì sửa URL thủ công trong code.

Ví dụ:

export DASHSCOPE_API_KEY="your_api_key"
export DASHSCOPE_BASE_URL="https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
Enter fullscreen mode Exit fullscreen mode

2. Hạn mức hết hạn sau 90 ngày

1M token có hiệu lực trong 90 ngày kể từ lúc kích hoạt. Token chưa dùng không được cộng dồn sau thời hạn này.

Đừng kích hoạt hạn mức nếu bạn chưa sẵn sàng chạy thử nghiệm. Hãy chuẩn bị trước:

  1. Bộ prompt benchmark.
  2. Tiêu chí đánh giá đầu ra.
  3. Logging số token theo từng request.
  4. Cảnh báo chi phí sau khi hết hạn mức.

3. Sau hạn mức miễn phí: $2 input / $6 output cho mỗi triệu token

Sau khi hết hạn mức hoặc hết 90 ngày, giá là:

  • $2 / 1M input token
  • $6 / 1M output token

Mức giá này áp dụng trên toàn bộ ngữ cảnh 1M token, không phân tầng. Đây không còn là mức miễn phí, và việc chuyển sang trả phí diễn ra tự động.

Để ước tính chi phí theo workload thực tế, xem hướng dẫn định giá Qwen 3.8.

Thiết lập API tối thiểu

Các bước lấy hạn mức:

  1. Tạo tài khoản Alibaba Cloud Model Studio.
  2. Kích hoạt dịch vụ.
  3. Tạo API key.
  4. Lưu key trong biến môi trường DASHSCOPE_API_KEY.
  5. Chọn endpoint Singapore.

Danh mục model liệt kê qwen3.8-max trong nhóm model được đề xuất.

Endpoint hỗ trợ giao thức tương thích OpenAI và cũng có endpoint tương thích Anthropic. Xem hướng dẫn API Qwen 3.8 để triển khai streaming và xử lý output suy luận.

Ví dụ request theo giao thức tương thích OpenAI:

curl "$DASHSCOPE_BASE_URL/chat/completions" \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.8-max",
    "messages": [
      {
        "role": "user",
        "content": "Tóm tắt nội dung tài liệu này trong 5 gạch đầu dòng."
      }
    ],
    "reasoning_effort": "low"
  }'
Enter fullscreen mode Exit fullscreen mode

Hãy kiểm tra model ID, endpoint và tham số hỗ trợ trong tài liệu Model Studio trước khi đưa request vào production.

Bẫy lớn: reasoning_effort mặc định là xhigh

Qwen 3.8-Max được đặt reasoning_effort mặc định là xhigh. Token suy luận được tính như output token.

Điều này có nghĩa là một prompt phức tạp có thể tiêu tốn hàng nghìn token suy luận trước khi model trả về câu trả lời hiển thị cho người dùng.

Để kéo dài hạn mức 1M token:

  • Dùng low cho tác vụ phân loại, tóm tắt, trích xuất hoặc định dạng dữ liệu.
  • Dùng medium khi cần suy luận vừa phải.
  • Chỉ dùng xhigh cho tác vụ thực sự cần suy luận sâu.

Ví dụ cấu hình theo loại tác vụ:

{
  "model": "qwen3.8-max",
  "reasoning_effort": "low",
  "messages": [
    {
      "role": "user",
      "content": "Trích xuất tên, email và công ty từ văn bản sau."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Quy trình để 1M token dùng được lâu hơn

Một triệu token có thể cạn nhanh nếu bạn gửi lại toàn bộ prompt trong mỗi vòng lặp debug. Hãy áp dụng quy trình sau.

1. Sửa request trước khi chạy lại

Tạo request trong Apidog, điều chỉnh headers, body và tham số theo từng lần gọi. Kiểm tra phản hồi streaming, bao gồm các thay đổi liên quan đến suy luận, trước khi đưa request vào vòng lặp retry của ứng dụng.

2. Mock phản hồi trong lúc phát triển

Sau khi biết cấu trúc response mong muốn, lưu một response mẫu và dùng mock server để phục vụ frontend hoặc agent trong giai đoạn xây dựng.

Ví dụ response mẫu:

{
  "id": "chatcmpl_example",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "Đây là phản hồi mẫu để kiểm thử giao diện."
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 120,
    "completion_tokens": 48,
    "total_tokens": 168
  }
}
Enter fullscreen mode Exit fullscreen mode

Bạn không cần gọi model thật cho mỗi thay đổi UI, parser hay workflow agent.

3. Ghi log token trên từng request

Theo dõi trường usage mà API trả về để biết mức tiêu thụ thực tế:

console.log({
  input: response.usage?.prompt_tokens,
  output: response.usage?.completion_tokens,
  total: response.usage?.total_tokens
});
Enter fullscreen mode Exit fullscreen mode

Tải xuống Apidog miễn phí nếu bạn muốn quản lý request, mock response và lưu nhiều environment. Bạn có thể tạo riêng các environment Singapore, Bắc Kinh và Mỹ để tránh gọi nhầm endpoint.

Kết luận: đây là cách tốt nhất cho developer hiện nay, miễn là bạn dùng đúng khu vực Singapore, theo dõi hạn dùng 90 ngày và kiểm soát token suy luận.

Cách 3: Chờ trọng số mở được phát hành

Tin đáng chú ý nhất với người muốn tự lưu trữ là Qwen 3.8-Max được Alibaba giới thiệu là model đầu tiên thuộc lớp Qwen-Max có trọng số mở. Alibaba cho biết trọng số sẽ xuất hiện trên Hugging Face và ModelScope vào “tuần tới”, tức khoảng ngày 10 tháng 8.

Tuy nhiên, tính đến ngày 3 tháng 8 năm 2026, trọng số vẫn chưa có để tải xuống.

Điều đó có nghĩa là hiện tại bạn chưa thể:

  • Tải trọng số.
  • Lượng tử hóa model.
  • Chạy local.
  • Triển khai server inference riêng.

Nếu gặp hướng dẫn nói rằng bạn có thể chạy Qwen 3.8 local trước khi trọng số được phát hành, hãy kiểm tra lại nguồn model mà hướng dẫn đó thực sự sử dụng.

Thực tế về tự lưu trữ

Ngay cả sau khi trọng số được phát hành, “miễn phí” chỉ áp dụng cho trọng số, không áp dụng cho phần cứng.

Qwen 3.8-Max có tổng cộng 2,4 nghìn tỷ tham số. Tiền lệ gần nhất là Kimi K3, model 2,8T tham số được phát hành với 594 GB trọng số ngay cả khi dùng lượng tử hóa MXFP4 mạnh.

Với Qwen 3.8-Max, bạn vẫn nên dự kiến:

  • Hàng trăm GB trọng số.
  • Hệ thống multi-GPU.
  • Khả năng cần triển khai đa node.
  • Chi phí GPU, lưu trữ, điện năng và vận hành.

Đây không phải model phù hợp với laptop, GPU consumer đơn lẻ hoặc một workstation thông thường. Để hình dung loại hạ tầng liên quan, xem bài phân tích chạy Kimi K3 cục bộ.

Lợi ích thực tế của trọng số mở với phần lớn developer là:

  1. Nhà cung cấp bên thứ ba có thể bắt đầu host model.
  2. Cạnh tranh có thể kéo giá API xuống.
  3. Bạn có thêm lựa chọn về nơi triển khai và kiểm soát dữ liệu.

Với đa số đội ngũ, “trọng số mở miễn phí” sẽ thực tế hơn dưới dạng API host giá thấp, không phải model chạy trên máy cá nhân.

Kết luận: chưa dùng được tại thời điểm bài viết. Hãy kiểm tra lại vào giữa tháng 8 và dự trù chi phí hosting thay vì giả định có thể chạy local miễn phí.

Cách 4: Dùng các model Qwen cũ hơn

Nếu yêu cầu của bạn là “một model Qwen đủ tốt với chi phí bằng 0”, thay vì bắt buộc phải là Qwen 3.8-Max, các model thế hệ trước là phương án thực tế hơn.

Các model Qwen trọng số mở nhỏ hơn có thể chạy trên phần cứng phổ biến hơn và có các lựa chọn truy cập miễn phí riêng. Xem hướng dẫn sử dụng Qwen 3.7 miễn phí để cập nhật các lựa chọn này.

Đánh đổi là bạn không có các cải tiến hiệu năng của Qwen 3.8-Max. Nhưng với các tác vụ như:

  • Prototype nhỏ.
  • Phân loại nội dung.
  • Trích xuất dữ liệu.
  • Học cách tích hợp API Qwen.
  • Benchmark workflow trước khi trả phí.

…model cũ hơn thường đã đủ dùng.

Những gì không có thật

Tính đến ngày 3 tháng 8 năm 2026, các lựa chọn sau không tồn tại:

  • Không có API miễn phí không giới hạn. Bạn chỉ có 1M token và hạn mức này hết hạn.
  • Không có hạn mức miễn phí ngoài Singapore. Endpoint Bắc Kinh và US-Virginia tính phí từ token đầu tiên.
  • Chưa có trọng số để tải xuống. “Tuần tới” là lời hứa, không phải link tải.
  • Không có Qwen 3.8-Max miễn phí chính thức trên nền tảng tổng hợp bên thứ ba. Bất kỳ dịch vụ nào tuyên bố cung cấp Qwen 3.8-Max miễn phí trước khi trọng số phát hành đều cần được kiểm tra kỹ model backend thực tế.

Câu hỏi thường gặp

API của Qwen 3.8 có thực sự miễn phí không?

Có, nhưng chỉ một phần. Tài khoản mới nhận 1 triệu token miễn phí qua Alibaba Cloud Model Studio trong 90 ngày, chỉ ở khu vực Singapore.

Sau đó, giá là $2 cho mỗi triệu input token và $6 cho mỗi triệu output token.

Tôi có thể tải xuống và chạy Qwen 3.8 local ngay bây giờ không?

Không. Trọng số được hứa hẹn trên Hugging Face và ModelScope vào khoảng ngày 10 tháng 8 năm 2026, nhưng chưa được phát hành tại thời điểm viết bài.

Khi được phát hành, bạn vẫn cần chuẩn bị hạ tầng cho hàng trăm GB trọng số và triển khai multi-GPU.

Qwen 3.8 khác các tùy chọn miễn phí của Kimi K3 thế nào?

Trọng số Kimi K3 đã có thể tải xuống, nên phương án tự lưu trữ của Kimi K3 là có thật ngay hôm nay. Với Qwen 3.8, trọng số vẫn đang chờ phát hành.

Tuy nhiên, cả hai model đều quá lớn đối với phần cứng consumer. Xem thêm cách sử dụng Kimi K3 miễn phí nếu bạn muốn so sánh.

Hạn mức miễn phí có tính token suy luận không?

Có. Token suy luận được tính như output token và làm cạn hạn mức 1M token.

reasoning_effort mặc định là xhigh, hãy hạ xuống low hoặc medium cho các request thông thường.

Điểm mấu chốt

Truy cập Qwen 3.8 miễn phí là có thật, nhưng có điều kiện rõ ràng:

  • Qwen Chat phù hợp để trải nghiệm model.
  • 1M token Model Studio ở Singapore phù hợp để developer tích hợp và đánh giá trong 90 ngày.
  • Trọng số mở vẫn chưa phát hành và sẽ không biến việc tự lưu trữ model 2,4T thành bài toán miễn phí.
  • Model Qwen cũ hơn là lựa chọn thực tế nếu bạn cần chi phí bằng 0 lâu dài.

Nếu chọn API, đừng lãng phí hạn mức vào vòng lặp debug. Hãy tạo mẫu request trong Apidog, mock response trong lúc xây dựng, theo dõi token ở từng request và chỉ gọi model thật cho các lần đánh giá cuối cùng.

Top comments (0)