DEV Community

Cover image for Qwen 3.8 Giải thích giá: 2 USD Đầu vào / 6 USD Đầu ra trên Ngữ cảnh 1M
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

Qwen 3.8 Giải thích giá: 2 USD Đầu vào / 6 USD Đầu ra trên Ngữ cảnh 1M

Giá Qwen 3.8-Max: cách ước tính chi phí API cho ngữ cảnh 1M token

Alibaba phát hành Qwen 3.8-Max vào đầu tháng 8 năm 2026 với giá chính thức là 2 USD/1M token đầu vào6 USD/1M token đầu ra. Theo trang giá Model Studio, đây là mức giá cố định cho toàn bộ cửa sổ ngữ cảnh đến 1M token, không có phụ phí khi prompt vượt ngưỡng ngữ cảnh.

Dùng thử Apidog ngay hôm nay

Điểm quan trọng nhất: gửi 5.000 hay 900.000 token đầu vào vẫn tính theo mức 2 USD/1M token. Điều này giúp các workload như RAG, phân tích tài liệu dài và agent xử lý codebase lớn dễ dự báo ngân sách hơn.

Bài viết này hướng dẫn bạn:

  • Đọc bảng giá Qwen 3.8-Max.
  • Tính chi phí theo token đầu vào, đầu ra và reasoning.
  • Tận dụng context cache.
  • So sánh giá với Qwen 3.7-Max, Kimi K3, Claude Opus 5 và GPT-5.6 Terra.
  • Đo usage thực tế trước khi triển khai production.

Để xem tổng quan mô hình trước, hãy đọc Qwen 3.8 là gì và tại sao nó lại quan trọng.

Lưu ý: bảng giá chỉ là điểm bắt đầu. Qwen 3.8-Max mặc định dùng reasoning_effort: xhigh; token suy nghĩ được tính như token đầu ra. Hãy đo usage từ request thực tế thay vì chỉ ước lượng theo độ dài prompt. Apidog giúp xem usage token của từng response khi bạn kiểm thử API.

Giá GA: 2 USD đầu vào, 6 USD đầu ra

Theo bảng giá Model Studio được xác minh vào ngày 3 tháng 8 năm 2026, qwen3.8-max có các mức sau:

Mục Giá mỗi 1M token
Đầu vào $2.00
Đầu ra, bao gồm token suy nghĩ $6.00
Đầu vào cache hit 10% giá đầu vào
Tạo cache rõ ràng 125% giá đầu vào
Ngữ cảnh Một mức giá từ 0 đến 1M token
Thinking và non-thinking Cùng mức giá

Ba điểm cần đưa vào mô hình chi phí:

  1. Không có tier giá cho prompt dài: toàn bộ cửa sổ 1M token dùng chung một mức giá.
  2. Reasoning không có giá riêng: nhưng token suy nghĩ vẫn là token đầu ra, vì vậy được tính 6 USD/1M token.
  3. Đầu ra tối đa là 65.536 token/request: nếu response đạt giới hạn này, riêng chi phí đầu ra xấp xỉ 65,536 × 6 / 1,000,000 = $0.39.

Thông báo chính thức của Qwen 3.8 mô tả đây là mô hình mạnh nhất của Alibaba tại thời điểm đó, với 2.4T tham số tổng cộng, 95B tham số hoạt động, ngữ cảnh 1M token và đầu vào đa phương thức.

Vì sao giá cố định đến 1M token đáng chú ý?

Nhiều nhà cung cấp áp dụng giá theo tier ngữ cảnh: khi input vượt một ngưỡng token, giá mỗi token tăng. Điều này tạo ra chi phí khó dự đoán cho workload dài.

Alibaba cũng dùng cách định giá này cho một số model khác. Trên trang giá Model Studio, các model như qwen3-maxqwen3-coder-plus có giá tăng theo độ dài ngữ cảnh.

Với qwen3.8-max, cách tính đơn giản hơn:

chi phí input = input_tokens / 1_000_000 × $2
chi phí output = output_tokens / 1_000_000 × $6
tổng chi phí = chi phí input + chi phí output
Enter fullscreen mode Exit fullscreen mode

Điều này đặc biệt hữu ích khi bạn xây dựng:

  • Pipeline RAG đưa hàng trăm nghìn token tài liệu vào prompt.
  • Agent phân tích repository hoặc tài liệu kỹ thuật lớn.
  • Workflow truy xuất dữ liệu có context thay đổi theo từng request.

So sánh với Qwen 3.7-Max

Qwen 3.8-Max có giá niêm yết thấp hơn phiên bản trước:

  • Qwen 3.7-Max: $2.50 input / $7.50 output cho 1M token.
  • Qwen 3.8-Max: $2.00 input / $6.00 output cho 1M token.

Đây là mức giảm 20% ở cả input và output, trong khi model mới có ngữ cảnh lớn hơn, hỗ trợ đa phương thức và các cải tiến cho tác vụ agent.

Tuy nhiên, Qwen 3.7-Max đang có khuyến mãi 50%, đưa giá xuống $1.25 input / $3.75 output. Trong thời gian khuyến mãi, model cũ có thể phù hợp hơn nếu workload của bạn không cần ngữ cảnh 1M token hoặc các khả năng mới của Qwen 3.8-Max.

Nếu cần tối ưu chi phí hơn nữa, Qwen 3.7-Plus có giá niêm yết $0.40 input / $1.60 output, kèm chương trình khuyến mãi 20% tại thời điểm được đề cập.

Token suy nghĩ được tính phí như token đầu ra

Đây là phần cần kiểm tra kỹ trước khi ước tính ngân sách.

Qwen 3.8-Max hỗ trợ:

reasoning_effort: xhigh | medium | low
Enter fullscreen mode Exit fullscreen mode

Mức mặc định là xhigh. Khi reasoning được bật, model tạo token suy luận nội bộ trước khi trả về câu trả lời cuối. Các token này được tính theo giá output: 6 USD/1M token.

Ví dụ, response hiển thị cho người dùng chỉ dài 800 token, nhưng model có thể tạo thêm vài nghìn token suy nghĩ. Vì vậy, không nên tính chi phí chỉ bằng số token nhìn thấy trong nội dung trả về.

Cách giảm chi phí reasoning

  1. Dùng medium hoặc low cho tác vụ đơn giản:

    • Phân loại.
    • Trích xuất dữ liệu.
    • Chuẩn hóa/định dạng JSON.
    • Tóm tắt ngắn.
  2. Giữ xhigh cho tác vụ cần suy luận sâu:

    • Lập kế hoạch nhiều bước.
    • Phân tích code phức tạp.
    • Agent gọi tool nhiều vòng.
    • Giải bài toán nhiều ràng buộc.
  3. Đọc trường usage trong mọi response và lưu lại theo loại tác vụ.

Ví dụ payload:

{
  "model": "qwen3.8-max",
  "reasoning_effort": "medium",
  "messages": [
    {
      "role": "user",
      "content": "Trích xuất các trường quan trọng từ tài liệu này."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Context cache: cache hit chỉ bằng 10% giá input

Nếu ứng dụng gửi lại cùng một tiền tố prompt nhiều lần, context cache có thể giảm chi phí đáng kể.

Các mức giá:

  • Cache hit: $0.20/1M token, bằng 10% giá input thông thường.
  • Tạo cache rõ ràng: $2.50/1M token, bằng 125% giá input thông thường.

Nói cách khác:

  • Input thông thường: $2.00/1M.
  • Ghi cache: $2.50/1M.
  • Đọc từ cache: $0.20/1M.

Cache phù hợp cho các phần lặp lại giữa nhiều request:

  • System prompt dài.
  • Tài liệu sản phẩm ổn định.
  • Tool definitions.
  • Schema API.
  • Hướng dẫn agent.
  • Policy hoặc knowledge base dùng lại nhiều lần.

Công thức hòa vốn

Bạn trả thêm 25% khi tạo cache, nhưng các lần đọc sau tiết kiệm 90%.

Vì vậy, nếu một tiền tố được tái sử dụng từ hai lần trở lên, cache thường đã có lợi về chi phí.

Hạn mức miễn phí: 1M token, Singapore, 90 ngày

Model Studio có hạn mức miễn phí cho qwen3.8-max, với các điều kiện:

  • Dung lượng: 1M token.
  • Khu vực: chỉ Singapore.
  • Endpoint:
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
Enter fullscreen mode Exit fullscreen mode
  • Thời hạn: 90 ngày kể từ ngày kích hoạt.

Hạn mức này không áp dụng cho Bắc Kinh hoặc US-Virginia. Token suy nghĩ cũng bị trừ vào quota như token output thông thường.

Nếu mục tiêu của bạn là thử model với chi phí thấp nhất, xem thêm bài cách sử dụng Qwen 3.8 miễn phí.

So sánh giá Qwen 3.8-Max với các model khác

Model Input/1M token Output/1M token Ghi chú
Qwen 3.8-Max $2.00 $6.00 Cố định đến 1M context; cache hit 10%
Qwen 3.7-Max $2.50 $7.50 Khuyến mãi 50%: $1.25/$3.75
Qwen 3.7-Plus $0.40 $1.60 Khuyến mãi 20%
Kimi K3 $3.00 $15.00 Cache hit $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

Cách đọc bảng:

  • So với Kimi K3, Qwen 3.8-Max rẻ hơn khoảng một phần ba ở input và rẻ hơn 60% ở output. Cache hit cũng thấp hơn: $0.20 so với $0.30. Xem thêm hướng dẫn API Kimi K3.
  • So với Claude Opus 5, Qwen rẻ hơn 60% ở input và 76% ở output.
  • So với GPT-5.6 Terra, input có cùng giá $2/1M token, nhưng output của Qwen chỉ bằng một nửa.

Giá không phản ánh toàn bộ chất lượng hoặc mức độ phù hợp với workload. Tuy nhiên, xét riêng giá niêm yết, Qwen 3.8-Max có mức giá thấp trong nhóm model flagship được liệt kê.

Ví dụ tính chi phí thực tế

Ví dụ 1: một phiên agent 50K token

Giả sử một phiên agent dùng:

  • 38.000 token input.
  • 12.000 token output hiển thị.

Tính chi phí:

Input  = 38,000 × $2 / 1,000,000 = $0.076
Output = 12,000 × $6 / 1,000,000 = $0.072
Tổng   = $0.148
Enter fullscreen mode Exit fullscreen mode

Chi phí xấp xỉ $0.15 mỗi phiên.

Nếu reasoning xhigh phát sinh thêm 8.000 token suy nghĩ:

Output mới = 12,000 + 8,000 = 20,000 token
Output     = 20,000 × $6 / 1,000,000 = $0.12
Tổng       = $0.076 + $0.12 = $0.196
Enter fullscreen mode Exit fullscreen mode

Tổng chi phí tăng lên khoảng $0.20 mỗi phiên. Đây là lý do cần đo usage thực tế theo từng loại tác vụ.

Ví dụ 2: phân tích tài liệu 800K token

Giả sử bạn gửi 800.000 token tài liệu và yêu cầu bản tóm tắt 5.000 token:

Input  = 800,000 × $2 / 1,000,000 = $1.60
Output = 5,000 × $6 / 1,000,000 = $0.03
Tổng   = $1.63
Enter fullscreen mode Exit fullscreen mode

Chi phí xấp xỉ $1.63 cho mỗi lượt chạy.

Với Qwen 3.8-Max, toàn bộ 800K token input vẫn được tính theo cùng mức $2/1M token.

Ví dụ 3: cache system prompt 100K token, 50 request/ngày

Giả sử mỗi request đều gửi lại:

  • 100.000 token system prompt.
  • Tài liệu sản phẩm.
  • Tool definitions.

Không dùng cache:

100,000 × $2 / 1,000,000 = $0.20/request
$0.20 × 50 request = $10.00/ngày
Enter fullscreen mode Exit fullscreen mode

Dùng explicit cache:

Tạo cache:
100,000 × $2.50 / 1,000,000 = $0.25

49 cache hit:
49 × (100,000 × $0.20 / 1,000,000) = $0.98

Tổng/ngày = $0.25 + $0.98 = $1.23
Enter fullscreen mode Exit fullscreen mode

Kết quả: khoảng $1.23/ngày, thay vì $10/ngày, tương đương giảm khoảng 88% chi phí cho phần tiền tố lặp lại.

Quy trình đo và dự báo chi phí

Đừng xây dựng mô hình chi phí chỉ từ giả định. Hãy đo token từ các request đại diện cho production.

Bước 1: xác định nhóm tác vụ

Ví dụ:

  • Chat hỗ trợ khách hàng.
  • Trích xuất dữ liệu.
  • Tóm tắt tài liệu.
  • Agent gọi tool.
  • Phân tích code.
  • RAG với context dài.

Bước 2: kiểm thử mỗi nhóm với nhiều mức reasoning

Gửi cùng một loại request với:

reasoning_effort: low
reasoning_effort: medium
reasoning_effort: xhigh
Enter fullscreen mode Exit fullscreen mode

Bước 3: lưu usage thực tế

Theo dõi số token input, output và reasoning trong trường usage của response.

Bước 4: tính trung bình theo workload

Dùng công thức:

chi phí trung bình/request =
(avg_input_tokens × $2 / 1,000,000) +
(avg_output_tokens × $6 / 1,000,000)
Enter fullscreen mode Exit fullscreen mode

Bước 5: nhân với lưu lượng dự kiến

chi phí tháng =
chi phí trung bình/request × request/ngày × số ngày
Enter fullscreen mode Exit fullscreen mode

Trong Apidog, bạn có thể lưu các base URL theo environment, chạy cùng request với các mức reasoning_effort khác nhau và kiểm tra token usage trực tiếp trong response. Bạn cũng có thể A/B test cùng prompt với qwen3.7-max hoặc Kimi K3 trong một workspace.

Tải Apidog để kiểm thử request và tạo số liệu chi phí dựa trên dữ liệu thực tế.

Kết luận

Qwen 3.8-Max có giá niêm yết $2/1M token input và $6/1M token output, cố định trên toàn bộ cửa sổ ngữ cảnh 1M token. Mức giá này thấp hơn giá niêm yết của Qwen 3.7-Max, bằng một nửa giá output của GPT-5.6 Terra và thấp hơn đáng kể so với Claude Opus 5.

Để kiểm soát chi phí khi triển khai:

  1. Đo usage từ request thực tế.
  2. Chọn reasoning_effort theo độ khó của tác vụ.
  3. Dùng cache cho prompt hoặc context lặp lại.
  4. Không lập ngân sách dài hạn dựa trên giá khuyến mãi.
  5. Kiểm tra khu vực endpoint nếu dùng hạn mức miễn phí.

Các câu hỏi thường gặp

Qwen 3.8 có tốn nhiều chi phí hơn cho prompt dài không?

Không. Bảng giá chính thức liệt kê một mức giá từ 0 đến 1M token. Prompt 900K token vẫn dùng giá input $2/1M token, không tăng tier theo độ dài context.

Điều này khác với các model có pricing theo tier, bao gồm một số model trong danh sách model của Model Studio.

Token suy nghĩ có tốn thêm chi phí trên Qwen 3.8 không?

Không có giá riêng cho thinking mode. Tuy nhiên, token suy nghĩ được tính là token output ở mức $6/1M token. Vì reasoning_effort mặc định là xhigh, request cần suy luận sâu có thể tốn nhiều hơn dự đoán dựa trên nội dung hiển thị.

Hãy giảm reasoning_effort cho tác vụ đơn giản và kiểm tra usage trong từng response.

Có thể dùng thử Qwen 3.8 miễn phí không?

Có. Model Studio có hạn mức miễn phí 1M token trong 90 ngày, chỉ áp dụng trên endpoint Singapore. Qwen Chat cũng cung cấp quyền truy cập miễn phí qua trình duyệt.

Xem chi tiết trong bài cách sử dụng Qwen 3.8 miễn phí.

Chương trình “giá xem trước 10%” còn khả dụng không?

Không. Đây là chương trình khuyến mãi trong giai đoạn preview được nhắc đến vào tháng 7 năm 2026. Khi phát hành rộng rãi, model chuyển sang giá tiêu chuẩn $2 input / $6 output. Hãy dùng trang giá Model Studio làm nguồn tham khảo chính.

Top comments (0)