DEV Community

Cover image for Cách sử dụng Claude Opus 5 miễn phí?
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

Cách sử dụng Claude Opus 5 miễn phí?

Anthropic ra mắt Claude Opus 5 vào ngày 24 tháng 7 năm 2026. Câu trả lời ngắn cho “tôi có thể sử dụng miễn phí không?” có hai phần: trong ứng dụng Claude, có nếu bạn dùng gói trả phí; qua API, không có quyền truy cập miễn phí không giới hạn vào claude-opus-5. Opus 5 là mô hình mặc định cho người dùng Max và là mô hình hiệu suất cao nhất dành cho người dùng Pro.

Dùng thử Apidog ngay hôm nay

Qua API, Opus 5 có giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra, tương đương Opus 4.8 và bằng một nửa mức 10 USD / 50 USD của Fable 5. Bạn có thể giảm đáng kể chi phí thực tế bằng Batch API, prompt caching và cấu hình mức nỗ lực. Khi bắt đầu gọi API, Apidog giúp bạn gửi, lưu và so sánh request.

Để xem thông số kỹ thuật, đọc Claude Opus 5 là gì. Bài đăng ra mắt Opus 5 của Anthropic chứa thông báo chính thức, còn tổng quan mô hình cung cấp model ID và bảng khả dụng.

Một điểm cần phân biệt:

  • Miễn phí trong ứng dụng Claude: quyền dùng mô hình nằm trong gói đăng ký, nhưng vẫn chịu giới hạn sử dụng.
  • Miễn phí qua API: thường là tín dụng dùng thử hoặc khuyến mãi có số dư hữu hạn.

Cách miễn phí 1: Dùng gói đăng ký Claude

Tài liệu ra mắt của Anthropic nêu hai gói tiêu dùng có Opus 5:

  • Max: Opus 5 là mô hình mặc định, không cần thay đổi cấu hình.
  • Pro: Opus 5 là mô hình hiệu suất cao nhất có trên gói này.

Tài liệu không xác nhận gói Claude miễn phí có quyền truy cập Opus 5. Trước khi xây dựng quy trình phụ thuộc vào nó, hãy kiểm tra trực tiếp model selector trong tài khoản của bạn.

Opus 5 cũng xuất hiện trong Claude Code, Claude Cowork và GitHub Copilot. Nếu bạn đã trả phí cho một trong các bề mặt này, gói hiện có có thể đã bao gồm mô hình. Tuy nhiên, hãy theo dõi hạn mức vì Opus 5 có thể tiêu thụ nhanh hơn 4.8 do:

  • Chế độ suy nghĩ được bật mặc định.
  • Phản hồi thường dài hơn.
  • Mô hình dễ ủy quyền tác vụ cho tác nhân phụ hơn.

Xem cách sử dụng Claude Opus 5 trong Claude Code để kiểm soát mức tiêu thụ, hoặc tham khảo cách sử dụng Claude Opus 4.8 miễn phí cho các lựa chọn ở thế hệ trước.

Cách miễn phí 2: Tín dụng dùng thử API và khuyến mãi đám mây

Model ID chính xác trên Claude API là:

claude-opus-5
Enter fullscreen mode Exit fullscreen mode

API được tính phí theo usage, nhưng bạn có thể bắt đầu mà không trả trước trong hai trường hợp:

  • Tín dụng tài khoản API Anthropic mới: tài khoản mới thường có một lượng tín dụng nhỏ để xác nhận tích hợp và đo lường token.
  • Tín dụng khuyến mãi trên cloud: Opus 5 có mặt trên Amazon Bedrock với ID anthropic.claude-opus-5, Claude Platform trên AWS, Google Cloud và Microsoft Foundry. Các nền tảng này có thể cấp tín dụng khuyến mãi cho tài khoản mới.

Đừng dùng tín dụng thử nghiệm cho lưu lượng production. Thay vào đó:

  1. Chạy prompt thực tế của bạn.
  2. Lưu response.
  3. Đọc khối usage.
  4. Tính chi phí theo từng tác vụ trước khi nạp tiền.

Kiểm tra bảng giá mới nhất trong tài liệu giá của Anthropic.

Lưu ý: Chế độ suy nghĩ được bật mặc định trên Opus 5. Một request từ Opus 4.8 không có trường thinking có thể chạy không suy nghĩ, nhưng request tương tự trên Opus 5 chạy chế độ suy nghĩ thích ứng. Token suy nghĩ bị tính như token đầu ra, với giá 25 USD mỗi triệu token.

Nếu di chuyển test suite từ 4.8 sang 5, hãy đo lại chi phí. Xem thêm các điểm cần kiểm tra trong bài di chuyển từ Opus 4.8 sang Opus 5.

Không có API miễn phí không giới hạn

Không có gói Claude API miễn phí nào cung cấp request claude-opus-5 không giới hạn. Proxy, nhóm API key hoặc đại lý hứa hẹn quyền truy cập miễn phí thường:

  • Vi phạm điều khoản của Anthropic.
  • Có thể bị thu hồi bất kỳ lúc nào.
  • Định tuyến prompt qua hạ tầng bạn không kiểm soát.

Khi tín dụng thử nghiệm hoặc khuyến mãi hết, bạn phải trả theo token hoặc dừng sử dụng API. Phần còn lại tập trung vào cách giảm chi phí hợp pháp.

Cách trả phí rẻ nhất

Giá cơ bản là 5 USD đầu vào và 25 USD đầu ra trên mỗi triệu token. Các đòn bẩy dưới đây có tác động trực tiếp đến hóa đơn.

Đòn bẩy 1: Dùng Batch API để giảm 50%

Các tác vụ không cần phản hồi trong vài giây nên chạy qua Batch API. Batch xử lý không đồng bộ với giá:

  • 2,50 USD / triệu token đầu vào
  • 12,50 USD / triệu token đầu ra

Đây là đúng bằng một nửa giá tiêu chuẩn, không thay đổi chất lượng mô hình.

Batch API phù hợp cho:

  • Chạy evaluation hàng đêm.
  • Xử lý tài liệu hàng loạt.
  • Backfill phân loại.
  • Regression test.
  • Pipeline tạo nội dung.

Batch cũng hỗ trợ tới 300.000 token đầu ra mỗi request với beta header:

output-300k-2026-03-24
Enter fullscreen mode Exit fullscreen mode

Trong khi Messages API tiêu chuẩn hỗ trợ 128.000 token đầu ra. Đổi lại, bạn phải chấp nhận độ trễ và không thể dùng chế độ nhanh với Batch API.

Đòn bẩy 2: Hạ output_config.effort

Opus 5 hỗ trợ output_config.effort để đánh đổi giữa chi phí và khả năng. Mặc định là high.

{
  "output_config": {
    "effort": "low"
  }
}
Enter fullscreen mode Exit fullscreen mode

Mức nỗ lực thấp hơn tạo ít token suy nghĩ hơn. Vì token suy nghĩ được tính phí như token đầu ra, effort là một trong các cấu hình ảnh hưởng trực tiếp nhất đến chi phí.

Anthropic cho biết lowmedium trên Opus 5 mạnh hơn đáng kể so với các mô hình Opus trước đó. Đừng giả định cấu hình tốt nhất từ Opus 4.8 vẫn đúng; hãy chạy evaluation lại với workload của bạn.

Khi tối ưu, lưu ý hai điểm:

  • Giảm effort không tự rút ngắn output hiển thị. Nếu cần câu trả lời ngắn, hãy ghi rõ trong prompt, ví dụ: “Trả lời tối đa 3 gạch đầu dòng.”
  • Không tắt thinking chỉ để giảm chi phí. Kết hợp thinking: {type: "disabled"} với xhigh hoặc max sẽ trả về lỗi HTTP 400.

Anthropic khuyến nghị giữ thinking và giảm effort. Khi tắt thinking, Opus 5 đôi khi có thể viết tool call dưới dạng văn bản thường thay vì thực thi, hoặc để lộ thẻ XML nội bộ trong output.

Xem chi tiết từng cấp độ trong bài tham số mức nỗ lực của Claude Opus 5.

Đòn bẩy 3: Bật prompt caching từ 512 token

Cache hit có giá 0,50 USD mỗi triệu token, bằng một phần mười giá input tiêu chuẩn.

  • Ghi cache 5 phút: 6,25 USD / triệu token.
  • Ghi cache 1 giờ: 10 USD / triệu token.
  • Đọc cache: 0,50 USD / triệu token.

Với Opus 5, prefix tối thiểu có thể cache đã giảm từ 1.024 xuống 512 token. Các system prompt hoặc tài liệu tham chiếu trước đây quá ngắn để cache giờ có thể dùng được.

Ví dụ, một request có:

  • 40.000 token prefix ổn định.
  • 10.000 token input thay đổi.

Chi phí input sẽ gần đúng như sau:

Trường hợp Chi phí input
Không cache: 50.000 token × 5 USD / MTok 0,25 USD
Ghi cache prefix 40.000 token 0,25 USD
Request tiếp theo: 40.000 token cache + 10.000 token mới 0,07 USD

Lượt đầu trả chi phí ghi cache. Các lượt sau giảm input từ 0,25 USD xuống 0,07 USD.

Để xác minh cache đang hoạt động, đọc trường sau trong response:

{
  "usage": {
    "cache_read_input_tokens": 40000
  }
}
Enter fullscreen mode Exit fullscreen mode

Nếu cache_read_input_tokens vẫn bằng 0 ở request lặp lại, hãy kiểm tra vị trí cache breakpoint.

Đòn bẩy 4: Không dùng chế độ nhanh nếu không cần

Chế độ nhanh có giá:

  • 10 USD / triệu token đầu vào
  • 50 USD / triệu token đầu ra

Đó là gấp đôi giá tiêu chuẩn để đổi lấy tốc độ output nhanh hơn khoảng 2,5 lần.

Chế độ này là bản xem trước nghiên cứu, chỉ dùng qua API bên thứ nhất, không có trên Bedrock, Google Cloud hoặc Microsoft Foundry, và không tương thích với Batch API.

Chỉ dùng chế độ nhanh cho UI tương tác nơi người dùng đang chờ token xuất hiện. Với background job, hãy dùng Batch API hoặc mức giá tiêu chuẩn.

Đòn bẩy 5: Không đặt inference_geo nếu không bắt buộc

Cấu hình sau:

{
  "inference_geo": "us"
}
Enter fullscreen mode Exit fullscreen mode

áp dụng hệ số 1,1x cho mọi loại token, tức phụ phí 10% trên toàn bộ hóa đơn.

Chỉ đặt cấu hình này khi có yêu cầu về lưu trú dữ liệu. Nếu không, hãy để mặc định.

Một thay đổi nhỏ khác: system prompt dùng công cụ của Opus 5 thêm 286 token khi tool_choiceauto hoặc none, giảm từ 290 ở Opus 4.8 và thấp hơn nhiều so với 675 ở Opus 4.7. Đây không phải cấu hình để bật/tắt, nhưng việc di chuyển từ 4.7 có thể tự giảm chi phí nền trên mỗi request.

Để xem các cách giảm chi phí áp dụng cho toàn bộ dòng Claude, đọc cắt giảm hóa đơn Claude API của bạn.

So sánh chi phí nhanh

Cấu hình Đầu vào / MTok Đầu ra / MTok Tốt nhất cho
Tiêu chuẩn, mức nỗ lực high $5.00 $25.00 Mặc định tương tác
Batch API $2.50 $12.50 Bất cứ thứ gì không đồng bộ
Lượt truy cập bộ nhớ đệm trên tiền tố ổn định $0.50 Không áp dụng Các cuộc gọi ngữ cảnh dài lặp lại
Chế độ nhanh $10.00 $50.00 Chỉ dành cho các trường hợp cần độ trễ thấp
inference_geo: "us" 1,1x tất cả các loại 1,1x tất cả các loại Yêu cầu về lưu trú dữ liệu

Chiết khấu 50% của Batch API áp dụng cho giá token tiêu chuẩn. Hãy xác minh trên hóa đơn thực tế cách nó tương tác với token cache trước khi xây dựng mô hình tiết kiệm kết hợp. Xem thêm ví dụ trong bài giá của Claude Opus 5.

Kiểm thử cấu hình tiết kiệm trong Apidog

Mỗi đòn bẩy chi phí ở trên đều có thể xác minh từ HTTP response. Bắt đầu bằng request Opus 5 cơ bản:

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 4096,
    "output_config": {"effort": "low"},
    "messages": [
      {"role": "user", "content": "Tóm tắt đặc tả OpenAPI này trong ba câu."}
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Trong Apidog, lưu request POST và đặt API key trong environment variable thay vì dán vào request body hoặc commit vào repository.

Thực hiện các kiểm thử sau:

  1. So sánh effort

    • Nhân bản request.
    • Thử low, mediumhigh.
    • So sánh usage.output_tokens và chất lượng output.
  2. Xác nhận cache hit

    • Gửi hai request có cùng prefix dài.
    • Kiểm tra usage.cache_read_input_tokens ở request thứ hai.
    • Nếu giá trị vẫn là 0, cache breakpoint có thể nằm sai vị trí.
  3. Phát hiện cắt ngắn bởi max_tokens

    • Thinking và output hiển thị dùng chung ngân sách max_tokens.
    • Nếu nhận được stop_reason: "max_tokens", bạn có thể đã trả tiền cho output chưa hoàn chỉnh.
    • Thêm assertion cho trường này vào kiểm thử.
  4. Kiểm tra streaming và tool call

    • Đọc SSE response và tool-call payload.
    • Đây là cách nhanh để tìm vòng lặp agent đang tiêu token vượt dự kiến.

Tải xuống Apidog để thực hành, hoặc xem cách sử dụng Claude Opus 5 API để có hướng dẫn tích hợp đầy đủ.

Opus 5 có phải mô hình phù hợp để tối ưu hóa?

Đôi khi cách giảm chi phí tốt nhất là chọn một model khác.

Sonnet 5 có giá giới thiệu 2 USD / 10 USD, tăng lên 3 USD / 15 USD vào ngày 1 tháng 9 năm 2026, và có cùng cửa sổ ngữ cảnh 1 triệu token. Nếu workload không yêu cầu coding tác tử hoặc suy luận đa bước phức tạp, hãy benchmark Sonnet 5 trước khi tối ưu hóa Opus 5.

Đọc Claude Opus 5 so với Sonnet 5 để xem khi nào phí premium là hợp lý, hoặc cách sử dụng Claude Sonnet 5 miễn phí để xem các phương án miễn phí của Sonnet.

Anthropic tuyên bố Opus 5 có hiệu suất hơn gấp đôi Opus 4.8 trên Frontier-Bench, nằm trong khoảng 0,5% của Fable 5 trên CursorBench 3.2 với giá bằng một nửa, và vượt Fable 5 trên OSWorld 2.0 với chi phí bằng một phần ba. Đây là số liệu do Anthropic công bố, chưa được tái kiểm tra độc lập tính đến ngày 25 tháng 7 năm 2026. Hãy coi chúng là các tuyên bố cần xác minh trên workload của bạn.

Opus 5 cũng không phải cấp cao nhất trong hệ thống Claude. Fable 5 vẫn là mô hình được phát hành rộng rãi có năng lực nhất của Anthropic, còn Mythos 5 vượt Opus 5 ở khai thác an ninh mạng và nghiên cứu sinh học tự động. Xem Claude Fable 5 là gì nếu workload của bạn cần khả năng ở cấp đó.

Chọn con đường phù hợp

Mục tiêu Cách thức Hạn chế
Trò chuyện, viết lách, nghiên cứu Đăng ký Claude Pro hoặc Max Giới hạn sử dụng; Opus 5 tiêu thụ nhanh hơn 4.8
Mã hóa tác tử Claude Code trên gói trả phí Output dài hơn và ủy quyền tác nhân phụ làm hao hụt hạn mức
Tạo mẫu tích hợp Tín dụng dùng thử API hoặc khuyến mãi cloud Số dư sẽ hết, sau đó trả theo token
API production rẻ nhất Batch API + cache + effort low Batch thêm độ trễ; cache cần prefix ổn định
API tương tác rẻ nhất Giá tiêu chuẩn + cache + effort theo tác vụ Không có chiết khấu theo batch

Câu hỏi thường gặp

Claude Opus 5 có miễn phí không?

Không qua API. Trong ứng dụng Claude, Opus 5 đi kèm các gói trả phí: mặc định ở Max và là mô hình hiệu suất cao nhất ở Pro. Tài liệu ra mắt không xác nhận gói miễn phí có Opus 5.

Tôi có thể truy cập Claude Opus 5 API miễn phí không?

Chỉ thông qua tín dụng dùng thử tài khoản mới hoặc tín dụng khuyến mãi trên Amazon Bedrock, Google Cloud hoặc Microsoft Foundry. Tất cả đều có số dư giới hạn.

Cách hợp pháp rẻ nhất để chạy Opus 5 số lượng lớn là gì?

Dùng Batch API với giá 2,50 USD / 12,50 USD, kết hợp cache cho prefix ổn định trên 512 token và thử low hoặc medium nếu evaluation cho phép. Không dùng chế độ nhanh và không đặt inference_geo nếu không có yêu cầu lưu trú dữ liệu.

Tôi có nên tắt thinking để tiết kiệm token không?

Không. Tắt thinking kết hợp với xhigh hoặc max sẽ trả về lỗi 400. Anthropic khuyến nghị giữ thinking và giảm effort. Hãy đo chi phí thực tế bằng khối usage, đồng thời dùng request đã lưu trong Apidog để thêm assertion và phát hiện suy thoái tự động.

Top comments (0)