DEV Community

Cover image for OpenAI Giảm Sốc Giá API GPT-5.6: Luna Rẻ Hơn 80%, Terra Rẻ Hơn 20% (Chi Tiết Bảng Giá Mới)
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

OpenAI Giảm Sốc Giá API GPT-5.6: Luna Rẻ Hơn 80%, Terra Rẻ Hơn 20% (Chi Tiết Bảng Giá Mới)

OpenAI đã giảm giá API cho hai trong ba mô hình GPT-5.6 vào ngày 30 tháng 7 năm 2026. GPT-5.6 Luna hiện rẻ hơn 80%, còn 0,20 USD cho mỗi triệu token đầu vào và 1,20 USD cho mỗi triệu token đầu ra. GPT-5.6 Terra giảm 20%, còn 2 USD đầu vào và 12 USD đầu ra. GPT-5.6 Sol — mô hình suy luận cao cấp — vẫn giữ mức 5 USD và 30 USD, đồng thời có chế độ Fast mới: nhanh hơn 2,5 lần với giá gấp đôi mức tiêu chuẩn.

Dùng thử Apidog ngay hôm nay

Nếu mô hình chi phí của bạn vẫn dựa trên giá GPT-5.6 vào ngày ra mắt, hãy cập nhật ngay. Bài viết này trình bày bảng giá mới, tác động đến định tuyến API và quy trình kiểm tra chi phí bằng lưu lượng truy cập thực tế. Để so sánh nhanh, bạn có thể dùng Apidog gửi cùng một prompt tới Sol, Terra và Luna, sau đó đối chiếu token usage và chất lượng phản hồi.

Bảng giá GPT-5.6 mới

Bảng dưới đây tính theo mỗi triệu token.

Mô hình Đầu vào cũ Đầu vào mới Đầu ra cũ Đầu ra mới Thay đổi
GPT-5.6 Sol $5.00 $5.00 $30.00 $30.00 Không thay đổi
GPT-5.6 Terra $2.50 $2.00 $15.00 $12.00 -20%
GPT-5.6 Luna $1.00 $0.20 $6.00 $1.20 -80%

Giá mới có hiệu lực từ ngày 30 tháng 7 năm 2026 và áp dụng cho API tiêu chuẩn. So với ngày 9 tháng 7, khi ra mắt rộng rãi, chênh lệch giữa mô hình đắt nhất và rẻ nhất đã tăng từ 5 lần lên 25 lần.

Điều này ảnh hưởng trực tiếp đến định tuyến:

  • Chọn Luna thay vì Sol hiện có thể giảm khoảng 96% chi phí giá niêm yết.
  • Terra vẫn phù hợp cho các tác vụ cần chất lượng cao hơn Luna nhưng không cần suy luận cấp Sol.
  • Sol nên được dành cho các luồng công việc thực sự cần khả năng suy luận cao cấp hoặc độ trễ thấp.

Ưu đãi bộ nhớ đệm prompt vẫn áp dụng ngoài bảng giá trên. Tuy nhiên, OpenAI chưa công bố mức giá đầu vào được cache riêng cho Luna và Terra trong thông báo này. Trước khi cập nhật dự báo phụ thuộc vào cache hit rate, hãy kiểm tra trang giá chính thức.

Điều gì thay đổi với GPT-5.6 Sol?

Giá niêm yết tiêu chuẩn của Sol không đổi, nhưng tùy chọn tốc độ đã thay đổi.

OpenAI giới thiệu chế độ Fast cho Sol:

  • Tốc độ tạo token nhanh hơn 2,5 lần.
  • Giá gấp đôi mức tiêu chuẩn.
  • Thay thế gói Xử lý ưu tiên trước đây.

Nếu production traffic của bạn đang dùng Xử lý ưu tiên, hãy kiểm tra cấu hình và cập nhật quy trình theo dõi billing. Về mặt kiến trúc, Sol giờ được phân tầng theo độ trễ thay vì giảm giá:

  • Dùng Sol tiêu chuẩn khi chất lượng suy luận là ưu tiên và độ trễ chấp nhận được.
  • Dùng Sol Fast khi cần phản hồi tương tác nhanh và ngân sách cho phép.
  • Định tuyến xuống Terra hoặc Luna khi tác vụ không cần năng lực của Sol.

Tại sao OpenAI giảm giá?

OpenAI cho biết việc giảm giá đến từ hiệu quả vận hành cao hơn, gồm:

  • Cải thiện định tuyến phần cứng trên hệ thống suy luận.
  • Phần mềm suy luận production tốt hơn.
  • Thuật toán cache ngữ cảnh thông minh hơn.
  • Các serving kernel được GPT-5.6 Sol tự viết lại.

Theo thông báo, Sol đã tự động viết lại serving kernel, giúp giảm 20% chi phí phục vụ đầu cuối và tăng hơn 15% hiệu quả tạo token. Điều này tạo điều kiện để OpenAI giảm giá Luna 80% mà vẫn bảo vệ biên lợi nhuận.

Yếu tố cạnh tranh cũng rõ ràng. VentureBeat đánh giá đây là phản ứng trước các gói Flash của Google. Giá niêm yết kết hợp đầu vào và đầu ra của Luna hiện là 1,40 USD cho mỗi triệu token, thấp hơn:

Tuy nhiên, không nên chọn model chỉ dựa trên giá niêm yết. Chi phí thực tế còn phụ thuộc vào token đầu ra, retry rate, cache hit rate và chất lượng cần đạt.

Tác động đến khối lượng công việc của bạn

Việc Luna giảm 80% có thể thay đổi quyết định kiến trúc, đặc biệt với workload có lưu lượng lớn.

1. Agent loop rẻ hơn đáng kể

Agent loop thường tạo nhiều token qua các bước lập kế hoạch, gọi công cụ, đọc kết quả và thử lại. Với mức giá mới của Luna, đây có thể là model mặc định để thử nghiệm hoặc chạy các luồng agent không yêu cầu suy luận cấp Sol.

Khi đánh giá agent, đừng chỉ đo token của một request. Hãy đo toàn bộ chuỗi:

Tổng chi phí tác vụ
= token đầu vào của mọi bước × giá input
+ token đầu ra của mọi bước × giá output
+ chi phí của các lần retry
Enter fullscreen mode Exit fullscreen mode

2. Phân loại, trích xuất và tóm tắt nên được đánh giá lại trên Luna

Các tác vụ như phân loại, trích xuất dữ liệu có cấu trúc và tóm tắt thường là ứng viên tốt để chuyển xuống model rẻ hơn.

Nếu bạn đang dùng Terra cho các tác vụ này, hãy chạy lại eval thay vì giả định Luna không đủ tốt. Chất lượng model không đổi, nhưng cấu trúc chi phí đã thay đổi mạnh.

Ví dụ, nếu một workload trước đây tốn khoảng 100 USD/ngày trên Terra, thì với mức giá mới, chi phí trên Luna có thể giảm xuống khoảng 11 USD/ngày — với điều kiện token usage và chất lượng đầu ra tương đương yêu cầu của bạn.

3. Terra vẫn là lựa chọn mặc định hợp lý

Phân tích Sol, Terra và Luna vẫn khuyến nghị Terra làm lựa chọn cân bằng cho công việc hàng ngày. Với mức giảm 20%, lựa chọn này càng dễ bảo vệ hơn khi bạn cần chất lượng cao hơn Luna nhưng không muốn trả giá Sol.

4. Mức độ nỗ lực vẫn quyết định hóa đơn

GPT-5.6 có sáu cấp độ nỗ lực suy luận. Nỗ lực cao hơn thường tạo nhiều token đầu ra hơn, trong khi output token là phần đắt hơn ở mọi gói.

Trước khi đổi model, hãy kiểm tra cả cấu hình nỗ lực:

Model routing = model ID + effort level + giới hạn output token
Enter fullscreen mode Exit fullscreen mode

Giảm giá model không khắc phục được một cấu hình effort quá cao hoặc max_output_tokens không được kiểm soát.

Cách kiểm tra lại số liệu của bạn

Không nên chỉ áp dụng phần trăm giảm giá vào hóa đơn cũ. Hãy đo prompt và response thực tế của hệ thống.

Quy trình kiểm tra

  1. Lấy một mẫu prompt đại diện từ production.
  2. Gửi cùng một request tới gpt-5.6-luna, gpt-5.6-terragpt-5.6-sol.
  3. Lưu output, độ trễ và trường usage của từng response.
  4. Chấm chất lượng bằng bộ eval nội bộ.
  5. Tính chi phí theo giá mới.
  6. Cập nhật rule định tuyến dựa trên chất lượng, chi phí và latency.

Bạn có thể dùng công thức sau:

Chi phí request
= (input_tokens / 1_000_000 × giá input)
+ (output_tokens / 1_000_000 × giá output)
Enter fullscreen mode Exit fullscreen mode

Ví dụ dữ liệu nên lưu cho mỗi lần chạy:

{
  "model": "gpt-5.6-luna",
  "input_tokens": 1200,
  "output_tokens": 450,
  "latency_ms": 980,
  "eval_score": 0.91
}
Enter fullscreen mode Exit fullscreen mode

Apidog giúp bạn thực hiện bước so sánh này nhanh hơn: định nghĩa endpoint chat completion một lần, dùng biến môi trường để đổi model ID, rồi chạy cùng một test scenario trên cả ba model. Trình xem response hiển thị khối usage, giúp bạn lấy số token đầu vào và đầu ra thực tế thay vì ước tính.

Nếu đây là lần đầu bạn tích hợp GPT-5.6, hãy xem hướng dẫn sử dụng API GPT-5.6 để kiểm tra xác thực, model ID và cấu trúc request. Bạn cũng có thể mô phỏng endpoint trong giai đoạn chờ phê duyệt ngân sách, sau đó chuyển sang traffic trực tiếp mà không cần viết lại test. Tải Apidog miễn phí để bắt đầu chạy so sánh.

Bức tranh lớn hơn: cuộc chiến giá vẫn tiếp diễn

Đây là đợt giảm giá lớn thứ ba ở phân khúc giá rẻ trong mùa hè này. Google đã làm mới gói Flash vào tháng 7, Anthropic ra mắt Claude Opus 5 với giá bằng một nửa Fable 5, và OpenAI hiện định giá Luna thấp hơn các lựa chọn Gemini Flash được nêu ở trên.

Chất lượng model vẫn phân biệt các sản phẩm cao cấp, nhưng với tác vụ batch, giá đang trở thành một biến số quyết định. Vì vậy, lựa chọn model không nên là quyết định làm một lần mỗi năm.

Hãy thiết kế tích hợp theo hướng:

  • Model ID là biến cấu hình, không hard-code trong business logic.
  • Có bộ eval chuẩn cho từng loại tác vụ.
  • Theo dõi token usage, latency và tỷ lệ lỗi theo model.
  • Chạy lại benchmark sau mỗi lần nhà cung cấp thay đổi giá hoặc model.

Ví dụ cấu hình đơn giản:

{
  "routing": {
    "classification": "gpt-5.6-luna",
    "summarization": "gpt-5.6-terra",
    "complex_reasoning": "gpt-5.6-sol"
  }
}
Enter fullscreen mode Exit fullscreen mode

Cách tiếp cận này giúp đội ngũ thay đổi routing trong vài ngày khi giá biến động, thay vì chờ một chu kỳ lập kế hoạch mới.

Câu hỏi thường gặp

Giá API GPT-5.6 mới là bao nhiêu?

Từ ngày 30 tháng 7 năm 2026:

  • Luna: 0,20 USD cho mỗi triệu input token và 1,20 USD cho mỗi triệu output token.
  • Terra: 2 USD input và 12 USD output.
  • Sol: không đổi, 5 USD input và 30 USD output.

Sol cũng có chế độ Fast với giá gấp đôi để đạt tốc độ xử lý nhanh hơn 2,5 lần.

GPT-5.6 Sol có được giảm giá không?

Không. Giá tiêu chuẩn của Sol không đổi. Thay đổi chính là chế độ Fast mới thay thế Xử lý ưu tiên, với mức giá gấp đôi để đổi lấy tốc độ nhanh hơn 2,5 lần.

GPT-5.6 Luna giờ có rẻ hơn Gemini Flash không?

Xét theo giá niêm yết kết hợp input và output, có. Luna là 1,40 USD cho mỗi triệu token, so với 2,80 USD của Gemini 3.5 Flash-Lite và 9 USD của Gemini 3.6 Flash.

Tuy nhiên, giá không đồng nghĩa với chất lượng. Hãy chạy cả hai trên bộ eval của riêng bạn trước khi chuyển đổi. Nếu muốn thử trước, hãy xem cách sử dụng GPT-5.6 miễn phí.

Việc giảm giá có tự động áp dụng không?

Có. Giá mới áp dụng cho API tiêu chuẩn từ ngày 30 tháng 7 năm 2026 mà không yêu cầu thay đổi mã.

Bạn chỉ cần hành động nếu đang sử dụng Xử lý ưu tiên trên Sol, vì gói này được thay thế bằng chế độ Fast.

Những việc cần làm trong tuần này

  1. Cập nhật mô hình chi phí bằng bảng giá mới.
  2. Chạy lại eval cho các workload hiện dùng Terra nhưng có thể chuyển sang Luna.
  3. Kiểm tra các rule định tuyến có ngưỡng chi phí dựa trên giá cũ.
  4. Rà soát các luồng dùng Xử lý ưu tiên trên Sol.
  5. Đo token usage, chất lượng và latency trên traffic thực tế.
  6. Đưa model ID vào cấu hình để thay đổi routing mà không cần sửa business logic.

Thay vì chỉ tính giá niêm yết, hãy chạy một test scenario trong Apidog với ba model ID và so sánh dữ liệu usage. Đó là cách nhanh nhất để xác định chính xác đợt giảm giá này ảnh hưởng thế nào đến hệ thống của bạn.

Top comments (0)