Claude Haiku 5.5 và GPT-6 Luna có cùng giá niêm yết ở cấp cơ bản: $0.10/$0.50 cho mỗi triệu token đầu vào/đầu ra, áp dụng cho lời nhắc Haiku đến 100K token và Luna đến 272K token. Cả hai cũng tính $0.01 cho mỗi lần đọc bộ nhớ đệm và $0.125 cho mỗi lần ghi bộ nhớ đệm. Khác biệt xuất hiện khi vượt ngưỡng: Haiku 5.5 chuyển sang $0.50/$2.50 trên 100K token, còn Luna giữ giá cơ bản đến 272K token, sau đó tính $0.20 đầu vào và $0.75 đầu ra. Trong bảng ra mắt của Anthropic, Haiku 5.5 đạt điểm cao hơn ở các hàng chung; trong biểu đồ chi phí, Luna thường rẻ hơn cho mỗi tác vụ.
Bài viết này tập trung vào cách chọn và kiểm thử mô hình trong pipeline thực tế: so sánh giá, ngưỡng token, thông số API, điểm chuẩn, chi phí theo mức nỗ lực và cách chạy A/B test. Xem thêm Claude Haiku 5.5 là gì và GPT-6 Luna là gì.
Giá so sánh
| Mỗi 1 triệu token | Claude Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| Đầu vào, cấp cơ bản | $0.10, lời nhắc đến 100K token | $0.10, đến 272K token đầu vào |
| Đầu ra, cấp cơ bản | $0.50 | $0.50 |
| Đọc bộ nhớ đệm, cấp cơ bản | $0.01 | $0.01 |
| Ghi bộ nhớ đệm, cấp cơ bản | $0.125, TTL 5 phút | $0.125 |
| Cấp cao hơn, đầu vào / đầu ra | $0.50 / $2.50, trên 100K | $0.20 / $0.75, trên 272K |
| Cấp cao hơn, đọc / ghi bộ nhớ đệm | $0.05 / $0.625 | Giá bộ nhớ đệm gấp 2 lần |
| Xử lý hàng loạt | $0.05 / $0.25 đến 100K; $0.25 / $1.25 trên ngưỡng | 50% giá tiêu chuẩn cho Xử lý hàng loạt và Linh hoạt |
Nguồn: tài liệu giá Anthropic và trang mô hình GPT-6 Luna của OpenAI.
OpenAI định giá lại toàn bộ yêu cầu khi đầu vào vượt 272K token. Anthropic cho biết lời nhắc dài hơn 100.000 token phải dùng mức giá cao hơn, được xác định theo độ dài lời nhắc của từng yêu cầu.
Cách ước tính chi phí nhanh
Dưới 100K token, hóa đơn của hai mô hình khớp từng dòng. Từ 100K đến 272K, Haiku 5.5 đắt gấp 5 lần Luna ở cả token đầu vào và đầu ra. Trên 272K, cả hai dùng mức giá cao hơn nhưng Luna vẫn rẻ hơn.
Ví dụ, tính bằng token riêng của từng nhà cung cấp:
-
Lời nhắc 150K token, đầu ra 2K token
- Haiku 5.5:
0.15 × $0.50 + 0.002 × $2.50 = $0.080 - Luna:
0.15 × $0.10 + 0.002 × $0.50 = $0.016
- Haiku 5.5:
-
Lời nhắc 300K token, đầu ra 2K token
- Haiku 5.5:
0.30 × $0.50 + 0.002 × $2.50 = $0.155 - Luna:
0.30 × $0.20 + 0.002 × $0.75 = $0.0615
- Haiku 5.5:
Anthropic cho biết các lời nhắc đến 100K token chiếm khoảng 90% yêu cầu của Haiku 4.5. Nếu lưu lượng của bạn có phân phối tương tự, phần lớn request sẽ có giá như nhau trên cả hai mô hình. Xem thêm tại giá của Claude Haiku 5.5.
Trình tokenizer thay đổi ngưỡng
Không thể giả định một token của mô hình này tương đương một token của mô hình khác.
Theo Anthropic, tokenizer cập nhật của Haiku 5.5 tạo ra nhiều hơn khoảng 30% token so với Haiku 4.5 cho cùng văn bản. Trong chủ đề ra mắt trên Hacker News, một người bình luận ước tính rằng 100K token Claude hiện đại tương đương khoảng 60–65K token GPT hiện đại. Đây là ước tính cộng đồng, không phải số liệu từ nhà cung cấp.
Để quyết định đúng cho workload của bạn:
- Gửi cùng một tập lời nhắc đại diện đến cả hai API.
- Đọc đối tượng
usagetrong từng response. - Lưu số token đầu vào, đầu ra, token cache và tổng chi phí.
- Kiểm tra tỷ lệ request vượt 100K và 272K token theo tokenizer của từng nhà cung cấp.
Đừng định tuyến chỉ bằng số ký tự hoặc số token ước tính từ một tokenizer khác.
Thông số kỹ thuật
| Claude Haiku 5.5 | GPT-6 Luna | |
|---|---|---|
| ID mô hình API | claude-haiku-5-5 |
gpt-6-luna |
| Cửa sổ ngữ cảnh | 1M token | 1.050.000 token |
| Đầu ra tối đa | 128K token; 300K qua Xử lý hàng loạt với tiêu đề beta | 128.000 token |
| Ngày cắt giảm kiến thức | Tháng 6 năm 2026 | 18 tháng 5 năm 2026 |
| Mức độ nỗ lực | thấp, trung bình, cao, rất cao, tối đa | không, thấp, trung bình, cao, rất cao, tối đa |
| Tắt suy nghĩ |
thinking: {"type": "disabled"} ở mức nỗ lực cao hoặc thấp hơn |
reasoning.effort: "none" |
| Truy cập trò chuyện miễn phí | Người dùng Claude.ai miễn phí có thể chọn | Người dùng miễn phí và Go trong ứng dụng ChatGPT desktop |
Cả hai mặc định ở mức medium:
- Haiku 5.5 dùng
output_config.effort. - Luna dùng
reasoning.effort.
Các tùy chọn chat miễn phí không cung cấp khóa API, vì vậy không thể dùng chúng cho script, CI, agent hoặc backend service. Tham khảo Claude Haiku 5.5 miễn phí và GPT-6 Luna miễn phí.
Lưu ý về cache trong vòng lặp agent
Đây là khác biệt quan trọng khi request lặp lại:
- Với Haiku 5.5, thay đổi
effortcấp cao nhất giữa các request làm mất hiệu lực cache lời nhắc. - OpenAI cho biết thay đổi mức nỗ lực suy luận không còn làm hỏng cache trên các mô hình GPT-6.
Nếu agent của bạn thay đổi effort động theo từng bước, hãy đo cache hit rate trước khi chọn Haiku 5.5. Xem thêm: Bộ nhớ đệm lời nhắc GPT-6.
Điểm chuẩn: nguồn dữ liệu và đơn vị thực hiện
Các số liệu dưới đây lấy từ bài đăng ra mắt của Anthropic và system card của họ. Anthropic tổng hợp bảng, nhưng không phải mọi hàng đều do cùng một bên chạy. Kết quả Haiku 5.5 dùng mức nỗ lực tối đa và chủ yếu là trung bình của năm lần thử.
| Điểm chuẩn | Haiku 5.5 | GPT-6 Luna | Cách lấy số liệu Luna |
|---|---|---|---|
| GDPval-AA v2.1, Elo | 1620 | 1437 | Artificial Analysis thực hiện độc lập |
| AA-Briefcase v1.1, Elo | 1578 | 1336 | Artificial Analysis thực hiện độc lập |
| OSWorld 2.1, tập con ngoại tuyến | 72,4% | 48,9% | Anthropic chạy cùng 82 tác vụ qua API OpenAI |
| Terminal-Bench 4.0 | 39,2% | 16,4% | Bảng xếp hạng công khai, Codex CLI ở mức tối đa |
| FrontierCode 1.1, chính | 46,4% | 42,4% | Cognition chạy: Claude trong Claude Code, GPT trong Codex |
| Chartography, không công cụ | 46,4% | 29,1% | Báo cáo công khai của Surge AI |
Các hàng dùng chung tên benchmark, không nhất thiết dùng chung harness:
- Terminal-Bench so sánh Haiku 5.5 trong Claude Code với Luna trong Codex CLI.
- OSWorld là gần nhất với thử nghiệm có kiểm soát vì Anthropic chạy cả hai mô hình trên cùng tác vụ.
- Tuy nhiên, OSWorld vẫn là kết quả do một nhà cung cấp chạy trên mô hình của đối thủ.
Chưa có cuộc đối đầu độc lập đầy đủ. Tính đến ngày 8 tháng 10 năm 2026, Artificial Analysis chưa có trang Haiku 5.5 và không có kết quả Haiku 5.5 trên Vals, LMArena, SWE-bench hoặc Aider. Bảng xếp hạng AA trong ngày đó liệt kê GPT-6 Luna ở mức tối đa với Chỉ số Thông minh là 38 và tốc độ 129 token đầu ra/giây.
Xem kết quả đầy đủ tại Điểm chuẩn Claude Haiku 5.5.
Chi phí cho mỗi lần thử ở từng mức nỗ lực
Bảng ra mắt hiển thị kết quả ở mức maximum. Anthropic cũng cung cấp biểu đồ so sánh điểm số và chi phí ở từng mức effort.
OSWorld 2.1: điểm tín dụng một phần / chi phí mỗi lần thử
| Nỗ lực | Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| Thấp | 42,0% / $0.0695 | 19,2% / $0.038 |
| Trung bình | 53,3% / $0.1257 | 37,5% / $0.1261 |
| Cao | 61,3% / $0.1827 | 42,3% / $0.1435 |
| Rất cao | 67,6% / $0.2792 | 44,8% / $0.1672 |
| Tối đa | 72,4% / $0.6111 | 48,9% / $0.205 |
GDPval-AA v2.1: Elo / chi phí mỗi tác vụ
| Nỗ lực | Haiku 5.5 | GPT-6 Luna |
|---|---|---|
| Thấp | 1125 / $0.01167 | 1036 / $0.0038 |
| Trung bình | 1277 / $0.03042 | 1262 / $0.02 |
| Cao | 1420 / $0.08938 | 1344 / $0.03 |
| Rất cao | 1513 / $0.26725 | 1364 / $0.05 |
| Tối đa | 1620 / $0.86593 | 1437 / $0.09 |
Luna có chi phí thấp hơn ở mọi mức effort trên GDPval-AA và ở các mức thấp, cao, rất cao, tối đa trên OSWorld. Riêng OSWorld ở mức trung bình, Haiku 5.5 rẻ hơn rất nhỏ: $0.1257 so với $0.1261.
Đọc kết quả theo ngân sách
Đừng chỉ so sánh hai mô hình ở cùng một effort. Hãy so sánh ở mức chi tiêu tương đương:
-
OSWorld: Haiku 5.5 ở
mediumcó giá $0.1257/lần thử, đạt 53,3%; Luna ởmediumcó giá $0.1261/lần thử, đạt 37,5%. Haiku ởmediumcũng vượt Luna ởmaximum(48,9%) với chi phí thấp hơn. -
GDPval-AA: Luna ở
maximumđạt 1437 Elo với $0.09; Haiku 5.5 ởhighđạt 1420 Elo với $0.08938. Chi phí gần bằng, chênh 17 Elo.
Theo các thử nghiệm do Anthropic công bố:
- Với tác vụ sử dụng máy tính, Haiku 5.5 đạt điểm cao hơn trên mỗi đô la.
- Với công việc tri thức, hai mô hình gần nhau hơn khi chi tiêu tương đương.
- Nếu mục tiêu là kết quả “đủ tốt” với chi phí thấp nhất, Luna có lợi thế.
Định tuyến theo khối lượng công việc
| Khối lượng công việc | Bắt đầu với | Lý do |
|---|---|---|
| Phân loại, định tuyến, trích xuất dưới 100K token | Một trong hai; thử cả hai | Giá giống nhau; chọn theo độ chính xác nhãn thực tế |
| Hỏi đáp tài liệu dài, 100K–272K token | GPT-6 Luna | Giữ giá cơ bản đến 272K; Haiku đắt gấp 5 lần sau 100K |
| Tự động hóa trình duyệt và desktop | Claude Haiku 5.5 | Điểm OSWorld cao hơn ở chi phí tương đương |
| Agent phụ dưới Opus 5.5 hoặc Sonnet 5.5 | Claude Haiku 5.5 | Claude Code hỗ trợ frontmatter model: haiku
|
| Chi phí thấp nhất mỗi request | GPT-6 Luna | Mức sàn thấp: $0.038 trên OSWorld và $0.0038 trên GDPval-AA |
| Soạn thảo công việc tri thức ở effort cao | Một trong hai; thử cả hai | Chênh 17 Elo ở mức chi tiêu tương đương trên GDPval-AA |
Anthropic định vị Haiku 5.5 cho các tác vụ có phạm vi hẹp, đồng thời cho biết Sonnet 5.5 và Opus 5.5 vẫn phù hợp hơn với tác vụ coding agent phức tạp. Cả Haiku 5.5 và Luna đều hướng đến workload có lưu lượng lớn.
Để triển khai:
- Xem Claude Haiku 5.5 trong Claude Code nếu bạn cần agent phụ.
- Xem GPT-6 Luna cho khối lượng công việc API cao nếu bạn cần pipeline QPS cao.
- Nếu đang chuyển từ Haiku 4.5, đọc Haiku 5.5 so với Haiku 4.5 để kiểm tra năm lỗi 400 mới.
Thử nghiệm cả hai song song trong Apidog
So sánh hữu ích nhất phải chạy trên prompt, dữ liệu và tiêu chí đánh giá của chính bạn. Trong Apidog, tạo một project có hai request dùng cùng prompt.
- Lưu
ANTHROPIC_API_KEYvà khóa OpenAI dưới dạng biến môi trường. - Tạo request Haiku 5.5 và request Luna với cùng prompt, cùng giới hạn output và cùng mức effort.
- Kiểm tra
stop_reasoncủa Haiku không phải"refusal"vàusagekhông vượt ngân sách token. - Chạy mỗi request ở
low,mediumvàhigh. - Lưu response, độ trễ, token đầu vào/đầu ra, cache usage và điểm đánh giá cho từng lần chạy.
- Định tuyến theo tỷ lệ thắng và chi phí của workload thực tế, không chỉ theo benchmark công khai.
Ví dụ request Haiku 5.5:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 2048,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Classify this support ticket as billing, bug, or feature request: The export button returns a 500 error since this morning."
}
]
}'
Không gửi temperature, top_p hoặc top_k với giá trị không mặc định: Haiku 5.5 sẽ trả về lỗi 400.
Hướng dẫn liên quan:
Câu hỏi thường gặp
Claude Haiku 5.5 và GPT-6 Luna có cùng giá không?
Có, với lời nhắc Haiku đến 100K token: $0.10/$0.50 cho token đầu vào/đầu ra, $0.01 đọc cache và $0.125 ghi cache. Sau 100K token, Haiku 5.5 chuyển sang $0.50/$2.50; Luna giữ giá cơ bản đến 272K token.
Mô hình nào đạt điểm cao hơn?
Haiku 5.5 đạt điểm cao hơn ở mọi hàng chung trong bảng ra mắt của Anthropic. Tuy nhiên, Anthropic là bên tổng hợp bảng đó và chưa có cuộc đối đầu độc lập đầy đủ.
Mô hình nào rẻ hơn cho mỗi tác vụ?
Thường là Luna: rẻ hơn ở mọi mức effort trong biểu đồ GDPval-AA của Anthropic và bốn trên năm mức ở OSWorld. Ngoại lệ là OSWorld ở medium, nơi Haiku 5.5 rẻ hơn $0.0004.
Ở mức chi tiêu tương đương, Haiku 5.5 dẫn đầu trên OSWorld; GDPval-AA gần tương đương hơn.
Có mô hình nào miễn phí không?
Chỉ có trong trải nghiệm chat:
- Người dùng Claude.ai miễn phí có thể chọn Haiku 5.5.
- Người dùng ChatGPT miễn phí và Go có Luna trong ứng dụng desktop.
Không có tùy chọn nào cấp khóa API. Xem Claude Haiku 5.5 miễn phí.
Chọn theo độ dài lời nhắc, sau đó kiểm tra
Bắt đầu bằng phân phối độ dài prompt của bạn:
- Dưới 100K token: giá tương đương; chọn theo độ chính xác, độ trễ và tỷ lệ lỗi trên dữ liệu thực tế.
- Từ 100K đến 272K token: Luna có lợi thế giá rõ rệt do giữ mức cơ bản lâu hơn.
-
Trên 272K token: đo lại chi phí bằng
usagecủa từng API; Luna vẫn có giá cao hơn cấp cơ bản nhưng thấp hơn Haiku 5.5 theo bảng giá. - Workload browser hoặc desktop: chạy benchmark nội bộ trước, nhưng Haiku 5.5 là điểm khởi đầu hợp lý theo OSWorld.
- Workload chi phí nhạy cảm: bắt đầu với Luna ở effort thấp, sau đó chỉ tăng effort khi chất lượng không đạt ngưỡng.
Tải Apidog, đặt hai request vào cùng một project, chạy trên dữ liệu thực tế và để các số liệu usage, độ trễ và chất lượng đầu ra quyết định.
Top comments (0)