DEV Community

Cover image for Claude Haiku 5.5 đối đầu GPT-6 Luna
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Claude Haiku 5.5 đối đầu GPT-6 Luna

Claude Haiku 5.5 và GPT-6 Luna có cùng giá niêm yết ở cấp cơ bản: $0.10/$0.50 cho mỗi triệu token đầu vào/đầu ra, áp dụng cho lời nhắc Haiku đến 100K token và Luna đến 272K token. Cả hai cũng tính $0.01 cho mỗi lần đọc bộ nhớ đệm và $0.125 cho mỗi lần ghi bộ nhớ đệm. Khác biệt xuất hiện khi vượt ngưỡng: Haiku 5.5 chuyển sang $0.50/$2.50 trên 100K token, còn Luna giữ giá cơ bản đến 272K token, sau đó tính $0.20 đầu vào và $0.75 đầu ra. Trong bảng ra mắt của Anthropic, Haiku 5.5 đạt điểm cao hơn ở các hàng chung; trong biểu đồ chi phí, Luna thường rẻ hơn cho mỗi tác vụ.

Dùng thử Apidog ngay hôm nay

Bài viết này tập trung vào cách chọn và kiểm thử mô hình trong pipeline thực tế: so sánh giá, ngưỡng token, thông số API, điểm chuẩn, chi phí theo mức nỗ lực và cách chạy A/B test. Xem thêm Claude Haiku 5.5 là gì và GPT-6 Luna là gì.

Giá so sánh

Mỗi 1 triệu token Claude Haiku 5.5 GPT-6 Luna
Đầu vào, cấp cơ bản $0.10, lời nhắc đến 100K token $0.10, đến 272K token đầu vào
Đầu ra, cấp cơ bản $0.50 $0.50
Đọc bộ nhớ đệm, cấp cơ bản $0.01 $0.01
Ghi bộ nhớ đệm, cấp cơ bản $0.125, TTL 5 phút $0.125
Cấp cao hơn, đầu vào / đầu ra $0.50 / $2.50, trên 100K $0.20 / $0.75, trên 272K
Cấp cao hơn, đọc / ghi bộ nhớ đệm $0.05 / $0.625 Giá bộ nhớ đệm gấp 2 lần
Xử lý hàng loạt $0.05 / $0.25 đến 100K; $0.25 / $1.25 trên ngưỡng 50% giá tiêu chuẩn cho Xử lý hàng loạt và Linh hoạt

Nguồn: tài liệu giá Anthropic và trang mô hình GPT-6 Luna của OpenAI.

OpenAI định giá lại toàn bộ yêu cầu khi đầu vào vượt 272K token. Anthropic cho biết lời nhắc dài hơn 100.000 token phải dùng mức giá cao hơn, được xác định theo độ dài lời nhắc của từng yêu cầu.

Cách ước tính chi phí nhanh

Dưới 100K token, hóa đơn của hai mô hình khớp từng dòng. Từ 100K đến 272K, Haiku 5.5 đắt gấp 5 lần Luna ở cả token đầu vào và đầu ra. Trên 272K, cả hai dùng mức giá cao hơn nhưng Luna vẫn rẻ hơn.

Ví dụ, tính bằng token riêng của từng nhà cung cấp:

  • Lời nhắc 150K token, đầu ra 2K token
    • Haiku 5.5: 0.15 × $0.50 + 0.002 × $2.50 = $0.080
    • Luna: 0.15 × $0.10 + 0.002 × $0.50 = $0.016
  • Lời nhắc 300K token, đầu ra 2K token
    • Haiku 5.5: 0.30 × $0.50 + 0.002 × $2.50 = $0.155
    • Luna: 0.30 × $0.20 + 0.002 × $0.75 = $0.0615

Anthropic cho biết các lời nhắc đến 100K token chiếm khoảng 90% yêu cầu của Haiku 4.5. Nếu lưu lượng của bạn có phân phối tương tự, phần lớn request sẽ có giá như nhau trên cả hai mô hình. Xem thêm tại giá của Claude Haiku 5.5.

Trình tokenizer thay đổi ngưỡng

Không thể giả định một token của mô hình này tương đương một token của mô hình khác.

Theo Anthropic, tokenizer cập nhật của Haiku 5.5 tạo ra nhiều hơn khoảng 30% token so với Haiku 4.5 cho cùng văn bản. Trong chủ đề ra mắt trên Hacker News, một người bình luận ước tính rằng 100K token Claude hiện đại tương đương khoảng 60–65K token GPT hiện đại. Đây là ước tính cộng đồng, không phải số liệu từ nhà cung cấp.

Để quyết định đúng cho workload của bạn:

  1. Gửi cùng một tập lời nhắc đại diện đến cả hai API.
  2. Đọc đối tượng usage trong từng response.
  3. Lưu số token đầu vào, đầu ra, token cache và tổng chi phí.
  4. Kiểm tra tỷ lệ request vượt 100K và 272K token theo tokenizer của từng nhà cung cấp.

Đừng định tuyến chỉ bằng số ký tự hoặc số token ước tính từ một tokenizer khác.

Thông số kỹ thuật

Claude Haiku 5.5 GPT-6 Luna
ID mô hình API claude-haiku-5-5 gpt-6-luna
Cửa sổ ngữ cảnh 1M token 1.050.000 token
Đầu ra tối đa 128K token; 300K qua Xử lý hàng loạt với tiêu đề beta 128.000 token
Ngày cắt giảm kiến thức Tháng 6 năm 2026 18 tháng 5 năm 2026
Mức độ nỗ lực thấp, trung bình, cao, rất cao, tối đa không, thấp, trung bình, cao, rất cao, tối đa
Tắt suy nghĩ thinking: {"type": "disabled"} ở mức nỗ lực cao hoặc thấp hơn reasoning.effort: "none"
Truy cập trò chuyện miễn phí Người dùng Claude.ai miễn phí có thể chọn Người dùng miễn phí và Go trong ứng dụng ChatGPT desktop

Cả hai mặc định ở mức medium:

  • Haiku 5.5 dùng output_config.effort.
  • Luna dùng reasoning.effort.

Các tùy chọn chat miễn phí không cung cấp khóa API, vì vậy không thể dùng chúng cho script, CI, agent hoặc backend service. Tham khảo Claude Haiku 5.5 miễn phí và GPT-6 Luna miễn phí.

Lưu ý về cache trong vòng lặp agent

Đây là khác biệt quan trọng khi request lặp lại:

  • Với Haiku 5.5, thay đổi effort cấp cao nhất giữa các request làm mất hiệu lực cache lời nhắc.
  • OpenAI cho biết thay đổi mức nỗ lực suy luận không còn làm hỏng cache trên các mô hình GPT-6.

Nếu agent của bạn thay đổi effort động theo từng bước, hãy đo cache hit rate trước khi chọn Haiku 5.5. Xem thêm: Bộ nhớ đệm lời nhắc GPT-6.

Điểm chuẩn: nguồn dữ liệu và đơn vị thực hiện

Các số liệu dưới đây lấy từ bài đăng ra mắt của Anthropic và system card của họ. Anthropic tổng hợp bảng, nhưng không phải mọi hàng đều do cùng một bên chạy. Kết quả Haiku 5.5 dùng mức nỗ lực tối đa và chủ yếu là trung bình của năm lần thử.

Điểm chuẩn Haiku 5.5 GPT-6 Luna Cách lấy số liệu Luna
GDPval-AA v2.1, Elo 1620 1437 Artificial Analysis thực hiện độc lập
AA-Briefcase v1.1, Elo 1578 1336 Artificial Analysis thực hiện độc lập
OSWorld 2.1, tập con ngoại tuyến 72,4% 48,9% Anthropic chạy cùng 82 tác vụ qua API OpenAI
Terminal-Bench 4.0 39,2% 16,4% Bảng xếp hạng công khai, Codex CLI ở mức tối đa
FrontierCode 1.1, chính 46,4% 42,4% Cognition chạy: Claude trong Claude Code, GPT trong Codex
Chartography, không công cụ 46,4% 29,1% Báo cáo công khai của Surge AI

Các hàng dùng chung tên benchmark, không nhất thiết dùng chung harness:

  • Terminal-Bench so sánh Haiku 5.5 trong Claude Code với Luna trong Codex CLI.
  • OSWorld là gần nhất với thử nghiệm có kiểm soát vì Anthropic chạy cả hai mô hình trên cùng tác vụ.
  • Tuy nhiên, OSWorld vẫn là kết quả do một nhà cung cấp chạy trên mô hình của đối thủ.

Chưa có cuộc đối đầu độc lập đầy đủ. Tính đến ngày 8 tháng 10 năm 2026, Artificial Analysis chưa có trang Haiku 5.5 và không có kết quả Haiku 5.5 trên Vals, LMArena, SWE-bench hoặc Aider. Bảng xếp hạng AA trong ngày đó liệt kê GPT-6 Luna ở mức tối đa với Chỉ số Thông minh là 38 và tốc độ 129 token đầu ra/giây.

Xem kết quả đầy đủ tại Điểm chuẩn Claude Haiku 5.5.

Chi phí cho mỗi lần thử ở từng mức nỗ lực

Bảng ra mắt hiển thị kết quả ở mức maximum. Anthropic cũng cung cấp biểu đồ so sánh điểm số và chi phí ở từng mức effort.

OSWorld 2.1: điểm tín dụng một phần / chi phí mỗi lần thử

Nỗ lực Haiku 5.5 GPT-6 Luna
Thấp 42,0% / $0.0695 19,2% / $0.038
Trung bình 53,3% / $0.1257 37,5% / $0.1261
Cao 61,3% / $0.1827 42,3% / $0.1435
Rất cao 67,6% / $0.2792 44,8% / $0.1672
Tối đa 72,4% / $0.6111 48,9% / $0.205

GDPval-AA v2.1: Elo / chi phí mỗi tác vụ

Nỗ lực Haiku 5.5 GPT-6 Luna
Thấp 1125 / $0.01167 1036 / $0.0038
Trung bình 1277 / $0.03042 1262 / $0.02
Cao 1420 / $0.08938 1344 / $0.03
Rất cao 1513 / $0.26725 1364 / $0.05
Tối đa 1620 / $0.86593 1437 / $0.09

Luna có chi phí thấp hơn ở mọi mức effort trên GDPval-AA và ở các mức thấp, cao, rất cao, tối đa trên OSWorld. Riêng OSWorld ở mức trung bình, Haiku 5.5 rẻ hơn rất nhỏ: $0.1257 so với $0.1261.

Đọc kết quả theo ngân sách

Đừng chỉ so sánh hai mô hình ở cùng một effort. Hãy so sánh ở mức chi tiêu tương đương:

  • OSWorld: Haiku 5.5 ở medium có giá $0.1257/lần thử, đạt 53,3%; Luna ở medium có giá $0.1261/lần thử, đạt 37,5%. Haiku ở medium cũng vượt Luna ở maximum (48,9%) với chi phí thấp hơn.
  • GDPval-AA: Luna ở maximum đạt 1437 Elo với $0.09; Haiku 5.5 ở high đạt 1420 Elo với $0.08938. Chi phí gần bằng, chênh 17 Elo.

Theo các thử nghiệm do Anthropic công bố:

  • Với tác vụ sử dụng máy tính, Haiku 5.5 đạt điểm cao hơn trên mỗi đô la.
  • Với công việc tri thức, hai mô hình gần nhau hơn khi chi tiêu tương đương.
  • Nếu mục tiêu là kết quả “đủ tốt” với chi phí thấp nhất, Luna có lợi thế.

Định tuyến theo khối lượng công việc

Khối lượng công việc Bắt đầu với Lý do
Phân loại, định tuyến, trích xuất dưới 100K token Một trong hai; thử cả hai Giá giống nhau; chọn theo độ chính xác nhãn thực tế
Hỏi đáp tài liệu dài, 100K–272K token GPT-6 Luna Giữ giá cơ bản đến 272K; Haiku đắt gấp 5 lần sau 100K
Tự động hóa trình duyệt và desktop Claude Haiku 5.5 Điểm OSWorld cao hơn ở chi phí tương đương
Agent phụ dưới Opus 5.5 hoặc Sonnet 5.5 Claude Haiku 5.5 Claude Code hỗ trợ frontmatter model: haiku
Chi phí thấp nhất mỗi request GPT-6 Luna Mức sàn thấp: $0.038 trên OSWorld và $0.0038 trên GDPval-AA
Soạn thảo công việc tri thức ở effort cao Một trong hai; thử cả hai Chênh 17 Elo ở mức chi tiêu tương đương trên GDPval-AA

Anthropic định vị Haiku 5.5 cho các tác vụ có phạm vi hẹp, đồng thời cho biết Sonnet 5.5 và Opus 5.5 vẫn phù hợp hơn với tác vụ coding agent phức tạp. Cả Haiku 5.5 và Luna đều hướng đến workload có lưu lượng lớn.

Để triển khai:

Thử nghiệm cả hai song song trong Apidog

So sánh hữu ích nhất phải chạy trên prompt, dữ liệu và tiêu chí đánh giá của chính bạn. Trong Apidog, tạo một project có hai request dùng cùng prompt.

  1. Lưu ANTHROPIC_API_KEY và khóa OpenAI dưới dạng biến môi trường.
  2. Tạo request Haiku 5.5 và request Luna với cùng prompt, cùng giới hạn output và cùng mức effort.
  3. Kiểm tra stop_reason của Haiku không phải "refusal" và usage không vượt ngân sách token.
  4. Chạy mỗi request ở low, medium và high.
  5. Lưu response, độ trễ, token đầu vào/đầu ra, cache usage và điểm đánh giá cho từng lần chạy.
  6. Định tuyến theo tỷ lệ thắng và chi phí của workload thực tế, không chỉ theo benchmark công khai.

Ví dụ request Haiku 5.5:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 2048,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug, or feature request: The export button returns a 500 error since this morning."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Không gửi temperature, top_p hoặc top_k với giá trị không mặc định: Haiku 5.5 sẽ trả về lỗi 400.

Hướng dẫn liên quan:

Câu hỏi thường gặp

Claude Haiku 5.5 và GPT-6 Luna có cùng giá không?

Có, với lời nhắc Haiku đến 100K token: $0.10/$0.50 cho token đầu vào/đầu ra, $0.01 đọc cache và $0.125 ghi cache. Sau 100K token, Haiku 5.5 chuyển sang $0.50/$2.50; Luna giữ giá cơ bản đến 272K token.

Mô hình nào đạt điểm cao hơn?

Haiku 5.5 đạt điểm cao hơn ở mọi hàng chung trong bảng ra mắt của Anthropic. Tuy nhiên, Anthropic là bên tổng hợp bảng đó và chưa có cuộc đối đầu độc lập đầy đủ.

Mô hình nào rẻ hơn cho mỗi tác vụ?

Thường là Luna: rẻ hơn ở mọi mức effort trong biểu đồ GDPval-AA của Anthropic và bốn trên năm mức ở OSWorld. Ngoại lệ là OSWorld ở medium, nơi Haiku 5.5 rẻ hơn $0.0004.

Ở mức chi tiêu tương đương, Haiku 5.5 dẫn đầu trên OSWorld; GDPval-AA gần tương đương hơn.

Có mô hình nào miễn phí không?

Chỉ có trong trải nghiệm chat:

  • Người dùng Claude.ai miễn phí có thể chọn Haiku 5.5.
  • Người dùng ChatGPT miễn phí và Go có Luna trong ứng dụng desktop.

Không có tùy chọn nào cấp khóa API. Xem Claude Haiku 5.5 miễn phí.

Chọn theo độ dài lời nhắc, sau đó kiểm tra

Bắt đầu bằng phân phối độ dài prompt của bạn:

  • Dưới 100K token: giá tương đương; chọn theo độ chính xác, độ trễ và tỷ lệ lỗi trên dữ liệu thực tế.
  • Từ 100K đến 272K token: Luna có lợi thế giá rõ rệt do giữ mức cơ bản lâu hơn.
  • Trên 272K token: đo lại chi phí bằng usage của từng API; Luna vẫn có giá cao hơn cấp cơ bản nhưng thấp hơn Haiku 5.5 theo bảng giá.
  • Workload browser hoặc desktop: chạy benchmark nội bộ trước, nhưng Haiku 5.5 là điểm khởi đầu hợp lý theo OSWorld.
  • Workload chi phí nhạy cảm: bắt đầu với Luna ở effort thấp, sau đó chỉ tăng effort khi chất lượng không đạt ngưỡng.

Tải Apidog, đặt hai request vào cùng một project, chạy trên dữ liệu thực tế và để các số liệu usage, độ trễ và chất lượng đầu ra quyết định.

Top comments (0)