DEV Community

Cover image for Claude Haiku 5.5 là gì?
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Claude Haiku 5.5 là gì?

Claude Haiku 5.5 là mô hình nhỏ nhất và nhanh nhất hiện tại của Anthropic, ra mắt ngày 7 tháng 10 năm 2026 với ID API claude-haiku-5-5. Giá là 0,10 đô la cho mỗi triệu token đầu vào và 0,50 đô la cho mỗi triệu token đầu ra với lời nhắc tối đa 100K token; với lời nhắc vượt 100K token, giá là 0,50 đô la/2,50 đô la. Trong bài đăng ra mắt, Anthropic cho biết mô hình có chi phí vận hành trung bình thấp hơn khoảng 75% so với Haiku 4.5 và đây là “mô hình nhanh nhất” của họ. Đây cũng là Haiku đầu tiên hỗ trợ mức độ nỗ lực (effort) và cửa sổ ngữ cảnh 1 triệu token.

Dùng thử Apidog ngay hôm nay

Bài viết này tập trung vào thông số, giá theo hai cấp, các thay đổi khi nâng cấp từ Haiku 4.5, benchmark, nền tảng hỗ trợ và quy trình gửi yêu cầu đầu tiên. Để phân tích chi phí chi tiết hơn, xem phân tích chi phí Haiku 5.5. Bạn có thể dùng Apidog để gửi yêu cầu Messages API, lưu API key trong biến môi trường và kiểm tra phản hồi cùng mức sử dụng token.

Thông số kỹ thuật Claude Haiku 5.5

Thông số Claude Haiku 5.5
Ngày phát hành 7 tháng 10 năm 2026
ID mô hình — Claude API, Google Cloud, Microsoft Foundry, Claude Platform trên AWS claude-haiku-5-5 — ID cố định, không có hậu tố ngày
ID mô hình — Amazon Bedrock anthropic.claude-haiku-5-5
Cửa sổ ngữ cảnh 1 triệu token — Haiku 4.5: 200K
Đầu ra tối đa 128K — Haiku 4.5: 64K; 300K qua Batch API với beta header output-300k-2026-03-24
Tư duy Chỉ thích ứng (adaptive)
Mức độ nỗ lực low, medium (mặc định), high, xhigh, max
Ngày cắt dữ liệu Tháng 6 năm 2026
Giá cho prompt tối đa 100K token 0,10 đô la đầu vào, 0,50 đô la đầu ra / 1 triệu token
Giá cho prompt trên 100K token 0,50 đô la đầu vào, 2,50 đô la đầu ra / 1 triệu token
Ngừng hoạt động Không sớm hơn ngày 7 tháng 10 năm 2027

Vị trí của Haiku 5.5 trong dòng Claude

Mô hình Đầu vào / đầu ra mỗi triệu token Mức độ nỗ lực mặc định Độ trễ
Claude Fable 5.1 10 đô la / 50 đô la high Chậm hơn
Claude Opus 5.5 4 đô la / 20 đô la medium Trung bình
Claude Sonnet 5.5 2 đô la / 10 đô la high Nhanh
Claude Haiku 5.5 0,10 đô la / 0,50 đô la cho prompt tối đa 100K token medium Nhanh nhất

Cả bốn mô hình đều có cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 128K và ngày cắt dữ liệu tháng 6 năm 2026.

Anthropic định vị Haiku 5.5 cho các workload khối lượng lớn và nhạy độ trễ:

  • Phân loại.
  • Trích xuất dữ liệu.
  • Định tuyến yêu cầu.
  • Tóm tắt.
  • Hỗ trợ trực tiếp.
  • Sử dụng trình duyệt.
  • Tác vụ subagent dưới Opus 5.5 hoặc Sonnet 5.5.

Lưu ý về tốc độ: Haiku 5.5 là nhanh nhất ở tốc độ tiêu chuẩn của mỗi mô hình, nhưng vẫn chậm hơn Opus trong Fast Mode. Anthropic không công bố số token/giây.

Giá của Claude Haiku 5.5

Giá phụ thuộc vào độ dài prompt. Khi tổng prompt vượt 100.000 token, toàn bộ yêu cầu áp dụng mức giá cao hơn.

Bảng giá Claude Haiku 5.5

Nguồn: Giá API Claude.

Mức “giảm khoảng 75%” là giá trị trung bình:

  • Rẻ hơn 90% so với Haiku 4.5 cho prompt tối đa 100K token.
  • Rẻ hơn 50% cho prompt trên 100K token.
  • Khoảng 90% yêu cầu Haiku 4.5 nằm dưới ngưỡng 100K token.
  • Tokenizer mới tạo nhiều hơn khoảng 30% token cho cùng một văn bản.

Suy luận chỉ ở Hoa Kỳ qua inference_geo có chi phí cao hơn 1,1 lần cho mọi loại token. Prompt cache có thể lưu từ tối thiểu 512 token, giảm từ 4.096 token ở Haiku 4.5.

Với prompt dưới 100K token, giá niêm yết khớp GPT-6 Luna:

Loại token Haiku 5.5 / GPT-6 Luna
Đầu vào 0,10 đô la / 1 triệu token
Đầu ra 0,50 đô la / 1 triệu token
Đọc cache 0,01 đô la / 1 triệu token
Ghi cache 0,125 đô la / 1 triệu token

Khác biệt quan trọng là ngưỡng phụ phí: Luna chỉ áp dụng phụ phí từ trên 272K token đầu vào. Xem so sánh Haiku 5.5 với GPT-6 Luna và hướng dẫn định giá để ước tính chi phí thực tế.

Nâng cấp từ Haiku 4.5: các thay đổi cần sửa

Haiku 5.5 tăng cửa sổ ngữ cảnh gấp năm lần, tăng đầu ra tối đa gấp đôi và thêm quyền kiểm soát effort. Tuy nhiên, hướng dẫn di chuyển cảnh báo một số payload của Haiku 4.5 sẽ trả lỗi 400.

1. Thay ngân sách tư duy thủ công bằng adaptive thinking

Không dùng:

{
  "thinking": {
    "type": "enabled",
    "budget_tokens": 4000
  }
}
Enter fullscreen mode Exit fullscreen mode

Dùng:

{
  "thinking": {
    "type": "adaptive"
  },
  "output_config": {
    "effort": "medium"
  }
}
Enter fullscreen mode Exit fullscreen mode

2. Xóa tham số lấy mẫu

Xóa temperature, top_p và top_k.

Các trường hợp sau sẽ thất bại:

  • Giá trị temperature hoặc top_p khác mặc định.
  • Bất kỳ giá trị top_k nào.
  • Gửi đồng thời temperature và top_p.

3. Không dùng assistant prefill

Assistant prefill bị từ chối, kể cả khi bạn tắt thinking. Hãy bắt đầu luồng phản hồi từ API thay vì ép assistant tiếp tục bằng nội dung có sẵn.

4. Dùng computer toolset mới

Trên Claude API và Google Cloud, thay:

computer_20250124
Enter fullscreen mode Exit fullscreen mode

bằng:

computer_toolset_20260801
Enter fullscreen mode Exit fullscreen mode

5. Giữ lịch sử hội thoại append-only

Không thay đổi system, tools hoặc message trước đó sau khi API đã trả về một thinking block. Hãy chỉ thêm message mới vào cuối lịch sử hội thoại.

Các thay đổi không gây lỗi nhưng ảnh hưởng kết quả

  • Hiển thị thinking: thinking block mặc định chỉ trả chữ ký. Đặt "display": "summarized" nếu cần đọc bản tóm tắt.
  • Số token: cùng một văn bản có thể tiêu thụ nhiều token hơn khoảng 30%; max_tokens cũng tính cả token tư duy.
  • Forced tool use: tool_choice: "any" hoặc chỉ định tên tool vẫn hoạt động, nhưng phản hồi không có thinking block.
  • Refusal: bộ phân loại an toàn có thể trả stop_reason: "refusal" mà không có fallback phía server.
  • Priority Tier: không hỗ trợ trên Haiku 5.5.

Bạn có thể tắt thinking khi dùng low, medium hoặc high. Với xhigh và max, tắt thinking sẽ trả lỗi 400.

Haiku 4.5 chưa bị deprecated và vẫn được liệt kê là hoạt động. Xem hướng dẫn Haiku 5.5 so với Haiku 4.5 để xem JSON trước/sau cho từng thay đổi.

Điểm chuẩn Claude Haiku 5.5

Điểm Haiku 5.5 được đo ở mức max, chủ yếu là trung bình của năm lần thử. Artificial Analysis chạy GDPval-AA và AA-Briefcase, Cognition chạy FrontierCode, còn Anthropic chấm Chartography bằng triển khai riêng.

Điểm chuẩn Claude Haiku 5.5

Khi đọc biểu đồ, cần lưu ý:

  • FrontierCode so sánh Haiku ở max với Sonnet 5.5 ở xhigh.
  • Sonnet 5.5 đạt 46,2% ở max, thấp hơn 46,4% của Haiku.
  • Anthropic chạy OSWorld của Luna qua OpenAI API.
  • Điểm Terminal-Bench của Luna lấy từ bảng xếp hạng công khai sử dụng Codex CLI.
  • Ở effort mặc định medium, Haiku 5.5 đạt 1277 trên GDPval-AA và 1372 trên AA-Briefcase.

Anthropic vẫn khuyến nghị Sonnet 5.5 và Opus 5.5 cho tác vụ coding agent phức tạp. Tính đến ngày 8 tháng 10 năm 2026, chưa có bảng xếp hạng độc lập chứa kết quả Haiku 5.5. Cursor báo cáo 48,4% trên CursorBench riêng ở mức max.

Để xem chi phí và điểm số theo từng mức effort, đọc phân tích benchmark chuyên sâu.

Nơi sử dụng Claude Haiku 5.5

Nền tảng Truy cập Ghi chú
Claude API claude-haiku-5-5 Thanh toán theo token
Amazon Bedrock anthropic.claude-haiku-5-5 Thanh toán qua AWS Marketplace
Google Cloud, Microsoft Foundry, Claude Platform trên AWS claude-haiku-5-5 Cùng ID với Claude API
Claude.ai — web, iOS, Android Trình chọn model Người dùng Free, Pro, Max, Team và Enterprise có thể chọn
Claude Code /model claude-haiku-5-5 Phiên bản 2.1.293 trở lên; yêu cầu gói trả phí
Vercel AI Gateway anthropic/claude-haiku-5.5 Từ 0,10 đô la / 0,50 đô la
Cursor claude-haiku-5-5 Nhóm cùng các model khác

Tính đến ngày 8 tháng 10 năm 2026, Haiku 5.5 chưa có trên OpenRouter và chưa được công bố cho GitHub Copilot.

Truy cập chat qua gói Free không tương đương với API key. API được tính phí theo mức sử dụng, ngoài khoản credit thử nghiệm nhỏ dành cho người dùng mới. Các gói Max và Team hiện gồm credit API hàng tháng:

  • Max 5x: 100 đô la.
  • Max 20x: 200 đô la.
  • Team: gộp tối đa 500 đô la.

Các credit này không bao gồm Claude Code. Xem hướng dẫn truy cập miễn phí để biết rõ phần nào miễn phí.

Trong Claude Code, alias haiku chỉ trỏ đến Haiku 5.5 khi dùng Anthropic API; trên các nền tảng khác, alias này vẫn có thể trỏ đến Haiku 4.5. Xem Haiku 5.5 trong Claude Code để thiết lập subagent.

Ai nên chuyển sang Haiku 5.5?

  • Đang dùng Haiku 4.5: nên nâng cấp sau khi sửa năm thay đổi gây lỗi. Haiku 5.5 có điểm cao hơn ở mọi dòng benchmark mà cả hai model cùng xuất hiện, đồng thời có giá niêm yết thấp hơn.
  • Đang dùng Sonnet hoặc Opus cho tác vụ đơn giản, lặp lại: thử Haiku 5.5 cho phân loại, trích xuất, tóm tắt và subagent. Giữ model lớn hơn cho coding agent phức tạp.
  • Prompt thường vượt 100K token: tính giá ở cả hai cấp trước khi triển khai. Khi vượt ngưỡng, chi phí đầu vào tăng 5 lần cho mỗi token.
  • Làm việc về bảo mật: biện pháp bảo vệ an ninh mạng của Haiku 5.5 vẫn chặn kiểm tra thâm nhập.

Trong bài đăng ra mắt, Asana báo cáo thời gian hoàn thành tác vụ thấp hơn hơn 30%, còn Box ghi nhận điểm số cao hơn 11 điểm so với Haiku 4.5 với độ trễ chỉ bằng khoảng một nửa. Đây là tuyên bố từ khách hàng, không phải thử nghiệm độc lập.

System card cũng ghi nhận Haiku 5.5 từ chối nhiều hơn bất kỳ model nào khác trong kiểm toán tự động của Anthropic. Hãy đo tỷ lệ refusal trên dữ liệu và prompt thực tế của bạn trước khi đưa vào production.

Gửi yêu cầu Haiku 5.5 đầu tiên

Ví dụ dưới đây phân loại một ticket hỗ trợ, bật adaptive thinking và đặt effort ở mức thấp để tối ưu độ trễ và chi phí.

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 4000,
    "thinking": {
      "type": "adaptive",
      "display": "summarized"
    },
    "output_config": {
      "effort": "low"
    },
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug, or feature request: The export button returns a 500 error."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Khi tích hợp:

  1. Không gửi sampling parameters hoặc assistant prefill.
  2. Duyệt content theo trường type, vì phản hồi có thể bắt đầu bằng thinking block.
  3. Kiểm tra stop_reason.
  4. Ghi lại trường usage để theo dõi token và chi phí.

Trong Apidog, bạn có thể import lệnh cURL thành request mới, lưu key trong biến môi trường ANTHROPIC_API_KEY và thêm assertion:

stop_reason != "refusal"
stop_reason != "max_tokens"
Enter fullscreen mode Exit fullscreen mode

Sau đó, nhân bản request, đổi effort từ low sang medium, rồi so sánh usage và chất lượng đầu ra. Xem hướng dẫn API Haiku 5.5 để triển khai cache, batch và streaming. Nếu cần tạo key, xem hướng dẫn API key Anthropic.

Câu hỏi thường gặp

Claude Haiku 5.5 được phát hành khi nào?

Ngày 7 tháng 10 năm 2026, chín ngày sau Sonnet 5.5.

Claude Haiku 5.5 có miễn phí không?

Trong ứng dụng chat Claude.ai, người dùng Free có thể chọn model này. API tính phí ngoài khoản credit thử nghiệm nhỏ cho người dùng mới. Xem mọi cách truy cập miễn phí.

Cửa sổ ngữ cảnh của Claude Haiku 5.5 là gì?

1 triệu token, với đầu ra tối đa 128K token trên Messages API.

Haiku 4.5 có bị ngừng hoạt động không?

Chưa. Model vẫn hoạt động và thời điểm ngừng hoạt động không sớm hơn ngày 15 tháng 10 năm 2026.

Bước tiếp theo

Chọn một tác vụ khối lượng lớn đang chạy trong hệ thống của bạn, ví dụ phân loại ticket hoặc tóm tắt tài liệu. Chạy cùng dữ liệu với claude-haiku-5-5 ở low và medium, sau đó so sánh:

  • Chất lượng đầu ra.
  • Tỷ lệ refusal.
  • Độ trễ.
  • usage.input_tokens và usage.output_tokens.
  • Chi phí so với model hiện tại.

Tải xuống Apidog để lưu request, environment và assertion trong một project. Sau đó, dùng hướng dẫn định giá để chuyển mức sử dụng token thành ước tính hóa đơn hàng tháng.

Top comments (0)