DEV Community

Cover image for Cách dùng Claude Haiku 5.5 trong Claude Code và làm mô hình sub-agent
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Cách dùng Claude Haiku 5.5 trong Claude Code và làm mô hình sub-agent

Để sử dụng Claude Haiku 5.5 trong Claude Code, hãy cập nhật lên v2.1.293 hoặc mới hơn bằng lệnh claude update. Sau đó, bắt đầu phiên với claude --model claude-haiku-5-5 hoặc chạy /model claude-haiku-5-5 trong một phiên đang mở. Với đa số trường hợp, cách hiệu quả hơn là dùng Haiku làm subagent: đặt model: haiku trong tệp subagent để Sonnet 5.5 hoặc Opus 5.5 xử lý phần điều phối, còn Haiku đảm nhiệm tìm kiếm, chạy kiểm thử và tóm tắt. Khi dùng khóa API, chi phí là 0,10 đô la / 0,50 đô la cho mỗi triệu token đầu vào/đầu ra với lời nhắc tối đa 100K token, hoặc 0,50 đô la / 2,50 đô la khi vượt ngưỡng này.

Dùng thử Apidog ngay hôm nay

Bài viết này tập trung vào thiết lập, bẫy của bí danh haiku, mức nỗ lực, cấu hình subagent, bước giá 100K và thời điểm nên để Sonnet hoặc Opus làm mô hình chính. Để tìm hiểu về mô hình, xem Claude Haiku 5.5 là gì. Nếu mã của bạn gọi API, Apidog có thể lưu các kịch bản kiểm thử để subagent Haiku chạy thay bạn.

Claude Haiku 5.5 trong Claude Code

Claude Haiku 5.5 trong Claude Code: Sơ lược

Cài đặt Haiku 5.5
Phiên bản tối thiểu v2.1.293 (claude update)
ID mô hình claude-haiku-5-5
Bí danh haiku Haiku 5.5 chỉ trên Anthropic API
Ngữ cảnh 1M gốc trên mọi gói, không có hậu tố [1m]
Tự động nén Khoảng 967K token theo mặc định
Mức nỗ lực mặc định medium (các cấp từ low đến max)
Suy nghĩ Luôn bật; không thể tắt
Giá API 0,10 đô la / 0,50 đô la cho lời nhắc đến 100K token; 0,50 đô la / 2,50 đô la trên 100K
Gói dịch vụ Pro, Max, Team, Enterprise hoặc khóa API; không phải gói Miễn phí

Bước 1: Cập nhật Claude Code

Haiku 5.5 yêu cầu Claude Code v2.1.293 trở lên. Nhật ký thay đổi cho biết đây là “mô hình Haiku mặc định trên Anthropic API”.

claude update
Enter fullscreen mode Exit fullscreen mode

Claude Code không có trong gói Miễn phí. Người dùng miễn phí có thể chọn Haiku 5.5 trong ứng dụng Claude.ai, nhưng Claude Code yêu cầu Pro, Max, Team, Enterprise hoặc khóa API Anthropic. Theo claude.com/pricing, gói Pro có giá 17 đô la/tháng khi thanh toán hàng năm hoặc 20 đô la/tháng khi thanh toán theo tháng; Max bắt đầu từ 100 đô la.

Bước 2: Chọn Haiku 5.5 làm mô hình chính

Khởi động Claude Code với ID mô hình đầy đủ:

claude --model claude-haiku-5-5
Enter fullscreen mode Exit fullscreen mode

Trong phiên đang chạy, dùng:

/model claude-haiku-5-5
Enter fullscreen mode Exit fullscreen mode

Nếu cài đặt model đã lưu của bạn là haiku, một phiên đã lưu trên Haiku 4.5 sẽ tiếp tục dùng Haiku 5.5 khi chạy trên Anthropic API.

Bí danh haiku chỉ là Haiku 5.5 trên Anthropic API

Nhà cung cấp haiku được giải quyết thành
Anthropic API Haiku 5.5
Nền tảng Claude trên AWS Haiku 4.5
Amazon Bedrock, Nền tảng Agent của Google Cloud Haiku 4.5
Microsoft Foundry Haiku 4.5

Trên các nhà cung cấp đám mây, /model haiku và model: haiku trong tệp subagent đều có thể trả về Haiku 4.5.

Để ghim Haiku 5.5, dùng ID đầy đủ:

  • Google Cloud và Claude Platform trên AWS: claude-haiku-5-5
  • Microsoft Foundry: tên deployment của bạn
  • Amazon Bedrock: ID cấu hình suy luận, ví dụ us.anthropic.claude-haiku-5-5

Bạn cũng có thể trỏ bí danh haiku tới Haiku 5.5 bằng ANTHROPIC_DEFAULT_HAIKU_MODEL.

Bước 3: Chọn mức độ nỗ lực

Haiku 5.5 hỗ trợ các mức nỗ lực:

low, medium, high, xhigh, max
Enter fullscreen mode Exit fullscreen mode

Claude Code mặc định dùng medium. Ví dụ, để chạy với mức high:

claude --model claude-haiku-5-5 --effort high
Enter fullscreen mode Exit fullscreen mode

Trong phiên hiện tại, dùng:

/effort low
Enter fullscreen mode Exit fullscreen mode

Lệnh này lưu mức nỗ lực cho mô hình hiện tại.

Chọn mức theo loại tác vụ:

  • low: tác vụ công cụ ngắn, yêu cầu số lượng lớn.
  • medium: phần lớn công việc hằng ngày.
  • high: tác vụ tác nhân dài hơn.
  • xhigh và max: chỉ nên dùng khi đánh giá nội bộ cho thấy chất lượng cải thiện đáng kể.

Tính năng suy nghĩ luôn bật trong Claude Code với Haiku 5.5. Các cấu hình sau không có tác dụng:

alwaysThinkingEnabled: false
MAX_THINKING_TOKENS=0
Enter fullscreen mode Exit fullscreen mode

Nếu cần giảm token suy nghĩ, hãy giảm effort. API Messages thô có thể tắt suy nghĩ ở mức high trở xuống, nhưng Claude Code thì không.

Bước 4: Chạy Haiku 5.5 dưới dạng subagent

Anthropic cho biết Haiku 5.5 kết hợp tốt với Opus 5.5 và Sonnet 5.5 dưới dạng subagent trong quy trình viết mã.

Subagent là tệp Markdown có YAML frontmatter, đặt tại:

.claude/agents/     # chỉ trong dự án hiện tại
~/.claude/agents/   # cho mọi dự án
Enter fullscreen mode Exit fullscreen mode

Hai trường bắt buộc là name và description. Theo tài liệu subagent, trường model chấp nhận:

sonnet, opus, haiku, fable, <model-id-đầy-đủ>, inherit
Enter fullscreen mode Exit fullscreen mode

Xem thêm hướng dẫn tạo Claude Code subagent để biết phạm vi và công cụ phù hợp.

Thay thế Explore bằng trình khám phá chi phí thấp

Subagent Explore tích hợp chạy trên mô hình của cuộc trò chuyện chính. Nếu phiên chính đang dùng Opus 5.5, mọi tìm kiếm Explore cũng chạy trên Opus.

Bạn có thể ghi đè Explore bằng subagent dự án có mô hình riêng. Tạo tệp .claude/agents/Explore.md:

---
name: Explore
description: Tìm kiếm cơ sở mã chỉ đọc nhanh chóng. Sử dụng để tìm tệp, ký hiệu và vị trí gọi mà không chỉnh sửa bất cứ thứ gì.
tools: Read, Grep, Glob
model: haiku
effort: low
---

Bạn tìm kiếm cơ sở mã và báo cáo những gì bạn tìm thấy. Trả về đường dẫn tệp với số dòng và tóm tắt ngắn gọn về mỗi kết quả khớp. Không bao giờ chỉnh sửa tệp.
Enter fullscreen mode Exit fullscreen mode

Khi subagent chạy, dùng /tasks để xác nhận mô hình đang được sử dụng. Trên nhà cung cấp đám mây, thay haiku bằng ID đầy đủ từ Bước 2 để tránh vô tình chạy Haiku 4.5.

Buộc mọi subagent dùng Haiku

Để chạy toàn bộ subagent trên Haiku, bao gồm Explore, thêm hai biến sau vào khối env trong tệp cài đặt:

{
  "env": {
    "CLAUDE_CODE_SUBAGENT_MODEL": "haiku",
    "CLAUDE_CODE_SUBAGENT_MODEL_FORCE": "1"
  }
}
Enter fullscreen mode Exit fullscreen mode

Chỉ đặt CLAUDE_CODE_SUBAGENT_MODEL thì đây chỉ là giá trị mặc định: trường model riêng trong subagent vẫn có ưu tiên cao hơn và Explore tích hợp không tự chuyển sang Haiku.

Bước 5: Hướng công việc nền đến Haiku 5.5

Biến ANTHROPIC_DEFAULT_HAIKU_MODEL đặt mô hình cho haiku hoặc các công việc nền, ví dụ tóm tắt phiên trước cho:

claude --resume
Enter fullscreen mode Exit fullscreen mode

Biến cũ ANTHROPIC_SMALL_FAST_MODEL đã bị phản đối theo tài liệu biến môi trường. Nếu shell profile vẫn khai báo biến này, hãy thay bằng ANTHROPIC_DEFAULT_HAIKU_MODEL.

Trên Anthropic API, bạn không cần cấu hình thêm. Trên các nền tảng khác:

  • Google Cloud: tác vụ nền mặc định là Sonnet.
  • Foundry: tác vụ nền mặc định là mô hình chính.
  • Bedrock: tác vụ nền mặc định là Sonnet hoặc mô hình chính.

Khi Haiku 5.5 đã được bật trong tài khoản, ghim ID như sau:

# Nền tảng Agent của Google Cloud
export ANTHROPIC_DEFAULT_HAIKU_MODEL=claude-haiku-5-5

# Amazon Bedrock: ID cấu hình suy luận
export ANTHROPIC_DEFAULT_HAIKU_MODEL=us.anthropic.claude-haiku-5-5
Enter fullscreen mode Exit fullscreen mode

Lưu ý bước giá 100K trong phiên dài

Giá Haiku 5.5 phụ thuộc vào độ dài lời nhắc. Claude Code gửi lịch sử cuộc trò chuyện trong mỗi lượt, vì vậy khi ngữ cảnh vượt quá 100K token, mỗi yêu cầu được tính:

0,50 đô la / 2,50 đô la
Enter fullscreen mode Exit fullscreen mode

thay vì:

0,10 đô la / 0,50 đô la
Enter fullscreen mode Exit fullscreen mode

Đây là mức tăng gấp năm lần so với lời nhắc ngắn. Tài liệu không nêu rõ token cache có được tính vào ngưỡng này hay không, vì vậy nên lập ngân sách như thể chúng được tính.

Tự động nén mặc định chỉ diễn ra khoảng 967K token, nên không ngăn được việc vượt ngưỡng 100K. Áp dụng hai thói quen sau:

  1. Nén sớm hơn
   /autocompact 100k
Enter fullscreen mode Exit fullscreen mode

Đây là cửa sổ ngữ cảnh thấp nhất mà Claude Code chấp nhận, giúp phiên nén gần ngưỡng 100K thay vì gần 1M.

  1. Đẩy tác vụ cồng kềnh sang subagent

Subagent có ngữ cảnh riêng. Nhật ký kiểm thử, kết quả grep và đầu ra lệnh dài sẽ không làm phình cuộc trò chuyện chính.

Ngay cả ở ngưỡng trên 100K, mức 0,50 đô la / 2,50 đô la vẫn bằng một phần tư mức 2 đô la / 10 đô la của Sonnet 5.5. Trên gói trả phí, phiên Claude Code tiêu thụ giới hạn sử dụng; Anthropic chưa công bố cách Haiku 5.5 được tính vào giới hạn này. Xem phân tích giá Claude Haiku 5.5 để biết chi tiết cách tính.

Với người đăng ký Max và Team: tín dụng API hàng tháng mới — 100 đô la trên Max 5x, 200 đô la trên Max 20x và tối đa 500 đô la gộp trên Team — không bao gồm Claude Code tương tác, theo tài liệu tín dụng API của Anthropic.

Khi nào nên giữ Sonnet 5.5 hoặc Opus 5.5 làm mô hình chính?

Anthropic cho biết Sonnet 5.5 và Opus 5.5 vẫn phù hợp hơn với các tác vụ mã hóa phức tạp, có tính tác nhân cao.

Trên Terminal-Bench 4.0, do Anthropic chạy trong Claude Code ở mức nỗ lực tối đa:

  • Haiku 5.5 đạt 39,2%.
  • Sonnet 5.5 đạt 70,6%.

Dữ liệu chi phí cho mỗi lần thử:

Mức nỗ lực Haiku 5.5 Sonnet 5.5
medium 20,3% với 0,68 đô la 28,8% với 0,68 đô la
high 24,8% với 1,04 đô la 43% với 1,46 đô la
max 39,2% với 2,64 đô la 70,6% với 10,44 đô la

Ở mức medium, chi phí mỗi lần thử của hai mô hình tương đương nhưng Sonnet đạt điểm cao hơn. Giá token thấp của Haiku không nhất thiết chuyển thành lợi thế trong phiên shell dài hoặc công việc mã hóa khó.

Tuy nhiên, với tác vụ sử dụng máy tính, Haiku có thể rất hiệu quả. Trên OSWorld 2.1:

  • Haiku 5.5 ở medium: 53,3% với 0,13 đô la mỗi lần thử.
  • Sonnet 5.5 ở low: 57,9% với 0,68 đô la mỗi lần thử.

Xem phân tích benchmark Haiku 5.5 để xem toàn bộ bảng số liệu và hướng dẫn Claude Code với Sonnet 5.5 để cấu hình mô hình chính.

Cách phân chia thực tế:

  • Sonnet 5.5 hoặc Opus 5.5: mô hình chính, lập kế hoạch, sửa lỗi phức tạp, tác vụ tác nhân dài.
  • Haiku 5.5: Explore, chạy kiểm thử, đọc log, tìm tài liệu và các tác vụ lặp lại.

Ví dụ: Subagent Haiku chạy kiểm thử Apidog

Các lần chạy kiểm thử thường dài dòng và lặp lại, phù hợp để giao cho Haiku. Apidog CLI có thể chạy các kịch bản kiểm thử Apidog đã lưu từ terminal, trong khi mô hình chính chỉ nhận báo cáo ngắn.

Tạo .claude/agents/api-test-runner.md:

---
name: api-test-runner
description: Chạy các kịch bản kiểm thử Apidog của dự án bằng Apidog CLI sau khi một điểm cuối API thay đổi, sau đó báo cáo số lượng pass và fail cùng với các yêu cầu bị lỗi.
tools: Bash, Read
model: haiku
effort: low
---

Chạy lệnh kiểm thử Apidog CLI được ghi lại trong README của kho lưu trữ này cho kịch bản bao gồm điểm cuối đã thay đổi. Báo cáo số lượng pass và fail.
Đối với mỗi lỗi, cung cấp tên yêu cầu, kết quả mong đợi và kết quả thực tế. Không chỉnh sửa mã. Không thử lại một lần chạy thất bại quá một lần.
Enter fullscreen mode Exit fullscreen mode

Thiết lập CLI, gồm xác thực và lệnh chạy, có trong hướng dẫn Apidog CLI trong Claude Code. Tải xuống Apidog để xây dựng các kịch bản mà subagent sẽ chạy.

Di chuyển ứng dụng từ Haiku 4.5

Nếu ứng dụng gọi Haiku 4.5 qua API, Claude Code có thể khởi tạo quá trình di chuyển:

/claude-api migrate this project to claude-haiku-5-5
Enter fullscreen mode Exit fullscreen mode

Chuẩn bị cho các thay đổi đột phá. Haiku 5.5 trả về lỗi 400 nếu yêu cầu có:

  • budget_tokens suy nghĩ thủ công.
  • temperature hoặc top_p không ở giá trị mặc định.
  • Bất kỳ giá trị top_k nào.
  • Assistant prefill.

Xem hướng dẫn Haiku 5.5 so với Haiku 4.5 để biết từng thay đổi cần sửa.

Sau khi cập nhật mã, hãy lưu yêu cầu cũ và mới thành một cặp trong Apidog. Lưu ANTHROPIC_API_KEY dưới dạng biến môi trường và thêm assertion cho:

stop_reason
usage
Enter fullscreen mode Exit fullscreen mode

Cách này giúp kiểm thử thất bại khi gặp stop_reason: refusal mới hoặc khi số token tăng bất thường, thay vì để lỗi đi tới môi trường production.

Câu hỏi thường gặp

Haiku 5.5 có phải mô hình mặc định trong Claude Code không?

Không. Đây là mô hình Haiku mặc định trên Anthropic API, nghĩa là bí danh haiku trỏ tới Haiku 5.5. Để dùng làm mô hình chính, hãy chọn bằng --model hoặc /model.

Tôi có thể dùng Haiku 5.5 trong Claude Code với gói Miễn phí không?

Không. Claude Code yêu cầu gói trả phí hoặc khóa API. Người dùng miễn phí có thể chọn Haiku 5.5 trong Claude.ai. Xem thêm cách sử dụng Claude Haiku 5.5 miễn phí.

Tại sao model: haiku lại cho tôi Haiku 4.5?

Bạn đang dùng Bedrock, Google Cloud, Foundry hoặc Claude Platform trên AWS; hoặc Claude Code đang thấp hơn v2.1.293. Hãy ghim ID mô hình đầy đủ hoặc đặt ANTHROPIC_DEFAULT_HAIKU_MODEL.

Tôi có thể tắt tính năng suy nghĩ để tiết kiệm token không?

Không trong Claude Code. Thay vào đó, giảm mức nỗ lực; low là cấu hình rẻ nhất.

Bước tiếp theo

  1. Chạy claude update.
  2. Thêm subagent Explore dùng Haiku.
  3. Giữ Sonnet hoặc Opus làm mô hình chính trong một tuần để so sánh chất lượng.
  4. Nếu dự án có API, thêm subagent chạy kiểm thử Apidog.
  5. Nếu gọi mô hình từ mã ứng dụng, bắt đầu với hướng dẫn API Haiku 5.5.

Apidog miễn phí để bắt đầu và giúp subagent của bạn có các bài kiểm thử thực tế để chạy.

Top comments (0)