DEV Community

Cover image for Claude Haiku 5.5 ผลการทดสอบประสิทธิภาพ
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

Claude Haiku 5.5 ผลการทดสอบประสิทธิภาพ

Claude Haiku 5.5 ได้คะแนน 72.4% ใน OSWorld 2.1, 1620 ใน GDPval-AA v2.1, 46.4% ใน FrontierCode 1.1 และ 39.2% ใน Terminal-Bench 4.0. Haiku 4.5 ได้คะแนน 15.7%, 735 และ 0.0% ในสามรายการดังกล่าว ทั้งหมดนี้เป็นตัวเลขที่ได้จากความพยายามสูงสุด (max); หากใช้ความพยายามระดับ medium ตามค่าเริ่มต้น GDPval-AA จะลดลงเหลือ 1277 ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่ผลการทดสอบ Haiku 5.5

ลองใช้ Apidog วันนี้

บทความนี้สรุปทุกเกณฑ์มาตรฐานของ Claude Haiku 5.5, ผู้ที่ดำเนินการทดสอบ, ความแตกต่างของคะแนนและค่าใช้จ่ายตามระดับความพยายาม รวมถึงวิธีทดสอบโมเดลกับทราฟฟิกจริงของคุณใน Apidog สำหรับข้อมูลจำเพาะและราคา เริ่มต้นได้ที่ Claude Haiku 5.5 คืออะไร

ตารางการเปิดตัว

เซลล์ Haiku 5.5 ทุกรายการใช้การคิดแบบปรับตัว (adaptive thinking) ที่ความพยายามสูงสุด (max) โดยปกติจะเฉลี่ยจากห้าครั้งที่ลอง โดย Terminal-Bench ใช้สิบครั้งต่องาน ส่วน n/r หมายถึงไม่มีการเผยแพร่ผลลัพธ์

เกณฑ์มาตรฐาน Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, ชุดข้อมูลออฟไลน์ 72.4% 15.7% 48.9% 83.9%
การสอบครั้งสุดท้ายของมนุษยชาติ, ไม่มีเครื่องมือ 45.9% 10.2% n/r 56.9%
การสอบครั้งสุดท้ายของมนุษยชาติ, มีเครื่องมือ 57.4% 18.7% n/r 64.5%
Terminal-Bench 4.0 39.2% 0.0% 16.4% 70.6%
FrontierCode 1.1 (หลัก) 46.4% n/r 42.4% 52.1% (xhigh)
Chartography, ไม่มีเครื่องมือ 46.4% 6.4% 29.1% 61.6%

ใครเป็นผู้ดำเนินการเกณฑ์มาตรฐานแต่ละรายการ

Anthropic เป็นผู้ดำเนินการทดสอบส่วนใหญ่ด้วยตัวเอง แถวข้ามผู้จำหน่ายใช้ชื่อเกณฑ์มาตรฐานเดียวกัน แต่ไม่ได้หมายความว่าจะใช้ชุดทดสอบหรือการตั้งค่าความพยายามเหมือนกันเสมอไป

เกณฑ์มาตรฐาน ผู้ดำเนินการ เงื่อนไข
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, โดยอิสระ GDPval-AA: 220 งาน, 44 อาชีพ, Elo อิงกับ DeepSeek V4.1 Flash (สูงสุด) ที่ 1600; Briefcase: โปรเจกต์หลายสัปดาห์
FrontierCode 1.1 Cognition Claude ใน Claude Code, GPT ใน Codex; หลัก = 100 งานที่ยากที่สุดจาก 150 งาน
Chartography Anthropic, บนเกณฑ์มาตรฐานของ Surge AI ตัวประเมิน Gemini 3.5 Flash; คะแนน Luna จาก Surge AI
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 งาน, 10 ครั้งที่ลองในแต่ละงาน, เปิดระบบป้องกัน
OSWorld 2.1 Anthropic 82 จาก 108 งาน, 1080p, สูงสุด 500 ขั้นตอน
การสอบครั้งสุดท้ายของมนุษยชาติ Anthropic งบประมาณงาน 980K โทเค็น, ตัวประเมิน Opus 4.6

เซลล์ GPT-6 Luna สองรายการต้องการบริบทเพิ่มเติม: Anthropic รันคะแนน OSWorld ของ Luna ผ่าน API ของ OpenAI ด้วย 82 งานเดียวกัน ส่วนคะแนน Terminal-Bench ของ Luna ที่ 16.4% มาจากกระดานผู้นำสาธารณะ โดยใช้ Codex CLI ที่ความพยายามสูงสุด

ใน Terminal-Bench ระบบป้องกันหยุดการทดสอบ Haiku 5.5 จำนวน 1.8% หรือ 12 จาก 660 ครั้ง และแต่ละครั้งถูกนับเป็นความล้มเหลว

กับดัก FrontierCode

ตารางการเปิดตัวแสดง Haiku 5.5 ที่ระดับสูงสุด 46.4% เทียบกับ Sonnet 5.5 ที่ระดับ xhigh 52.1% ซึ่งเป็นคะแนนที่ดีที่สุดของ Sonnet อย่างไรก็ตาม system card ให้ตัวเลขที่เทียบกันได้ดังนี้

FrontierCode 1.1 หลัก ขยาย
Haiku 5.5, สูงสุด 46.4% 58.4%
Haiku 5.5, xhigh 45.8% n/r
Sonnet 5.5, สูงสุด 46.2% 59.1%
Sonnet 5.5, xhigh 52.1% 64.4%

ที่ความพยายามสูงสุด Haiku 5.5 เหนือกว่า Sonnet 5.5 ในชุด Main เล็กน้อย: 46.4% ต่อ 46.2% แต่เมื่อเทียบการตั้งค่าที่ดีที่สุดของแต่ละโมเดล Sonnet นำอยู่ 5.7 จุด

เมื่ออ้างอิงผลทดสอบ ให้ระบุระดับความพยายามเสมอ เพราะผลลัพธ์เปลี่ยนอย่างมีนัยสำคัญตามการตั้งค่านี้

ข้อมูลเสริมจากการ์ดระบบ

การ์ดระบบเพิ่มรายการที่โพสต์เปิดตัวไม่ได้กล่าวถึง ผลลัพธ์ทั้งหมดด้านล่างใช้ความพยายามสูงสุด เว้นแต่ระบุเป็นอย่างอื่น

เกณฑ์มาตรฐาน Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64.8 n/r 81.3
SWE-bench หลายภาษา 83.7 67.4 90.3
SWE-bench หลายรูปแบบ 30.7 19.8 54.3
OSWorld 2.1, อัตราผ่านที่เข้มงวด 37.1% n/r 48.8%
Chartography, มีเครื่องมือ 86.2% 8.8% 90.2%
OfficeQA / OfficeQA Pro 73.5% / 60.3% 63.0% / 47.1% 76.9% / 65.6%
HealthBench Professional (ปรับตามความยาว) 64.8% 32.2% 69.2%

คะแนน OSWorld 72.4% เป็นคะแนนแบบบางส่วน (partial credit) โดยมีเพียง 37.1% ของงานที่ผ่านทั้งหมด

Chartography เพิ่มขึ้นเกือบสองเท่าเมื่อใช้เครื่องมือ: จาก 46.4% เป็น 86.2% ดังนั้น หากงานของคุณเกี่ยวข้องกับแผนภูมิ ควรให้ Haiku 5.5 เข้าถึงเครื่องมือที่จำเป็น

คะแนนความพยายามเริ่มต้นต่ำกว่า

Haiku 5.5 มีค่าเริ่มต้นเป็น medium บน Claude API และใน Claude Code การ์ดระบบรายงานผลลัพธ์ที่ระดับค่าเริ่มต้นดังนี้

เกณฑ์มาตรฐาน กลาง (ค่าเริ่มต้น) สูงสุด หมายเหตุ
GDPval-AA v2.1 1277 1620 ระดับกลางใช้โทเค็นเอาต์พุตประมาณหนึ่งในสิบของระดับสูงสุด
AA-Briefcase v1.1 1372 1578 ระดับกลางใช้โทเค็นเอาต์พุตน้อยกว่าหนึ่งในสี่ของระดับสูงสุด
HealthBench Professional 59.9% 64.8% ต่ำ 57.9%, สูง 61.3%

หากเรียก API โดยไม่ส่ง output_config.effort คุณจะได้รับผลลัพธ์ใกล้เคียงกับคอลัมน์ระดับกลาง เอกสารความพยายาม ครอบคลุมระดับทั้งห้า

คะแนนและค่าใช้จ่ายตามระดับความพยายาม

ข้อมูลจากแผนภูมิการเปิดตัวแสดงเป็น คะแนน (ค่าใช้จ่าย) ค่าใช้จ่ายของ OSWorld และ Terminal-Bench คิดต่อครั้งที่ลอง ส่วน GDPval-AA คิดต่อหนึ่งงาน

โมเดล / เกณฑ์มาตรฐาน ต่ำ กลาง สูง Xสูง สูงสุด
OSWorld 2.1
Haiku 5.5 42.0% ($0.07) 53.3% ($0.13) 61.3% ($0.18) 67.6% ($0.28) 72.4% ($0.61)
Sonnet 5.5 57.9% ($0.68) 66.0% ($0.93) 73.2% ($1.38) 81.1% ($2.22) 83.9% ($5.73)
GPT-6 Luna 19.2% ($0.04) 37.5% ($0.13) 42.3% ($0.14) 44.8% ($0.17) 48.9% ($0.21)
GDPval-AA v2.1
Haiku 5.5 1125 ($0.012) 1277 ($0.030) 1420 ($0.089) 1513 ($0.27) 1620 ($0.87)
Sonnet 5.5 1179 ($0.22) 1324 ($0.27) 1551 ($0.62) 1731 ($1.88) 1840 ($6.78)
GPT-6 Luna 1036 ($0.004) 1262 ($0.02) 1344 ($0.03) 1364 ($0.05) 1437 ($0.09)
Terminal-Bench 4.0
Haiku 5.5 12.7% ($0.42) 20.3% ($0.68) 24.8% ($1.04) 31.5% ($1.75) 39.2% ($2.64)
Sonnet 5.5 20.0% ($0.62) 28.8% ($0.68) 43.0% ($1.46) 61.5% ($4.34) 70.6% ($10.44)

ข้อสังเกตสำหรับการเลือกโมเดลและ effort:

  • ระดับสูงสุดมีราคาแพงสำหรับผลลัพธ์ช่วงสุดท้าย: ใน GDPval-AA ระดับสูงสุดมีค่าใช้จ่ายประมาณ 28 เท่าของระดับกลาง เพื่อเพิ่ม 343 Elo point ใน OSWorld ระดับสูงสุดมีค่าใช้จ่ายมากกว่าสองเท่าของ xhigh เพื่อเพิ่ม 4.8 จุด
  • Haiku 5.5 ที่ระดับกลางเอาชนะ Luna ที่ระดับสูงสุดใน OSWorld: 53.3% ที่ราคา $0.13 เทียบกับ 48.9% ที่ราคา $0.21 อย่างไรก็ตาม Luna มีราคาถูกกว่าในระดับที่ตรงกันอื่น ๆ และที่ระดับกลางทั้งสองมีค่าใช้จ่ายใกล้เคียงกัน ดู Haiku 5.5 เทียบกับ GPT-6 Luna
  • Haiku 5.5 ที่ระดับสูงสุดเอาชนะ Sonnet 5.5 ที่ระดับกลางใน OSWorld: 72.4% ที่ราคา $0.61 เทียบกับ 66.0% ที่ราคา $0.93
  • Terminal-Bench เป็นข้อยกเว้น: Sonnet 5.5 ที่ระดับสูง 43.0%, $1.46 เอาชนะ Haiku 5.5 ที่ระดับสูงสุด 39.2%, $2.64 ด้วยค่าใช้จ่ายที่น้อยกว่า ค่าใช้จ่ายของ Sonnet ใช้ราคาอ่านแคชใหม่ที่ $0.10

ค่าใช้จ่ายใช้ราคาตามรายการ: $0.10/$0.50 ต่อล้านโทเค็นสำหรับพรอมต์สูงสุด 100K โทเค็น และราคาจะสูงขึ้นสำหรับพรอมต์ที่ยาวกว่า ดู รายละเอียดราคา

จุดที่ Haiku 5.5 ยังตามหลัง

Sonnet 5.5 นำทุกแถวในตารางการเปิดตัว Haiku ชนะการเปรียบเทียบแบบตัวต่อตัวได้เฉพาะ FrontierCode เมื่อทั้งสองโมเดลรันที่ความพยายามสูงสุด

ช่องว่างที่กว้างที่สุดคือ Terminal-Bench 4.0:

  • Haiku 5.5: 39.2%
  • Sonnet 5.5: 70.6%

SWE-Bench Pro ที่ 64.8 เทียบกับ 81.3 และ SWE-bench Multimodal ที่ 30.7 เทียบกับ 54.3 แสดงรูปแบบเดียวกัน

Anthropic ระบุว่า Sonnet 5.5 และ Opus 5.5 “ยังคงเป็นตัวเลือกที่ดีกว่าสำหรับงานการเขียนโค้ดที่ซับซ้อน” Haiku 5.5 เหมาะกับงานขอบเขตแคบ เช่น การย่อ การสรุป การจัดหมวดหมู่ การใช้งานเบราว์เซอร์ และการทำงานเป็น subagent ภายใต้โมเดลที่ใหญ่กว่า

สำหรับแนวทางรัน Haiku 5.5 เป็น subagent ราคาประหยัด ดู Haiku 5.5 ใน Claude Code

ผลลัพธ์อิสระ: ยังไม่มี

ณ วันที่ 8 ตุลาคม 2026 ยังไม่มีห้องปฏิบัติการอิสระใดเผยแพร่ผลการทดสอบ Haiku 5.5 หน้า Haiku 5.5 ของ Artificial Analysis แสดงข้อผิดพลาด 404 และ กระดานผู้นำ ของพวกเขาระบุเฉพาะ Claude 4.5 Haiku

Vals, LMArena, SWE-bench และ Aider ก็ยังไม่แสดงผลเช่นกัน รวมถึงยังไม่มีตัวเลขความเร็วจากบุคคลที่สาม Anthropic เรียก Haiku 5.5 ว่าเป็น “โมเดลที่เร็วที่สุดในปัจจุบัน” ที่ความเร็วมาตรฐาน ซึ่งช้ากว่า Opus ในโหมด Fast

ตัวเลขภายนอกที่ใกล้เคียงที่สุดมาจาก Cursor โดยเอกสารโมเดล ระบุว่า Haiku 5.5 “ได้คะแนน 48.4% บน CursorBench ที่ความพยายามสูงสุด” เพิ่มขึ้นจาก 30.9% ที่ระดับต่ำ

เมื่อปิดการคิด (thinking off) Cursor รายงานคะแนน 22.1% ถึง 26.2% ขณะที่เปิดการคิด (thinking on) ได้ 30.9% ถึง 42.3% ที่ระดับความพยายามเดียวกัน

สิ่งที่ลูกค้ารายงาน

ข้อมูลต่อไปนี้มาจากโพสต์การเปิดตัวของ Anthropic และยังไม่ได้รับการยืนยันโดยอิสระ:

  • HubSpot: เฉลี่ย 92.8% จากการรันสามครั้งบนชุดพอร์ทัล CRM จำลอง ซึ่งเป็นคะแนนที่ดีที่สุดที่เคยเห็นบนชุดนั้น
  • AlphaSense: 0.84 เทียบกับ Haiku 4.5 ที่ 0.76 ใน 400 คำถาม “Ask in Document” ซึ่งถือว่ามีนัยสำคัญทางสถิติ
  • Box: สูงกว่า Haiku 4.5 ถึง 11 จุด โดยมีความหน่วงประมาณครึ่งหนึ่งในการทดสอบเบื้องต้น
  • Asana: ความหน่วงในการทำงานให้เสร็จสิ้นต่ำลงกว่า 30% เทียบกับโมเดลปัจจุบัน
  • Cognition: Devin Fusion มีคะแนน FrontierCode ที่ 66.2 โดยมี Haiku 5.5 เป็นผู้ช่วยและ Opus 5.5 เป็นตัวนำ นี่คือระบบสองโมเดล ไม่ใช่ Haiku เพียงอย่างเดียว

ดำเนินการประเมินผลของคุณเอง

เกณฑ์มาตรฐานอาจไม่ตรงกับทราฟฟิกของคุณ คู่มือการพร้อมท์ ของ Anthropic แนะนำให้ใช้ xhigh หรือ max เฉพาะเมื่อการประเมินของคุณแสดงให้เห็นถึงประโยชน์ และให้รันการประเมินเดียวกันบน Sonnet 5.5 เพื่อเปรียบเทียบ

ทำตามขั้นตอนนี้ใน Apidog:

  1. จัดเก็บ ANTHROPIC_API_KEY เป็นตัวแปรสภาพแวดล้อม และบันทึกพรอมต์จริง 20 ถึง 50 รายการเป็นคำขอ Messages
  2. เพิ่มการยืนยันอย่างน้อย:
    • สถานะ HTTP เป็น 200
    • stop_reason ไม่ใช่ "max_tokens" หรือ "refusal"
    • เนื้อหาตรงตามเกณฑ์คำตอบที่ถูกต้องของคุณ
  3. รันชุดข้อมูลเดียวกันที่ระดับ low, medium และ high
  4. บันทึกอัตราการผ่านและจำนวนโทเค็นจากฟิลด์ usage
  5. ทำซ้ำคอลเลกชันโดยเปลี่ยนโมเดลเป็น claude-sonnet-5-5
  6. เปรียบเทียบ Haiku และ Sonnet ในโปรเจกต์เดียวกัน

การเปลี่ยนระดับความพยายามจะทำให้แคชพรอมต์ไม่ถูกต้อง จึงควรแยกผลลัพธ์แต่ละระดับให้ชัดเจน

ตัวอย่างคำขอ Messages API:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [{
      "role": "user",
      "content": "Classify this support ticket as billing, bug or feature request: ..."
    }]
  }'
Enter fullscreen mode Exit fullscreen mode

ห้ามส่ง temperature, top_p, top_k หรือ assistant prefill เพราะแต่ละรายการจะส่งคืนข้อผิดพลาด 400 บน Haiku 5.5

เมื่ออ่าน response ให้เลือกบล็อกตามฟิลด์ type เนื่องจากบล็อก thinking อาจปรากฏก่อนบล็อกคำตอบจริง

ดูรายละเอียดการใช้งานเพิ่มเติมได้ที่:

คำถามที่พบบ่อย

  • Claude Haiku 5.5 ดีกว่า Sonnet 5.5 หรือไม่?

    ไม่ใช่จากตัวเลขของ Anthropic Sonnet 5.5 นำหน้าทุกแถวในตารางการเปิดตัว ส่วน Haiku เหนือกว่าเล็กน้อยใน FrontierCode เมื่อทั้งสองรันที่ระดับสูงสุด: 46.4% เทียบกับ 46.2% ดู Haiku 5.5 เทียบกับ Haiku 4.5 สำหรับมุมมองการอัปเกรด

  • คะแนน SWE-bench ของ Haiku 5.5 คือเท่าไร?

    64.8 ใน SWE-Bench Pro, 83.7 ใน SWE-bench Multilingual และ 30.7 ใน SWE-bench Multimodal ทั้งหมดที่ความพยายามสูงสุด

  • เกณฑ์มาตรฐานถูกรันที่ระดับความพยายามเท่าไร?

    ระดับสูงสุด โดยปกติเป็นค่าเฉลี่ยจากการลองห้าครั้ง ค่าเริ่มต้นของ API คือระดับกลาง ซึ่ง GDPval-AA ได้ 1277 แทนที่จะเป็น 1620

  • มีเกณฑ์มาตรฐาน Haiku 5.5 ที่เป็นอิสระหรือไม่?

    ยังไม่มี Artificial Analysis รัน GDPval-AA และ AA-Briefcase อย่างอิสระ แต่ Anthropic เป็นผู้เผยแพร่คะแนนเหล่านั้น และ AA ยังไม่มีหน้า Haiku 5.5

  • GPT-6 Luna ถูกกว่าหรือไม่?

    โดยปกติ Luna มีค่าใช้จ่ายน้อยกว่าในทุกระดับความพยายามของ GDPval-AA และทุกระดับของ OSWorld ยกเว้นระดับกลาง ซึ่งทั้งสองมีค่าใช้จ่ายใกล้เคียงกัน อย่างไรก็ตาม Haiku 5.5 ได้คะแนนสูงกว่าในทั้งสองเกณฑ์มาตรฐาน

ขั้นตอนต่อไป

เริ่มต้นที่ระดับ medium และเพิ่มระดับความพยายามเฉพาะเมื่ออัตราการผ่านที่เพิ่มขึ้นคุ้มค่ากับต้นทุนของคุณ

ดาวน์โหลด Apidog สร้างชุดประเมินตามขั้นตอนข้างต้น และเก็บผลลัพธ์ไว้ใน Apidog เพื่อเทียบกับ Sonnet 5.5 baseline ก่อนเปลี่ยนทราฟฟิกการผลิตไปยังโมเดลใหม่

Top comments (0)