Claude Haiku 5.5 mencetak 72,4% pada OSWorld 2.1, 1620 pada GDPval-AA v2.1, 46,4% pada FrontierCode 1.1, dan 39,2% pada Terminal-Bench 4.0. Haiku 4.5 mencetak 15,7%, 735, dan 0,0% pada tiga tolok ukur tersebut. Semua angka ini menggunakan upaya maksimal; pada upaya standar medium, GDPval-AA turun menjadi 1277. Belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5.
Artikel ini merangkum setiap tolok ukur Claude Haiku 5.5, pihak yang menjalankannya, dampak pengaturan upaya terhadap skor dan biaya, serta cara mengujinya pada lalu lintas Anda sendiri di Apidog. Untuk spesifikasi dan harga, mulai dari apa itu Claude Haiku 5.5.
Tabel peluncuran
Setiap hasil Haiku 5.5 di bawah menggunakan pemikiran adaptif pada upaya maksimal, biasanya dirata-ratakan dari lima percobaan. Terminal-Bench menggunakan sepuluh percobaan per tugas. n/r berarti tidak ada hasil yang diterbitkan.
| Tolok ukur | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| GDPval-AA v2.1 (Elo) | 1620 | 735 | 1437 | 1840 |
| AA-Briefcase v1.1 (Elo) | 1578 | 614 | 1336 | 1824 |
| OSWorld 2.1, subset offline | 72,4% | 15,7% | 48,9% | 83,9% |
| Ujian Terakhir Manusia, tanpa alat | 45,9% | 10,2% | n/r | 56,9% |
| Ujian Terakhir Manusia, dengan alat | 57,4% | 18,7% | n/r | 64,5% |
| Terminal-Bench 4.0 | 39,2% | 0,0% | 16,4% | 70,6% |
| FrontierCode 1.1 (Utama) | 46,4% | n/r | 42,4% | 52,1% (sangat tinggi) |
| Kartografi, tanpa alat | 46,4% | 6,4% | 29,1% | 61,6% |
Siapa yang menjalankan setiap tolok ukur
Anthropic menjalankan sebagian besar pengujian sendiri. Baris lintas vendor dapat memakai nama tolok ukur yang sama, tetapi tidak selalu menggunakan harness atau pengaturan upaya yang identik.
| Tolok ukur | Siapa yang menjalankannya | Kondisi |
|---|---|---|
| GDPval-AA v2.1, AA-Briefcase v1.1 | Artificial Analysis, secara independen | GDPval-AA: 220 tugas, 44 pekerjaan, Elo dijangkarkan ke DeepSeek V4.1 Flash (maks) pada 1600; Briefcase: proyek multi-minggu |
| FrontierCode 1.1 | Cognition | Claude di Claude Code, GPT di Codex; Utama = 100 tugas tersulit dari 150 |
| Kartografi | Anthropic, pada tolok ukur Surge AI | Penilai Gemini 3.5 Flash; skor Luna dari Surge AI |
| Terminal-Bench 4.0 | Anthropic | Claude Code --bare, 66 tugas, 10 percobaan masing-masing, pengamanan aktif |
| OSWorld 2.1 | Anthropic | 82 dari 108 tugas, 1080p, hingga 500 langkah |
| Ujian Terakhir Manusia | Anthropic | Anggaran tugas 980K token, penilai Opus 4.6 |
Dua skor GPT-6 Luna memerlukan konteks:
- Anthropic menjalankan skor OSWorld Luna melalui API OpenAI pada 82 tugas yang sama.
- Terminal-Bench Luna 16,4% berasal dari papan peringkat publik menggunakan Codex CLI pada upaya maksimal.
- Pada Terminal-Bench, pengamanan menghentikan 1,8% percobaan Haiku 5.5 atau 12 dari 660 percobaan. Setiap percobaan tersebut dihitung sebagai kegagalan.
Jebakan FrontierCode
Tabel peluncuran membandingkan Haiku 5.5 pada maks (46,4%) dengan Sonnet 5.5 pada sangat tinggi (52,1%), yaitu skor terbaik Sonnet. Kartu sistem menyediakan angka yang lebih sebanding:
| FrontierCode 1.1 | Utama | Diperluas |
|---|---|---|
| Haiku 5.5, maks | 46,4% | 58,4% |
| Haiku 5.5, sangat tinggi | 45,8% | n/r |
| Sonnet 5.5, maks | 46,2% | 59,1% |
| Sonnet 5.5, sangat tinggi | 52,1% | 64,4% |
Pada upaya maksimal yang sama, Haiku 5.5 sedikit mengungguli Sonnet 5.5 pada subset Utama: 46,4% versus 46,2%.
Namun, pada konfigurasi terbaik masing-masing model, Sonnet memimpin 5,7 poin. Saat mengutip hasil FrontierCode, selalu sertakan tingkat upaya yang digunakan.
Tambahan dari kartu sistem
Kartu sistem menambahkan beberapa hasil yang tidak ada pada postingan peluncuran. Semua menggunakan upaya maksimal, kecuali jika disebutkan lain.
| Tolok ukur | Haiku 5.5 | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| SWE-Bench Pro | 64,8 | n/r | 81,3 |
| SWE-bench Multilingual | 83,7 | 67,4 | 90,3 |
| SWE-bench Multimodal | 30,7 | 19,8 | 54,3 |
| OSWorld 2.1, tingkat kelulusan ketat | 37,1% | n/r | 48,8% |
| Kartografi, dengan alat | 86,2% | 8,8% | 90,2% |
| OfficeQA / OfficeQA Pro | 73,5% / 60,3% | 63,0% / 47,1% | 76,9% / 65,6% |
| HealthBench Profesional, disesuaikan panjang | 64,8% | 32,2% | 69,2% |
Skor OSWorld 72,4% mencakup kredit parsial; hanya 37,1% tugas yang lulus sepenuhnya. Pada Kartografi, penggunaan alat menaikkan skor Haiku 5.5 dari 46,4% menjadi 86,2%, sehingga alat penting untuk tugas berbasis grafik.
Skor upaya standar lebih rendah
Haiku 5.5 menggunakan medium secara default pada API Claude dan Claude Code. Kartu sistem melaporkan hasil berikut untuk upaya standar:
| Tolok ukur | Menengah (standar) | Maks | Catatan |
|---|---|---|---|
| GDPval-AA v2.1 | 1277 | 1620 | Menengah menggunakan sekitar sepersepuluh token output maks |
| AA-Briefcase v1.1 | 1372 | 1578 | Menengah menggunakan kurang dari seperempat token output maks |
| HealthBench Profesional | 59,9% | 64,8% | Rendah 57,9%, tinggi 61,3% |
Jika Anda memanggil API tanpa output_config.effort, harapkan hasil yang mendekati kolom medium. Dokumentasi effort mencakup kelima tingkat upaya.
Skor dan biaya berdasarkan upaya
Data berikut berasal dari grafik peluncuran. Biaya OSWorld dan Terminal-Bench adalah biaya per percobaan, sedangkan GDPval-AA adalah biaya per tugas.
| Model — OSWorld 2.1 | Rendah | Menengah | Tinggi | Sangat tinggi | Maks |
|---|---|---|---|---|---|
| Haiku 5.5 | 42,0% ($0.07) | 53,3% ($0.13) | 61,3% ($0.18) | 67,6% ($0.28) | 72,4% ($0.61) |
| Sonnet 5.5 | 57,9% ($0.68) | 66,0% ($0.93) | 73,2% ($1.38) | 81,1% ($2.22) | 83,9% ($5.73) |
| GPT-6 Luna | 19,2% ($0.04) | 37,5% ($0.13) | 42,3% ($0.14) | 44,8% ($0.17) | 48,9% ($0.21) |
| Model — GDPval-AA v2.1 | Rendah | Menengah | Tinggi | Sangat tinggi | Maks |
|---|---|---|---|---|---|
| Haiku 5.5 | 1125 ($0.012) | 1277 ($0.030) | 1420 ($0.089) | 1513 ($0.27) | 1620 ($0.87) |
| Sonnet 5.5 | 1179 ($0.22) | 1324 ($0.27) | 1551 ($0.62) | 1731 ($1.88) | 1840 ($6.78) |
| GPT-6 Luna | 1036 ($0.004) | 1262 ($0.02) | 1344 ($0.03) | 1364 ($0.05) | 1437 ($0.09) |
| Model — Terminal-Bench 4.0 | Rendah | Menengah | Tinggi | Sangat tinggi | Maks |
|---|---|---|---|---|---|
| Haiku 5.5 | 12,7% ($0.42) | 20,3% ($0.68) | 24,8% ($1.04) | 31,5% ($1.75) | 39,2% ($2.64) |
| Sonnet 5.5 | 20,0% ($0.62) | 28,8% ($0.68) | 43,0% ($1.46) | 61,5% ($4.34) | 70,6% ($10.44) |
Poin praktis dari tabel tersebut:
-
Upaya maksimal mahal untuk peningkatan terakhir. Pada GDPval-AA,
maksmenggunakan sekitar 28 kali biayamediumuntuk tambahan 343 Elo. Pada OSWorld,maksmenghabiskan lebih dari dua kali biayasangat tinggiuntuk tambahan 4,8 poin. -
Haiku 5.5 pada
mediummengalahkan Luna padamaksdi OSWorld: 53,3% dengan $0.13, dibandingkan 48,9% dengan $0.21. -
Haiku 5.5 pada
maksmengalahkan Sonnet 5.5 padamediumdi OSWorld: 72,4% dengan $0.61, dibandingkan 66,0% dengan $0.93. -
Terminal-Bench adalah pengecualian: Sonnet 5.5 pada
tinggimencapai 43,0% dengan $1.46, lebih baik daripada Haiku 5.5 padamaksyang mencapai 39,2% dengan $2.64.
Luna lebih murah pada setiap tingkat upaya yang setara, kecuali biaya medium OSWorld yang hampir sama. Untuk perbandingan lebih rinci, lihat Haiku 5.5 vs GPT-6 Luna.
Biaya menggunakan harga daftar: $0.10/$0.50 per juta token untuk prompt hingga 100K token, dan lebih tinggi untuk konteks di atas batas tersebut. Lihat rincian harga.
Di mana Haiku 5.5 masih tertinggal
Sonnet 5.5 memimpin setiap baris pada tabel peluncuran. Satu-satunya kemenangan head-to-head Haiku adalah FrontierCode pada upaya maksimal yang sama.
Kesenjangan terbesar terlihat pada:
- Terminal-Bench 4.0: 39,2% vs 70,6%.
- SWE-Bench Pro: 64,8 vs 81,3.
- SWE-bench Multimodal: 30,7 vs 54,3.
Anthropic juga menyatakan bahwa Sonnet 5.5 dan Opus 5.5 tetap lebih baik untuk tugas pengkodean agen yang kompleks. Haiku 5.5 lebih cocok untuk pekerjaan dengan cakupan sempit, seperti:
- Pemadatan konteks
- Peringkasan
- Klasifikasi
- Penggunaan browser
- Sub-agen di bawah model yang lebih besar
Untuk pola sub-agen yang lebih murah, lihat Haiku 5.5 di Claude Code.
Hasil independen belum ada
Per 8 Oktober 2026, belum ada laboratorium independen yang menerbitkan hasil Haiku 5.5.
Halaman Haiku 5.5 Artificial Analysis mengembalikan 404, sementara papan peringkat Artificial Analysis hanya mencantumkan Claude 4.5 Haiku. Vals, LMArena, SWE-bench, dan Aider juga belum menampilkan hasil Haiku 5.5.
Tidak ada angka kecepatan pihak ketiga. Anthropic menyebut Haiku 5.5 sebagai “model tercepat hingga saat ini” pada kecepatan standar, tetapi lebih lambat dari Opus dalam Mode Cepat.
Angka eksternal terdekat datang dari Cursor. Dokumentasi model Cursor menyebut Haiku 5.5 mencetak 48,4% pada CursorBench dengan upaya maksimal, naik dari 30,9% pada low.
Dengan pemikiran dimatikan, Cursor melaporkan skor 22,1% hingga 26,2%. Ketika pemikiran diaktifkan, skor menjadi 30,9% hingga 42,3% pada tingkat upaya yang sama.
Apa yang dilaporkan pelanggan
Data berikut berasal dari postingan peluncuran Anthropic dan belum diverifikasi secara independen:
- HubSpot: rata-rata 92,8% dari tiga percobaan pada suite portal CRM simulasi mereka.
- AlphaSense: 0,84 dibanding 0,76 untuk Haiku 4.5 pada 400 kueri Tanya dalam Dokumen.
- Box: 11 poin lebih tinggi daripada Haiku 4.5 dengan sekitar setengah latensi dalam pengujian awal.
- Asana: latensi lebih dari 30% lebih rendah untuk penyelesaian tugas dibandingkan model saat ini.
- Cognition: Devin Fusion mencapai skor FrontierCode 66,2 dengan Haiku 5.5 sebagai rekan dan Opus 5.5 sebagai pemimpin. Ini adalah sistem dua model, bukan hasil Haiku saja.
Jalankan evaluasi Anda sendiri
Tolok ukur publik tidak akan identik dengan lalu lintas produksi Anda. Panduan prompt Anthropic menyarankan penggunaan xhigh atau maks hanya jika evaluasi Anda menunjukkan peningkatan yang nyata. Jalankan evaluasi yang sama pada Sonnet 5.5 sebagai pembanding.
Gunakan alur berikut di Apidog:
- Simpan
ANTHROPIC_API_KEYsebagai variabel lingkungan. - Buat koleksi berisi 20 hingga 50 prompt nyata sebagai permintaan Messages API.
- Tambahkan assertion untuk:
- Status
200 -
stop_reasonbukan"max_tokens"atau"refusal" - Konten wajib yang harus ada pada jawaban benar
- Status
- Jalankan koleksi pada
low,medium, danhigh. - Catat tingkat kelulusan dan jumlah token di objek
usage. - Duplikat koleksi, ganti model menjadi
claude-sonnet-5-5, lalu bandingkan hasilnya dalam proyek yang sama.
Mengubah pengaturan effort membatalkan cache prompt. Tokenizer baru juga menghasilkan sekitar 30% lebih banyak token dibandingkan Haiku 4.5 untuk teks yang sama.
Contoh permintaan API:
curl https://api.anthropic.com/v1/messages \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "content-type: application/json" \
-d '{
"model": "claude-haiku-5-5",
"max_tokens": 8000,
"thinking": {"type": "adaptive"},
"output_config": {"effort": "medium"},
"messages": [
{
"role": "user",
"content": "Classify this support ticket as billing, bug or feature request: ..."
}
]
}'
Jangan mengirim temperature, top_p, top_k, atau prefill asisten. Masing-masing akan mengembalikan HTTP 400 pada Haiku 5.5.
Saat memproses respons, pilih blok berdasarkan nilai type, karena blok thinking dapat muncul sebelum blok jawaban. Lihat panduan API Claude Haiku 5.5 dan pengujian aplikasi LLM.
FAQ
Apakah Claude Haiku 5.5 lebih baik dari Sonnet 5.5?
Tidak berdasarkan angka Anthropic. Sonnet 5.5 memimpin setiap baris pada tabel peluncuran. Haiku hanya sedikit unggul di FrontierCode ketika keduanya menggunakan upaya maksimal: 46,4% vs 46,2%. Lihat Haiku 5.5 vs Haiku 4.5 untuk perbandingan peningkatan.
Berapa skor SWE-bench Haiku 5.5?
Haiku 5.5 mencetak 64,8 pada SWE-Bench Pro, 83,7 pada SWE-bench Multilingual, dan 30,7 pada SWE-bench Multimodal. Semuanya menggunakan upaya maksimal.
Pada upaya berapa tolok ukur dijalankan?
Biasanya pada maks, dengan rata-rata lima percobaan. Standar API adalah medium, di mana GDPval-AA menghasilkan 1277, bukan 1620.
Apakah ada tolok ukur Haiku 5.5 independen?
Belum. Artificial Analysis menjalankan GDPval-AA dan AA-Briefcase secara independen, tetapi Anthropic yang menerbitkan skor tersebut. Artificial Analysis belum memiliki halaman Haiku 5.5.
Apakah GPT-6 Luna lebih murah?
Biasanya, ya. Luna memiliki biaya lebih rendah pada setiap tingkat GDPval-AA dan setiap tingkat OSWorld kecuali medium, ketika biaya keduanya hampir sama. Namun, Haiku 5.5 menghasilkan skor lebih tinggi pada kedua tolok ukur tersebut.
Langkah selanjutnya
Mulai dari medium, lalu naikkan effort hanya jika peningkatan tingkat kelulusan sepadan dengan biayanya.
Unduh Apidog, buat koleksi evaluasi Anda, lalu simpan hasil Haiku dan baseline Sonnet 5.5 di Apidog sebelum mengalihkan lalu lintas produksi.
Top comments (0)