DEV Community

Cover image for Claude Haiku 5.5 Benchmark Testleri
Tobias Hoffmann
Tobias Hoffmann

Posted on Originally published at apidog.com

Claude Haiku 5.5 Benchmark Testleri

Claude Haiku 5.5, OSWorld 2.1'de %72,4, GDPval-AA v2.1'de 1620 Elo, FrontierCode 1.1'de %46,4 ve Terminal-Bench 4.0'da %39,2 puan almıştır. Haiku 4.5 aynı testlerin üçünde sırasıyla %15,7, 735 ve %0,0 puan almıştır. Bu sonuçların tümü maksimum çaba düzeyindedir; varsayılan orta düzeyde GDPval-AA puanı 1277'ye iner. Henüz hiçbir bağımsız laboratuvar Haiku 5.5 sonuçlarını yayımlamamıştır.

Apidog'u bugün deneyin

Bu yazıda Haiku 5.5 kıyaslamalarını, testleri kimin yürüttüğünü, çaba düzeyinin kalite ve maliyete etkisini ve modeli Apidog üzerinde kendi üretim trafiğinize benzeyen isteklerle nasıl test edeceğinizi ele alıyorum. Model özellikleri ve fiyatlandırma için önce Claude Haiku 5.5 nedir yazısına bakın.

Lansman tablosu

Aşağıdaki Haiku 5.5 sonuçları maksimum çaba düzeyinde adaptif düşünme kullanır. Sonuçlar genellikle beş denemenin ortalamasıdır; Terminal-Bench görev başına on deneme kullanmıştır. n/r, yayımlanmış sonuç olmadığı anlamına gelir.

Kıyaslama Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
GDPval-AA v2.1 (Elo) 1620 735 1437 1840
AA-Briefcase v1.1 (Elo) 1578 614 1336 1824
OSWorld 2.1, çevrimdışı alt küme %72,4 %15,7 %48,9 %83,9
Humanity’s Last Exam, araçsız %45,9 %10,2 n/r %56,9
Humanity’s Last Exam, araçlarla %57,4 %18,7 n/r %64,5
Terminal-Bench 4.0 %39,2 %0,0 %16,4 %70,6
FrontierCode 1.1 (Ana) %46,4 n/r %42,4 %52,1 (xhigh)
Chartography, araçsız %46,4 %6,4 %29,1 %61,6

Her kıyaslamayı kim çalıştırdı?

Testlerin çoğu Anthropic tarafından yürütüldü. Aynı kıyaslama adı, farklı sağlayıcılarda her zaman aynı test çerçevesi veya çaba ayarı anlamına gelmez.

Kıyaslama Kim çalıştırdı Koşullar
GDPval-AA v2.1, AA-Briefcase v1.1 Artificial Analysis, bağımsız olarak GDPval-AA: 220 görev, 44 meslek, Elo 1600'de DeepSeek V4.1 Flash (maksimum) ile sabitlenmiş; Briefcase: çok haftalı projeler
FrontierCode 1.1 Cognition Claude Code'da Claude, Codex'te GPT; Ana = 150 görevin en zor 100'ü
Chartography Anthropic, Surge AI'ın kıyaslamasında Gemini 3.5 Flash değerlendirici; Luna puanı Surge AI'dan
Terminal-Bench 4.0 Anthropic Claude Code --bare, 66 görev, görev başına 10 deneme, korumalar açık
OSWorld 2.1 Anthropic 108 görevin 82'si, 1080p, 500 adıma kadar
Humanity’s Last Exam Anthropic 980 bin belirteç görev bütçesi, Opus 4.6 değerlendirici

GPT-6 Luna sonuçları için bağlam önemlidir:

  • Anthropic, Luna'nın OSWorld puanını OpenAI API'si üzerinden aynı 82 görevde çalıştırdı.
  • Luna'nın Terminal-Bench sonucu (%16,4), genel liderlik tablosundan gelir: Codex CLI ve maksimum çaba düzeyi kullanılmıştır.
  • Terminal-Bench'te korumalar, Haiku 5.5 denemelerinin %1,8'ini durdurdu. Bu, 660 denemenin 12'sidir ve her biri başarısız sayılmıştır.

FrontierCode karşılaştırmasındaki tuzak

Lansman tablosu Haiku 5.5'i maksimum çabada (%46,4), Sonnet 5.5'i ise en iyi ayarı olan xhigh seviyesinde (%52,1) gösterir. Sistem kartı daha doğrudan karşılaştırma yapmayı sağlar:

FrontierCode 1.1 Ana Genişletilmiş
Haiku 5.5, maksimum %46,4 %58,4
Haiku 5.5, xhigh %45,8 n/r
Sonnet 5.5, maksimum %46,2 %59,1
Sonnet 5.5, xhigh %52,1 %64,4

Eşit koşullarda, yani her iki model de maksimum çabada çalışırken Haiku 5.5, Ana kategoride Sonnet 5.5'i %46,4'e karşı %46,2 ile az farkla geçer.

Ancak her modelin en iyi ayarını karşılaştırırsanız Sonnet 5.5, 5,7 puan öndedir. Bu nedenle FrontierCode sonucunu paylaşırken çaba düzeyini mutlaka belirtin.

Sistem kartındaki ek sonuçlar

Sistem kartı, lansman gönderisinde bulunmayan ek kıyaslama sonuçları içerir. Aksi belirtilmedikçe sonuçlar maksimum çaba düzeyindedir.

Kıyaslama Haiku 5.5 Haiku 4.5 Sonnet 5.5
SWE-Bench Pro 64,8 n/r 81,3
SWE-bench Çok Dilli 83,7 67,4 90,3
SWE-bench Çok Modlu 30,7 19,8 54,3
OSWorld 2.1, katı geçme oranı %37,1 n/r %48,8
Chartography, araçlarla %86,2 %8,8 %90,2
OfficeQA / OfficeQA Pro %73,5 / %60,3 %63,0 / %47,1 %76,9 / %65,6
HealthBench Professional, uzunluğa göre ayarlanmış %64,8 %32,2 %69,2

Bu sonuçları uygulamanıza aktarırken iki noktaya dikkat edin:

  1. OSWorld'deki %72,4 sonucu kısmi kredidir; görevlerin yalnızca %37,1'i doğrudan geçmiştir.
  2. Chartography, araçlar verildiğinde %46,4'ten %86,2'ye çıkar. Grafik veya veri işlemleri için modeli araçsız değerlendirmeyin.

Varsayılan çaba düzeyinde sonuçlar daha düşüktür

Claude API ve Claude Code, varsayılan olarak orta çaba düzeyini kullanır. output_config.effort göndermeden API çağrısı yaparsanız aşağıdaki sol sütundaki sonuçları hedeflemelisiniz.

Kıyaslama Orta (varsayılan) Maksimum Not
GDPval-AA v2.1 1277 1620 Orta, maksimumun çıkış belirteçlerinin yaklaşık onda birini kullandı
AA-Briefcase v1.1 1372 1578 Orta, maksimumun çıkış belirteçlerinin dörtte birinden azını kullandı
HealthBench Professional %59,9 %64,8 Düşük: %57,9, yüksek: %61,3

Beş çaba düzeyi hakkında ayrıntı için çaba düzeyleri belgelerine bakın.

Çaba düzeyine göre puan ve maliyet

Aşağıdaki değerler lansman grafiklerinden alınmıştır. OSWorld ve Terminal-Bench maliyetleri deneme başına, GDPval-AA maliyetleri görev başınadır.

Model / OSWorld 2.1 Düşük Orta Yüksek Çok Yüksek Maksimum
Haiku 5.5 %42,0 (0,07$) %53,3 (0,13$) %61,3 (0,18$) %67,6 (0,28$) %72,4 (0,61$)
Sonnet 5.5 %57,9 (0,68$) %66,0 (0,93$) %73,2 (1,38$) %81,1 (2,22$) %83,9 (5,73$)
GPT-6 Luna %19,2 (0,04$) %37,5 (0,13$) %42,3 (0,14$) %44,8 (0,17$) %48,9 (0,21$)
Model / GDPval-AA v2.1 Düşük Orta Yüksek Çok Yüksek Maksimum
Haiku 5.5 1125 (0,012$) 1277 (0,030$) 1420 (0,089$) 1513 (0,27$) 1620 (0,87$)
Sonnet 5.5 1179 (0,22$) 1324 (0,27$) 1551 (0,62$) 1731 (1,88$) 1840 (6,78$)
GPT-6 Luna 1036 (0,004$) 1262 (0,02$) 1344 (0,03$) 1364 (0,05$) 1437 (0,09$)
Model / Terminal-Bench 4.0 Düşük Orta Yüksek Çok Yüksek Maksimum
Haiku 5.5 %12,7 (0,42$) %20,3 (0,68$) %24,8 (1,04$) %31,5 (1,75$) %39,2 (2,64$)
Sonnet 5.5 %20,0 (0,62$) %28,8 (0,68$) %43,0 (1,46$) %61,5 (4,34$) %70,6 (10,44$)

Bu tablodan uygulanabilir çıkarımlar:

  • Maksimum seviye son adımda pahalılaşır. GDPval-AA'da orta seviyeden maksimuma çıkmak, 343 Elo puanı için yaklaşık 28 kat maliyet oluşturur.
  • Haiku 5.5, orta seviyede OSWorld'de Luna'yı maksimum seviyede geçer. Haiku: %53,3 ve 0,13$. Luna: %48,9 ve 0,21$. Buna rağmen Luna, orta seviye hariç diğer eşleşen seviyelerde daha ucuzdur. Ayrıntılı karşılaştırma için Haiku 5.5 vs GPT-6 Luna yazısına bakın.
  • Haiku 5.5, maksimumda OSWorld'de Sonnet 5.5'i orta seviyede geçer. Haiku %72,4 ve 0,61$ iken Sonnet %66,0 ve 0,93$'dır.
  • Terminal-Bench farklı bir örnektir. Sonnet 5.5 yüksek seviyede %43,0 ve 1,46$ ile Haiku 5.5'in maksimum seviyedeki %39,2 ve 2,64$ sonucunu daha düşük maliyetle geçer.

Maliyetler liste fiyatlarını temel alır: 100 bin belirtece kadar istemlerde milyon belirteç başına 0,10$/0,50$, bunun üzerinde daha yüksek fiyat uygulanır. Ayrıntılar için fiyatlandırma dökümüne bakın.

Haiku 5.5'in geride kaldığı alanlar

Sonnet 5.5, lansman tablosundaki her satırda genel olarak öndedir. Haiku 5.5'in eşit çaba düzeyindeki tek başa baş avantajı FrontierCode'da, her iki model maksimumda çalışırken görülür.

En büyük fark Terminal-Bench 4.0'dadır:

  • Haiku 5.5: %39,2
  • Sonnet 5.5: %70,6

Benzer farklar SWE-Bench Pro'da (64,8'e karşı 81,3) ve SWE-bench Multimodal'da (30,7'ye karşı 54,3) da görülür.

Anthropic de Sonnet 5.5 ve Opus 5.5'in “karmaşık ajanik kodlama görevleri için daha iyi seçenekler olmaya devam ettiğini” belirtiyor. Haiku 5.5'i şu tür dar kapsamlı işler için değerlendirin:

  • Sıkıştırma
  • Özetleme
  • Sınıflandırma
  • Tarayıcı kullanımı
  • Daha büyük bir modelin yönettiği alt ajanlar

Haiku'yu düşük maliyetli alt ajan olarak kullanma yaklaşımı için Claude Code'da Haiku 5.5 yazısına bakın.

Bağımsız sonuçlar henüz yok

8 Ekim 2026 itibarıyla bağımsız laboratuvarlar Haiku 5.5 için sonuç yayımlamamıştır. Artificial Analysis'in Haiku 5.5 sayfası 404 döndürüyor; liderlik tablosu yalnızca Claude 4.5 Haiku'yu listeliyor.

Vals, LMArena, SWE-bench ve Aider tarafında da sonuç görünmüyor. Üçüncü taraf hız verisi yoktur. Anthropic, Haiku 5.5'i standart hızda “bugüne kadarki en hızlı modeli” olarak tanımlıyor; ancak Hızlı Mod'daki Opus'tan daha yavaş olduğunu belirtiyor.

En yakın dış kaynaklı sayı Cursor'dan gelir. Cursor model belgeleri, Haiku 5.5'in maksimum çaba düzeyinde CursorBench'te %48,4 aldığını bildirir. Bu değer düşük çaba düzeyindeki %30,9'a göre artıştır.

Düşünme kapatıldığında Cursor, aynı çaba seviyelerinde %22,1 ile %26,2 arasında sonuç verir. Düşünme açık olduğunda bu aralık %30,9 ile %42,3'e çıkar.

Müşteriler ne rapor ediyor?

Aşağıdaki bilgiler Anthropic'in lansman gönderisinden alınmıştır ve bağımsız olarak doğrulanmamıştır:

  • HubSpot: Simüle edilmiş CRM portal paketinde üç çalıştırma ortalaması %92,8; bu pakette gördüğü en iyi sonuç.
  • AlphaSense: 400 Belge İçi Sorgu üzerinde Haiku 4.5'in 0,76 sonucuna karşı 0,84; farkın istatistiksel olarak anlamlı olduğunu bildiriyor.
  • Box: Erken testlerde Haiku 4.5'e göre 11 puan daha yüksek sonuç ve yaklaşık yarı gecikme süresi.
  • Asana: Görev tamamlamalarında mevcut modeline göre %30'dan fazla daha düşük gecikme.
  • Cognition: Devin Fusion, Haiku 5.5'i yardımcı, Opus 5.5'i lider model olarak kullanarak FrontierCode'da 66,2 puan aldı. Bu, yalnızca Haiku'dan oluşan bir sistem değildir.

Kendi değerlendirmenizi çalıştırın

Genel kıyaslamalar uygulamanızın trafiğini temsil etmez. Anthropic'in istem rehberi, xhigh veya maksimum çaba düzeyini yalnızca kendi değerlendirmelerinizde ölçülebilir kazanç sağladığında kullanmanızı önerir.

Aynı değerlendirme kümesini Sonnet 5.5 üzerinde de çalıştırın. Apidog ile aşağıdaki akışı uygulayın:

  1. ANTHROPIC_API_KEY değerini ortam değişkeni olarak saklayın.
  2. Üretimden veya gerçekçi testlerden 20–50 istem seçin ve bunları Mesajlar API isteği olarak kaydedin.
  3. Her isteğe doğrulama ekleyin:
    • HTTP durum kodu 200
    • stop_reason değerinin "max_tokens" veya "refusal" olmaması
    • Doğru yanıt için gereken alanların veya içeriğin bulunması
  4. Aynı koleksiyonu düşük, orta ve yüksek çaba düzeylerinde çalıştırın.
  5. Başarı oranını ve yanıttaki usage alanında bulunan belirteç sayılarını kaydedin.
  6. Koleksiyonu çoğaltın, modeli claude-sonnet-5-5 olarak değiştirin ve iki modeli aynı veri kümesinde karşılaştırın.

Çaba düzeyini değiştirmek istem önbelleğini geçersiz kılar. Ayrıca yeni belirteçleyici, aynı metin için Haiku 4.5'e göre yaklaşık %30 daha fazla belirteç üretebilir.

Örnek API isteği:

curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "max_tokens": 8000,
    "thinking": {"type": "adaptive"},
    "output_config": {"effort": "medium"},
    "messages": [
      {
        "role": "user",
        "content": "Classify this support ticket as billing, bug or feature request: ..."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Haiku 5.5 isteklerinde temperature, top_p, top_k veya asistan ön doldurma göndermeyin; bu parametrelerin her biri 400 yanıtı döndürür.

Yanıt bloklarını type alanına göre seçin. Çünkü bir thinking bloğu, asıl içerik bloğundan önce gelebilir.

Uygulama ayrıntıları için Claude Haiku 5.5 API rehberine ve LLM uygulamalarını test etme yazısına bakın.

Sıkça Sorulan Sorular

Claude Haiku 5.5, Sonnet 5.5'ten daha mı iyi?

Anthropic'in yayımladığı sonuçlara göre genel olarak hayır. Sonnet 5.5, lansman tablosundaki her satırda öndedir. Haiku 5.5 yalnızca FrontierCode'da, iki model de maksimum çabada çalışırken %46,4'e karşı %46,2 ile küçük bir avantaj sağlar.

Yükseltme değerlendirmesi için Haiku 5.5 vs Haiku 4.5 yazısına bakın.

Haiku 5.5'in SWE-bench puanı nedir?

Maksimum çaba düzeyinde:

  • SWE-Bench Pro: 64,8
  • SWE-bench Multilingual: 83,7
  • SWE-bench Multimodal: 30,7

Kıyaslamalar hangi çaba düzeyinde çalıştırıldı?

Sonuçların çoğu maksimum çaba düzeyindedir ve genellikle beş denemenin ortalamasıdır. API varsayılanı orta düzeydir; GDPval-AA sonucu bu düzeyde 1620 yerine 1277'dir.

Bağımsız Haiku 5.5 kıyaslamaları var mı?

Henüz yok. Artificial Analysis, GDPval-AA ve AA-Briefcase testlerini bağımsız yürüttü; ancak sonuçlar Anthropic tarafından yayımlandı. Artificial Analysis'in Haiku 5.5 sayfası şu anda mevcut değil.

GPT-6 Luna daha mı ucuz?

Genellikle evet. Luna, GDPval-AA'daki her çaba düzeyinde ve orta seviye dışındaki tüm OSWorld seviyelerinde daha düşük maliyetlidir. Orta seviyede iki model yaklaşık aynı maliyettedir. Haiku 5.5 ise iki kıyaslamada da daha yüksek puan alır.

Sonraki adım

orta çaba düzeyinden başlayın. Yalnızca başarı oranındaki artış ek maliyeti karşılıyorsa yüksek, çok yüksek veya maksimum seviyeye çıkın.

Apidog'u indirin, değerlendirme koleksiyonunuzu oluşturun ve üretim trafiğini değiştirmeden önce Haiku 5.5 sonuçlarını Sonnet 5.5 temelinizle birlikte Apidog içinde saklayın.

Top comments (0)