Claude Fable 5.1 Kıyaslamaları: Büyük Farklar, Küçük Farklar ve Kendi Testlerinizi Yapma
Anthropic, Claude Fable 5.1'i 1 Eylül 2026'da piyasaya sürdü. Sürüm duyurusunda Fable 5, Opus 5 ve GPT-5.6 Sol'u dokuz testte karşılaştıran bir tablo yer aldı. En çok öne çıkan sonuç Terminal-Bench-Science oldu: Fable 5.1 %52,6 puan alırken Fable 5 %24,7'de, Opus 5 ise %29,0'da kaldı. Daha az konuşulan CursorBench sonucunda ise Fable 5.1 ile Opus 5 arasındaki fark yalnızca 3,4 puandı.
Bu rehber, yayınlanan tüm sonuçları kaynaklarıyla birlikte toplar, her kıyaslamanın neyi ölçtüğünü açıklar ve büyük farkları küçük farklardan ayırır. Ayrıca lansman haberlerinde genellikle atlanan noktaları ele alır: tüm sonuçlar satıcı tarafından yürütüldü; her iki modelin de yayınlandığı tek ajan tabanlı kodlama testinde Mythos 5.1, Fable 5.1'i geride bıraktı. Bir lansman tablosuna verilecek en doğru yanıt, kendi değerlendirmelerinizi yapmaktır.
Birincil kaynak Anthropic'in lansman yazısıdır. Model bağlamı için Claude Fable 5.1 nedir yazısına bakabilirsiniz.
Tam tablo
| Kıyaslama | Neyi ölçer | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | Bir terminalde ajan tabanlı bilimsel araştırma | %52.6 | %24.7 | %29.0 | %22.4 |
| Terminal-Bench 4.0 | Bir terminalde ajan tabanlı kodlama | %55.8 | %42.0 | %52.3 | %37.3 |
| GDPval-AA v2 | Ekonomik olarak değerli bilgi çalışması (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (kısmi kredi) | Gerçek masaüstü görevlerinde bilgisayar kullanımı | %77.9 | %72.9 | %75.4 | bildirilmedi |
| OSWorld 2.0 (katı) | Aynı, yalnızca tam görev tamamlama | %41.7 | %36.1 | %39.6 | bildirilmedi |
| İnsanlığın Son Sınavı (araçsız) | Uzman düzeyinde muhakeme soruları | %60.9 | %57.8 | %56.6 | bildirilmedi |
| İnsanlığın Son Sınavı (araçlı) | Aynı, arama ve kod ile | %65.0 | %63.8 | %63.6 | bildirilmedi |
| AutomationBench | Uçtan uca iş akışları | %31.4 | %17.1 | %26.9 | %19.6 |
| CursorBench 3.2.0 | IDE tarzı kodlama görevleri | %73.4 | %70.5 | %70.0 | %67.2 |
Anthropic ayrıca Terminal-Bench 4.0 için Mythos 5.1'in %60,9 puan aldığını açıkladı. VentureBeat, Fable 5.1 için %82'lik bir Browserbase sonucu da bildirdi. En zorlu tarayıcı-ajan görevlerindeki sonuçlar Opus 5 için %74, Fable 5 için %57 idi. Bu veri lansman yazısından değil, basın haberlerinden geldiği için dikkatli değerlendirilmelidir.
Büyük farklar
Terminal-Bench-Science 0.1
Fable 5.1: %52.6 — Fable 5: %24.7 — Opus 5: %29.0
Bu, tablodaki en dikkat çekici sonuç. Fable 5.1, önceki modelinin puanını iki katından fazla artırıyor ve bilimsel araçlarla çalışan bir terminalde çok adımlı araştırma görevlerinde Opus 5'i neredeyse ikiye katlıyor.
Sonuç, Anthropic'in “uzun vadeli problem çözme” odağının ölçülebilir bir karşılığı olduğunu gösteriyor. Ancak bu, sürüm 0.1 olan yeni bir kıyaslama; görev seti olgunlaştıkça puanlar değişebilir.
AutomationBench
Fable 5.1: %31.4 — Fable 5: %17.1 — Opus 5: %26.9
AutomationBench, uygulamalar arası uçtan uca iş akışlarını ölçüyor. Mutlak puanlar tüm modellerde düşük olsa da Fable 5.1, Fable 5'in neredeyse iki katı puan alıyor ve Opus 5'in 4,5 puan önünde.
Ürününüz çok uygulamalı iş görevlerini otomatikleştiriyorsa bu satır özellikle önemlidir.
Terminal-Bench 4.0
Fable 5.1: %55.8 — Fable 5: %42.0 — Opus 5: %52.3
Ajan tabanlı kodlamada Fable 5.1, Fable 5'e göre 13,8 puanlık artış sağlıyor. Anthropic'in lansman yazısında kodlama bölümünde öne çıkardığı temel sayı buydu.
Opus 5'e karşı fark 3,5 puan. Opus 5, Temmuz ayında bu kıyaslamada Fable 5'i zaten geride bırakmıştı. Fable serisi böylece avantajı geri kazanıyor, ancak bu avantaj Haziran ayındaki farktan daha dar.
Opus 5 kıyaslama detayları Temmuz sonuçlarını içeriyor.
GDPval-AA v2
Fable 5.1: 1853 — Fable 5: 1723 — Opus 5: 1824
Bilgi işi görevlerinde Fable 5.1, Fable 5'e karşı 130 Elo puanlık kazanç sağlıyor. Anthropic bu kıyaslamayı belge, e-tablo ve slayt performansını desteklemek için kullanıyor.
Opus 5'e karşı fark 29 Elo; yani diğer büyük farklarla karşılaştırıldığında küçük.
Küçük farklar
CursorBench 3.2.0
Fable 5.1: %73.4 — Fable 5: %70.5 — Opus 5: %70.0
CursorBench, IDE tarzı kodlama görevlerini ölçüyor. Fable 5.1, her iki modele karşı da yalnızca yaklaşık üç puan önde.
Bu, geliştiricilerin büyük bölümü için en pratik kıyaslama olabilir. İş yükünüz “editörümde bana yardım et” seviyesindeyse, bu tablo tek başına iki kat fiyatı haklı çıkarmıyor.
OSWorld 2.0
Kısmi kredi: Fable 5.1 %77.9 — Opus 5 %75.4 — Fable 5 %72.9
Katı puanlama: Fable 5.1 %41.7 — Opus 5 %39.6 — Fable 5 %36.1
OSWorld, gerçek masaüstü görevlerinde bilgisayar kullanımını ölçüyor. Her iki puanlama yönteminde de Fable 5.1, Opus 5'in yaklaşık iki; Fable 5'in yaklaşık beş puan önünde.
Fark dramatik değil. Daha önemli nokta, katı puanlamada modellerin görevlerin yarısından azını tamamen tamamlaması. Bilgisayar kullanımı hâlâ bu alanın en zayıf noktası.
İnsanlığın Son Sınavı
Araçsız: Fable 5.1 %60.9 — Opus 5 %56.6
Araçlı: Fable 5.1 %65.0 — Opus 5 %63.6
Araçsız değerlendirmede Fable 5.1'in Opus 5'e farkı 4,3 puan. Bu, küçük farklar grubundaki en büyük fark. Arama ve kod çalıştırma eklendiğinde fark 1,4 puana düşüyor.
Araçsız sonuç ham muhakemeyi; araçlı sonuç ise modelin gerçek kullanım biçimini daha iyi yansıtıyor.
Fable 5.1 ve GPT-5.6 Sol
Anthropic, GPT-5.6 Sol'un bulunduğu dört satır yayımladı ve Fable 5.1 dördünde de önde:
- Terminal-Bench-Science: 30,2 puan fark
- Terminal-Bench 4.0: 18,5 puan fark
- AutomationBench: 11,8 puan fark
- CursorBench: 6,2 puan fark
GDPval-AA sonucu da 1853'e karşı 1711.
İki önemli uyarı var:
- Bu sonuçlar Anthropic'in rakip model üzerinde yaptığı çalıştırmalardır.
- GPT-5.6 Sol sütunu olmayan beş satırda neden sonuç paylaşılmadığı belirtilmemiştir.
Daha önceki eşleşme için GPT-5.6 Sol ve Fable 5 karşılaştırmamıza göz atabilirsiniz. Bu rakamlara göre Fable 5.1, Fable 5'in sahip olduğu avantajları genişletiyor.
Lansman haberlerinin atladığı noktalar
Tüm sonuçlar satıcı tarafından üretildi
Rakip model sütunu dahil tüm sonuçları Anthropic kendisi çalıştırdı. Lansman sırasında hiçbir bağımsız laboratuvar bu sonuçları yeniden üretmedi.
Anthropic'in kıyaslama geçmişi genellikle sağlam olsa da CursorBench ve OSWorld farkları küçük. Farklı bir test çerçevesi veya puanlama yaklaşımı sonuçları tersine çevirebilir.
Mythos 5.1 daha yüksek bir tavan gösteriyor
Anthropic'in sistem kartı ve lansman yazısına göre Fable 5.1 ile Mythos 5.1, farklı güvenlik önlemlerine sahip aynı model.
Terminal-Bench 4.0 sonuçları:
- Mythos 5.1: %60.9
- Fable 5.1: %55.8
Beş puanlık fark, ajan tabanlı kodlamada güvenlik önlemlerinin maliyetini gösteriyor. Aynı zamanda Anthropic'in en yetenekli, yaygın olarak piyasaya sürülen modelinin üzerinde daha yetenekli bir kardeş model bulunduğu anlamına geliyor.
Mythos 5.1 ve Fable 5.1 karşılaştırması, erişim koşullarını açıklıyor.
Çaba seviyesi belirtilmedi
Anthropic'in çaba dokümantasyonu, Fable 5.1 kazanımlarının xhigh ve max seviyelerinde daha büyük olduğunu belirtiyor.
Ancak lansman yazısı, her puanın hangi çaba seviyesinde üretildiğini veya karşılaştırma modellerinin hangi ayarlarla çalıştırıldığını açıklamıyor. Çaba, bu modellerdeki temel kalite kaldıraçlarından biri olduğu için bu eksiklik, sonuçları yeniden üretmeye çalışırken önem kazanıyor.
Çok dillilik iyileşmedi
Anthropic, çok dilli performansın Fable 5 ile aynı seviyede kaldığını ve iyileşmediğini belirtiyor. İş yükünüz İngilizce dışındaysa lansman tablosundaki genel kazanım sizin sonuçlarınızı yansıtmayabilir.
Güvenlik ölçümleri farklı bir kıyaslama türüdür
Anthropic, Fable 5'e göre şu sonuçları bildiriyor:
- İyi huylu biyoloji isteklerinde %85 daha az yanlış pozitif
- Claude Code oturumu başına yaklaşık %60 daha az siber müdahale
Bu ölçümler Anthropic'in kendi trafiğinde yapıldığı için dışarıdan yeniden üretilemez. Ancak retlerle karşılaşan bir Fable 5 kullanıcısı için bu sonuçlar, herhangi bir yetenek puanından daha önemli olabilir.
Kendi testlerinizi yapın
Lansman tablosu nereye bakacağınızı söyler; kendi değerlendirmeleriniz hangi modele geçmeniz gerektiğini gösterir. Aşağıdaki dört testi uygulayın:
-
Uzun vadeli ajan görevi: Kendi ürününüzden bir görevi Fable 5.1'de
high, Opus 5'texhighve Fable 5'tehighçaba seviyesinde tamamlanana kadar çalıştırın. Bu, Terminal-Bench-Science ve AutomationBench'in pratik bir karşılığıdır. - Kodlama karşılaştırması: En zor 10 kodlama isteminizi Fable 5.1 ve Opus 5'te aynı çaba seviyesiyle çalıştırın. Sonuçlar eşitse CursorBench hikâyesini yeniden üretmiş olursunuz; bu durumda Opus 5 daha mantıklı olabilir.
-
Çaba taraması: Rutin bir görevde yalnızca Fable 5.1'i
lowilemaxarasında test edin. Anthropic'in iddiası,mediumseviyesinin Fable 5 ile eşleştiği velowseviyesinin görev başına maliyette Opus 5 ile rekabet ettiği yönünde. - Güvenli istekler: İyi huylu güvenlik veya yaşam bilimleri istemlerinizde Fable 5 ile Fable 5.1'in ret oranlarını karşılaştırın. Böylece bildirilen %60 ve %85'lik iyileştirmeleri kendi kullanımınızda kontrol edebilirsiniz.
Bu testleri Apidog'da model ve effort değerlerini ortam değişkeni olarak tanımlayarak istekler halinde oluşturun. stop_reason değerini ve yanıtta beklenen bir dizenin bulunmasını doğrulayan iddialar ekleyin; ardından koleksiyonu modellere göre çalıştırın.
Çalışma geçmişi, yeni altyapı kurmadan yeniden üretilebilir bir değerlendirme tablosu sağlar. Başlamak için Apidog'u indirin. İstek biçimleri için API rehberine bakabilirsiniz.
Kıyaslamalar kararı nasıl etkiler?
- Uzun vadeli ajanlar, araştırma ve otomasyon: Farklar büyük ve tutarlı. Fable 5.1 bu iş yüklerinde öne çıkıyor. Fiyatlandırma detayları, daha ucuz önbellek okumalarının maliyet farkını nasıl daralttığını açıklıyor.
- IDE kodlama, bilgi soru-cevap ve araç destekli muhakeme: Opus 5'e karşı farklar bir ila dört puan arasında. Daha yüksek çaba seviyelerinde yapılan kendi testleriniz başarısız olmadıkça Opus 5'te kalmak mantıklı olabilir. Fable 5.1 ve Opus 5 karşılaştırması ayrıntıları içeriyor.
- Fable 5'ten geçiş: Tüm satırlarda iyileşme var; fiyat değişmedi ve yanlış pozitif oranı düştü. Fable 5.1 ve Fable 5 karşılaştırması, geçiş maliyetini ele alıyor.
Sıkça Sorulan Sorular
Claude Fable 5.1'in en iyi kıyaslama sonucu nedir?
Terminal-Bench-Science 0.1'de %52.6 puan aldı. Bu sonuç Fable 5'in %24.7'sinin iki katından fazla; Opus 5'in %29.0 ve GPT-5.6 Sol'un %22.4 puanının da üzerinde. Tüm rakamlar Anthropic'e ait.
Fable 5.1 kodlamada Opus 5 ile nasıl karşılaştırılır?
Anthropic'in sonuçlarına göre:
- Terminal-Bench 4.0: Fable 5.1 %55.8, Opus 5 %52.3
- CursorBench 3.2.0: Fable 5.1 %73.4, Opus 5 %70.0
Fark gerçek, ancak yaklaşık üç puanla sınırlı.
Fable 5.1, GPT-5.6 Sol'dan daha mı iyi?
Anthropic'in her iki model için sonuç yayımladığı dört kıyaslamada evet. Farklar 6 ila 30 puan arasında. Ancak GPT-5.6 Sol sonuçları Anthropic tarafından çalıştırıldı ve dokuz satırın beşinde GPT-5.6 Sol girişi bulunmuyor.
Fable 5.1 kıyaslamaları bağımsız olarak doğrulandı mı?
Lansman sırasında doğrulanmadı. Tüm sonuçlar Anthropic tarafından yürütüldü. Bu nedenle sonuçları kesin gerçekler yerine kendi iş yükünüzde test edilmesi gereken iddialar olarak değerlendirin.
Mythos 5.1 nasıl puan alıyor?
Anthropic'in yayımladığı tek sonuç Terminal-Bench 4.0'a ait: Mythos 5.1 %60.9, Fable 5.1 ise %55.8 puan aldı. İki model, farklı güvenlik önlemlerine sahip aynı model olarak tanımlanıyor.
Bu puanları hangi çaba seviyesi üretti?
Anthropic bunu belirtmedi. Şirket, Fable 5.1 kazanımlarının xhigh ve max seviyelerinde daha büyük olduğunu söylüyor. Bu nedenle yüksek çaba kullanıldığını varsayın ve daha düşük ayarlarda puanların düşmesini bekleyin.





Top comments (0)