İki hafta boyunca Qwen 3.8 hikayesinde bir boşluk vardı. Temmuz ayındaki basın ön gösterimleri, sınır ötesi sınıf bir model vaat ediyordu ancak hiçbir skor sunmadı; bu nedenle erken dönem yazılar izlenimlere dayanıyordu. Bu durum 3 Ağustos 2026'da değişti. Alibaba'nın Qwen 3.8-Max için resmi yayın gönderisi, Claude Opus 4.8, Fable 5, GPT-5.6 Sol ve Qwen3.7-Max'e karşı tam bir karşılaştırma tablosunun yanı sıra Gemini 3.1 Pro ve GPT-5.6 Sol'a karşı ayrı bir çok modlu tablo içeriyor.
Bu tabloyu dikkatle okumaya değer. Gerçek başarılar, dürüst kayıplar ve çoğu haberin atlayacağı küçük yazılar içeriyor. Bu gönderi bunların üçünü de ele alıyor, ardından satıcı tablolarına daha az bağımlı olmak için pratik bir yol sunuyor: API'ye karşı kendi değerlendirmenizi yapın. Önce modelin tam açıklamasını (parametreler, fiyatlandırma, erişim) istiyorsanız, Qwen 3.8-Max açıklayıcımızdan başlayın ve geri dönün.
Rakamları vermeden önce bir not: Aşağıdaki her skor Alibaba'nın kendi yayınladığı tablodan alınmıştır ve dipnotlardaki liderlik tablosu verileri 3 Ağustos 2026 tarihine aittir. Yazıldığı sırada bağımsız bir değerlendirme mevcut değildi. Her satırı bu bağlamda okuyun.
Tabloya bir bakış
Alibaba'nın yayınladığı başlık niteliğindeki metin-model satırları aşağıda. Tüm satırlarda daha yüksek skor daha iyidir.
| Kıyaslama | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE (İnsanlığın Son Sınavı) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
Kaynak: Alibaba'nın kendi çalıştırdığı tablo. “Satıcı tarafından çalıştırılan” ifadesinin pratikte ne anlama geldiği burada özellikle önem taşıyor.
Qwen 3.8-Max'in kazandığı yerler
PaperBench: en iyi amiral gemisi satırı
Bir modelin araştırma makalesi sonuçlarını yeniden üretip üretemeyeceğini test eden PaperBench, Qwen 3.8-Max'in en güçlü sınır performansı:
- Qwen 3.8-Max: 93.0
- GPT-5.6 Sol: 90.5
- Fable 5: 88.8
- Claude Opus 4.8: 80.3
- Qwen3.7-Max: 64.8
Qwen3.7-Max'in 64.8 skorundan 93.0'a çıkış, dikkatle incelenmesi gereken büyük bir nesiller arası sıçrama. Bu sonuç bağımsız testlerde de korunursa, modelin uzun vadeli araştırma görevlerindeki yeteneği hakkında güçlü bir sinyal olur.
IFBench: geniş farkla talimat takibi
IFBench'te Qwen 3.8-Max 82.8 puan alıyor. En yakın Qwen dışı rakip GPT-5.6 Sol 72.7 puanda; Fable 5 63.5, Opus 4.8 ise 62.2 puanda.
Bu, doymuş bir kıyaslamada alışılmadık derecede büyük, 10 ila 20 puanlık bir fark. Ayrıca Qwen3.7-Max'in de bu satırda 79.1 almış olması, talimat takibinin tek seferlik bir sonuçtan ziyade kalıcı bir Qwen gücü olabileceğini gösteriyor.
Terminal Bench 2.1: Claude'u geride bırakıyor
Alibaba'nın Terminal Bench 2.1 testinde Qwen 3.8-Max:
- Qwen 3.8-Max: 86.6
- Claude Opus 4.8: 84.6
- Fable 5: 84.6
- GPT-5.6 Sol: 88.8
Qwen burada hem Opus 4.8'i hem Fable 5'i geçiyor, ancak GPT-5.6 Sol 88.8 ile lider kalıyor. Sonuç, mutlak bir zafer değil; yine de terminal tabanlı aracı görevlerde iki Anthropic amiral gemisini geçmek önemli bir sonuç.
Çok modlu zafer
Ayrı çok modlu tablo, Qwen 3.8-Max'in genel olarak en güçlü göründüğü alan. Alibaba şu skorları bildiriyor:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
Model, OCR satırlarının büyük bölümünde de lider konumda. Opus 4.8 ve Fable 5 bu karşılaştırmada doğrudan rekabet etmiyor; karşılaştırma daha çok Gemini 3.1 Pro ve GPT-5.6 Sol üzerinden yapılıyor. Görsel akıl yürütme ve belge zekası satırları, modelin en net farklılaştırıcıları olarak öne çıkıyor.
Yazın diğer büyük açık ağırlıklı sürümüyle karşılaştırıyorsanız, çok modlu fark daha da belirgin: Kimi K3 yalnızca metin tabanlıdır. Qwen 3.8 vs Kimi K3 karşılaştırmamız bu eşleşmeyi ayrıntılı olarak ele alıyor.
Kaybettiği yerler, dürüstçe belirtildi
Alibaba kayıpları tabloda bırakmış. Üç alan öne çıkıyor.
HLE: 43.6, Fable 5'in oldukça gerisinde
Geniş bilgi birikimine dayalı sınır kıyaslaması olan İnsanlığın Son Sınavı'nda:
- Fable 5: 53.3
- GPT-5.6 Sol: 47.2
- Claude Opus 4.8: 45.7
- Qwen 3.8-Max: 43.6
- Qwen3.7-Max: 41.4
Qwen 3.8-Max dört amiral gemisi arasında son sırada. Qwen3.7-Max'e göre iyileşme var, ancak sınırlı. HLE'nin kıyaslamaya özgü ayarlamalara diğer birçok değerlendirmeden daha iyi direnmesi, bu satırı daha ağır tartmak için bir neden.
SWE-bench Pro: 67.7'ye karşı Fable 5'in 80.0'ı
Daha zorlu yazılım mühendisliği kıyaslamasında sonuçlar şöyle:
- Fable 5: 80.0
- Claude Opus 4.8: 69.2
- Qwen 3.8-Max: 67.7
- GPT-5.6 Sol: 64.6
- Qwen3.7-Max: 60.6
Qwen3.7-Max'e göre ilerleme gerçek. Ancak Qwen 3.8-Max, Fable 5'in yaklaşık 12 puan gerisinde kalıyor. “Terminal Bench'te Claude'u geçiyor” ve “SWE-bench Pro'da Fable 5'in gerisinde kalıyor” ifadeleri aynı anda doğru.
DeepSWE ve daha zorlu aracı satırları
DeepSWE, Alibaba'nın kendi tablosunda Qwen 3.8-Max'in sınırın gerisinde kaldığı başka bir satır. Kodlama sonuçlarının genel deseni şu:
- Terminal odaklı aracı görevlerde rekabetçi.
- Daha derin yazılım mühendisliği değerlendirmelerinde daha zayıf.
- Çok modlu ve belge zekası görevlerinde güçlü.
Dürüst özet: Qwen 3.8-Max bazı aracı satırlarda Opus 4.8'i geçiyor, temel kodlama işlerinin çoğunda Fable 5'in gerisinde kalıyor ve çok modlu görevlerde güçlü sonuçlar veriyor. Bu, milyon token başına 2 dolar giriş ve 6 dolar çıkış fiyatıyla sunulan bir model için güçlü bir tablo; fiyatları resmi fiyatlandırma sayfasından doğrulayabilirsiniz. Ancak tablo, her alanda sınırları zorlayan bir zafer göstermiyor.
Çoğu haberin atlayacağı küçük yazı
Bir kıyaslama tablosunu doğru okumak için yalnızca skorları değil, metodolojiyi de kontrol edin. Alibaba'nın yayınındaki dört detay özellikle önemli.
1. Her sayı satıcı tarafından çalıştırılıyor
Alibaba hem kendi modelini hem rakip modelleri değerlendirdi. Bu, lansman tablolarında standart bir uygulamadır.
Ancak satıcılar şu değişkenleri seçer:
- Kıyaslama sürümü
- İstem stratejisi
- Örnekleme ayarları
- Yeniden deneme politikası
- Arayüz ve araç zinciri
Bunların hiçbiri tek başına usulsüzlük anlamına gelmez. Ancak sonuçları etkileyebilir.
2. Çoğu kodlama satırı Claude Code arayüzünde çalıştırıldı
Alibaba, kodlama kıyaslamalarının çoğunu Anthropic'in araç arayüzü Claude Code içinde, Qwen 3.8-Max'i Anthropic uyumlu API üzerinden hedefleyerek çalıştırdı.
Bu yaklaşımın iki tarafı var:
- Her modeli aynı yaygın kullanılan araçta değerlendirmek karşılaştırmayı daha tutarlı hale getirebilir.
- Sonuçlar, yalnızca modelin değil, “Anthropic arayüzündeki Qwen” kombinasyonunun performansını yansıtır.
Arayüz seçimi aracı sonuçlarını birkaç puan değiştirebilir. Bu nedenle kendi kullanımınızda çalıştırmayı planladığınız istemciyi ve protokolü ayrıca test edin.
3. Bazı kıyaslamalar Qwen ekibinin kendi oluşturduğu testler
QwenSWEBench, QwenQoderBench, CoWorkBench ve RecreationBench, Qwen ekibi tarafından oluşturuldu.
Şirket içi kıyaslamalar değersiz değildir; halka açık değerlendirmelerin kaçırdığı yetenekleri ölçebilirler. Ancak şirketin kendi kıyaslamasındaki yüksek skor ile SWE-bench Pro'daki yüksek skor aynı türden kanıt değildir.
Bir sonuç alıntılarken önce şunu kontrol edin:
- Kıyaslama bağımsız mı?
- Kıyaslama açık ve tekrarlanabilir mi?
- Kıyaslamayı model üreticisi mi oluşturdu?
4. Fable 5 dipnotu
Alibaba'nın tablosunda “Fable5 sonuçları geri dönüşler içerebilir” şeklinde bir dipnot bulunuyor. Bu, en az bir rakibin skorlarının modelin normal çalışma durumunu tam olarak yansıtmayabileceğini gösteriyor.
Teknik neden ne olursa olsun, Qwen 3.8-Max'in en sık gerisinde kaldığı Fable 5 sütunu yıldız işaretiyle okunmalı.
Bunların hiçbiri Alibaba'ya özgü değil. Anthropic, OpenAI ve Google da kendi metodolojik seçimleriyle satıcı tarafından çalıştırılan tablolar yayınlıyor. Kimi K3 kıyaslama analizimizde aynı deseni incelemiştik.
Asıl nokta şu: Satıcı tablosu bir iddiadır; bağımsız bir ölçüm değildir.
Neleri izlemeli ve bir sonraki tabloyu nasıl okumalı
3 Ağustos 2026 itibarıyla Qwen 3.8-Max için bağımsız bir değerlendirme bulunmuyor. Yazıldığı sırada Artificial Analysis henüz sonuç yayınlamamıştı ve topluluk liderlik tabloları modeli puanlamamıştı.
Bağımsız sonuçlar geldiğinde, satıcı tablosu ile bağımsız çalışmalar arasındaki farklar asıl hikaye olacak.
O zamana kadar, herhangi bir satıcı kıyaslama tablosunu değerlendirmek için şu kontrol listesini kullanın:
Değerlendirmeyi kim yaptı?
Satıcının kendi modeli için kendi bildirdiği skorlar daha fazla inceleme gerektirir.Hangi arayüz ve ayarlar kullanıldı?
Aracı kıyaslamalar arayüze duyarlıdır. Arayüzü açıkça belirten tablo daha kullanışlıdır, ancak seçim sonuçları yine de etkiler.Satıcı hangi kıyaslamaları oluşturdu?
Şirket içi değerlendirmeler bir şeyi ölçer, ancak bağımsız ve halka açık kıyaslamalarla aynı şeyi ölçmeyebilir.Dipnotları okuyun.
“Geri dönüşler içerebilir” gibi ifadeler, metodoloji hakkında önemli bilgi taşır.Eksik satırları kontrol edin.
Yayınlanmayan sonuçlar da anlamlı olabilir. Geçmiş nesillerde hangi değerlendirmelerin yer aldığını görmek için önceki neslin satıcılar arasındaki performansını karşılaştırın.İkinci kaynağı bekleyin.
Bir haftalık sabır çoğu zaman bağımsız sayılar sağlar.
Bunun yerine kendi değerlendirmenizi yapın
Kontrol listesi tabloları daha iyi okumanıza yardımcı olur. Daha iyi yöntem ise genel tablolara daha az ihtiyaç duymaktır.
Qwen 3.8-Max, Alibaba Cloud Model Studio'da qwen3.8-max model ID'siyle kullanılabiliyor ve resmi modeller sayfasında listeleniyor. Model hem OpenAI uyumlu hem de Anthropic uyumlu API sunuyor.
Genel liderlik tablosu yerine gerçek üretim istemlerinizi kullanarak karşılaştırma yapın.
Apidog ile uygulanabilir bir kurulum şu şekilde olabilir:
- Model Studio sohbet tamamlama uç noktası için bir istek oluşturun.
- Model olarak
qwen3.8-maxkullanın. - Mevcut temel modeliniz için ikinci, eşdeğer isteği oluşturun. Bu model Qwen3.7-Max, Kimi K3, Claude veya GPT olabilir.
- Üretimden alınmış 20–30 gerçek istemi test senaryosu olarak kaydedin.
- Başarı ölçütleri ekleyin:
- Geçerli JSON dönüyor mu?
- Gerekli alanlar mevcut mu?
- Yanıt beklenen şemaya uyuyor mu?
- Gecikme belirlediğiniz eşiğin altında mı?
- Hata oranı kabul edilebilir mi?
- İki senaryoyu aynı koşullarda arka arkaya çalıştırın.
- Geçme oranı, gecikme ve hata sonuçlarını model bazında karşılaştırın.
Örneğin JSON çıktısı bekleyen bir API akışı için test doğrulaması şu mantıkta olabilir:
const body = JSON.parse(response.body);
if (!body.choices?.[0]?.message?.content) {
throw new Error("Model yanıtında içerik yok");
}
const content = JSON.parse(body.choices[0].message.content);
if (!content.title || !content.summary) {
throw new Error("Zorunlu alanlar eksik");
}
Apidog'un test raporlarıyla, satıcı kıyaslaması yerine kendi iş yükünüzde model başına geçme oranlarını ve yanıt sürelerini yan yana inceleyebilirsiniz.
Qwen'e özgü iki noktayı ayrıca test edin:
- Model varsayılan olarak
reasoning_effort: xhighkullanıyor. Maliyet ve gecikmeyi üretimde kullanacağınız efor seviyesinde ölçün. - Anthropic uyumlu uç noktayı kullanmayı planlıyorsanız, bu protokol biçimini ayrı test edin. Alibaba'nın kodlama kıyaslamalarının çoğu bu yapı üzerinden çalıştırıldı.
Apidog'u ücretsiz indirin, iki uç noktayı ortam olarak ekleyin ve bağımsız liderlik tabloları sonuç yayınlamadan önce kendi birinci taraf verilerinizi toplayın.
Sıkça Sorulan Sorular
Qwen 3.8 kıyaslama sayıları bağımsız olarak doğrulandı mı?
Hayır. 3 Ağustos 2026 itibarıyla yayınlanan her sayı Alibaba'nın kendi tablosundan geliyor. Yazıldığı sırada Artificial Analysis ve topluluk liderlik tabloları Qwen 3.8-Max'i henüz puanlamamıştı. Bağımsız çalışmalar yayımlanana kadar tabloyu satıcı iddiası olarak değerlendirin.
Qwen 3.8-Max'in en iyi kıyaslama sonucu nedir?
PaperBench, 93.0 ile amiral gemisi tablosundaki en iyi satırıdır. Qwen 3.8-Max burada GPT-5.6 Sol'u (90.5), Fable 5'i (88.8) ve Opus 4.8'i (80.3) geçiyor.
Çok modlu tabloda MathVision (95.2) ve OCR satırları modelin en güçlü sonuçları arasında.
Qwen 3.8-Max açıkça nerede kaybediyor?
Qwen 3.8-Max, HLE'de 43.6 puanla dört amiral gemisi arasında sonuncu sırada ve Fable 5'in 53.3 skorunun belirgin şekilde gerisinde.
SWE-bench Pro'da Fable 5'in 80.0 skoruna karşı 67.7 alıyor. DeepSWE'de de sınırın gerisinde kalıyor. Derin yazılım mühendisliği değerlendirmeleri ve geniş bilgi sınavları, Alibaba'nın tablosundaki en zayıf alanlar.
Qwen 3.8, Qwen 3.7-Max'ten kıyaslamalarda ne kadar daha iyi?
Alibaba'nın tablosundaki nesiller arası gelişmeler büyük:
| Kıyaslama | Qwen3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
Yükseltmenin iş yükünüz için değerli olup olmadığı fiyat, gecikme ve modalite gereksinimlerinize de bağlıdır. Qwen 3.8 vs Qwen 3.7 karşılaştırmamız karar sürecini ayrıntılı olarak ele alıyor.

Top comments (0)