DEV Community

Cover image for Qwen 3.8 vs Qwen 3.7 Max: Gerçekten Ne Değişti?
Tobias Hoffmann
Tobias Hoffmann

Posted on • Originally published at apidog.com

Qwen 3.8 vs Qwen 3.7 Max: Gerçekten Ne Değişti?

Alibaba, Qwen 3.8-Max’i 2026 Ağustos başında piyasaya sürdü. Üretimde zaten qwen3.7-max kullanıyorsanız, karar yalnızca “yeni model daha iyi” değildir: 3.8-Max ajanlık ve araştırma kıyaslamalarında güçlü kazanımlar, görüntü girişi, daha düşük liste fiyatı ve açık ağırlık sözü getiriyor. Buna karşılık, 3.7-Max’in geçici %50 promosyonu onu bugün token başına daha ucuz yapıyor.

Apidog'u bugün deneyin

Bu yazıda, geçiş kararını üretim ihtiyaçlarınıza göre vermek için performans, fiyat, API uyumluluğu ve test adımlarını karşılaştırıyoruz.

Yeni modelin genel çerçevesi için Qwen 3.8-Max açıklayıcımıza, önceki sürümün arka planı için ise Qwen 3.7'nin neler getirdiğine bakın.

Metodoloji notu: Aşağıdaki kıyaslama skorları, Alibaba’nın resmi Qwen 3.8 sürüm gönderisindeki tablodan alınmıştır. Her iki model aynı satıcı çalıştırmasında değerlendirildiği için sonuçlar kendi içinde karşılaştırılabilir; ancak bağımsız doğrulamalar henüz sınırlıdır. Kodlama satırlarının çoğu Claude Code harness üzerinde, bazıları da Qwen’in kendi ortamında çalıştırılmıştır.

Kısa versiyon

Ne değişti Qwen 3.7-Max Qwen 3.8-Max
Terminal Bench 2.1 74.5 86.6
SWE-bench Pro 60.6 67.7
PaperBench 64.8 93.0
IFBench 79.1 82.8
GPQA Diamond 92.4 92.6
HLE 41.4 43.6
Liste fiyatı (1M token) $2.5 giriş / $7.5 çıkış $2 giriş / $6 çıkış
Mevcut fiyat $1.25 giriş / $3.75 çıkış $2 giriş / $6 çıkış
Görüntü girişi Hayır Evet
Açıklanmış mimari Açıklanmadı 2.4T toplam, 95B aktif MoE
Açık ağırlıklar Yayınlanmadı “Gelecek hafta” sözü (~10 Ağustos)
Bağlam penceresi 1M token 1M token

Kıyaslamalar: Nerede anlamlı fark var?

Qwen 3.8-Max’in en büyük kazanımları, uzun süreli ajanlık görevlerinde görülüyor: planlama, araç kullanımı, uygulama ve hata düzeltme içeren iş akışları.

Qwen 3.8-Max Benchmarkları

Terminal Bench 2.1: 74.5 → 86.6

Terminal tabanlı ajanlık görevlerinde +12.1 puanlık artış var. Alibaba’nın aynı tablosunda Claude Opus 4.8 ve Fable 5, 84.6 puanda kalıyor. GPT-5.6 Sol ise 88.8 ile lider.

Ne yapmalı? Terminal, CLI, repo yönetimi veya çok adımlı araç çağrısı yapan ajanlar geliştiriyorsanız 3.8-Max’i gerçek görevlerinizde test edin. Bu fark, üretimde hissedilebilecek büyüklükte.

SWE-bench Pro: 60.6 → 67.7

Gerçek dünya yazılım mühendisliği görevlerinde +7.1 puanlık artış var. Bu anlamlı bir ilerleme olsa da Alibaba’nın tablosunda Fable 5, 80.0 puanda.

Ne yapmalı? Önceliğiniz issue çözme, patch üretme ve test düzeltme ise yalnızca genel kıyaslama skoruna göre geçiş yapmayın. Kendi repository’nizdeki gerçek issue setiyle karşılaştırma çalıştırın.

PaperBench: 64.8 → 93.0

En büyük sıçrama burada: yapay zeka araştırma makalelerini yeniden üretme görevlerinde +28.2 puan. Alibaba’nın karşılaştırmasında 3.8-Max bu satırdaki tüm rakiplerin önünde.

Ne yapmalı? Teknik doküman analizi, araştırma tekrarı, deney tasarımı veya uzun zincirli bilimsel muhakeme yapıyorsanız 3.8-Max güçlü bir adaydır.

IFBench: 79.1 → 82.8

Talimat takibinde yaklaşık +3.7 puan iyileşme var. 3.7-Max zaten bu alanda güçlü olduğu için bu, zayıf bir alanı kapatmaktan çok mevcut performansı artırıyor.

GPQA Diamond: 92.4 → 92.6

Pratikte değişiklik yok. Yüksek lisans seviyesindeki bilimsel soru-cevap performansı zaten 3.7-Max için yüksek seviyedeydi.

Ne yapmalı? İş yükünüz çoğunlukla bilgi soruları, bilimsel soru-cevap veya genel yanıt üretimiyse, kalite kazanımı tek başına geçişi zorunlu kılmayabilir.

HLE: 41.4 → 43.6

Humanity’s Last Exam skorunda +2.2 puan artış var. Ancak Alibaba’nın tablosunda Fable 5 53.3, GPT-5.6 Sol ise 47.2 puanda.

Özetle:

  • Ajanlık ve araştırma: Büyük kazanım
  • Talimat takibi: Orta düzey iyileşme
  • Bilgi tabanlı görevler: Neredeyse değişim yok
  • En zor muhakeme testleri: Rakiplere göre boşluk devam ediyor

Kıyaslama koşum takımları ve ayrıntılı sonuçlar için Qwen 3.8 kıyaslama analizimize bakın.

Mimari: Kapasite ve maliyet planlaması

Qwen 3.8-Max, Qwen 3.5 mimari temeli üzerinde çalışan bir MoE modelidir:

  • Toplam parametre: 2.4 trilyon
  • Aktif parametre: Her ileri geçişte 95B
  • Yaklaşık aktivasyon oranı: %4

Bu fark operasyonel olarak önemlidir. Hesaplama maliyetini 2.4T parametrenin tamamı değil, etkinleştirilen yaklaşık 95B parametre belirler.

Qwen 3.7-Max için Alibaba benzer parametre, uzman sayısı veya aktivasyon oranı bilgileri açıklamamıştı. Buna karşılık, 3.8-Max için Model Studio model dokümantasyonu ve sürüm gönderisi daha açık kapasite bilgileri sağlıyor.

Açık ağırlıklı büyük MoE modelleriyle kıyaslandığında, Kimi K3 toplam 2.8T ve 104B aktif parametreyle çalışıyor. Qwen 3.8-Max her iki ölçütte de daha küçük.

Çok modlu kullanım: Görüntü girişi artık var

Qwen 3.7-Max yalnızca metin modelidir. Qwen 3.8-Max ise yerel görüntü girişi kabul eder.

Alibaba’nın çok modlu tablosundaki öne çıkan skorlar:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1

3.7-Max için eşdeğer bir çok modlu sütun bulunmuyor; eski model görüntü kabul etmediği için doğrudan karşılaştırma yapılamaz.

Bu özellik özellikle şu iş yüklerinde mimariyi sadeleştirebilir:

  • Ekran görüntüsü analizi
  • Belge görsellerinden bilgi çıkarma
  • UI otomasyonu
  • Grafik ve diyagram yorumlama
  • Görsel + metin bağlamı gerektiren destek akışları

Yayın gönderisinde uzun belge ve video anlama örnekleri de yer alıyor. Bunlar belirli API giriş türleri anlamına gelmeyebilir; üretime geçmeden önce API dokümantasyonundaki desteklenen mesaj formatlarını kontrol edin.

Fiyatlandırma: Liste fiyatında ucuz, bugün değil

Qwen 3.8-Max’in liste fiyatı 1M token başına:

  • Giriş: $2
  • Çıkış: $6

Qwen 3.7-Max’in liste fiyatı ise:

  • Giriş: $2.5
  • Çıkış: $7.5

Yani 3.8-Max, selefinden liste fiyatında yaklaşık %20 daha ucuz.

Ancak 3.7-Max için geçici %50 promosyon uygulanıyor:

  • Giriş: $1.25
  • Çıkış: $3.75

Bu promosyonla 3.7-Max, mevcut fiyatlar üzerinden 3.8-Max’ten yaklaşık %38 daha ucuz. Güncel oranları resmi Model Studio fiyatlandırma sayfasından takip edin.

Maliyet hesabında dikkat edilmesi gerekenler

  1. Promosyon kalıcı olmayabilir.

    Alibaba promosyonu sınırlı süreli olarak tanımlıyor, ancak bitiş tarihi yayınlamıyor. Uzun vadeli bütçeyi promosyon fiyatına göre planlamayın. Liste fiyatına döndüğünde 3.8-Max daha ucuz seçenektir.

  2. Düşünce tokenları faturayı artırabilir.

    Qwen 3.8-Max varsayılan olarak reasoning_effort: xhigh kullanır. Düşünce tokenları çıkış tokenı olarak faturalandırılır; dolayısıyla gerçek istek maliyeti etiket fiyatından daha yüksek olabilir.

  3. Rutin işler için Max gerekmeyebilir.

    qwen3.7-plus, $0.4 / $1.6 fiyatıyla daha düşük maliyetli bir seçenek olmaya devam ediyor. Sınıflandırma, çıkarma ve şablon tabanlı üretim gibi görevlerde Max sınıfı model gereksiz maliyet yaratabilir.

Token, önbellek ve görev başına maliyet hesabı için Qwen 3.8 fiyatlandırma rehberimize bakın. Plus ve Max seçimi için de Qwen 3.7 Plus vs Max karşılaştırmasını inceleyin.

Açık ağırlıklar: Max sınıfında ilk kez

Daha önce hiçbir Qwen-Max sınıfı model açık ağırlıklarla yayınlanmadı. Qwen 3.8-Max bu modeli değiştirebilir: Alibaba, Hugging Face ve ModelScope için “gelecek hafta” ağırlık sözü verdi; bu tarih yaklaşık 10 Ağustos’a işaret ediyor.

Bu yazının bağlamındaki tarih olan 3 Ağustos 2026 itibarıyla ağırlıklar indirilebilir değildi. Bu nedenle üretim planınızı mevcut erişime değil, duyurulmuş söze göre değerlendirin.

Açık ağırlıklar yayınlansa bile 2.4T parametreli bir modeli kendi altyapınızda çalıştırmak, nicemleme kullanılsa dahi çok düğümlü bir barındırma projesi olacaktır. Çoğu ekip için pratik etki şunlar olabilir:

  • Üçüncü taraf sağlayıcılarda daha fazla barındırma seçeneği
  • Fiyat rekabeti
  • Tedarik ve uyumluluk seçeneklerinin genişlemesi

Açık ağırlıklar satın alma veya uyumluluk gereksiniminiz için kritikse, bu tek başına 3.8-Max lehine karar sebebi olabilir.

Değişmeyenler

Bağlam penceresi: 1M token

Her iki model de 1M token bağlam penceresi sunuyor. Uzun bağlam, tek başına geçiş nedeni değil.

API erişimi: Aynı temel yol

Her iki model de Alibaba Cloud Model Studio üzerinden OpenAI uyumlu uç noktalarla sunuluyor. Temel geçiş çoğu senaryoda model kimliğini değiştirmekten ibaret:

qwen3.7-max
Enter fullscreen mode Exit fullscreen mode

yerine:

qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Qwen 3.8-Max ayrıca Anthropic uyumlu bir API yüzeyi de ekliyor. Araç zinciriniz bu protokolü kullanıyorsa, Apidog gibi bir istemciyle hızlıca doğrulama yapabilirsiniz.

Muhakeme kontrolleri: Daha görünür ve yapılandırılabilir

Qwen 3.8-Max’te aşağıdaki parametreler belgelenmiş durumda:

  • reasoning_effort
    • xhigh — varsayılan
    • medium
    • low
  • enable_thinking
  • preserve_thinking

Maliyet ve gecikme kritikse reasoning_effort değerini açıkça ayarlayın. Örneğin, rutin veri çıkarma görevlerinde daha düşük ayarları değerlendirmeniz gerekebilir.

Yükseltmeli misiniz?

Şimdi yükseltin, eğer…

  • Terminal veya CLI ajanları çalıştırıyorsanız
  • Çok adımlı araştırma görevleriniz varsa
  • Teknik makale, deney veya uzun doküman analizi yapıyorsanız
  • Görüntü girişi gerekiyorsa
  • Promosyon sonrası maliyet riskini azaltmak istiyorsanız

Terminal Bench’te 74.5 → 86.6 ve PaperBench’te 64.8 → 93.0 artışları, gerçek iş yüklerinde fark yaratabilecek seviyede.

3.7-Max promosyonunda kalın, eğer…

  • Trafiğiniz ağırlıklı olarak soru-cevap, özetleme veya genel sohbetse
  • 3.7-Max kalite eşiğinizi zaten karşılıyorsa
  • Görüntü girişi gerekmiyorsa
  • Kısa vadeli token maliyeti ana önceliğinizse

Promosyon fiyatı olan $1.25 / $3.75, bugün iki Max modeli arasındaki en düşük token maliyetidir. Ancak fiyat değişimlerini aylık olarak takip edin; promosyon bittiğinde geri dönüş seçeneğiniz 3.7-Max’in liste fiyatı değil, $2 / $6 liste fiyatıyla 3.8-Max olabilir.

Qwen3.7-Plus kullanın, eğer…

  • Maliyet önceliğinizse
  • İşleriniz rutin sınıflandırma, yapılandırılmış çıkarma veya şablonlu üretimse
  • Max sınıfı muhakeme ve ajanlık yeteneğine ihtiyacınız yoksa

Qwen 3.7 Plus, $0.4 / $1.6 fiyatıyla 3.8-Max’e göre giriş tarafında yaklaşık 5 kat daha ucuzdur.

Geçişten önce gerçek iş yükünüzde test edin

Satıcı kıyaslamaları faydalıdır, ancak kendi istemleriniz, araç çağrılarınız, veri formatlarınız ve kalite metrikleriniz için garanti değildir.

En düşük riskli yaklaşım, iki modeli aynı istek setinde yan yana çalıştırmaktır.

Önerilen test planı

  1. Model Studio’nun OpenAI uyumlu uç noktasına bağlanın.
  2. Aynı koleksiyon için iki ortam tanımlayın.
  3. Tek fark olarak model kimliğini değiştirin:
    • Ortam A: qwen3.7-max
    • Ortam B: qwen3.8-max
  4. Temsilî üretim isteklerinizi çalıştırın.
  5. Şunları karşılaştırın:
    • Yanıt kalitesi
    • Görev başarı oranı
    • Gecikme
    • Giriş ve çıkış token tüketimi
    • Düşünce token maliyeti
    • Araç çağrısı doğruluğu
  6. Sonuçları tekrar çalıştırılabilir test senaryoları olarak kaydedin.

Apidog içinde aynı koleksiyonu iki ortamla kullanarak model kimliğini hızlıca değiştirebilir, sonuçları karşılaştırabilir ve fiyat ya da model güncellemeleri sonrası aynı testleri yeniden çalıştırabilirsiniz.

Bu yaklaşım, “yükseltmeli miyiz?” sorusunu soyut kıyaslama tartışmasından ölçülebilir bir üretim kararına dönüştürür. Üretim yapılandırmanızı değiştirmeden önce Apidog’u ücretsiz indirin ve kendi trafiğinizle karşılaştırma yapın.

SSS

Qwen 3.8-Max, Qwen 3.7-Max’ten daha mı ucuz?

Liste fiyatında evet:

  • Qwen 3.8-Max: $2 / $6
  • Qwen 3.7-Max: $2.5 / $7.5

Mevcut promosyon fiyatında ise hayır:

  • Qwen 3.7-Max: $1.25 / $3.75
  • Qwen 3.8-Max: $2 / $6

3.7-Max promosyonunun yayınlanmış bitiş tarihi yok. Ayrıntılı maliyet hesabı için Qwen 3.8 fiyatlandırma rehberini inceleyin.

qwen3.7-max modelinden qwen3.8-max modeline geçmek için kod değişikliği gerekir mi?

Temel kullanım için genellikle hayır. Her iki model de aynı OpenAI uyumlu Model Studio uç noktalarıyla çalışır; çoğu durumda model ID değişikliği yeterlidir.

Ancak şunları kontrol edin:

  • reasoning_effort değerini açıkça ayarlayın.
  • Varsayılan xhigh ayarının maliyet etkisini ölçün.
  • Görüntü gönderiyorsanız yalnızca 3.8-Max’in desteklediği görüntü mesaj formatını kullanın.
  • Araç çağrısı ve yapılandırılmış çıktı davranışını kendi şemalarınızda test edin.

Qwen 3.7-Max açık ağırlıklara sahip mi?

Hayır. Qwen 3.7-Max için açık ağırlık yayınlanmadı ve Alibaba bu yönde bir plan açıklamadı.

Qwen 3.8-Max, açık ağırlıkları vaat edilen ilk Max sınıfı Qwen modelidir. Duyuruya göre Hugging Face ve ModelScope erişimi yaklaşık 10 Ağustos 2026’da bekleniyordu; 3 Ağustos itibarıyla indirilebilir değildi.

Qwen 3.8-Max, Claude veya GPT’den daha mı iyi?

Göreve bağlıdır ve mevcut rakamların Alibaba’nın kendi ölçümleri olduğunu unutmamak gerekir.

Alibaba’nın tablosuna göre Qwen 3.8-Max:

  • Terminal Bench 2.1’de Opus 4.8 ve Fable 5’in önünde
  • PaperBench ve IFBench’te lider
  • SWE-bench Pro’da Fable 5’in gerisinde
  • HLE’de üst düzey rakiplerin gerisinde

Bağımsız kıyaslama sonuçları sınırlı olduğu için, nihai kararı kendi iş yükünüzde yaptığınız testler ve üçüncü taraf değerlendirmelerle destekleyin.

Top comments (0)