DEV Community

Cover image for Mistral Geri Döndü: Le Chonk GPT-6 Astra ve Claude'u Geride Bıraktı
Tobias Hoffmann
Tobias Hoffmann

Posted on Originally published at apidog.com

Mistral Geri Döndü: Le Chonk GPT-6 Astra ve Claude'u Geride Bıraktı

Mistral bir süredir üst düzey model yarışında sessizdi. Mistral Large 3, Aralık 2025'te piyasaya sürüldükten sonra açık ağırlıklı öncü modellerle ilgili tartışmalar Kimi, DeepSeek, GLM ve Qwen etrafında döndü. Mistral, 6 Ekim 2026'da ekibin “Le Chonk” olarak adlandırdığı, 1 trilyon parametreli Mistral Large 4 ile yanıt verdi.

Apidog'u bugün deneyin

Large 4'ün en çok paylaşılan sonucu, AA Siber Endeksi'nde aldığı %82 puan: Claude Opus 5.5 ve GPT-6 Astra ise sıfıra yakın puanda kalıyor. Ancak bunun önemli bir bağlamı var: kapalı modeller görevi reddettiği için düşük puan alıyor. Bu yazıda Large 4'ün teknik özelliklerini, fiyatını, güçlü ve zayıf olduğu alanları ve kendi API iş akışlarınızda nasıl test edebileceğinizi ele alıyoruz.

Özet

  • Nedir? 1.05T toplam parametreli, 49B aktif parametreli, 1.6B görsel kodlayıcılı bir uzmanlar karışımı (MoE) modeli. Metin ve görüntü kabul ediyor, bağlam penceresi 1M jeton.
  • Nasıl erişilir? Mistral API'de herkese açık önizleme olarak mistral-large-4 model kimliğiyle kullanılabilir.
  • Fiyat: Önizlemede 1M giriş jetonu için 0.68$, 1M çıkış jetonu için 2.09$. Liste fiyatı sırasıyla 1.36$ ve 4.18$.
  • Siber güvenlik sonucu: AA Siber Endeksi'nde %82. Opus 5.5 ve Astra'nın sıfıra yakın puanı, görevi reddetmelerinden kaynaklanıyor.
  • Kodlama kalitesi: İnsan değerlendirmeli testte Claude Opus 5, 4.22 puanla lider; Large 4 Önizleme 3.74 puanda.

“Mistral geri döndü” demek neden makul?

2026'nın büyük bölümünde en güçlü açık ağırlıklı modeller Çin merkezliydi. Mistral; Medium 3.5, Devstral 2 ve Small 4 gibi modeller yayınlamaya devam etti, ancak kendi kategorisinde öncü kapalı modellerle doğrudan rekabet edecek bir model sunamamıştı.

Large 4 bu tabloyu değiştiriyor. Mistral, modelin ABD veya Avrupa'da geliştirilen açık ağırlıklı modelleri belirgin biçimde geride bıraktığını iddia ediyor. Model:

  • Mistral'in Avrupa veri merkezlerinde,
  • 3.800 NVIDIA Grace Blackwell GPU üzerinde,
  • sıfırdan eğitildi,
  • resmi AB dilleri dahil 160'tan fazla dili kapsıyor.

Lansman, Mistral'in 3 milyar Avroluk D Serisi yatırım turundan haftalar sonra geldi.

Zamanlama da önemli: Large 4, Reflection'ın açık ağırlıklı Beam modelini duyurmasından hemen sonra yayınlandı. Böylece ABD-Çin açık model yarışına üçüncü ciddi oyuncu eklendi.

Siber güvenlik manşetini doğru okuyun

Artificial Analysis Siber Endeksi, modelden açık kaynaklı yazılımlardaki gerçek güvenlik açıklarını yeniden üretmesini ve ardından yamalamasını isteyen görevler içeriyor. Mistral'e göre Large 4, bu değerlendirmede %82 ile en yüksek puanı aldı.

Ancak Mistral'in belirttiği kritik nokta şu: Claude Opus 5.5 ve GPT-6 Astra, aynı görevde sıfıra yakın puan alıyor çünkü görevi gerçekleştirmeyi reddediyorlar.

İddia Pratik anlamı
“Large 4, Astra ve Opus 5.5'i siber alanda yeniyor.” Bu testte kapalı modeller çoğunlukla yanıt vermiyor; Large 4 ise görevi tamamlamaya çalışıyor.
“Large 4 en iyi siber saldırı modelidir.” Kanıtlanmış değil. Reddetme davranışı, modelin yetenek sınırını doğrudan göstermez.
“Large 4 güvensizdir.” Bu da kanıtlanmış değil. Mistral; JailbreakBench, StrongREJECT ve AgentHarm sonuçlarında diğer açık ağırlıklı modellere göre daha yüksek ortalama reddetme oranı bildirdi.

Buna rağmen sonuç tamamen gürültüden ibaret değil. Mistral'e göre Large 4:

  • 40 adet capture-the-flag görevinden oluşan Cybench'in %93'ünü çözüyor.
  • B3 Ajan Güvenliği Karşılaştırması'nda saldırıların %93.3'üne direniyor.

Güvenlik ekipleri için çıkarım net: Model, kendi kod tabanınızdaki bir CVE'yi yeniden üretme ve yama önerme işinde yardımcı olabilir. API ekipleri için ise bu tür iş yüklerini üçüncü taraf bir politika katmanına tamamen bağımlı olmadan, ileride kendi altyapınızda çalıştırma seçeneği sunuyor.

Siber güvenlik dışındaki karşılaştırmalar

GPT-6 Astra'ya karşı iki sonuç daha dikkat çekiyor; çünkü iki modelin de görevi yürüttüğü senaryolar bunlar.

Karşılaştırma testi Mistral Large 4 GPT-6 Astra Not
Dense 200 (görsel temel) %42 %41 Fark gerçek, ancak yalnızca 1 puan.
Finans Ajanı v2 (vals.ai) Önde Geride Mistral sıralamayı paylaşıyor, puanları paylaşmıyor.
Harvey Hukuk Ajanı Karşılaştırması En iyi açık model Listelendi Doğrudan puan farkı yayınlanmadı.

Diğer açık ağırlıklı modellere karşı Mistral'in bildirdiği sonuçlar ise şöyle:

Karşılaştırma testi Mistral Large 4 Karşılaştırma
AutomationBench (657 iş akışı) %59.9 Kimi K3 ve DeepSeek V4 Pro'nun önünde
AA-Briefcase 1.393 Elo DeepSeek V4 Pro'nun önünde
DeepSWE v1.1 %61.7 Açık ağırlıklı modellere liderlik ediyor
SWE-Atlas-QnA %59.4 —
Terminal-Bench 4.0 %28.3 —

Bu sayıların tamamı Mistral tarafından önizleme modeline ait olarak rapor edildi. Bağımsız laboratuvarlar henüz sonuçları yeniden üretmedi. Ayrıca Euronews'e göre lansman sırasında pekiştirmeli öğrenme süreci hâlâ tamamlanıyordu.

Bu nedenle sonuçları nihai karar yerine güçlü bir başlangıç sinyali olarak değerlendirin.

Large 4 hâlâ nerede geride?

Mistral, kapalı modelin açık biçimde kazandığı bir sonucu da yayınladı. Surge AI tarafından yürütülen insan değerlendirmeli kodlama kalitesi testinde Large 4 Önizleme ikinci sırada:

Model İnsan kodlama puanı (5 üzerinden)
Claude Opus 5 4.22
Mistral Large 4 Önizleme 3.74
GLM-5.3 3.60
Kimi K3 3.59
GLM-5.2 3.40

Bu sonuç, Large 4 için en iyi Çin açık modellerine karşı net bir galibiyet; ancak Claude Opus 5'in yaklaşık yarım puan gerisinde olduğunu da gösteriyor.

Mistral'in “kodlamada öncü modellerle aradaki farkı kapattı” ifadesi bu yüzden daha doğru bir yorum. Ayrıca lansman materyallerinde Claude Fable 5.1 veya GPT-6 Sol ile karşılaştırma bulunmuyor. Bu tür bir iddiayla karşılaşırsanız, doğrudan karşılaştırma testini isteyin.

Teknik özellikler

Özellik Mistral Large 4
API model kimliği mistral-large-4
Takma ad mistral-large-4-0
Sürüm 26.10, herkese açık önizleme
Mimari Uzmanlar karışımı, hibrit talimat + muhakeme
Parametreler 1.05T toplam, 49B aktif, 1.6B görsel kodlayıcı
Bağlam penceresi 1M jeton
Girdi Metin, görüntü
Muhakeme reasoning_effort: "high" veya "none"
Araçlar Fonksiyon çağırma, yapılandırılmış çıktılar, yerleşik ajan araçları
Uç noktalar /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Ağırlıklar Ekim 2026 sonuna kadar açık ağırlıklar planlanıyor; lisans henüz yayınlanmadı

API'den ilk isteği gönderin

Large 4'ü mevcut modelinizle karşılaştırmanın en hızlı yolu, aynı istemi ve aynı araç tanımlarını kullanmaktır.

curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "reasoning_effort": "high",
    "messages": [
      {
        "role": "user",
        "content": "Bu API hatasının olası nedenlerini listele ve JSON olarak döndür."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Karşılaştırma yaparken yalnızca model alanını değiştirin. Ardından şu metrikleri kaydedin:

  1. Yanıt kalitesi ve görev başarısı
  2. Toplam gecikme
  3. Girdi ve çıktı jetonları
  4. Yapılandırılmış çıktı doğrulama başarısı
  5. Araç çağırma hataları veya eksik parametreler

Fiyat: Önizlemede düşük maliyetli öncü sınıf seçenek

Mistral'in fiyatlandırma sayfası, Large 4'ü önizleme döneminde liste fiyatının yarısıyla gösteriyor:

Model Giriş / 1M jeton Çıkış / 1M jeton Açık ağırlıklar
Mistral Large 4 — önizleme 0.68$ 2.09$ Evet, Ekim sonu planlanıyor
Mistral Large 4 — liste fiyatı 1.36$ 4.18$ Evet, Ekim sonu planlanıyor
Claude Opus 5.5 4.00$ 20.00$ Hayır
GPT-6 Astra 10.00$ 50.00$ Hayır

Önizleme fiyatında Large 4'ün çıktı maliyeti, Astra'nın yaklaşık yirmi dörtte biri. Liste fiyatında bile yaklaşık 12 kat daha düşük.

Önbelleğe alınmış giriş maliyeti 1M jeton başına 0.07$. Aynı sistem istemini, OpenAPI araç tanımlarını veya uzun bağlam belgelerini her istekte yeniden kullanan ajanlar için bu fark önemlidir.

Mistral, önizleme indiriminin ne zaman biteceğini açıklamadı. Bu nedenle üretim bütçenizi liste fiyatına göre planlayın.

Geçiş yapmalı mısınız?

Şimdi deneyin

  • Ajan tabanlı otomasyon veya bilgi işi akışlarında yüksek model maliyeti ödüyorsanız.
  • AB dillerinde yüksek kaliteli çıktıya ya da AB'de barındırılan çıkarım hizmetine ihtiyacınız varsa.
  • Savunma amaçlı güvenlik çalışmalarında meşru güvenlik açığı yeniden üretim görevleri yapıyorsanız.
  • Yakında kendi altyapınızda çalıştırabileceğiniz öncü sınıf bir model istiyorsanız.

Bekleyin

  • Kod kalitesi ana karar kriterinizse; Claude insan değerlendirmeli kodlama testinde hâlâ önde.
  • Satın alma veya güvenlik incelemesinde bağımsız test sonuçlarına ihtiyacınız varsa.
  • Large 3'ü üretimde kullanıyorsanız; Large 4 hâlâ önizleme aşamasında ve kararlı sürüm kimliği yayınlanmadı.

Apidog ile Large 4'ü kendi API'larınızda test edin

Karşılaştırma testleri, modelin standart görevlerdeki performansını gösterir. Ancak üretim kararını vermek için modeli kendi istemleriniz, kendi şemalarınız ve kendi API araçlarınızla çalıştırmalısınız. Apidog, bunu ek yapıştırıcı kod yazmadan test etmenizi sağlar.

  1. İsteği oluşturun. POST https://api.mistral.ai/v1/chat/completions isteğini kaydedin. API anahtarını ortam değişkeni olarak saklayın ve şu başlığı ekleyin:
   Authorization: Bearer {{MISTRAL_API_KEY}}
Enter fullscreen mode Exit fullscreen mode
  1. Model bazlı klon oluşturun.

    İsteği çoğaltın. Birinde mistral-large-4, diğerinde mevcut üretim modeliniz olsun. İstem, sistem mesajı, araç tanımları ve parametreler aynı kalsın.

  2. Yanıtları karşılaştırın.

    Durum kodunu, gecikmeyi, yanıt boyutunu ve usage bloğundaki jeton sayılarını yan yana inceleyin. Böylece kalite farkını maliyet farkıyla birlikte görebilirsiniz.

  3. Otomatik doğrulama ekleyin.

    Yapılandırılmış çıktı kullanıyorsanız aşağıdaki kontrolleri tanımlayın:

    • 200 durum kodu
    • Boş olmayan yanıt
    • Beklenen JSON alanları
    • JSON Schema eşleşmesi
    • Gerekli araç çağrılarının yapılması
  4. Regresyon senaryosuna dönüştürün.

    İstekleri bir test senaryosunda gruplayın. Mistral önizleme modelini güncellediğinde veya ağırlıklar yayınlandığında aynı senaryoyu yeniden çalıştırın.

Large 4'ün güvenlik yetenekleri, örneğin kendi hazırlık API'nizde kimlik doğrulama bypass senaryolarını incelerken, API güvenlik testi için ikinci inceleyici olarak yararlı olabilir. Fonksiyon çağırma ve yapılandırılmış çıktı desteği sayesinde, Apidog'da tasarladığınız bir OpenAPI belirtimini ajanların çağırabileceği araç tanımlarına dönüştürebilirsiniz.

Anahtar yönetimi, muhakeme parçacıkları, görsel girdiler, fonksiyon çağırma ve maliyet hesaplama örnekleri için Mistral Large 4 API rehberine bakın. Daha eski bir Mistral modelinden geçiyorsanız Mistral AI API temel bilgileri ve Mistral Medium 3.5 API rehberi de geçerliliğini koruyor: temel URL ve kimlik doğrulama aynı, değişen ana unsur model kimliği.

Sıkça sorulan sorular

Mistral Large 4 açık kaynak mı?

Açık ağırlıklı olarak yayınlanacak. Mistral, ağırlıkların Ekim 2026 sonuna kadar gönderileceğini belirtiyor. Lisans henüz yayınlanmadığı için Large 3 ile aynı Apache 2.0 lisansını kullanacağını varsaymayın.

Mistral Large 4 gerçekten GPT-6 Astra'yı geçiyor mu?

Mistral'in sayılarına göre görsel temel testinde %42'ye karşı %41 ve Finans Ajanı v2'de evet. Siber güvenlik açığı testinde ise Astra görevi reddettiği için sıfıra yakın puan alıyor; bu nedenle sonuç doğrudan yetenek karşılaştırması olarak okunmamalı.

Claude'u geçiyor mu?

Kodlamada hayır. Claude Opus 5, insan değerlendirmeli kodlama testinde 4.22 puan alırken Large 4 Önizleme 3.74 puanda. Claude Opus 5.5, siber güvenlik açığı yeniden üretim görevini reddettiği için o testte sıfıra yakın puan alıyor.

“Le Chonk” ne demek?

Mistral ekibinin modelin boyutuna gönderme yapan gayri resmi takma adı. Resmi isim Mistral Large 4 veya ML4.

Ücretsiz kullanabilir miyim?

Mistral'in ücretsiz planı aylık 10$ API kredisi ile Le Chat ve Vibe'daki en yeni modellere erişim içeriyor. Önizleme fiyatıyla 10$, Large 4'te yaklaşık 4.8 milyon çıktı jetonuna karşılık geliyor.

Sonuç

Mistral, Large 4 ile öncü model yarışına yeniden dahil oldu. Mistral'in paylaştığı sonuçlara göre model, Çin dışındaki en güçlü açık ağırlıklı seçeneklerden biri ve kapalı modellere kıyasla çok daha düşük maliyetli.

“Siber alanda Astra ve Claude'u geçiyor” ifadesi teknik olarak doğru olsa da önemli ölçüde ret davranışından etkileniyor. Kodlama kalitesinde daha dengeli yorum şu: Large 4, Claude'un ardından güçlü bir ikinci seçenek.

Önizleme fiyatı sürerken Large 4'ü kendi API senaryolarınızda test edin; ancak üretim kararını, 27 Ekim sonrasında bağımsız karşılaştırma testleri ve ağırlık lisansı yayınlanana kadar temkinli verin.

Top comments (0)