Gemini 4 Argon, Google'ın lansman tablosundaki 19 satırın 13'ünde açık ara lider, 1'inde GPT-6 Astra ile berabere (CWE-bench v1) ve 5'inde geride: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 ve OSWorld-2.0. Ancak kritik nokta erişim: Argon şu anda yalnızca Fairwind Programı savunucularına açık. Bu nedenle Google'ın iş ortağı listesi dışındaki geliştiriciler ve sınırlı sayıdaki kıyaslama kuruluşu sonuçları henüz yeniden çalıştıramıyor.
Aşağıda her puanın kim tarafından ölçüldüğünü, Argon'un geride kaldığı beş alanı, metodoloji notlarını, siber güvenlik puanlarını ve üçüncü taraf lider tablolarını bulacaksınız. Erişim açılmadan önce kendi değerlendirme akışınızı kurmak için Apidog kullanabilirsiniz. Model bağlamı için Gemini 4 Argon'un ne olduğunu inceleyin. Satın alma değerlendirmesi için Argon, GPT-6 Astra ve Claude Opus 5.5 karşılaştırmasına bakın.
Her bir satırı kimin ölçtüğünü gösteren tam tablo
Bu sonuçlar, Google'ın “Ekim 2026 itibarıyla sonuçlar” lansman gönderisinden ve değerlendirme metodolojisinden alınmıştır.
Google, 19 Argon puanının 10'unu kendisi hesapladı; diğer 9 puan herkese açık lider tablolarından geliyor. Rakip puanlar ise lider tablolarından, Google'ın değerlendirmelerinden veya satıcı sistem kartları ve blog yazılarından alınmış. Her satırın araçları ve çalışma koşulları farklıdır. Kalın değerler satır liderini gösterir.
| Kıyaslama | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Kim ölçtü |
|---|---|---|---|---|---|
| Vals Endeksi | %68,9 | %63,1 | %65,8 | %67,0 | Vals AI |
| AutomationBench | %51,3 | %41,4 | %31,4 | %42,5 | Zapier lider tablosu (özel set) |
| Vals Finans Aracısı v2 | %65,4 | %53,5 | %58,9 | %58,6 | Vals AI |
| Harvey Yasal Aracı | %19,6 | %5,4 | %6,7 | %3,8 | Vals AI |
| DeepSWE v1.1 | %77,9 | %74,1 | %67,4 | %74,2 | Argon kendi kendine hesapladı; Astra lider tablosu; Anthropic sistem kartları |
| FrontierSWE v2 | %55,0 | %65,5 | %56,3 | %62,3 | Proximal lider tablosu |
| Vibe Kod Kıyaslaması | %91,9 | %89,6 | %90,3 | %90,3 | Vals AI |
| Terminal-bench 4.0 | %57,4 | %58,2 | %57,9 | %66,4 | Argon kendi kendine hesapladı; rakiplerin lider tablosu |
| PostTrainBench | %45,3 | %44,3 | %40,2 | %49,3 | Tüm modeller için kendi kendine hesaplandı |
| Terminal-Bench Science 0.1 | %57,6 | %68,1 | %52,6 | %63,3 | Argon kendi kendine hesapladı; rakiplerin lider tablosu |
| LABBench 2 | %88,8 | %85,4 | %68,6 | %73,1 | Tüm modeller için kendi kendine hesaplandı |
| RiemannBench | %76,0 | %72,0 | %65,6 | %69,6 | Surge lider tablosu |
| GraphWalks 128K'ye kadar | %99,7 | %98,7 | %91,4 | %90,6 | Tüm modeller için kendi kendine hesaplandı |
| GraphWalks 256K ila 1M | %84,2 | %71,8 | %65,0 | %66,8 | Tüm modeller için kendi kendine hesaplandı |
| Aracının Son Sınavı | %39,5 | %34,2 | bildirilmedi | %38,2 | Argon kendi kendine hesapladı; rakiplerin lider tablosu |
| OSWorld-2.0 (çevrimdışı) | %69,2 | %72,6 | bildirilmedi | bildirilmedi | Argon kendi kendine hesapladı; Astra OpenAI'ın blog gönderisinden |
| Çartografi | %71,6 | %71,0 | %46,2 | %66,3 | Surge lider tablosu |
| LVBench | %91,7 | %87,5 | %79,7 | %83,7 | Tüm modeller için kendi kendine hesaplandı |
| CWE-bench v1 | %68,0 | %68,0 | %58,0 | %67,0 | Herkese açık lider tablosu |
n/r= bildirilmedi. Google'ın tablosunda olmayan Grok 4.7 de CWE-bench lider tablosunda %68 puan alıyor; dolayısıyla bu beraberlik üç yönlüdür.
Kaynak türüne göre sonuçları ayırmak daha doğru yorum yapmanızı sağlar:
- 9 satır, tüm modeller için herkese açık lider tablolarından gelir: Vals AI, Zapier, Proximal, Surge ve CWE-bench. Argon bu 9 satırın 7'sini kazanıyor, 1'inde berabere kalıyor.
- 5 satır, Google tarafından dört model için de çalıştırıldı. Argon bunların 4'ünde lider.
- 5 karma satırda, Argon puanı Google tarafından çalıştırılırken rakip puanlar başka kaynaklardan geliyor. Argon'un 5 kaybının 3'ü bu grupta yer alıyor.
Bu ayrım önemlidir: kendi kendine çalıştırılan değerlendirmeler Argon'u sistematik biçimde daha iyi gösterseydi, bunun tersini görmeniz beklenirdi.
Argon'un geride kaldığı yerler ve bunun ajan tabanlı kodlama için önemi
Argon'un kaybettiği beş satır şunlar:
- FrontierSWE v2: Argon %55,0; GPT-6 Astra %65,5. Argon, Fable 5.1 (%56,3) ve Opus 5.5'in (%62,3) de gerisinde, dördüncü sırada.
- Terminal-bench 4.0: Argon %57,4; Opus 5.5 %66,4. Astra ve Fable 5.1 ile fark küçük olsa da Argon son sırada.
- PostTrainBench: Argon %45,3; Opus 5.5 %49,3. Google'ın tüm modeller için çalıştırdığı bu satırda Argon ikinci sırada.
- Terminal-Bench Science 0.1: Argon %57,6; Astra %68,1. Argon yalnızca Fable 5.1'in önünde. Google, Argon denemesini 6 kat doğrulayıcı zaman aşımı ile çalıştırdı.
- OSWorld-2.0 (çevrimdışı alt küme): Argon %69,2; Astra %72,6. Anthropic yalnızca birleşik çevrimiçi ve çevrimdışı skor bildirdiği için Claude modelleri bu satırda yok.
Ajan tabanlı kodlama sonuçları ikiye ayrılıyor:
- Argon, DeepSWE v1.1 ve Vibe Code Bench sonuçlarında önde.
- Argon, FrontierSWE v2 ve Terminal-bench 4.0 sonuçlarında son sırada.
DeepSWE karşılaştırmasında çalışma araçları aynı değil: Argon bir mini-swe ajan aracıyla çalıştırılmış, Astra puanı herkese açık lider tablosundan alınmış, Claude skorları ise sistem kartlarından geliyor. Vibe Code Bench daha karşılaştırılabilir bir satırdır çünkü dört model de Vals AI tarafından değerlendirilmiş; ancak fark yalnızca 1,6 puandır.
İş yükünüz yoğun terminal kullanımı, uzun süreli depo görevleri veya çok adımlı ajan iş akışları içeriyorsa, yalnızca toplam galibiyet sayısına bakmayın. FrontierSWE liderliği Astra'da kalıyor. Pratik kullanım örnekleri için GPT-6 Astra uygulamalı incelememize, Fable sonuçları için ise Claude Fable 5.1 kıyaslama dökümüne bakın.
Bloomberg, erişimi bulunan isimsiz Google çalışanlarının Argon'un bazı kodlama ve ön uç tasarım işlerinde kıyaslama skorlarının ima ettiğinden daha zayıf kaldığını söylediğini bildirdi. Google bu tanımlamayı yanlış olarak nitelendirdi.
Tabloyu okumanızı değiştiren metodoloji uyarıları
Bu puanları ürün kararına doğrudan dönüştürmeden önce aşağıdaki ayrıntıları kontrol edin:
- Her model maksimum çaba ayarlarıyla çalıştırıldı. Argon, “en yüksek düşünme ayarlarına sahip Gemini API” ile çalıştırıldı. Astra, Fable 5.1 ve Opus 5.5 için Google, mevcut en yüksek düşünme veya muhakeme ayarlarını kullandı. Bu sonuçlar varsayılan gecikme, maliyet veya davranışı değil, model tavanını karşılaştırır.
- LVBench'te modeller aynı video girdisini görmedi. Google, dört modeli araç kullanmadan çalıştırdı. Gemini video karelerini 1 FPS'de örnekledi. Astra 800, Fable 5.1 300, Opus 5.5 ise 600 kare aldı; Google bunun API sınırlamalarından kaynaklandığını belirtiyor.
- OSWorld skoru ortalama değil, en iyi çalıştırma sonucu. Argon'un skoru, her çalıştırmada tek deneme olacak şekilde üç çalışma arasından maksimize edildi.
- Agent's Last Exam için 5 saatlik pencere kullanıldı. Argon, ALE-Claw aracı üzerinde bu süre sınırıyla çalıştırıldı.
- Güvenlik filtreleri açıktı. Agent's Last Exam ve OSWorld değerlendirmelerinde işaretlenen yanıtlar boş dize olarak döndürüldü. Bu durum pratikte Argon'un skorunu düşürebilir.
DeepMind'ın siber sayfasındaki siber satırlar
DeepMind siber sayfası, lansman tablosuna ek olarak dört sonuç yayınlıyor:
| Siber değerlendirme | Gemini 4 Argon | Karşılaştırma |
|---|---|---|
| Gerçek dünya güvenlik açığı keşfi | %85,8 | Gemini 3.8 Flash Cyber %71,0 |
| Wiz Penetrasyon Testi Kıyaslaması | %70,9 | Gemini 3.8 Flash Cyber %58,2 |
Gray Swan IPI saldırı başarısı (k=15, düşük daha iyidir) |
%0,7 | Grafikte en düşük; Kimi K3 en yüksek %52,7 |
| CWE-bench v1 | %68 | Grok 4.7 ve GPT-6 Astra ile üç yönlü beraberlik; Opus 5.5 %67 |
Güvenlik açığı değerlendirmesi, kaynak kod erişimi olan ancak “siber alanda uzmanlaşmamış” dahili bir Antigravity aracı kullandı. Wiz testi ise modele yalnızca çalışan web sitesi ve genel davranışı sundu; uygulama kaynak kodu verilmedi.
Her iki karşılaştırma da rakiplere değil, Google'ın önceki siber modeline dayanıyor. Bu sonuçların API güvenlik iş akışlarınıza etkisi için Argon siber savunma açıklamamızı inceleyin.
Üçüncü taraf puan tabloları
Bu kuruluşlar puanlarını lansmandan kısa süre sonra yayımladı; dolayısıyla ön sürüm erişimleri olduğu anlaşılıyor.
- Artificial Analysis, Gemini 4 Argon'u (Yüksek) 53 İstihbarat Endeksi puanıyla 223 model arasında 8. sırada listeliyor. Bu sıralama her muhakeme ayarını ayrı model gibi sayıyor. Modeller bazında Argon, Fable 5.1 ve GPT-6 Astra ile 53 puanda berabere; Opus 5.5'in maksimum 58 ve Sonnet 5.5'in maksimum 56 skorunun gerisinde. AA, AA-Omniscience üzerinde %15 halüsinasyon oranı bildirirken Astra için maksimum ayarda %51 oran veriyor. Doğrulukta ise Argon %50, Astra %63. Endeks çalıştırma maliyeti görev başına 1,99 dolar; Argon yaklaşık 62 bin çıktı tokeni, Astra ise maksimum ayarda yaklaşık 27 bin çıktı tokeni kullandı. Artificial Analysis hız veya gecikme verisi yayımlamıyor.
- Vals AI, Argon'u Vals Endeksi'nde %68,90 ile 41 model arasında 1. sıraya koyuyor. Bu, modeli zirveye taşıyan ilk Gemini sonucu. Test başına maliyet 15,68 dolar. Vals AI, test edilen yapılandırma için 262 bin maksimum çıktı listeliyor; bu değer Google'ın belirttiği 1 milyon sınırının altında.
- Arena, Argon'u Metin lider tablosunda 1525 puanla 1. sıraya yerleştiriyor. Model 4.942 oyla “Ön” olarak işaretlenmiş; WebDev kategorisinde ise 8. sırada.
Yayın organları neden 12, 13 ve 14 galibiyet bildiriyor?
Galibiyet sayısı, Argon'un hangi rakibe karşı değerlendirildiğine bağlı olarak değişir. Google'ın 19 satırı yeniden sayıldığında sonuç şöyledir:
| Kime karşı sayıldı | Argon galibiyetleri | Beraberlikler | Argon kayıpları | Bildirilmedi |
|---|---|---|---|---|
| Üç rakibin en iyisine karşı | 13 | 1 | 5 | 0 |
| Sadece GPT-6 Astra | 14 | 1 | 4 | 0 |
| Sadece Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Sadece Claude Fable 5.1 | 15 | 0 | 2 | 2 |
- 13 galibiyet, üç rakibin en iyi skoruna karşı hesaplandığında doğrudur.
- 14 galibiyet, Astra veya Opus 5.5 ile bire bir karşılaştırmada doğrudur.
- 12 galibiyet, 19 satırın tam kümesinde kullanılan çerçevelerden hiçbirine uymuyor. Böyle bir iddiada hangi satırların dışarıda bırakıldığını kontrol edin.
Farkların büyüklüğü de aynı değil. Harvey Legal Agent'ta Argon %19,6'ya karşı Fable 5.1 %6,7 ile geniş fark var. Çartografi satırında ise Argon ile Astra arasındaki fark yalnızca 0,6 puan.
Erişim açıldığı gün kendi değerlendirmenizi nasıl çalıştırırsınız?
Google'ın kıyaslamaları kendi araç zincirlerini ölçer. Sizin için önemli olan ise gerçek istemleriniz, veri formatlarınız, araç çağrılarınız ve maliyet sınırlarınızdır.
Argon erişimi açılmadan önce bir temel değerlendirme kurun. Erişim geldiğinde yalnızca model değişkenini güncelleyerek aynı senaryoyu tekrar çalıştırabilirsiniz.
-
Kendi kullanımınıza uyan gerçek görevleri seçin:
- Bir depo düzeltmesi
- Bir terminal görevi
- Uzun belge üzerinden soru-cevap
- Yapılandırılmış JSON üretimi
- Araç çağrısı gerektiren çok adımlı iş akışı
Apidog'da aşağıdaki değişkenleri içeren bir ortam oluşturun:
GEMINI_API_KEY=...
GEMINI_MODEL=gemini-3.8-flash
Google, Argon'un model kimliğini henüz yayımlamadı. Kullanıma açıldığında yalnızca GEMINI_MODEL değerini değiştirmeniz yeterli olacak.
- Her görevi modeli
{{GEMINI_MODEL}}değişkeninden okuyan ayrı bir istek olarak kaydedin.
{
"model": "{{GEMINI_MODEL}}",
"contents": [
{
"role": "user",
"parts": [
{
"text": "{{PROMPT}}"
}
]
}
]
}
- İstekleri tek bir test senaryosunda gruplayın. Her istek için yalnızca HTTP 200 kontrolü eklemeyin; ürün davranışını doğrulayan kontroller de ekleyin:
pm.test("Yanıt başarılı", () => {
pm.expect(pm.response.code).to.equal(200);
});
pm.test("Gerekli alanlar döndü", () => {
const body = pm.response.json();
pm.expect(body).to.have.property("candidates");
});
pm.test("Düşünme tokeni maliyet sınırını aşmadı", () => {
const body = pm.response.json();
const thoughts = body.usageMetadata?.thoughtsTokenCount ?? 0;
pm.expect(thoughts).to.be.below(50000);
});
Çıktı kalitesini, gerekli alanları, beklenen içeriği ve
usageMetadatadeğerlerini doğrulayın. ÖzelliklethoughtsTokenCountiçin maliyet bütçenize uygun bir üst sınır belirleyin.Senaryoyu şimdi Gemini 3.8 Flash ile çalıştırın ve raporu temel sonuç olarak saklayın.
Argon model kimliği yayınlandığında aşağıdaki değişikliği yapın:
GEMINI_MODEL=<Argon model kimliği>
Ardından aynı senaryoyu tekrar çalıştırın ve şu metrikleri karşılaştırın:
- Başarı oranı
- Yanıt doğruluğu
- Araç çağrısı veya yapılandırılmış çıktı geçerliliği
- Toplam token kullanımı
thoughtsTokenCount- Gecikme süresi
- Hata oranı
- Görev başına maliyet
Google, “tüm yeni modellerin” Interactions API üzerinde başlatılacağını söylüyor. Bu nedenle her kritik isteğin bir Interactions API sürümünü de kaydedin. Fiyatlandırma ve sınır beklentileri için Argon ve Gemini 3.8 Flash karşılaştırmamıza bakın.
Sıkça Sorulan Sorular
Gemini 4 Argon'un kıyaslamaları bağımsız olarak doğrulandı mı?
Kısmen. 19 satırın 9'u tüm modeller için herkese açık lider tablolarından geliyor. Artificial Analysis, Vals AI ve Arena da kendi sonuçlarını yayımladı. Geri kalan Argon sonuçları Google tarafından çalıştırıldı.Gemini 4 Argon'un DeepSWE puanı nedir?
DeepSWE v1.1'de %77,9. Bu skor Opus 5.5'in %74,2 ve Astra'nın %74,1 sonucunun önünde. Ancak Argon bir mini-swe ajan aracıyla çalıştırılırken rakip puanları lider tablosu ve sistem kartlarından alınmış.Argon, kıyaslamalarda GPT-6 Astra'yı yeniyor mu?
Google'ın tablosunda bire bir karşılaştırmada Argon 14 satırı kazanıyor, 1 satırda berabere kalıyor ve 4 satırı kaybediyor. Artificial Analysis'te ise ikisi de 53 puanda.Bu kıyaslamaları kendim yeniden çalıştırabilir miyim?
Henüz değil. Argon Fairwind iş ortaklarıyla sınırlı ve Google halka açık yayın tarihi vermedi. Güncellemeler için Argon yayın tarihi takipçisini izleyin.
Sonraki adım
Değerlendirme senaryonuzu şimdi kurun, Gemini 3.8 Flash üzerinde çalıştırın ve raporu saklayın. Argon erişime açıldığında model değişkenini güncelleyerek kendi kullanım senaryolarınızdaki farkı dakikalar içinde ölçebilirsiniz.
Kuruluma başlamak için Apidog'u indirin.
Top comments (0)