Gemini 4 Argon, GPT-6 Astra, Claude Opus 5.5 ve Claude Fable 5.1'e karşı Google'ın karşılaştırma tablosundaki 19 satırın 13'ünde lider olsa da, tek bir gerçek her puanın önüne geçiyor: Astra ve Opus 5.5'i bugün satın alabilirsiniz, ancak Argon'u satın alamazsınız. Google'ın yeni öncü modeli bugün yalnızca Fairwind Programı savunucularına, tanıtım dönemi boyunca milyon belirteç başına 2$/10$ ve sonrasında 4$/20$ karşılığında sunuluyor. Bu, Opus 5.5'in standart maliyetiyle aynıdır.
Bu karşılaştırma; dört modeli fiyat ve limitler açısından hizalar, kıyaslama satırlarını kazanan modele göre gruplandırır, sayıların neden doğrudan karşılaştırılamadığını açıklar ve kendi komut istemlerinizde modelleri Apidog ile test etmek için uygulanabilir bir akış sunar. Argon'a yeniyseniz Gemini 4 Argon nedir ile başlayın; zamanlama için Argon çıkış tarihi kılavuzuna bakın.
Fiyat ve limitler yan yana
Google'ın tablosu Claude Fable 5.1'i de içeriyor; bu nedenle aşağıdaki karşılaştırmada o da yer alıyor. Fiyatlar 1 milyon belirteç başınadır ve Google'ın lansman gönderisi, OpenAI'ın GPT-6 Astra model sayfası ve Anthropic'in fiyatlandırma sayfasından alınmıştır.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Bugün arayabilir misiniz? | Hayır, yalnızca Fairwind | Evet | Evet | Evet |
| API model kimliği | Yayınlanmadı | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| Giriş | 2$ tanıtım, sonra 4$ | 10$ | 4$ | 10$ |
| Önbelleğe alınmış giriş | 0,10$ tanıtım, sonra 0,20$ | 1$ | 0,20$ | 0,25$ |
| Çıkış | 10$ tanıtım, sonra 20$ | 50$ | 20$ | 50$ |
| Maksimum çıkış | 1M (Google'ın belirttiği limit) | 128K | 128K (Batch'te 300K, beta) | 128K |
| Bağlam penceresi | Yayınlanmadı | 1.050.000 (maksimum 922K giriş) | 1M | 1M |
| Uzun komut istemi ek ücreti | Belirtilmedi | 272K giriş üzeri: tüm istek için 2x giriş ve önbellek, 1,5x çıkış | Yok | Yok |
Bu tabloda üç nokta öne çıkıyor:
- Argon'un standart giriş, önbelleğe alınmış giriş ve çıkış fiyatları Opus 5.5 ile eşleşiyor. Anthropic'e karşı fiyat avantajı yalnızca Google'ın tanıtım dönemi boyunca geçerli.
- Astra ve Fable 5.1, Argon'un standart giriş ve çıkış fiyatlarının 2,5 katı; tanıtım fiyatlarının ise 5 katı.
- Google'ın belirttiği maksimum çıktı limiti 1M belirteç. Ancak Vals AI, test ettiği Argon yapılandırması için 262K maksimum çıktı listeliyor.
İstek başına maliyet hesaplamak için Gemini 4 Argon fiyatlandırması rehberine bakın.
Google'ın tablosunda her modelin lider olduğu yerler
Önce önemli bir bağlam: Bu, Google'ın tablosudur. Argon puanları Google tarafından raporlanmıştır; bazıları şirket içi hesaplamalar, bazıları liderlik tablolarından alınan sonuçlardır. Rakip puanları çoğunlukla sağlayıcıların kendi verileri veya kamu liderlik tablolarındaki sonuçlardır. Test ortamları farklı olduğu için küçük puan farklarını kesin üstünlük olarak yorumlamayın.
| Lider kim | Kıyaslama | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: bilgi işi | Vals Endeksi | %68,9 | %63,1 | %65,8 | %67,0 |
| Argon: bilgi işi | AutomationBench | %51,3 | %41,4 | %31,4 | %42,5 |
| Argon: bilgi işi | Harvey'in Hukuk Temsilcisi Kıyaslaması | %19,6 | %5,4 | %6,7 | %3,8 |
| Argon: kodlama | DeepSWE v1.1 | %77,9 | %74,1 | %67,4 | %74,2 |
| Argon: uzun bağlam | GraphWalks 256K'dan 1M'ye (F1) | %84,2 | %71,8 | %65,0 | %66,8 |
| Argon: çok modlu | LVBench | %91,7 | %87,5 | %79,7 | %83,7 |
| Argon: çok modlu | Chartography | %71,6 | %71,0 | %46,2 | %66,3 |
| Astra | FrontierSWE v2 | %55,0 | %65,5 | %56,3 | %62,3 |
| Astra | Terminal-Bench Bilim 0.1 | %57,6 | %68,1 | Bildirilmedi | Bildirilmedi |
| Astra | OSWorld-2.0 (çevrimdışı, kısmi) | %69,2 | %72,6 | Bildirilmedi | Bildirilmedi |
| Opus 5.5 | Terminal-bench 4.0 | %57,4 | %58,2 | %57,9 | %66,4 |
| Opus 5.5 | PostTrainBench | %45,3 | %44,3 | %40,2 | %49,3 |
| Berabere | CWE-bench v1 | %68,0 | %68,0 | %58,0 | %67,0 |
Argon'un diğer doğrudan galibiyetleri Vals Finans Temsilcisi v2, Vibe Code Bench, LABBench 2, RiemannBench, 128K'ya kadar GraphWalks ve Agent's Last Exam'dır. Fable 5.1 hiçbir satırda lider değildir.
CWE-bench v1'de DeepMind'ın siber liderlik tablosu, Argon, Astra ve Grok 4.7 arasında %68 ile üç yönlü beraberlik gösterirken Opus 5.5 %67'de kalıyor.
Gemini 4 Argon ile Fable 5.1 doğrudan karşılaştırıldığında Argon, her iki modelin de sayı bildirdiği 17 satırın 15'inde daha yüksek puan alıyor. Fable yalnızca FrontierSWE v2'de (%56,3'e karşı %55,0) ve Terminal-bench 4.0'da (%57,9'a karşı %57,4) önde. Anthropic'in verileri için Claude Fable 5.1 kıyaslama yazısına, 19 satırlık tam liste için Gemini 4 Argon kıyaslamalarına bakın.
Farklara güvenmeden önce üç uyarı
1. Rakip sayıları Google'ın testleri değildir
Google'ın metodolojisi, Gemini dışındaki modellerin sonuçlarının “aksi belirtilmedikçe sağlayıcıların kendi bildirdiği sayılardan alındığını” belirtir. Bazı satırlar da Vals AI, Proximal ve Surge tarafından yürütülen kamu liderlik tablolarından gelir.
2. Test ortamları farklılık gösterir
DeepSWE v1.1'de Google, Argon'un %77,9 sonucunu mini-swe-agent ortamında kendisi hesaplıyor. Astra puanı kamu liderlik tablosundan, Anthropic puanları ise sistem kartlarından geliyor.
LVBench'te video örnekleme yöntemleri de aynı değil:
- Gemini: saniyede 1 kare
- Astra: 800 kare
- Opus 5.5: 600 kare
- Fable 5.1: 300 kare
Google, bu farkı API sınırlamalarına bağlıyor. Bu nedenle yalnızca nihai puanı değil, test yapılandırmasını da inceleyin.
3. Aynı model, farklı grafiklerde farklı puan alabilir
Opus 5.5'in Terminal-bench 4.0 sonucu test ortamına ve çaba ayarına bağlı olarak farklı grafiklerde değişiyor. Anthropic, %66,4 sonucunu yüksek çaba ayarıyla bildiriyor.
Pratik kural: Tek bir tabloya farklı kaynaklardan gelen sonuçları bağlamsız biçimde koyarak karar vermeyin.
Üçüncü taraf değerlendiriciler ne diyor?
Bağımsız liderlik tabloları farkı daraltıyor. Artificial Analysis, Argon'u 223 model arasında 8. sırada listeliyor; ancak bu liste her muhakeme ayarını ayrı bir giriş olarak sayıyor.
Farklı model aileleri açısından:
- Argon: 53
- GPT-6 Astra: 53
- Claude Fable 5.1: 53
- Claude Opus 5.5: 58
- Claude Sonnet 5.5: 56
Artificial Analysis ayrıca AA-Omniscience'de Argon'un halüsinasyon oranını %15, Astra'nın maksimum ayardaki oranını ise %51 olarak listeliyor.
Arena'da Argon, 4.942 oyla işaretlenmiş Ön Hazırlık durumunda Metin kategorisinde 1525 puanla birinci sırada yer alıyor. Opus 5.5 dördüncü sırada. Vals AI ise Argon'u Vals Endeksi'nde 41 model arasında birinci gösteriyor; bu, zirveye çıkan ilk Gemini modeli olduğu anlamına geliyor.
Google içinde de tam bir fikir birliği yok. Bloomberg, erişimi olan bazı çalışanların Argon'u belirli kodlama ve ön uç tasarım işlerinde kıyaslamalarına göre yetersiz bulduğunu bildirdi. Google bu tanımlamayı yanlış olarak nitelendirdi.
Hangisine yönlendirmeli?
2026'da her iş yükü için tek bir “en iyi” öncü model yok. Bugün erişebildiğiniz modellerle başlayın, Argon erişime açıldığında aynı iş yükünü yeniden test edin.
| Görev | Bugün yönlendir | Argon piyasaya çıktığında |
|---|---|---|
| Hukuk, finans ve ofis otomasyon ajanları | Opus 5.5 (%67,0 Vals Endeksi) | Argon'u test edin: dört bilgi işi satırının tamamında lider |
| Terminal ağırlıklı kodlama ajanları | Opus 5.5 (%66,4 Terminal-bench 4.0) | Opus 5.5 hâlâ lider |
| Ajan tabanlı yazılım mühendisliği | Astra (%65,5 FrontierSWE v2) veya Opus 5.5 | Argon DeepSWE'de lider, FrontierSWE'nin gerisinde; ikisini de test edin |
| Bilgisayar kullanımı ve GUI ajanları | Astra (%72,6 OSWorld-2.0) | Astra OSWorld'de lider; Argon Agent's Last Exam'da lider |
| 256K+ belirteç istemleri üzerinde akıl yürütme | Opus 5.5 (ek ücret yok) veya Astra (272K üzeri ek ücretli) | Argon (%84,2 GraphWalks 256K'dan 1M'ye) |
| Video ve grafik anlama | Astra (%87,5 LVBench) | Argon (%91,7), kare sayısı farkını dikkate alın |
| Bilim ve ML mühendisliği | Astra (Terminal-Bench Bilim), Opus 5.5 (PostTrainBench) | Argon LABBench 2 ve RiemannBench'te lider; test edin |
| 128K belirteçten fazla tek yanıtlar | Batch'te Opus 5.5 (300K, beta) | Argon, Google'ın belirttiği 1M'ye kadar |
| Yüksek hacimli, maliyete duyarlı işler | Opus 5.5 (4$/20$) | Tanıtım sürdüğü sürece Argon 2$/10$ |
Fiyat, en yüksek puandan daha önemliyse GPT-6 Sol vs Claude Opus 5.5 karşılaştırması OpenAI'ın daha ucuz Sol serisini Opus ile ele alır.
Üçünü de kendi komut istemlerinizde karşılaştırın
Satıcı tabloları, modelin sizin komut istemlerinizde nasıl davranacağını söylemez. Bunu ölçmek için Apidog içinde küçük ve tekrarlanabilir bir değerlendirme senaryosu oluşturun.
1. Üç API isteği oluşturun
Aynı proje içinde aşağıdaki üç isteği tanımlayın:
- GPT-6 Astra isteği
- Claude Opus 5.5 isteği
-
{{GEMINI_MODEL}}değişkenini kullanan Gemini isteği
Google, Argon'un model kimliğini yayınlayana kadar Gemini isteğini gemini-3.8-flash ile çalıştırabilirsiniz.
İstek gövdeleri ve kimlik doğrulama biçimleri için GPT-6 Astra API kılavuzuna ve Claude Opus 5.5 nedir rehberine bakın.
2. Ortak ortam değişkenleri kullanın
Her sağlayıcının API anahtarını ortam değişkeni olarak saklayın:
OPENAI_API_KEY
ANTHROPIC_API_KEY
GOOGLE_API_KEY
GEMINI_MODEL
PROMPT
Üç isteğin de aynı girdiyi alması için komut istemini ortak bir değişkende tutun:
{{PROMPT}}
Böylece test sırasında yalnızca modeli değiştirir, komut istemini ve değerlendirme koşullarını sabit tutarsınız.
3. Yanıt ve maliyet kontrolleri ekleyin
Her istek için aşağıdaki kontrolleri ekleyin:
- HTTP durum kodu
200 - Boş olmayan yanıt gövdesi
- Belirlediğiniz tavanın altında çıktı belirteci
- Yayınlanmış oranlarla hesaplanan maliyetin bütçe altında kalması
Örnek maliyet kontrolü mantığı:
const inputTokens = 20000;
const outputTokens = 4000;
const inputPricePerMillion = 10;
const outputPricePerMillion = 50;
const cost =
(inputTokens * inputPricePerMillion) / 1_000_000 +
(outputTokens * outputPricePerMillion) / 1_000_000;
if (cost > 0.50) {
throw new Error(`Bütçe aşıldı: $${cost.toFixed(2)}`);
}
Bu örnek Astra'nın 10$/1M giriş ve 50$/1M çıkış fiyatını kullanır.
4. İstekleri tek test senaryosunda çalıştırın
Üç isteği aynı test senaryosuna ekleyin ve sonuçları test raporunda yan yana değerlendirin:
- Yanıt kalitesi
- Başarı oranı
- Çıktı belirteçleri
- Gecikme
- Tahmini maliyet
- Göreve özel doğruluk
Maliyet hesabı basit aritmetiktir. 20.000 giriş ve 4.000 çıkış belirteçli bir istek için:
| Model | Giriş maliyeti | Çıkış maliyeti | Toplam |
|---|---|---|---|
| Astra | 0,20$ | 0,20$ | 0,40$ |
| Opus 5.5 | 0,08$ | 0,08$ | 0,16$ |
| Argon, tanıtım fiyatı | 0,04$ | 0,04$ | 0,08$ |
| Argon, standart fiyat | 0,08$ | 0,08$ | 0,16$ |
Ancak belirteç başına fiyat, görev başına maliyet değildir. Artificial Analysis, Argon'u görev başına yaklaşık 62K çıktı belirteciyle ölçerken Astra'yı maksimum çabada yaklaşık 27K ile ölçtü. Bu nedenle yalnızca fiyat tablosuna bakmayın; kendi üretim istemlerinizde çıktı belirteçlerini ölçün.
Argon erişime açıldığında yalnızca şu değişkeni güncelleyin:
GEMINI_MODEL=<Google'ın yayınladığı Argon model kimliği>
Ardından aynı senaryoyu yeniden çalıştırın. Böylece bugün satın alabileceğiniz Astra ve Opus 5.5 ile Argon'u aynı komut istemleri, aynı kontroller ve aynı bütçe kurallarıyla karşılaştırabilirsiniz.
SSS
Gemini 4 Argon, GPT-6 Astra'dan daha mı iyi?
Artificial Analysis'te ikisi de 53 puanda berabere. Google'ın tablosunda Argon çoğu satırda daha yüksek puan alsa da Astra, FrontierSWE v2, Terminal-Bench Science 0.1 ve OSWorld-2.0'ı kazanıyor. Ayrıca Astra bugün çağırabileceğiniz modeldir.
Gemini 4 Argon vs Claude Opus 5.5: Hangisi daha iyi?
Google'ın tablosu çoğu satırda Argon'u destekliyor. Opus 5.5 ise Terminal-bench 4.0 ve PostTrainBench'te lider. Artificial Analysis'te Opus 5.5, 58'e 53 önde. Standart fiyatlarda iki modelin maliyeti aynıdır.
Gemini 4 Argon, Claude Opus 5.5'ten daha mı ucuz?
Tanıtım döneminde yarı fiyatına: 2$/10$'a karşı 4$/20$. Tanıtım sonrasında liste fiyatları aynı. Google, tanıtım döneminin bitiş tarihini açıklamadı.
Hangi modelin en büyük çıktı limiti var?
Argon, belirtilen 1M belirteç limitiyle önde. Ancak Vals AI, test ettiği yapılandırma için 262K listeliyor. Diğer modeller senkron çıktıyı 128K ile sınırlandırıyor. 1M çıktı belirteçleri kılavuzu, bunun istemciniz için ne anlama geldiğini açıklar.
Gemini 4 Argon'u bugün kullanabilir miyim?
Yalnızca Google'ın Fairwind Programı aracılığıyla, belirli onaylanmış siber savunma ortakları için. Ücretli API müşterileri ve Google AI Ultra aboneleri daha sonra gelecek, ancak açıklanmış bir tarih yok.
İş yüküne göre seçin, sonra test edin
Argon; bilgi işi, uzun bağlam ve çok modlu görevlerde güçlü görünüyor. Astra; FrontierSWE, Terminal-Bench Science ve OSWorld'de öne çıkıyor. Opus 5.5 ise terminal işleri ve ML mühendisliğinde güçlü; ayrıca Argon'un tanıtım sonrası fiyatıyla aynı maliyet düzeyinde.
Bugün erişebildiğiniz Astra ve Opus 5.5'i temel alın. Gemini modelini bir ortam değişkeninde tutun. Argon açıldığında aynı test senaryosunu yeniden çalıştırın ve üretim iş yükünüze göre karar verin.
Tek projede üç istekli karşılaştırmayı kurmak için Apidog'u indirin.
Top comments (0)