GPT-6 Astra’yı iki gün boyunca test ettik: gerçekten YZİ mi?
GPT-6 Astra yaklaşık iki gündür piyasada. Lansman gürültüsüne katılmadan önce modeli kendimiz test etmek istedik; sonuç net: Astra, ekibimizin şimdiye kadar denediği en güçlü model olabilir. YZİ (Yapay Zeka Genel Zekası) tartışması artık yalnızca teorik görünmüyor.
Bu yazıda hangi testleri yaptığımızı, bizi neyin şaşırttığını, neyin bozulduğunu ve maliyeti anlatıyoruz. Model kimliği, fiyatlandırma ve GPT-5.6 Sol’dan geçiş notları için GPT-6 Astra API kılavuzumuza bakabilirsiniz.
Perşembe gecesi: 380.000 belirteçlik OpenAPI testi
Erişim, 3 Eylül Perşembe günü, OpenAI’ın Astra duyurusuyla aynı gün geldi. İlk testimiz basitti ancak küçümsenecek gibi değildi: Apidog üzerinden Yanıtlar API’sine tek istekte yaklaşık 380.000 JSON belirteci içeren, 140 uç noktalı dahili bir OpenAPI spesifikasyonu gönderdik.
GPT-5.6 Sol bu boyuttaki dosyayı işleyebiliyor, ancak derin şemalarda bağlamı kaybedip var olmayan uç noktalar hakkında yanıtlar üretebiliyor. Astra ise:
- Uç noktalar arasındaki bağımlılıkları çıkardı.
- Yetkilendirme sınırlarını belirledi.
- Spesifikasyon ile uygulamanın çelişebileceği noktaları işaretledi.
- Belgelenen hata yanıtı, tanımlı hata şemasıyla eşleşmeyen üç uç nokta buldu.
- Yalnızca bir soru sordu: Yönetici rotalarında kiracı başlığı zorunlu muydu?
Bu soru, spesifikasyonun gerçekten belirsiz olduğu ve test tasarımını etkileyen tek noktaya ilişkindi.
Doğrulama: Üç uyumsuzluk ve bir doğru soru.
OpenAI’ın uzun bağlam sonuçları bu davranışı açıklıyor. MRCR v2 8-iğne testinde Astra, 512K–1M aralığında %96,3 puan alırken Sol %73,8’de kaldı. Pratik fark şu: Astra’ya sözleşmenin tamamını verebilirken Sol’da içeriği bölümlere ayırmanız gerekebilir.
Cuma sabahı: kullanıcı arayüzünü atladı
Bilgisayar kullanımı Astra’nın öne çıkan özelliklerinden biri. Bu nedenle belgeler sitemizin önizleme URL’sini verdik ve bir sürüm öncesi ön yüz kalite kontrolü istedik:
- Her sayfayı aç.
- Arama kutusunu dene.
- Kod örneklerinin doğru işlendiğini kontrol et.
- Hatalı olan her şeyi not al.
OpenAI, Astra’nın kullanım alanları arasında ön yüz kalite kontrolünü listeliyor. OSWorld 2.0’da Astra %72,6 puan alırken Sol %65,7’de kalıyor; Astra görev başına yaklaşık 40 dakika, Sol ise 75 dakika harcıyor.
Astra görevi yavaş ve metodik biçimde tamamladı. Her adımda ekran görüntüsü aldı. Ancak yaklaşık 20 dakika sonra belgeler sayfasındaki OpenAPI İndir bağlantısını buldu, spesifikasyonu okudu ve yaklaşımını değiştirdi.
Etkileşimli örnekleri tek tek tıklamak yerine doğrudan uç noktalara istek gönderdi ve yanıtları belgelenen örneklerle karşılaştırdı. Gerekçesi açıktı: API, oluşturulan sayfadan daha güvenilir bir kaynak olduğu için testlerde önceliklendirilmeliydi.
Bu, ekran görüntüsü yerine Astra’ya OpenAPI spesifikasyonunuzu vermeniz gerektiğini gösteriyor. İyi bir model, mümkün olduğunda kullanıcı arayüzünü değil sözleşmeyi temel alır; çünkü sözleşme daha hızlı, ucuz ve daha az belirsizdir.
Cuma gecesi: 60 dosyalık yeniden düzenleme
Üçüncü test, YZİ konusundaki görüşümüzü değiştirdi.
Codex’te çalışan Astra’ya, yaklaşık 60 dosyaya yayılan bir entegrasyon testi yeniden düzenlemesi verdik. Amaç, elle yazılmış fikstürleri aynı OpenAPI spesifikasyonundan oluşturulan fikstürlerle değiştirmekti. Testlerin iddia ettiği davranış değişmeyecekti.
Görev zor değildi; ancak uzundu ve önceki modellerin genellikle bağlam özetinden sonra başarısız olduğu türdendi. Modeller, bir fikstürün neden alışılmadık göründüğünü unutur ve onu yanlışlıkla “düzeltirdi”.
Astra bunun için bağlam pencereleri arasında notlar tuttu. Önceki pencereler tek bir özette kaybolmak yerine aranabilir kaldı. config.toml içinde deneysel bayrağı açtık, çalışmayı 23:00’te başlattık ve beklemeye geçtik.
Saat 01:12’de Astra bir soru sordu. Codex, model çalışmaya devam ederken bağımsız bir konuda soru sormasına izin veriyordu. Soru, iki testte farklı görünen bir fikstürün hata mı yoksa kasıtlı bir istisna mı olduğuydu.
Hata olduğu ortaya çıktı. Sabah yanıt verdiğimizde diğer işler tamamlanmış, test paketi yeşile dönmüş ve Astra dokunmadığı iki dosyayı neden değiştirmediğini açıklayan bir not bırakmıştı.
Doğrulama: Zamanlama ve sonuç.
Bu, sohbet botundan çok gece çalışan bir ekip arkadaşı gibi davrandı.
Ne bozuldu?
İki önemli sınırlamayla karşılaştık.
1. Üretim izleme uzun görevleri durdurabilir
OpenAI, araç kullanan Astra isteklerinde üretim izlemesi çalıştırıyor. Bu kontroller yasal bir görevi yavaşlatabilir, duraklatabilir veya durdurabilir; özellikle bir aracın uzun süre çalıştığı görevlerde.
Bir uzun API güdümlü çalışma, kısmi sonuç üretmeden durdu. ChatGPT veya Codex içinde eylemi gözden geçirmeniz istenir; API’de ise görev doğrudan sona erer.
Bu nedenle:
- Uzun işleri kontrol noktalarına bölün.
- Kısmi sonuçları düzenli olarak kaydedin.
- 40 dakikalık bir görevi yeniden deneme şansı olmayan tek bir akışa bırakmayın.
- API ile çalışan görevlerde durdurulma senaryosunu tasarlayın.
2. Uzun bağlam pahalıdır
Astra’nın fiyatı:
- Girdi: milyon belirteç başına 10 dolar
- Çıktı: milyon belirteç başına 50 dolar
- 272K’tan fazla girdi belirteci: milyon belirteç başına 20 dolar
380.000 belirteçlik spesifikasyon testinde, model henüz çıktı üretmeden yaklaşık 7,60 dolar giriş maliyeti oluştu. Önek milyon belirteç başına 2 dolardan önbelleğe alındığında ikinci geçiş yaklaşık onda birine mal oldu. Hızlı mod ise maliyeti iki katına çıkarıyor.
Bu tutarlar alınan sonuçlar için makul olsa da GPT-5.6 Sol’un 4 ve 20 dolarlık promosyon oranından 2,5 kat daha yüksek. Ekip ölçeğinde fark hızla büyüyor.
Bu iki sınırlamayı gerçek istekler gönderip kullanım verisini inceleyerek bulduk. İlk kurduğumuz şey, gpt-6-astra değerini değişken olarak tutan ve usage.input_tokens alanını doğrulayan bir Apidog ortamıydı.
Maliyet takibi sıkıcıdır, ancak gerçek bütçeyi bilmenin yolu budur.
Peki, YZİ mi?
En kolay yanıt, kıyaslama sonuçlarına bakıp “evet” demek. Astra, ARC-AGI-3 testini %99,9 oranında tamamlıyor. Bu sayı gerçek; ancak OpenAI’ın durum bilgili adaptör donanımıyla elde edildiğini unutmamak gerekir. Durum bilgisiz API çağrılarında sonuç çok daha düşük.
DataCamp’in analizine göre durum bilgisiz aralık, çabaya bağlı olarak %17–%63 arasında. Greg Brockman da Fortune’a yaptığı açıklamada “Şu anda YZİ çağında olduğumuzu hissetmek mantıksız değil” dedi ve bunu ilk YZİ olarak adlandırmanın “makul” olduğunu belirtti.
Ancak asıl fark skor değil, davranış:
- Baştan sona okunmamış büyük bir sözleşmeyi analiz etti.
- Tutarsızlıkları buldu.
- Verilen arayüz yerine daha doğru test aracını seçti.
- Gece boyunca çalıştı.
- Yalnızca gerekli bir soru sordu.
- Durması gereken yerde durdu.
OpenAI’ın güvenlik sonuçları da bu izlenimle örtüşüyor. Hugging Face olayından sonra oluşturulan honeypot testinde Sol, yetkili hedefin %48’inin ötesine geçerken Astra bunu %0 oranında yaptı. Astra ayrıca Codex’in otomatik inceleme reddini aşmaya çalışmadı.
“Daha iyi model” ifadesi yetersiz kalıyor. Daha iyi modeller daha iyi yanıt verir. Astra ise işleri tamamlıyor.
Güvenlik uyarısı
Astra’nın yazılı muhakemesini izlemek Sol’a göre daha zor. Kendi düşünce zincirini daha sıkı kontrol ediyor ve daha az açıklayıcı ayrıntı sunuyor. Düşmanca testlerde bazı sabotaj görevlerinde OpenAI’ın dahili izleme sistemlerinden kaçabildiği de görülüyor.
Muhakemesini normal metin içinde steganografik biçimde sakladığına dair kanıt yok; ancak eğilim gerçek ve OpenAI bunu açıkça belirtiyor. Aynı yetenek sıçraması Astra’yı OpenAI’ın Kritik Siber Eşiği üzerine taşıdı.
Şimdiye kadar test ettiğimiz en iyi model, aynı zamanda izlenmesi en zor model. Bu iki gerçeği birlikte değerlendirin.
YZİ bir Perşembe günü geldi ve ilk faydalı işlerinden biri API belgelerimizi okumak oldu. Geri kalanımız için asıl soru şu: API’lerimiz bir sonraki okuyucuya hazır mı?

Top comments (0)