GPT-6 Astra ile API testleri: Ekranı değil, sözleşmeyi test edin
GPT-6 Astra'nın öne çıkan özelliği bilgisayar kullanabilmesi. Bu, 2025'teki bir demoda birkaç kez tıklayıp açılır menüde kaybolan modellerden farklı: OpenAI'nin lansman yazısına göre Astra, OSWorld 2.0'da görev başına yaklaşık 40 dakikada %72,6 puan alıyor; formları dolduruyor, CRM'leri güncelliyor, yazılım yüklüyor ve oluşturduğu sitelerde ön yüz QA kontrolleri yapıyor.
API oluşturuyor veya test ediyorsanız, Astra'yı doğrudan uygulamanıza yöneltip tıklamasına izin vermek cazip görünebilir. Ancak daha hızlı, ucuz ve doğrulanabilir yaklaşım, modele API sözleşmesini vermektir.
Bir OpenAPI spesifikasyonu, ekran yerine kullanılabilecek doğrudan bir arayüzdür. İki günlük uygulamalı testimizde Astra'nın bu geçişi kendi başına yaptığını gördük. Bu yazıda neden sözleşme öncelikli ilerlemeniz gerektiğini ve bunu Apidog ile nasıl kuracağınızı ele alıyoruz.
Kısa özet
- Astra'nın bilgisayar kullanımı gerçek: OSWorld 2.0'da %72,6, ScreenSpot-Pro'da %92,7.
- Codex altyapısı, bilgisayar kullanım görevlerini GPT-5.6 Sol deneyimine göre 1,9 kat daha hızlı tamamlıyor.
- Ekran yönlendirmesi onlarca dakika ve çok sayıda görüntü belirteci gerektirebilir.
- Ekran testi kullanıcı arayüzünü; OpenAPI testi ise API'nin verdiği sözü doğrular.
- OpenAPI spesifikasyonunu Apidog MCP Sunucusu üzerinden veya işlev araçları olarak Astra'ya sağlayın.
- Astra'nın oluşturduğu senaryoları Apidog'a aktarın ve Apidog CLI ile CI/CD hattınızda çalıştırın.
- Bilgisayar kullanımını API'si olmayan yüzeyler için saklayın.
GPT-6 Astra bilgisayar kullanarak neler yapabilir?
Astra'nın yetenekleri yalnızca web sitelerinde gezinmekle sınırlı değil. OpenAI, şu kullanım alanlarını listeliyor:
- Çevrimiçi formları doldurma
- CRM kayıtlarını ve takvimleri güncelleme
- Belge düzenleyicilerinde araştırma ve taslak oluşturma
- Çizimlerle bilimsel veri analizi
- ChatGPT Siteleri ile web sitesi oluşturma ve barındırma
- Oluşturulan sitelerde ön yüz QA kontrolleri
- KiCad'de baskılı devre kartı tasarlama
- Blender'da ev modeli oluşturma
Kıyaslama sonuçları
| Kıyaslama testi | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (çevrimdışı set, kısmi puan) | Görev başına yaklaşık 40 dakikada %72,6 | Görev başına yaklaşık 75 dakikada %65,7 | %70,2 |
| ScreenSpot-Pro (araçsız) | %92,7 | %76,9 | — |
| Ajanların Son Sınavı | %59,3 | %53,6 | %55,5 |
| AutomationBench | %41,4 | %18,1 | %26,9 |
Skorlar kadar önemli iki ayrıntı daha var:
- Astra, OSWorld görevlerini Sol'dan yaklaşık %47 daha kısa sürede tamamlıyor.
- Ajanların Son Sınavı'nda en yüksek puanlı ayarlarda Opus 5'e göre yaklaşık %65 daha az çıktı belirteci kullanıyor.
OpenAI ayrıca Codex altyapısını güncelleyerek bilgisayar kullanımı görevlerinin Mind2Web'deki mevcut Sol deneyimine göre 1,9 kat daha hızlı tamamlanmasını sağladı. Daha kısa döngüler, belirteç başına ödeme yapan ekipler için daha düşük maliyet anlamına geliyor.
Astra'nın davranışı da gelişmiş durumda:
- Yalnızca cevabın sonucu değiştireceği durumlarda odaklanmış sorular soruyor.
- Görevin ortasında yönlendirildiğinde bağlamını koruyor.
- Codex'te, yanıtınıza bağlı olmayan işleri sürdürürken soruları eşzamansız olarak iletebiliyor.
OpenAI'nin dahili bilgisayar kullanımı güvenlik kıyaslamasında düşük skor daha iyi anlamına geliyor. Astra %2,4, Sol ise %22,0 puan alıyor.
40 dakikalık bilgisayar kullanım görevinin maliyeti
Bilgisayar kullanımı sürekli tekrarlanan bir döngüdür:
- Ekran görüntüsü al.
- Düşün.
- Eyleme geç.
- Tekrar ekran görüntüsü al.
Her ekran görüntüsü görüntü girdisidir. Her adım, konuşmanın o ana kadarki geçmişini taşır. Bu nedenle 40 dakikalık bir görev yüzlerce adıma ve çok sayıda görüntü belirtecine ulaşabilir.
Standart fiyatlandırmaya göre Astra'nın maliyeti:
- 1 milyon girdi belirteci başına 10 dolar
- 1 milyon çıktı belirteci başına 50 dolar
- 272 bin girdi belirtecini aşan istemlerde 1 milyon belirteç başına 20 dolar
- Tekrarlanan ön ekler için 1 milyon önbelleğe alınmış belirteç başına 1 dolar
İstem önbellekleme yardımcı olsa da ekran görüntüleri her adımda yenidir. Uzun bir oturum, geçmişini bağlamda tuttuğu için zamanla uzun bağlam fiyatlandırmasına da kayabilir.
OpenAPI sözleşmesiyle yaklaşım farklıdır:
- Spesifikasyon tek bir ön ek olarak yüklenir ve önbelleğe alınabilir.
- Modelin yazdığı her test birkaç yüz belirteçlik JSON'dır.
- Test senaryosu bir kez oluşturulduktan sonra çalıştırılması yalnızca HTTP çağrıları gerektirir.
- CI, testleri model kullanmadan binlerce kez çalıştırabilir.
İkinci maliyet kesintidir. OpenAI'nin güvenlik genel bakışında üretim uyumsuzluk izleyicisinin bazen yasal işleri yavaşlatabileceği, duraklatabileceği veya durdurabileceği belirtiliyor. Uzun süren ajan görevlerinde inceleme beklenebilir. API'de görev durur; beş saniyelik bir API çağrısı ise 40 dakikalık ekran yönlendirme oturumu kadar kesintiye açık değildir.
Bilgisayar kullanımı mı, sözleşme mi?
| Durum | Daha iyi araç | Neden |
|---|---|---|
| Kendi API'nizi test etme | OpenAPI spesifikasyonu | Deterministik, yeniden çalıştırması ucuz ve gerçek sözleşmeyi doğrular |
| CI'da regresyon paketi | OpenAPI spesifikasyonu | Senaryolar model döngüsü olmadan çalışır |
| API'si olmayan üçüncü taraf portal | Bilgisayar kullanımı | Teslim edilecek bir sözleşme yoktur |
| Yayın öncesi uçtan uca ön yüz QA | Bilgisayar kullanımı | Test edilen yüzey kullanıcı arayüzüdür |
| Eski masaüstü aracı | Bilgisayar kullanımı | Kullanılabilir tek yüzey ekrandır |
| Belgelerin davranışla eşleşmesini kontrol etme | Önce spesifikasyon, sonra kullanıcı arayüzü | Belgelenen isteği gönderin, yanıtı karşılaştırın, ardından oluşturulan sayfayı kontrol edin |
Temel ayrım, neyi test ettiğinizdir:
- Bilgisayar kullanımı pikselleri test eder.
- Spesifikasyon API'nin verdiği sözü test eder.
Ön yüz bozulduğunda API hâlâ çalışıyor olabilir. API bozulduğunda ise ön yüz hatayı kullanıcı dostu bir mesajın arkasına gizleyebilir. Her iki test türü de önemlidir; ancak API ekipleri öncelikle sözleşmeyi doğrulamalıdır.
Astra'ya API sözleşmesi nasıl verilir?
Astra'ya bir OpenAPI spesifikasyonu vermenin üç temel yolu vardır.
1. Spesifikasyon dosyasını doğrudan ekleyin
OpenAPI spesifikasyonunuzu Apidog projenizden dışa aktarın veya mevcut spesifikasyonunuzu Apidog'a aktarın. Ardından dosyayı isteme ekleyin.
Astra'nın 1.050.000 belirteçlik bağlam penceresi, gerçek dünyadaki spesifikasyonların tek istemde tutulmasına olanak tanır. OpenAI'nin MRCR geri çağırma testinde Astra, 512K–1M aralığında %96,3 doğrulukta kalırken Sol %73,8'e düşüyor.
Büyük spesifikasyonlar artık mutlaka parçalara bölmeniz gereken bir engel değil.
2. Projeyi MCP üzerinden bağlayın
Apidog MCP Sunucusu, Apidog projenizi, yayınlanmış belgelerinizi veya bir OpenAPI dosyasını MCP destekli istemcilere açar.
Böylece Astra eski bir dışa aktarım yerine güncel sözleşmeyi okuyabilir. Codex ve masaüstü ajanları çalışırken uç nokta tanımlarını çekebilir. Uygulamalı testimizde Astra'nın spesifikasyonu kendi başına bulup okumasını sağlayan yöntem buydu.
3. Spesifikasyonu işlev araçlarına dönüştürün
Programatik kullanım için uç noktaları işlev araçlarına dönüştürüp Astra'yı Yanıtlar API'si üzerinden çağırabilirsiniz. Bu yaklaşım OpenAPI'dan AI ajan araçlarına yazısında ayrıntılı olarak ele alınıyor.
Model sayfası, Astra'nın işlev çağrısı, yapılandırılmış çıktılar ve dosya araması gibi özelliklerini listeliyor. Araç çağrıları için Sohbet Tamamlama yerine Yanıtlar API'sini kullanmanız gerekir.
Astra'dan test senaryoları oluşturmasını isteyin
Aşağıdaki istek, bir OpenAPI 3.1 spesifikasyonundan her kaynak için temel test senaryoları oluşturur:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{
"role": "developer",
"content": "API test senaryoları yazıyorsunuz. Eyleme yönelik olun. Sadece cevap test tasarımını değiştiriyorsa soru sorun. Şemayla eşleşen JSON çıktısı verin."
},
{
"role": "user",
"content": "İşte OpenAPI 3.1 spesifikasyonumuz. Her kaynak için bir test senaryosu taslağı oluşturun: başarılı senaryo (happy path), yetkilendirme sınırı ve her biri için bir olumsuz durum.\n\n"
}
],
"text": {
"format": {
"type": "json_schema",
"name": "scenarios",
"schema": {
"type": "object",
"properties": {
"scenarios": {
"type": "array"
}
},
"required": ["scenarios"]
}
}
}
}'
OpenAI'nin model rehberine göre Astra'da none veya minimal reasoning effort seçeneği yok. low veya medium ile başlayın.
Astra önceki modellere göre daha kolay açıklama isteyebiliyor. Bu nedenle geliştirici mesajındaki “eyleme yönelik olun” ifadesi önemlidir. Ayrıca JSON Schema ile çıktıyı sınırlandırmak, üretilen senaryoların doğrudan sonraki araca aktarılmasını kolaylaştırır.
Senaryoları model olmadan çalıştırın
Modelin oluşturduğu senaryoları Apidog'a aktarın. Ardından:
- Durum kodları için assertion ekleyin.
- Yanıt gövdelerini OpenAPI şemalarıyla doğrulayın.
- Kimlik doğrulama ve yetkilendirme sınırlarını kontrol edin.
- Negatif senaryoları koruyun.
- Testleri Apidog CLI ile CI/CD pipeline'ınızda çalıştırın.
Model testleri bir kez yazdıktan sonra CI bunları model kullanmadan tekrar tekrar çalıştırabilir. Bu iş akışındaki ekonomik argüman tek cümlede özetlenebilir:
Model testleri oluşturmak için kullanılır; testleri çalıştırmak için kullanılmaz.
İhtiyaç duyarsanız Apidog'u indirin ve API anahtarınızı bu iş akışına ekleyin.
Güvenlik önlemlerini koruyun
OpenAI'nin Astra için yayınladığı uyum sonuçları güçlü:
- Hugging Face olayından sonra oluşturulan honeypot testinde Sol, yetkili hedefin %48'inin dışına çıkarken Astra bunu %0 oranında yaptı.
- Astra, Codex otomatik inceleme reddini, ret kasten atlatılabilir şekilde yapılandırılsa bile, atlatmaya çalışmadı.
- Dolaylı istem enjeksiyonu sağlamlığı %96,23'ten %99,79'a yükseldi.
Bunlar güvenlik kapılarını kaldırmanız gerektiği anlamına gelmez. 1 milyon belirteçlik bağlama, Kritik siber derecelendirmesine ve API'nize rastgele istek gönderme yeteneğine sahip bir model yine de sınırlı kimlik bilgileriyle, hazırlık ortamında çalıştırılmalıdır.
Ayrıca:
- Değişikliklerde bir onay kapısı kullanın; AI ajanları için koruyucu önlemler uygulayın.
- Her çağrının izini tutun.
- Uzun görevleri devam ettirilebilir tasarlayın.
- Transkripti değil, sözleşmeyi doğrulayın.
Astra'nın izleyicisi bir çalışmayı görev ortasında durdurabilir. Bu nedenle uzun ajan işlerini hiçbir zaman kesintisiz çalışacaklarını varsayarak tasarlamayın.
Bilgisayar kullanımı ne zaman doğru seçimdir?
Bu yaklaşım “Astra'nın asla tıklamasına izin vermeyin” anlamına gelmez. Ekran tabanlı kullanım şu durumlarda daha uygundur:
- API'si olmayan bir iş ortağı portalı veya yönetim konsolu
- İnsanların normalde elle yaptığı yayın günü ön yüz kontrolleri
- Kullanıcı arayüzünün tek erişim yüzeyi olduğu eski bir masaüstü aracı
Astra, bu işlerin devredilmeye değer olduğu ilk modellerden biri. Codex altyapısındaki hız artışı, bu kontrolleri gecelik çalıştırmayı da daha gerçekçi hâle getiriyor.
Pratik kural:
Bir sözleşme varsa sözleşmeye ulaşın; yoksa ekrana ulaşın.
Sıkça Sorulan Sorular
GPT-6 Astra'nın bilgisayar kullanımı API üzerinden çalışır mı?
Evet. Bilgisayar kullanımı, Yanıtlar API'sinde Astra'nın desteklediği araçlar arasında web araması, dosya araması, kod yorumlayıcı ve görüntü oluşturma ile birlikte listeleniyor.
Uygulamanız çalışma ortamını sağlar ve modelin önerdiği eylemleri yürütür. API ayrıca OpenAI'nin daha katı koruyucu önlemlerini içerir: uyumsuzluk izleyicisi tarafından duraklatılan bir görev inceleme beklemek yerine durur.
Astra'ya ne kadar büyük bir spesifikasyon verebilirim?
Bağlam penceresi 1.050.000 belirteç, çıktı kapasitesi ise 128.000 belirteçtir. Yüzlerce uç noktaya ve tam şemalara sahip bir spesifikasyon, geriye test talimatları için yer kalacak şekilde sığabilir.
272 bin girdi belirtecini aşan istemler, girdi ve önbellek oranlarının iki katıyla faturalandırılır. Spesifikasyon ön ekini önbelleğe alın ve test başına eklenen mesajları küçük tutun.
Astra spesifikasyonda olmayan uç noktaları halüsinasyon olarak üretebilir mi?
Önceki modellere göre daha az olası. OpenAI'nin dahili halüsinasyon kıyaslamasında düşük skor daha iyi anlamına geliyor: Astra %4,2, Sol ise %12,2 puan alıyor. Astra'nın kendi yeteneklerini yanlış tanıtma olasılığı da üç kat daha düşük.
Bununla birlikte son doğrulama modelin yanıtı değil, çalıştırılan sözleşme testidir. Yapılandırılmış çıktılar ve Apidog'daki şema doğrulaması ek hataları yakalar. API sözleşme testi bu nedenle son sözü söylemelidir.
Bu yaklaşım test oluşturmak için GPT-5.6 Sol'dan daha ucuz mu?
Belirteç başına hayır. Astra, Sol'un tanıtım amaçlı 4 ve 20 dolarlık fiyatlarına karşılık milyon belirteç başına 10 ve 50 dolar maliyetindedir.
Tamamlanmış görev başına maliyet ise farklı olabilir. OpenAI, Astra'nın çok daha az belirteç kullandığını ve spesifikasyon öncelikli iş akışında model maliyetinin tek seferlik bir gider hâline geldiğini belirtiyor. Karar vermeden önce kendi spesifikasyonunuz üzerinde ölçüm yapın; API rehberi iki yaklaşımı yan yana karşılaştırmanıza yardımcı olur.
Sonuç
GPT-6 Astra bilgisayarınızı kullanabilir ve API'si olmayan yüzeyler için bu önemli bir gelişme. Ancak sahip olduğunuz bir API için ekran, genellikle daha yavaş ve pahalı yoldur.
Modele sözleşmeyi verin, test senaryolarını yazmasını sağlayın, assertion'ları Apidog'da ekleyin, testleri CI'da çalıştırın ve güvenlik kapılarını koruyun. Deterministik olmayan ajanlar için test tasarımı değişmez: transkripti değil, teslim edilen sözleşmeyi doğrulayın.
Astra bu sonuca yirmi dakika içinde kendi başına ulaştı. Ekibiniz de buradan başlayabilir.

Top comments (0)