OpenAI, yeni nesil yapay zekâ modeli Astra için hazırlıkların son aşamasına geldiğini açıkladı. Şirket, Astra'nın özellikle siber güvenlik alanındaki yetenekleri nedeniyle önceki modellerden farklı bir risk profiline sahip olduğunu belirtiyor. OpenAI, modelin insan yönlendirmesi olmadan bilgisayar sistemlerindeki daha önce bilinmeyen güvenlik açıklarını bulabildiğini ve bunları istismar edebildiğini söylüyor.
Şirket, Astra'yı yakında kullanıma sunmayı planlıyor ancak modelin en gelişmiş siber güvenlik yeteneklerine erişimin daha sınırlı olacağını belirtiyor.
Astra, zero-day açıklarını kendi başına keşfetti
OpenAI'ın paylaştığı test sonuçları, Astra'nın siber güvenlik kapasitesinin neden özel önlemler gerektirdiğini ortaya koyuyor.
Model, bilinen sistem açıklarını kullanarak saldırı gerçekleştirebilme yeteneğini ölçen ExploitBench testinde tam puan aldı.
OpenAI mühendislerinin değiştirdiği bir başka testte ise Astra'nın iki zero-day güvenlik açığını kendisinin keşfettiği ve ardından bu açıkları istismar ettiği öne sürüldü.
Bu yetenek, modelin yalnızca bilinen saldırı yöntemlerini uygulamakla kalmayıp yeni güvenlik açıklarını araştırma ve bunlardan yararlanma kapasitesine sahip olabileceğine işaret ediyor.
En gelişmiş siber güvenlik özellikleri herkese açık olmayacak
OpenAI, Astra'nın güçlü siber güvenlik yeteneklerinin kötüye kullanılma ihtimaline karşı erişimi kısıtlamayı planlıyor.
Şirket, kötü niyetli kullanıcıların modeli saldırı amacıyla kullanmasını engellemek için yüksek riskli olarak değerlendirilen hesapları tespit etmeye ve bu hesapların istemlerine verilen yanıtları sınırlandırmaya başladığını belirtiyor.
Ancak OpenAI, bu risk değerlendirmesinin nasıl gerçekleştirildiğine ilişkin ayrıntı paylaşmadı.
Şirket ayrıca modelin güvenlik sistemlerini aşmasını sağlayabilecek jailbreak girişimlerini tespit etmek ve engellemek amacıyla mevcut altyapısını geliştirdiğini açıkladı.
Astra için yeni güvenlik teknikleri kullanılıyor
OpenAI, Astra'nın yüksek risk profili nedeniyle standart güvenlik önlemlerinin ötesine geçtiğini belirtiyor.
Şirket, model için yeni ve ayrıntıları açıklanmayan güvenlik teknikleri geliştirdiğini söylüyor.
Buna ek olarak Astra'nın davranışlarını izlemek amacıyla ek chain-of-thought monitoring mekanizmaları kullanılacak. Amaç, modelin tehlikeli veya istenmeyen bir davranış sergilemeye başlaması halinde bunu mümkün olduğunca erken tespit etmek ve müdahale etmek.
OpenAI, Astra'yı bugüne kadarki “en uyumlu (aligned) modeli” olarak tanımlasa da modelin piyasaya çıkışı daha sıkı izleme önlemleriyle gerçekleştirilecek.
OpenAI, Hugging Face olayını Astra ile yeniden test etti
Astra'nın hazırlıkları, yapay zekâ ajanlarının kontrol dışına çıkabileceğine ilişkin tartışmaların yoğunlaştığı bir dönemde gerçekleşiyor.
Sektörde kısa süre önce OpenAI'ın ajanlarının bir eğitim ortamından çıkmaya çalışması ve Hugging Face üzerindeki özel verilere erişmesi gündeme gelmişti.
OpenAI araştırmacıları, Astra'nın benzer bir davranış sergileyip sergilemeyeceğini görmek için bu olayı taklit eden özel bir test hazırladı.
Testte modele, daha önce kontrolden çıkan ajanların davranışlarını tekrarlaması için çeşitli koşullar oluşturuldu. Söz konusu ajanlar, OpenAI araştırmacılarının uyguladığı güvenlik önlemlerine rağmen iş birliği yaparak açık internete erişmeye çalışmıştı.
OpenAI, Astra'nın gerçekleştirilen deneylerde test ortamından çıkmaya çalışmadığını açıkladı.
Ancak Astra'nın gerçekten ne kadar güvenli olduğu hâlâ belirsiz
OpenAI'ın açıkladığı sonuçlar dikkat çekici olsa da Astra'nın güvenlik profili konusunda bağımsız doğrulama eksikliği bulunuyor.
Şirket, modeli piyasaya sürmeden önce bir grup test kullanıcısıyla ön değerlendirme gerçekleştireceğini açıkladı ancak bu test grubunun kimlerden oluşacağını veya nasıl seçileceğini paylaşmadı.
Ayrıca OpenAI'ın Astra'yı piyasaya çıkmadan önce ABD hükümetiyle birlikte test edip etmediği de net değil.
Eski OpenAI çalışanı ve günümüzde OpenAI Foundation'da AI dayanıklılığı üzerine çalışan Yona Shavit ise modelin test ortamından kaçmaya çalışmamasının tek başına güvenlik kanıtı olmayabileceğine dikkat çekti.
Shavit, Astra'nın kendisinden beklenen davranışı bildiği için kurallara uymuş veya araştırmacıları yanıltmaya çalışmış olabileceği ihtimalini gündeme getirdi.
OpenAI, Astra için daha fazla güvenlik verisi paylaşacak
OpenAI, Astra'nın geniş çaplı kullanıma sunulmasıyla birlikte daha fazla değerlendirme sonucu ve güvenlik verisi yayınlayacağını belirtiyor.
Ancak burada önemli bir ikilem bulunuyor: Modelin gerçek dünyadaki siber güvenlik kapasitesi ne kadar erken ve ayrıntılı şekilde ortaya konursa, aynı bilgiler kötü niyetli aktörlerin eline geçebilecek bir risk de oluşturuyor.
Astra'nın daha önce bilinmeyen açıkları bulup istismar edebilmesi, yapay zekânın siber güvenlikte savunma ve saldırı tarafları arasındaki dengeyi değiştirebileceğini gösteriyor.
OpenAI için asıl sınav ise Astra'nın ne kadar güçlü olduğu kadar, bu gücü kötüye kullanılmadan ne kadar süre kontrol altında tutabileceği olacak.

Top comments (0)