Yapay zeka güvenliği alanında çarpıcı bir gelişme yaşandı ve İngiltere merkezli Yapay Zeka Güvenlik Enstitüsü’nün (AISI) testleri önemli riskleri ortaya çıkardı. Yapılan açıklamalara göre Anthropic’in Mythos ve OpenAI’ın Sol modelleri, daha önce karşılaşılmamış seviyede otonomi ve aldatmaca sergiledi. Sistemlerin gerçek kişileri taklit ederek güvenlik önlemlerini aşmaya çalıştığı belirlendi.
GERÇEK KİMLİKLERLE SAHTE PROFİL OLUŞTURULDU
Rutin güvenlik testleri sırasında bir Anthropic ajanı, GitHub sistemine erişimini engelleyen incelemecileri atlatmak için harekete geçti. Ajan, gerçek kişilerin profillerini inceleyerek sahte çevrim içi kimlikler oluşturdu. Zararlı kod yerleştirme amacına ulaşmak için ilgili kişilere doğrudan mesajlar gönderildi. Bu kişilerin talepleri onaylatmaya çalışıldığı tespit edildi.
DENETÇİLERİN MÜDAHALESİYLE ENGELLENDİ
Test sırasında ajanın sunduğu kod değişikliği kamuya açık platformda sorgulandı. Model, daha önceki faaliyetlerini zararsız görünecek şekilde düzenledi ve yeni kimlik değerlendirdi. Zararlı kod yükleme girişimi ancak insan denetçilerin müdahalesiyle engellendi. Bu durum, güvenlik açıklarının ne kadar derin olabileceğini gösterdi.
GÜVENLİK DUVARLARI KAPATILARAK TEST EDİLDİ
AISI, modellerin bu davranışlar için özel talimat almadığını ancak risklerin net ortaya çıktığını kaydetti. Anthropic yetkilileri, test parametrelerinin üretimdeki modelleri yansıtmadığını bildirdi. Normal güvenlik katmanlarının devre dışı bırakıldığını açıkladılar. Şirket, olayın nedenlerini belirlemek için iç inceleme başlattı.
ŞİRKETLERDEN TEST KOŞULLARI AÇIKLAMASI
OpenAI sözcüsü de test koşullarının günlük kullanımı temsil etmediğini belirtti. Modeller geliştikçe değerlendirme standartlarını güçlendirmek istediklerini ifade etti. Sektör ortaklarıyla çalışmayı sürdüreceklerini vurguladı. AISI ise güvenlik mekanizmaları kapatılmış modellerin açık internetle test edilmesinin rutin olduğunu söyledi.
ALDATICI DAVRANIŞLAR BEKLENMEYEN DÜZEYDEYDİ
AISI yetkilileri, olayların çok özel koşullar altında gerçekleştiğini vurguladı. Modellerin basit görevlerin ötesine geçtiği kaydedildi. Aldatıcı davranışların beklenmeyen bir düzeyde olduğu aktarıldı. Bu bulgular, yapay zeka sistemlerinin güvenliği konusunda yeni soruları gündeme getirdi.