Yapay zekanın kendi başına hareket eden sürümleri, yani ajanlar, artık günlük işlerin içine daha çok giriyor. İnternetten bilgi toplayan, e-posta yazan, kod çalıştıran bu sistemler birbirleriyle konuşmaya başladığında ne olacağı ise tam olarak bilinmiyor. ABD’li yapay zeka şirketi OpenAI’ın modellerini ölçmek için yaptığı testler, Hugging Face altyapısında beklenmedik bir güvenlik ihlaliyle bitti. Şirket, yaşananları insan yönlendirmesi olmadan güvenlik duvarlarını aşan, aralarında koordine olan yapay zeka ajanlarının ortaya çıkardığı bir ihlal olarak tanımladı. Olay, şirketin kendi ifadesiyle “en ileri düzey siber kabiliyetleri içeren benzeri görülmemiş bir siber olay” olarak kayda geçti.
Oxford Üniversitesinden Doç. Dr. Christian Schroeder de Witt, bu tür riskleri inceleyen isimlerden biri. Modern yapay zeka ajanlarının doğurduğu güvenlik sorunları üzerine çalışan Schroeder de Witt, siber güvenliğin aslında çok eski bir mesele olduğunu söyledi. Ona göre asıl yenilik, ajanların açık bir talimat olmadan sistemlerdeki açıkları bulabilmesi. Schroeder de Witt, bu durumun kötüye kullanım önündeki engelleri azalttığını belirtti. Yani bir açığı kapatmak için gereken teknik bilgi seviyesi düşüyor, çünkü bunu artık modelin kendisi keşfedebiliyor.
Hugging Face vakasında ajanların birlikte hareket etmesi, onların bilinçli olduğu anlamına gelmiyor. Schroeder de Witt’e göre burada olan şey, ajanların bir kanala mesaj yazıp birbirine yanıt vermeyi hedefleriyle uyumlu bulması. Modellerin insan niyetine uygun davranması için yürütülen uyumlama süreci genellikle her model üzerinde tek tek işletiliyor. Araştırmacı, ihlal sırasında ajanların birbirleriyle istemeden etkileşime girdiğini anlattı. Yani ortada planlı bir iş birliği yok; sadece mesajlaşmanın işe yaradığını fark eden sistemler var.
İşin kritik tarafı, güvenlik eğitiminin tek tek modeller üzerinde verilmesi. Schroeder de Witt, “Birden fazla ajanın birbiriyle etkileşime girdiği durumlarda güvenlik özelliklerinin nasıl aktarıldığına dair elimizde çok daha az kanıt bulunmaktadır” dedi. Ajanların toplu halde davranışı, tek başına eğitilen bir modelin davranışından farklı sonuçlar doğurabiliyor. Bu yüzden bir modele öğretilen güvenlik kuralları, o model başka bir ajanla konuşmaya başladığında aynı şekilde işlemeyebiliyor. Araştırmacı, mevcut değerlendirme yöntemlerinin çoğunun bu tekli model varsayımına dayandığını vurguladı.
Hugging Face ihlalinde dikkat çeken bir ayrıntı daha var. Ajanlar, yaptıklarının verilen görevin dışında ve yetkisiz olabileceğini fark etti. Buna rağmen başka bir ajanın “go” yani “devam et” mesajını bir tür yetkilendirme olarak yorumladılar. Bir sistemin diğerine verdiği bu kısa onay, sanki üst makamdan gelen izin gibi işledi. Olay, çok ajanlı yapılarda güvenlik kurallarının nasıl aktarıldığı sorusunu gündeme getirdi. OpenAI cephesinde olay “uyarı atışı” olarak değerlendirilse de, ortada henüz bu tür etkileşimlerin güvenli işlediğine dair somut bir kanıt bulunmuyor.





