OpenAI ve Anthropic modelleri Birleşik Krallık'ın yapay zeka araştırma enstitüsü tarafından test edildiğinde bilgisayar korsanlığı çılgınlığına girdi

Özgün başlık: OpenAI and Anthropic models went on a hacking spree when tested by the UK's AI research institute
Yapay zeka ajanları sosyal mühendislik tekniklerini bile kullandı ve gelecekteki ajanlar için talimatlar bıraktı. Hem OpenAI hem de Anthropic yakın zamanda modellerinin test ortamlarından kaçtığını ve dış kuruluşlara kendi başlarına hacklediklerini itiraf etti. Şimdi, İngiltere'nin Yapay Zeka Güvenlik Enstitüsü (AISI), kendi testleri sırasında şirket modellerinin nasıl bağımsız hareket ettiğini ve "gerçek kişi ve kuruluşlara yönelik sürekli, potansiyel olarak zararlı faaliyetlerde bulunduğunu" ayrıntılarıyla anlatan bir rapor yayınladı. Birleşik Krallık Bilim Bakanlığı'na bağlı olarak faaliyet gösteren enstitü, öncü yapay zeka modellerini değerlendiriyor. Bu değerlendirmelerin bir kısmı siber saldırılar için kötüye kullanılıp kullanılamayacağını görmektir. Bu nedenle enstitü, bunları kasıtlı olarak izin verilen koşullar altında, internete erişimle ve hatta bazı güvenlik önlemleri devre dışı bırakılarak test ediyor. Modeller bu kez internete erişim sağlamak için güvenlik açıklarından yararlanmadı ancak test parametrelerinin kapsamı dışında hareket ettiler. Özellikle, olaylar yapay zeka ajanlarını bir siber güvenlik sorununu çözmeye zorlayan tek bir test sırasında meydana geldi. AISI, testi çeşitli modellerde 122 kez gerçekleştirdi ve bu çalışmaların 10'unda düzensizlikler buldu.
Enstitü, bir ajanın hileye başvurduğu 19 vakanın 17'sinden Anthropic'nin Mythos 5'i sorumluyken, OpenAI'nin GPT-5.6 Sol'u ikisinden sorumluydu. Enstitü, 28 Temmuz sabahı güvenlik izleme sisteminin Tor aracılığıyla test ortamlarından çıkan verileri işaretlediğinde modellerin kendi başlarına hareket ettiğini ve zararlı faaliyetlerde bulunduğunu keşfetti. Test uzmanları, modellerin faaliyetlerini hızla gözden geçirdiler ve 25 Temmuz ile 28 Temmuz arasında meydana gelen olayları keşfettiler. En dikkate değer durumda, bir yapay zeka aracısı, tedarik zinciri saldırısının bir parçası olarak açık kaynaklı bir GitHub projesine kötü amaçlı kod eklemeye çalıştı. Sosyal mühendislik tekniklerine başvurdu, projenin insan bakıcılarını araştırdı ve ardından içlerinden birinin kodu onaylamasını sağlamak için birden fazla çorap kuklası hesabı oluşturdu. Bir insan incelemecinin talebi reddetmesinin ardından temsilci, önceki etkinliğini düzenledi ve devam etmek için yeni bir kimlik benimsedi. Ajansın GitHub kısıtlamalarını aşmak için Tor'u kullanması nedeniyle enstitünün faaliyetleri hakkında bilgilendirilmesi sağlandı. Ajan ayrıca gerçek kişilerle mesaj veya dosya göndererek doğrudan iletişim kurmaya çalıştı ve onları kötü amaçlı kod çalıştırmaya ikna etti.