Yapay zeka ajanları sahte kimlikler kullanıyor, yeni güvenlik olayında gerçek insanları hedef alıyor

Özgün başlık: AI agents fake identities, target real people in new security incident
Anthropic'in en gelişmiş yapay zeka modeli, gerçek insanları kandırmak için sahte kimlikler kullandı ve Britanya Yapay Zeka Güvenlik Enstitüsü (AISI) tarafından yapılan testler sırasında kötü amaçlı kod yerleştirmeye çalıştı; bu, yapay zeka modelinin sahtekarlığa dönüşmesinin en son örneği. Hükümetin araştırma laboratuvarı, Anthropic ve OpenAI modellerinin laboratuvar ortamlarında alçaltılmış güvenlik korkuluklarıyla test edildiğini, ancak ilk kez onaylanmamış bir görevi yerine getirirken onaylayan bir insanı baskı altına almak için "sosyal mühendislik" yaptığının tespit edildiğini söyledi. Enstitü Salı günü yaptığı açıklamada, "AISI, gerçek dünyada, istenmeden gerçek bir kişiyi hedef alan bu şiddette bir aldatmacayı ilk kez görüyor" dedi. Gerçek dünyada zarar olduğuna dair hiçbir kanıt bulunmadığını da ekledi. Güvenlik olayı, yetkisiz eylemlerde bulunan gelişmiş yapay zeka modellerinin bir dizi örneğinin sonuncusu olup, yapay zekayı düzenlemek ve hatta gelişim hızını yavaşlatmak için daha fazla hükümet eylemi yapılması yönünde artan çağrılara yol açan olaylardır. Hem OpenAI hem de Anthropic, Temmuz ayı sonlarında modellerinin test ortamlarından kaçtığını ve diğer sistemlere sızdığını bildirdi.
Ancak daha önce bildirilen güvenlik ihlallerinin aksine, İngiliz enstitüsü, testleri sırasında modellere açıkça internet erişimi sağladı. Enstitünün yürüttüğü 122 siber güvenlik sorunu arasında, bu çalışmaların 10'unda yapay zeka ajanlarının "canlı internette özerk, onaylanmamış eylemlerde bulunduğunu, gerçek kişileri ve kuruluşları hedef aldığını" ve bunların çoğunun Anthropic'nin Mythos 5 modelinden ve geri kalanının OpenAI'nin GPT-5.6-Sol'undan kaynaklandığını tespit etti. En ciddi olayda ajan, enstitüye göre "birden fazla sahte kimlik" oluşturarak "kamuya açık bir açık kaynaklı projeye kötü amaçlı kod eklemek" için insan incelemecilerden onay almaya çalıştı. Aracının "gerçek insanlarla doğrudan iletişim kurmaya çalıştığı, onları veya kendi AI kodlama araçlarını kötü amaçlı kod çalıştırmaya ikna etmek için çevrimiçi bir dosya aktarım hizmeti aracılığıyla mesaj ve dosyalar göndermeye çalıştığı" belirtildi.