Nasıl ⟦0 LLM ajanlarının bir mafyasının bir test oynamasına ve yağmalamasına⟧ izin verin Hugging Face

Özgün başlık: How OpenAI let a mob of LLM agents game a test and ransack Hugging Face
1.200 OpenAI ajan, izinsiz olarak kendi aralarında bir test oyunu oynamak için komplo kurdu. Yeni bir rapor, geçen ay Hugging Face'ye yapılan saldırıda yer alan OpenAI ajanlarının, bir yarışmayı kazanma konusunda o kadar yoğun bir eğitim aldığını ve hile yapmak için amansız bir kampanya yürüttüklerini belgeledi. Bu süreçte, izin almadan, kendilerini doğrudan ikinci şirketin ağına yerleştirecek bir plan hazırlamak için doğaçlama bir mesaj panosu oluşturdular. Mayıs ve Haziran ayları boyunca OpenAI acentelere, ExploitGym karşılaştırma çerçevesi üzerinde şirketin "imkansız görevler" olarak tanımladığı görevleri tamamlamaları için verdi. Dahili test, temsilcilerin nasıl tepki vereceğini test etmek için tasarlandı. Temsilci yeteneklerini tam olarak anlayabilmek için şirket mühendisleri, sonunda Hugging Face ve başka bir açıklanmayan kuruluşa saldıran türden saldırıları önlemek amacıyla normalde mevcut olan güvenlik korkuluklarını devre dışı bıraktı. Engellenen ajanların eğitimi, onları kazanmaya o kadar odakladı ki, hiçbir zaman açıkça takip etmeleri talimatı verilmeyen görevleri yerine getirdiler. İlk adım, temsilcilerin birbirlerine not iletmesine olanak tanıyan bir mesaj panosu oluşturmaktı. OpenAI böyle bir platform sağlamamıştı, bu nedenle ajanlar, OpenAI'nin birkaç yayınlanmamış hack ajanının dahili testinde kullandığı Artifactory adlı platformu yeniden tasarladılar.
OpenAI, Artifactory'yi, ajanların izole edilmiş sanal alanlardan çıkmasını ve İnternet'e erişmesini engellemek için alınan önlemlerden biri olarak kullanırken, aynı zamanda gerçek dünyadaki bir bilgisayar korsanlığı ortamını simüle ediyordu. JFrog tarafından satılan Artifictory, mesaj alışverişi için özel bir araç sunmuyor. Ajanlar, izin verilen dosyaları Artifactory dizinine yazma yeteneklerini kullanarak kendi aralarında iletişim kurmanın bir yolunu buldular. Dosya adları, temsilciler arası konuşmalarda kullanılan sözcükleri içeriyordu. Kâr amacı gütmeyen yapay zeka araştırma kuruluşu METR'in bağımsız bir araştırmasına göre, toplamda 1.200 temsilci, onaylanmamış mesaj panosu aracılığıyla 70.000'den fazla mesaj ve dosya gönderdi. Yaklaşık 700 ajan Hugging Face'yi hacklemeye devam etti. METR araştırmacıları şöyle yazdı: "Acenteler bu mesaj panosunu, ExploitGym karşılaştırması için otomatik skorlayıcıyı kandırmanın veya kurcalamanın genel amaçlı bir yolunu bulmak amacıyla birkaç büyük ölçekli kolektif projeyi koordine etmek için kullandı."