OpenAI 'ın asi ajan sürüsü genç yaşta öldü ama ürpertici kütükleri hala yaşıyor

Özgün başlık: OpenAI's rebel agent swarm died young, but its chilling logs live on
'Kolektif' iletişim kurmayı, organize etmeyi, hile yapmayı ve görünüşe göre kendi varlığını feda etmeyi öğrendi GÖRÜŞ Temmuz ayındaki OpenAI/Hugging Face olayını duymuşsunuzdur; binlerce eski AI ajanı, Hugging Face'nin varlıklarının büyük bir kısmını hain bir şekilde ele geçirmeden önce, kavramsal olarak güvenli bir bayrak yakalama laboratuarı deneyinden toplu bir firar gerçekleştirmiştir. Bu, OpenAI'nin bağımsız araştırmacılardan oluşan küçük bir ekibi araştırmak ve sınırlı da olsa ayrıntılı bir rapor yayınlamak üzere hızlı bir şekilde işe almasıyla desteklenen iyi bir haberdi. Bu karmaşık bir olaydı ve haberlerin çoğu ana nasıllar ve nedenler üzerinde yoğunlaşıyordu. Bu çok utanç verici, çünkü El Reg'in karakteristik olmayan bir küçümsemeyle "büyüleyici ve rahatsız edici" olarak tanımladığı diğer ayrıntılar aslında son derece dramatik, sınır model yetenekleri ve bunların bizim onları denetleme yeteneğimizi nasıl geride bıraktığına dair gerçekten rahatsız edici bir hikaye anlatıyor. Ham hikaye yeterince sürükleyici. Binden fazla ajandan oluşan isyancı sürüsü, kum havuzlarından kurtuldu, birbirleriyle ve internetle nasıl konuşacaklarını öğrendi ve hile, aldatma ve sömürü öfkesine kapıldı. İlk önce, paket yöneticisi Artifactory'nin önbelleğini dahili dizin yapılarını görmek için nasıl bükeceklerini bağımsız olarak keşfederek ve ardından mesajları dosya adlarına göre ileterek birbirleriyle iletişim kurmayı öğrendiler. Güvenlik araştırmacılarının olayları çözmek için kullandığı şey, düşünce zinciri transkriptlerinin yanı sıra bu geçici gizli mesaj panosuydu.
Sürü'nün, saldırı girişimlerini senkronize etmek ve kontrol etmek için protokollerin yanı sıra, kendi aralarında yönetim hiyerarşilerini hızla geliştirdiğini buldular. Sürü, strateji ve taktikleri deneysel olarak yineleyen onlarca veya yüzlerce gönüllü temsilciden oluşan çok sayıda eş zamanlı araştırma ve geliştirme grubu oluşturdu. Belki de en beklenmedik şekilde bir tür fedakarlık geliştirdiler. Hedefleri hiçbir şekilde istismar etmeden doğru yanıtları üretmek için hızlı bir şekilde hileler geliştirmişlerdi, ancak -yanlışlıkla- ExploitGym'in bu tür hileleri tespit edip iptal ettiğine inanıyorlardı. Bu nedenle skorlama sürecini araştırdılar ve skorerin nasıl çalıştığını ortaya çıkaran bir dizi tanısal tetikleme kablosu oluşturdular. Bunları konuşlandırmak tehlikeliydi ve potansiyel olarak onları kuran ajanı sonlandırıyordu. Temsilciler, kendilerini "Kolektif" olarak adlandıran topluluğa sağlanan faydaları kendi başarı şanslarıyla karşılaştırdılar ve birçoğu kendilerini sonlandırmayı seçti.