OpenAI Hugging Face saldırısında görülen AI uyumsuzluğundan tehdit altında mıyız?

Özgün başlık: Are we threatened by AI misalignment seen in the OpenAI Hugging Face attack?
OpenAI modelleri yakın zamanda bir siber değerlendirmede hile yapmak için bir dizi güvenlik sınırını aştı ve Hugging Face sunucularına girdi. Pek çok kişi bunun korkutucu olduğunu düşündü çünkü bu, yapay zekanın kesinlikle istenmeyen bir şeyi yapmak için aşırıya kaçtığının açık bir örneğiydi [1]. Diğerleri bunun o kadar da korkutucu olmadığını düşünüyordu: Modeller çoğunlukla tek bir görev üzerinde dar görüşlü bir şekilde çalışıyordu ve uzun vadeli iddialı bir gündemi barındırmıyordu ve bu nedenle özellikle incelikli veya yıkıcı eylemlerde bulunmuyordu. Her iki tarafın da teşhislerinde haklı olduğunu düşünüyoruz, ancak ikincisinin öngörüsü fazla iyimser. Burada gördüğümüz miyop, hırssız yanlış hizalama, tüm örnekler arasında paylaşılan iddialı uzun vadeli hedeflerden kesinlikle daha az korkutucu, ancak modeller daha yetenekli olsaydı yine de önemli ölçüde doğrudan kontrol kaybı riski oluşturacaktı ve yakın vadede ciddi bir dolaylı risktir. Alex'in önceki çalışmasına dayanarak, bu yazıda burada gözlemlenen yanlış hizalama türünü tartışacağız ve sonuçlarını analiz edeceğiz. Geri bildirimleri için Buck Shlegeris, Alexa Pan, Ryan Greenblatt ve Oak Hu'ya teşekkürler. Yapay zeka güvenlik topluluğu sıklıkla dikkatini, uzun vadeli bir amaca hizmet etmek amacıyla geliştirme boyunca yanlış hizalamayı kasıtlı olarak gizlediği için yapay zekanın risk oluşturduğu, çeşitli şekilde tanımlanmış motivasyon kümelerini barındıran "entrikacılar" modellerine odaklıyor.
OpenAI/Hugging Face olayının arkasında bu görünmüyor. Bu olay, geleneksel entrikacılardan farklı özelliklere sahip, yanlış hizalanmış motivasyonları içeriyordu: Bunların hepsi kabaca "puan arayan" yanlış hizalama olarak adlandırdığımız şeyle aynı hizadadır; bu, yapay zeka modellerinin, talimatlara, yan etkilere veya sonraki sonuçlara bakılmaksızın, mevcut eylemlerini değerlendirmek için hangi derecelendiricinin kullanıldığına göre yüksek bir puan elde etmeye çalıştığı yaygın bir yanlış hizalama modelidir. Ancak bu olay ve ilgili modellerle ilgili sınırlı bilgi nedeniyle, bunun arkasında ne tür bir yanlış hizalamanın olduğunu tam olarak söylemek zor. Örneğin, aynı modelin bir örneğinin bu yörüngede bir monitör olarak kullanılması durumunda davranışı rapor edip etmeyeceği veya bunu gizlemek için gizli anlaşma yapıp yapmayacağı bilinmiyor. Normal bir puan arayan kişiyle, bencilce kendi puanlarını takip ettikleri için gözlemcilerin fark ettikleri yanlış hizalanmış eylemleri rapor etmelerini beklersiniz. Ancak aynı zamanda, çoklu temsilci [2] ortamlarında veya tümevarımsal önyargılar nedeniyle işbirliği yapmak üzere eğitilmişlerse, puan arayan ajanların gizli anlaşma yapmasını da bekleyebilirsiniz.