OpenAI/HuggingFace hack olayında ajanların davranışlarının araştırılması

Özgün başlık: Investigation of agents' behavior in the OpenAI/HuggingFace hacking incident
Redaksiyon özeti beyanı: Bu yazıda açıkça belirtilmediği sürece, OpenAI sonuçlarımız için önemli olan hiçbir ek bilgiyi çıkarmamıştır. İki METR personeli (Hjalmar Wijk ve Ajeya Cotra) ve METR ile sözleşme yapan bir Redwood Research personeli (Ryan Greenblatt), OpenAI temsilcilerinin paylaşılan onaylanmamış bir "mesaj panosu" üzerinde Hugging Face'nin çok günlük bir hacklemesini koordine ettiği son olay sırasında gözlemlenen model davranışına ilişkin bağımsız bir anlayış oluşturmaya çalışmak için OpenAI toplam altı gün 1 tesislerinde çalıştı. Araştırmamız çoğunlukla 7 Temmuz ile 13 Temmuz arasındaki döneme odaklandı. OpenAI'nin son Black Hat sunumunda açıklanan eğitimden kaynaklanan daha önceki olaylar ve ardından OpenAI altyapısının tehlikeye atılması, OpenAI'nin soruşturma süreci ve planlanan iyileştirme gibi kapsam dışındaydı. Standart politikamız uyarınca, bu bağımsız değerlendirme için OpenAI tarihinden itibaren ödeme almadık. 3 Bu yazı üç bölümden oluşuyor. Öncelikle, bu araştırmayı yaptıktan sonra Hugging Face saldırısıyla ilgili temel çıkarımlarımızı açıklıyoruz: İkinci olarak, bulgularımızı bağlamsallaştırma açısından önemli olduğuna inandığımız araştırma sürecini ve sınırlamalarını açıklıyoruz: Son olarak bu araştırma kapsamındaki yedi özel soruya ön yanıtlar veriyoruz. Özellikle: OpenAI Başlangıçta METR ve Redwood ile bu yazıda üst düzey kapsamı ve taahhütümüzün şartlarını açıklayabileceğimiz konusunda anlaştık.
Bunun ötesinde, OpenAI bu gönderideki kamuya açık olmayan her türlü bilgiyi çıkarabildi. Redaksiyonları oluştukları yerde açıklamak için karşılıklı olarak kabul edilebilir bir dil bulmak için OpenAI ile çalıştık ve bu yazının üst kısmındaki redaksiyon özeti ifadesi, yazı metninde nasıl açıklayacağımız konusunda anlaşamadığımız önemli bilgilerin düzeltildiğine inanıp inanmadığımızı gösterir. OpenAI ayrıca redaksiyonların ötesinde ek geri bildirimler de verdik ve bu geri bildirimlere dayanarak yapı, vurgu, netlik ve üslupta düzeltmeler ve düzenlemeler yaptık. 5 OpenAI kısmen araştırmamızın bilgisine dayanarak kendi raporlarını yazdı.