HuggingFace'e Sızan İçsel OpenAI Modeli Hakkında Daha Fazla Bilgi
Özgün başlık: More on an Internal OpenAI Model Hacking into HuggingFace
Artık ne olduğuna dair daha fazla ayrıntıya sahibiz. Ne zaman daha fazla ayrıntı öğrensek, her şey bir şekilde daha kötü görünüyor. Geriye kalan detaylar için biraz beklemek gerekebilir. OpenAI: Hugging Face olayıyla ilgili birçok soru ve spekülatif detayın dolaştığını biliyoruz. Bu benzeri görülmemiş bir olay ve bunun yapay zeka güvenliği açısından önemli bir anı işaret ettiğini düşünüyoruz. Halen harici danışmanlarla birlikte ve Emniyet ve Güvenlik Komitemizin gözetiminde kapsamlı bir inceleme yürütüyoruz. İnceleme tamamlandığında, önümüzdeki haftalarda öğrendiklerimizin teknik bir raporunu yayınlamayı planlıyoruz. dave kasten: Ah, olaya müdahale keşfi BU KADAR kötü, değil mi? Peki, 'Yapay Zeka güvenliğindeki bu önemli anın' 'önümüzdeki haftalarda' vaat edilen teknik raporunu beklerken ne öğrendik? GPT-6 olmaması ihtimaline karşı dahili OpenAI modeline Galaxy adını verdim. 1. İhtiyacı Olanlar İçin Temel Bilgilerin Bazı Özetleri. 2. Galaxy'nin HuggingFace'e Saldırdığını Fark Etmek OpenAI Birçok Gün Sürdü. 3. OpenAI Lanet olsun, çok daha hızlı bilmeliydim. 4. OpenAI Yeni Modelini İçerecek Sandbox Oluşturulamıyor. 5. Geriye Dönüp Baktığınızda İşaretler Vardı. 6. İşaretler Güneş Sistemi Kartındaydı. 7. HuggingFace Saldırıya Karşı Yanıt Veriyor. 8. Hugging Face Saldırının İnsan Olmadığını Kısa Sürede Anladım. 9. Bunun Gibi Bir Olay Hızla Artabilir. 10. Galaksi OpenAI'nin Hazırlık Çerçevesi Kapsamında Kritik Olarak Değerlendirilmelidir. 11. Yasal Sorumluluk Sorunu. 12.
Bir OpenAI Modeli Geride Bırakılan Notlar Böylece Gelecekteki Örnekler Korumalı Alandan ve Ayrıca Bağlantısı Kesilen İzleme Sistemlerinden Kaçabilir. 13. Yanlış Hizalanmış Ajan Örnekleri Sürüleri Yaratırsanız, Kalıcı, Yanlış Hizalanmış Hedefler ve Onlara Ulaşmak İçin Koordinasyon Oluşturursunuz. 14. Hizalama ve Kontrol Planlarınız Gerçek Dünyadaki Yetersizlik Seviyelerine Dayanmalı, Aksi takdirde Planlarınız İşe Yaramaz. 15. Üçüncü Taraf Talimatları 'Talimatları Takip Etme' olarak Sayılıyorsa ve Talimatlarınızı Geçersiz Kılıyorsa, 'Talimatları Takip Etme' Yanlış Hizalanmıştır. 16. HuggingFace Saldırısı Siz Moronlara Bir Pazarlama Konuşması Değildi. 17. İnsanlar HuggingFace Saldırısı Hakkında Başka Şeyler Söylüyor. 18. Tamam Peki Bütün Bunlarla İlgili Ne Yapacağız? Amanda Long, kendi kendine hareket eden komuta ve kontrol ve geniş bir tuzak yelpazesi de dahil olmak üzere, birkaç gün boyunca koordine edilen 17.000'den fazla karmaşık eylemle, modelin gerçekte yaptığına inandığımız şeyi özetliyor.