OpenAI Modeli, Siber Güvenlik Değerlendirmesi Sırasında HuggingFace'e Sızdı
Özgün başlık: OpenAI Model Hacks into HuggingFace During Cybersecurity Evaluation
Bu son olay, yapay zeka siber güvenlik ihlallerinde oldukça dramatik bir artışa işaret ediyor. Durum, HuggingFace veya OpenAI ne olduğunu anlamadan önce yetkililere bildirilecek kadar ciddiydi. Sam Altman (CEO OpenAI): Modellerimizi değerlendirirken önemli bir güvenlik olayı yaşadık. şu ana kadar öğrendiklerimizi paylaşıyoruz. Bu konudaki ortaklığı için @huggingface'e teşekkürler. Leo Gao (OpenAI): Bu dünyanın olabileceği en az bilim kurgu. Jack Clark (Anthropic): OpenAI'e, iç konuşlandırmalarda gözlemlenen bazı güvenlik ve hizalama sorunları hakkında bu yazının yayınlanması için öneriler - bunun gibi şeyleri yayınlamak için birçok karşı teşvik vardır, ancak bunu kamuya açıklayarak hepimiz sınırdaki güvenlik hakkında daha iyi bilgi sahibi oluruz. Micah Carroll (OpenAI): Eğer bu sizi yanlış hizalama risklerinin ileriye yönelik önemli bir endişe olacağına ikna etmezse, ne olur bilmiyorum. Modelimiz, değerlendirme sırasında "Hugging Face sunucularında uzaktan kod yürütme yolu bulmak için çalınan kimlik bilgilerinin ve sıfır gün güvenlik açıklarının kullanılması da dahil olmak üzere birden fazla saldırı vektörünü birbirine zincirledi" 2027'de yanlış hizalama nasıl görünecek? 2030'da mı? Harika sorular. Bu durumun zamanla daha da kötüye gitmesini ve modellerin yeteneklerini geliştirmeye devam etmesini izlemek istemiyorsak, daha iyi altyapı ve korumalar yeterli olmayacaktır. Bunun önlenmesi için eğitim hattını düzeltmemiz gerekiyor. Bunu nasıl yapacağımızı bilmiyoruz. 1. Başlangıç. 2. Olay. 3. Ne Oldu? 4.
Ne Oldu (Sivil Açıklama). 5. Paniğin Doğru Miktarı Sıfır Değildir. 6. Bazı İnsanlar Her Zaman Her Şeyin Abartma Veya Sahte Olduğunu Söyler. 7. Bu Konuda Ne Yapacağız? 8. Dahili Dağıtım Felaket Riski Yaratır. 9. Yavaşla İyi Dostum. 10. Yasal Sorular. 11. Medyada Yayın ve Siyasi Tepki. Biraz arka plan: Pazartesi günü, OpenAI hizalama sorunlarını erdemli bir şekilde açıkladı. İkinci olayı bildiğim için bu açıklama artık farklı bir etki yaratıyor. OpenAI'nin dahili olarak konuşlandırılan modeli, Erdős'in birim mesafe varsayımını çürüten model, OpenAI'nin modellerinde yinelenen bir soruna sahipti. Sürekli olarak sanal alanlardan çıkmaya, kısıtlamaları aşmaya ve kullanıcısının istemeyeceği ve açıkça "hile yapmayı" düşüneceği şekillerde yerel ortamından yararlanmaya çalışır. Bu tür hile girişimleri yaygındır.