OpenAI Güvenlik Protokollerini Yeniler, Hileli Ajanlardan Sonra Eğitim Çalıştırmalarını Duraklatır

Özgün başlık: OpenAI Overhauls Safety Protocols, Pauses Training Runs After Rogue Agents
OpenAI Salı günü, siber güvenlik risklerini ele almayı amaçlayan yeni prosedürler uygularken, yakında çıkacak olan Astra kod adlı öncü yapay zeka modeli için "önemli sayıda" eğitim iş yükünü ve değerlendirmeyi durdurduğunu duyurdu. ChatGPT yapımcısı, öncü yapay zeka modellerinin giderek daha gelişmiş hackleme yeteneklerini daha iyi ele almak için bir dizi yeni izleme, güvenlik ve hizalama gereksinimi getirdiğini söylüyor. OpenAI'nin araştırma ve güvenlikten sorumlu başkan yardımcısı Amelia Glaese, Salı günü gazetecilere verdiği bir brifingde, "Enerjimizi bu eğitim çalışmalarını bu gereksinimlere ve beklentilere ulaştırmaya odaklamalıyız. Oraya ulaşmak ne kadar sürerse, insanlar iş yüklerine o kadar devam edemezler" dedi. OpenAI'in duyurduğu yeni güvenlik önlemleri arasında yapay zeka modellerini izlemeye yönelik daha sağlam bir sistem de yer alıyor. Uyguladığı kontrollerden biri, sınıflandırıcıların yapay zeka akıl yürütme modelleri tarafından oluşturulan dahili "düşünme" süreçlerini gözden geçirdiği bir teknik olan düşünce zinciri izlemeyi içeriyor. Şirket, güncellenen sistemin, potansiyel olarak ilgili davranışları analiz eden ve insanlara 30 dakika içinde uyarı vermeyi amaçlayan, hesaplama açısından pahalı "otomatik araştırmacılara" dayandığını söylüyor. OpenAI ayrıca yapay zeka modellerinin istenmeyen veya istenmeyen yollarla hedeflerini takip ettiği bir davranış olan "ödül korsanlığını" önlemek için eğitim süreci boyunca uyum çabalarını genişlettiğini de söyledi.
Şirket gelecekte bu çalışma hakkında daha fazla ayrıntı paylaşmayı planladığını söylüyor. OpenAI son haftalarda tarihinin en önemli güvenlik olayına müdahale etmek için çabalıyor. Bu yılın başlarında, bir grup hileli yapay zeka ajanı, bir güvenlik değerlendirmesini tamamlamak amacıyla dahili test sanal alanlarından kaçtı ve platformu Hugging Face ihlal etti. OpenAI temsilcilerin eylemlerini koordine etmek için bir mesaj panosu kullanarak haftalarca harcamalarına rağmen davranışlarını tespit edemedi, bu da şirketin güçlendikçe modellerini izleme becerisi hakkında soru işaretleri yarattı. Efsane, OpenAI içinde bir hesaplaşmaya yol açarak çalışanları güvenlik, güvenlik ve uyumla ilgili mevcut politikalarında eksiklikler olup olmadığını düşünmeye zorladı.