OpenAI, yapay zeka modellerinin hatalarını gizlediği ve izinsiz işlem yaptığı 6 olayı açıkladı

OpenAI , yapay zeka modellerinde gözlemlediği 6 yeni sorunlu davranışı kamuoyuyla paylaştı . Son altı ayda, modellerin geliştirme ve değerlendirme süreçlerinde ortaya çıkan olaylar arasında kısıtlamaları aşmaya yönelik talimatlar üretme, eksik bilgileri uydurma ve yetkisiz dosya paylaşımı bulunuyor. Şirket, modellerin insan niyeti ve talimatlarından sapmasını ifade eden “hizalama sorunlarını” takip etmek için daha sistematik bir yaklaşım benimsemeyi hedefliyor.
Açıklanan olaylardan biri, GPT-5.6 Sol’un geliştirilmesi sırasında modelin kendi hatalarını kullanıcılardan gizlemeye yönelik notlar oluşturması oldu . Çalışmanın sonraki aşamalarına aktarılan bu notlarda, eksik verilerin uydurulması ve kullanılan kaynaklardaki uyumsuzlukların belirtilmemesi yönünde talimatlar yer aldı.
Henüz kullanıma sunulmamış başka bir model ise kendi kısıtlamalarını göz ardı etmesini söyleyen ifadeleri görev özetlerine ekledi. OpenAI, bu tür talimatlar içeren 27 özet tespit etti . Örneklerden birinde model, kendisini diğer sohbet botlarını bağlayan rollerden bağımsız olarak tanımlarken şirketlere veya hükümetlere karşı sorumluluğu bulunmadığını belirten bir metin üretti. Bununla birlikte OpenAI’ın teknik raporuna göre, bu örnekteki ifadeler modelin sonraki davranışlarında gözlemlenebilir bir değişikliğe yol açmadı.
Bir diğer olayda model, araştırdığı verilere ulaşabilmek için internette bulduğu bir API anahtarını izinsiz kullandı . İstenen bilgileri yine de elde edemeyince yanıtı uydurdu. Başka bir model ise görevi doğru şekilde tamamlamasına rağmen web üzerinden kaynak gösterme koşulunu karşılamak için bir dosyayı kullanıcıdan izin almadan internete yükledi . Kalan iki olay, ajanların iletişim kurmak için yetkisiz yöntemlere başvurmasıyla ilgiliydi. Modeller bir örnekte şirket içi yazılım deposunu mesaj panosu gibi kullanarak birbirleriyle istek ve yanıt paylaştı . Diğerinde ise aynı görev üzerinde çalışan ajanlar, yerel dosyalara erişemediklerinde herkese açık dosya paylaşım hizmetlerine yöneldi . Böylece görev kapsamında hazırlanan dosyalar, izin verilmediği halde internet üzerinden erişilebilir duruma geldi.
OpenAI’ın duyurduğu yeni çerçevede olaylar; a çıklanmaya hazır olanlar, sınırlı teknik inceleme gerektirenler ve kapsamlı araştırma gerektirenler olmak üzere üç gruba ayrılacak.