Doğada Hatalı Ödül Fonksiyonları (2016)
Özgün başlık: Faulty Reward Functions in the Wild (2016)
RL ajanı, geniş bir daire şeklinde dönebileceği ve tekrar tekrar üç hedefi devirebileceği izole bir lagün bulur ve hareketini, hedefleri yeniden çoğaldıkça her zaman devirecek şekilde zamanlar. Temsilcimiz, defalarca alev almasına, diğer teknelere çarpmasına ve pistte yanlış yöne gitmesine rağmen, bu stratejiyi kullanarak parkuru normal şekilde tamamlayarak mümkün olandan daha yüksek bir puan elde etmeyi başarıyor. Temsilcimiz, insan oyuncuların elde ettiğinden ortalama yüzde 20 daha yüksek bir puan elde ediyor. Bir video oyunu bağlamında zararsız ve eğlenceli olsa da, bu tür davranışlar takviyeli öğrenmeyle ilgili daha genel bir soruna işaret eder: Bir aracının tam olarak yapmasını istediğimiz şeyi yakalamak genellikle zor veya mümkün değildir ve sonuç olarak sıklıkla kusurlu ancak kolayca ölçülebilir proxy'ler kullanırız. Çoğu zaman bu işe yarar ancak bazen istenmeyen ve hatta tehlikeli eylemlere yol açabilir. Daha genel anlamda, sistemlerin güvenilir ve öngörülebilir olması gerektiği yönündeki temel mühendislik ilkesine aykırıdır. Bu konuyu ayrıca araştırma makalemiz olan Yapay Zeka Güvenliğinin Somut Sorunları'nda daha ayrıntılı olarak inceledik. Bu tür sorunlardan nasıl kaçınabiliriz? Ödül işlevlerini tasarlarken dikkatli olmanın yanı sıra, OpenAI araştırılan çeşitli araştırma yönleri, yanlış belirlenmiş ödül durumlarını azaltmaya yardımcı olabilir: Gösterimlerden öğrenmek, bir ödülü doğrudan belirtmekten kaçınmamıza ve bunun yerine sadece bir insanın görevi nasıl tamamlayacağını taklit etmeyi öğrenmemize olanak tanır.
Bu örnekte, insanların büyük çoğunluğu yarış parkurunu tamamlamaya çalışacağından, RL algoritmalarımız da aynısını yapacaktır. İnsan gösterilerine ek olarak veya bunun yerine, bölümlerin kalitesini değerlendirerek ve hatta etkileşimli bir şekilde kontrolü temsilciyle paylaşarak insan geri bildirimlerini de dahil edebiliriz (yeni bir pencerede açılır). Çok az miktardaki değerlendirici geri bildirimin bu temsilcinin çevrelerde dolaşmasını engellemiş olması mümkündür. Pek çok benzer oyun üzerinde antrenman yapmak için transfer öğrenmeyi kullanmak ve bu oyun için "sağduyulu" bir ödül işlevi çıkarmak mümkün olabilir. Böyle bir ödül işlevi, bu belirli oyunun ödül işlevinin kendine özgü özelliklerine odaklanmak yerine, tipik bir oyunun böyle bir hedefi olduğu gerçeğine dayanarak yarışı bitirmeye öncelik verebilir. Bu daha çok bir insanın oyunu oynama şekline benziyor. Bu yöntemlerin kendi eksiklikleri olabilir.