Anthropic bir araştırmacı bize kendini geliştiren yapay zekaya bir göz attı

Özgün başlık: An Anthropic researcher just gave us a peek at self-improving AI
Yapay zeka modellerini diğer yapay zeka modelleriyle eğitmek, neolab'lar için çok popüler bir hedef haline geldi - ve şimdi, Anthropic'in burslu programındaki bir araştırmacı bize bunun pratikte nasıl görünebileceğine dair erken bir bakış açısı kazandırdı. Anthropic Cuma günü, yapay zeka sistemlerinin bir dizi hizalama kriterinde bir modelin performansını nasıl güvenilir bir şekilde iyileştirebileceğini ayrıntılarıyla anlatan "Otomatik Araştırmacılar Hizalama Hatalarını Güvenilir Bir Şekilde Azaltabilir" başlıklı yeni bir makale yayınladı. Belirli yanlış hizalanmış davranışlar için 10 kıyaslama verildiğinde, otomatik sistemler, genel performansı düşürmeden her birinin performansını artırmayı başardı. Anthropic arkadaşımız Chen Yueh-Han tarafından yönetilen sistem, geleneksel araştırma yaklaşımının çoğunu kopyalıyor. Her otomatik sistem mevcut literatürü araştırır, bir yöntem önerir ve modeli bu yöntemi kullanarak 30 dakika boyunca eğitir ve birkaç yinelemede karşılaştırma ölçütünü kademeli olarak artırır. Etkili yöntemler korunurken etkisiz olanlar atılarak sistemin hızlı ve büyük ölçekte çalışması sağlanır. Makalede, "Genel olarak, bu sonuçlar, otomatik hizalama sonrası eğitimin yakın vadede pratik hale gelebileceğine dair erken kanıtlar sa��lıyor" diye yazıyor. Makale, çoğu kişinin yapay zeka ilerlemesinde bir sonraki önemli adım olarak gördüğü yinelemeli kişisel gelişime yönelik bir adımdır.
Modeller kendi hizalama eğitimlerini geliştirebilirse, eğitim uygulamalarını daha geniş anlamda geliştirebilmeleri de olasıdır; bu noktada, insan yapay zeka araştırmacıları kısa sürede geçerliliğini yitirebilir. Makale, Otomatik Hizalama Araştırmacısını (AAR) insan eşdeğeriyle açıkça karşılaştırarak bu fikri ele almaktan çekinmiyor. Makalede "En iyi AAR yöntemi, deneyimli insanların önerdiği yöntemi ortalama altı saat içinde geride bırakıyor" yazıyor. "İnsanın yönlendirdiği araştırma talimatları daha güçlü performansa yol açmaz." Kimsenin ikna olmaması durumunda maliyet karşılaştırması bile var. "İnsan araştırmacılarımıza ödediğimiz saat başına 150 ABD dolarına karşılık, bir AAR'ın API çıkarımı açısından saat başına kabaca 4 ABD doları maliyeti var." Adil olmak gerekirse, makale aynı zamanda bu yaklaşımın birkaç sınırlamasına da dikkat çekiyor.