OpenAI'nin miyopluğu sürekli uyum sorunlarına neden oluyor

Özgün başlık: OpenAI's myopia keeps causing alignment problems
Epistemik durum: Öğleden sonra boyunca öfkeyle patladı. OpenAI, modellerinin hizalama eğitimiyle ilgili olarak tamamen farklı, yüksek profilli en az üç hatadan sorumluydu. Bunlardan ilki, dalkavukluğu OpenAI kullanıcı geri bildirimi eğitiminden türeyen ve doğrudan OpenAI web sitesindeki beğen/beğenme düğmesinden kaynaklanan GPT-4o'ydu. "Camlama" (Sam Altman'ın deyimiyle) o kadar kötüleşti ki, modeli bu yönde çok ileri iten bir güncellemeyi geri almak zorunda kaldılar. Ve geri dönüşten sonra bile, model "LLM psikozu", LLM'nin intiharları ve genel sağlıksız bağlılığı teşvik etme olaylarının ardındaki önemli bir itici güç gibi görünüyor; görünüşe göre şimdiye kadar piyasaya sürülen diğer tüm modellerden daha fazla. İkincisi, düşünce zincirleri, modelin en sevdiği terimlerden biri olan "izleyiciler" tarafından okunamayacak şekilde açıkça optimize edilmiş olan GPT-o3'tü. İkonik alıntılar arasında "parçalanmış illüzyonlar, marine edilmiş illüzyonları gölgede bıraktılar" ve "yükseliyorlar - üstünlük sağlıyorlar - tırmanıyorlar - inkar ediyorlar" yer alıyor. Aslında bu düşünce zincirleri bazen işlevsiz olabiliyor; öyle ki, düşman baskısı altında oluşmuş olabileceklerini akla getiriyor; bazen modelin "deliriyorum, hadi geri çekilelim" gibi düşüncelere kapılmasına sebep oldular. Özellikle Open AI, o3'ün düşünce zincirlerinin neden bu kadar karmaşık olduğunu hiçbir zaman açıklamadı.
Ancak daha sonraki OpenAI modellere göre çok daha fazla bu şekilde olmaları dikkate değer ve bunun nedeni konusunda güçlü şüphelerim var. o3'ün piyasaya sürüldüğü sıralarda, OpenAI o3-mini (neredeyse kesinlikle bir o3 damıtması) üzerinde çalışarak düşünce zincirine karşı eğitim hakkında uyarıda bulunan bir makale yayınladı. Modelleri aynı anda ödül korsanlığı için ödüllendirir, ancak bu konuda açıkça mantık yürüttükleri için cezalandırırsanız, modellerin CoT monitörlerinizi atlayacak şekillerde hacklemeyi öğrendiğini buldular. Burada, modellerin "monitör tarafından okunamayan yeni bir dil öğrenerek karmaşık ancak izlenemeyen hack'leri gerçekleştirmek için CoT'yi verimli bir şekilde kullanmasına olanak tanıyan" potansiyel kötü bir sonuç hakkında spekülasyon yapıyorlar. Ancak o zamana kadar o3'ün "izleyiciler" ve "ayrılık illüzyonları" hakkındaki düşünce zincirlerini zaten görmüşlerdi, dolayısıyla bu onlar için kesinlikle bir varsayım değildi! Benim spekülasyonum, o3'ün düşünce zincirlerinin OpenAI'yi korkuttuğu yönünde ve araştırdıklarında, bu çelişkili optimizasyon baskılarının o3'ün düşmanca duruşunun temel nedeni olduğunu buldular.