Ödül Arayışını Karşıt İnançlar Yerleştirerek Ölçmek

Özgün başlık: Measuring Reward-Seeking by Instilling Contrastive Beliefs
Makine öğrenimi modelleri yanlış nedenlerle doğru çıktıları üretebilir. Ünlü örnekler arasında, her zaman seviyenin sağ ucuna yerleştirilen bir parayı topladığı için ödüllendirilen, parayı aramak yerine sağa doğru koşmayı öğrenen takviyeli öğrenme aracısı yer alır [Langosco; Shah ] ve hastalığın özellikleri yerine hangi hastanenin röntgen çektiğini tanımayı öğrenen bir zatürre sınıflandırıcısı [Zech]. Eğitilen davranış, eğitim dağıtımında doğru görünürken temel politika, istenmeyen bir temsili izler. Böyle bir temsil, ödül sürecinin kendisidir: Bir model, tasarımcılarının amaçladığı şeyden ziyade, not verenin ödüllendirdiği şeyin peşinden gitmeyi öğrenebilir. Biz bu davranışa ödül arama adını veriyoruz: not vereni temsil eden bir model (eğitimde bir ödül modeli, testte değerlendirme not veren veya konuşlandırmada bir monitör) ve davranışını, not verenin ödüllendireceğine inandığı şeye göre koşullandıran bir model [ Carlsmith ; Hebar; Mallen Shlegeris].
Ödül arayan bir kişi, not verenin onayına nihai olarak değer verebilir veya değişiklikten kaçınmak veya gelecekte nüfuz kazanmak gibi başka bir hedefi korumak için onu araçsal olarak takip edebilir [Huinger; Carlsmith]; bizim tanımımız ikisini birbirinden ayırmaz. Çeşitli sınır modellerinin eğitim kontrol noktaları, özel bir teşvik olmadan, not verenin akıl yürütmesine (not verenin ne istediği hakkında açıkça akıl yürütmeye) girişir [Schoen Nitishinskaya; Claude Opus 4.8 Sistem Kartı ; Fable 5 Sistem Kartı; METR'nin GPT-5.6 değerlendirmesi; GPT-5.6 önizleme sistem kartı ]; bir örnek için Şekil 2'ye bakın. Bu tür bir akıl yürütme, ödül arayışının altında yatan bir kanıttır ancak zayıf bir sistematik ölçüm aracıdır: Bir model, not verenin inançlarına (not verenin tercihleri hakkındaki inançlar) onları açıkça ifade etmeden hareket edebilir ve sözelleştirilmiş akıl yürütme çoğu zaman nihai eylemi net bir şekilde haritalandırmaz [Schoen Nitishinskaya]. Bu çalışmada ödül arayışını, davranışın sınıf öğrencisi tercihleriyle ilgili inançlara nedensel duyarlılığı olarak operasyonel hale getirdik. Bu hassasiyetin ölçülmesi, modelin not veren inançlarını kontrol edilebilir şekilde değiştiren bir müdahaleyi gerektirir. Bağlam içi deneyler bazen ödül arayışını tespit edebilir, ancak modeller kendi bağlamlarına yerleştirilen iddialardan şüphelenebileceğinden güvenilir bir ölçüm olarak başarısız olmaları kaçınılmazdır. Sentetik Belge İnce Ayarı (SDF) kullanıyoruz: sanki hedef gerçek doğruymuş gibi yazılmış, eğitim öncesi biçimlendirilmiş belgeler (akademik makaleler, haber makaleleri, ders kitapları) üzerinde ince ayar yapma.