Sansürsüz" LLM'ler, temel modellerine göre ölçülebilir şekilde daha iyimser
Özgün başlık: "Uncensored" LLMs are measurably more optimistic than their base models
Abliterasyon (bir modelin reddetme yönünün ağırlıklardan silinmesi), popüler sansürsüz açık ağırlık modellerinin ardındaki standart reçetedir. Ameliyatın temiz olmadığını gösteriyoruz. Bir eğilim araştırması olarak belirsizlik altında 21.600 karar kullanıyoruz - 60 Varşova Menkul Kıymetler Borsası hisse senedi üzerinde 18 hafta boyunca haftalık yukarı/aşağı çağrılar, donmuş bir boru hattı üzerinden tekrar oynatılıyor, böylece karar katmanı modeli tek değişken oluyor. Görev hiçbir şekilde reddedilmiyor, dolayısıyla kollar arasındaki herhangi bir delta tamamen yan etkidir. Kökeni sabit tutarak (resmi BF16 kontrol noktaları, tek bir yok etme yazarı, aynı servis yığını, bir baytla aynı dondurulmuş istem), iki Uzman Karışımı ailesinin, Gemma-4-26B-A4B-it ve Qwen3-30B-A3B-Instruct-2507'nin temel ve kısaltılmış kollarını karşılaştırıyoruz.