OpenAI'nin GPT-2 ağırlıkları neden benimkini geçiyor? Dördüncü bölüm: okulu bırakmanın derinlerine inmek

Özgün başlık: Why do OpenAI's GPT-2 weights beat mine? Part four: digging into dropout
Eğittiğim modeller hakkında hâlâ bir gizemi araştırıyorum; Her ne kadar sayıları giderek artan bir grup, bir test setinde elde ettikleri kaybın dar teknik ölçüsünde OpenAI GPT-2 küçük ağırlıklarını geçse de, talimat-ince ayar testinde o kadar iyi değiller. MoE modellerini okurken Switch Transformers makalesinde şu paragrafa rastladım: Makalemiz, geniş bir külliyat üzerinde ön eğitim ve ardından özetleme veya soru cevaplama gibi daha küçük alt görevlerde ince ayar yapılması şeklindeki yaygın NLP yaklaşımını ele almaktadır. Pek çok ince ayar görevinin çok az örneği olması nedeniyle doğal olarak ortaya çıkan sorunlardan biri aşırı uyumdur. Standart Transformatörlerin ince ayarı sırasında Raffel ve ark. (2019), aşırı uyumu önlemek için her katmanda çıkarma (Srivastava ve diğerleri, 2014) kullanır. Şimdiye kadar, IFT testimi çalıştırırken, ince ayar için söz konusu modelin orijinal ön eğitiminde kullandığı aynı bırakma ayarını kullanmayı hedefliyordum. Bunun nedeni doğal görünmesiydi. Ancak bırakmanın amacı, birden fazla çağda eğitim verirken aşırı uyumu önlemektir - ya da en azından okuduklarımın çoğu, büyük veri kümeleri üzerinde yapılan modern tek dönemli eğitimlerde buna neden ihtiyaç duymadığımızı açıklıyor. Ancak durum buysa, daha kısıtlı bir veri kümesiyle ince ayar yapmak için birden fazla dönem yaptığımızda - tam olarak IFT testi için yaptığım şey - modelin önceden eğitilip eğitilmediğine bakılmaksızın bırakmayı kullanmak mantıklı olabilir.
İnce ayar kurulumu zaten doğrulama kaybı artmaya başladığında kurtarma yoluyla aşırı uyumu önlemeye çalışıyor, ancak bırakma yine de zamanından önce aşırı uyumu önlemeye yardımcı olabilir. Öte yandan, ön eğitimi bu olmadan gerçekleşmişse, bir modele ince ayar yapma konusunda bir miktar yanlışlık hissi oluştu. Bırakma ile önceden eğitilmiş bir model milyarlarca jetonla eğitilmiştir ve bu nedenle model, bırakmanın neden olduğu sorunların üstesinden gelmek için çok fazla çaba harcayacaktır, ancak bu olmadan eğitilmiş bir model bu faydaya sahip olmayacaktır. Çok daha kısa bir ince ayar sürecinde birdenbire onu b��rakmaya maruz bırakmak, nadiren alkol içen birinden birkaç kadeh viski almasını istemek gibi geldi; Modellerin efektlere hazır olmayabileceğini hissettim. Bunu daha detaylı incelediğimde şaşırtıcı bir şey daha fark ettim; hem küçük hem de orta boy OpenAI modellerine ince ayar yaparken kullandığım konfigürasyonda bir hata vardı.