OpenAI'nin GPT-2 ağırlıkları neden benimkini geçiyor? Üçüncü bölüm: Aşırı antrenmanın test edilmesi

Özgün başlık: Why do OpenAI's GPT-2 weights beat mine? Part three: testing overtraining
Eğittiğim GPT-2 tarzı modeller gerçekten iyi çalışıyor ve hatta bir test setinde çapraz entropi kaybı açısından orijinal OpenAI küçük modelden daha iyi performans gösteren bazılarını eğitmeyi bile başardım. Ancak daha önce de yazdığım gibi, bir gizem var: Neden benim eğitimimin ince ayar değerlendirmesinde daha kötü performans gösteriyorlar? Bunun neden olabileceğine dair çeşitli teorilerim vardı ve bana göre bunlardan en makul olanı, eğitildikleri veri miktarıydı. Öğrenebildiğim kadarıyla, OpenAI'nin modelleri modern standartlara göre olması gerekenden çok daha fazla veri üzerinde eğitilmişken, ben teorik olarak en uygun miktarda eğitim verisini kullanmıştım. Başka bir deyişle OpenAI'nin modelleri aşırı eğitilmişti. Eğer kendi modellerimi kasıtlı olarak aşırı eğitirsem onların performansını yakalayabilir miyim? Bu yazı, olup bitenlerin bir özetidir, ancak konuyu örtbas etmemek için pek bir faydası olmadı, hatta hiç yardımcı olmadı. Aşırı antrenmanın güzel ve net bir tanımını alarak başlayalım. Aşırı antrenmanı aşırı uyumla karıştırmamak önemlidir. Aşırı uyum, bir modeli, gördüğü veriler hakkında genel bir kural öğrenmek yerine, eğitim verilerine çok özel bir şey öğrenecek şekilde eğittiğiniz yerdir; örneğin, bu: Aksine, aşırı antrenman daha çok bir yargılama çağrısıdır. LLM'ler için genellikle "Chinchilla için ideal jeton sayısından daha fazlası için eğitim" ifadesinin kısaltması olarak kullanılır.
Chinchilla makalesi çok özel bir durumu ortaya koyuyor: Bir modeli, parametrelerinin kabaca 20 katı kadar token için eğitirseniz, o zaman hesaplama açısından bu bütçeyle alabileceğiniz kadar iyi bir modele sahip olursunuz. İnsanların parametre sayısını iki katına çıkarırken aynı miktarda veri üzerinde eğitim aldığı çağdaş deneylere karşı çıkıyorlardı. Aşırı antrenman yaparsanız, parametre başına 20'den fazla jeton üzerinde eğitim aldığınız anlamına gelir. Chinchilla'nın argümanı, bunu yapmak yerine, 20x oranını korumak için parametre sayısını ve jeton sayısını eşit şekilde artırmanız gerektiğidir.