← Tüm AI haberleri

Şirketler

OpenAI'nin GPT-2 ağırlıkları neden benimkileri geçiyor?

gilesthomas.com · 29.07.2026 · Base of AGI özeti

OpenAI'nin GPT-2 ağırlıkları neden benimkileri geçiyor?
© gilesthomas.com — görsel kaynağa aittir

Özgün başlık: Why do OpenAI's GPT-2 weights beat mine?

Sıfırdan bir LLM eğitimi projemi bitirdiğimde küçük bir gizemle baş başa kaldım. Modellerim neden talimatları takip etme konusunda orijinal OpenAI GPT-2 küçük ağırlıklara göre daha kötüydü? "Büyük Bir Dil Modeli Oluşturun (Scratch'ten)" bölümünün 7. bölümündeki talimat ince ayarı koduna dayanarak çalıştırdığım bir değerlendirmem vardı. Süreç, doğrulama kaybı artmaya başlayana kadar Alpaca talimat takip veri setinden örnekler üzerinde bir model eğitmek, bu talimat ince ayarlı modelini, geri tutulan bir test setinin tamamlamalarını oluşturmak için kullanmak ve ardından çeşitli farklı modellerden sonuçları karşılaştırmak için bir LLM kullanmaktı. Detaylar burada; buna IFT değerlendirmesi diyelim. OpenAI'nin GPT-2 küçük için orijinal ağırlıkları, benimki daha teknik bir değerlendirmede onlarınkinden daha iyi sonuçlar aldığında bile sürekli olarak kendi modellerimi yendi; burada her model için çapraz entropi kaybını, geri tutulan bir dizi test dizisinde ölçtüm. Bu beni şaşırttı; İki değerlendirme arasında oldukça yakın bir korelasyon olmasını beklerdim; daha iyi test kaybı, daha iyi talimat takibi anlamına gelir. Bunun neden olabileceğine dair birkaç düşüncem var ve yakın zamanda Poppy'yi kurduğum göz önüne alındığında, özel LLM eğitim kutumu bunlardan birini test etmek için onu bir deneyle başlatmaya karar verdim; Zamanla başka deneyler de gelecek; ancak bunun blogun odak noktası olacağını düşünmüyorum.

Daha çok, gizemi çözene veya umutsuzluk içinde pes edene kadar ara sıra gönderiler içeren, devam eden bir tema... Bu yazıda sorunun doğası hakkında biraz daha ayrıntılı bilgi vereceğim ve bunun nedeni olabileceğini düşündüğüm bazı şeyleri listeleyeceğim. Bir sonraki yazıda ilk deneyin sonuçlarını vereceğim. En son IFT değerlendirme çalışmalarımdan elde edilen sonuçlara bir göz atalım. OpenAI modellerini kalın harflerle vurguladım ve tablo, daha önce bahsettiğim, daha düşük olanın daha iyi olduğu daha teknik değerlendirme olan test kaybına göre sıralanmıştır. Modelin IFT değerlendirmesinde ne kadar başarılı olduğu son üç sütunda gösterilmektedir. "IFT dönemleri" sütunu, doğrulama kaybı artmaya başlamadan önce modelin kaç eğitim dönemine ihtiyaç duyduğunu gösterir; puan, (bu durumda) GPT 5.5'in IFT test setine modelin yanıtlarını verdiği 100 üzerinden ortalama puandır ve sıralama, modelin bu ortalama puana göre tuttuğu konumdur. IFT değerlendirmesi için OpenAI ağırlıklar en iyisidir.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri