OpenAI matematik sonuçlarının değerlendirilmesi

Özgün başlık: Assessment of open AI math results
Sıradan bir insanın bu görevlerin karmaşıklığını anlaması zordur. Matematikçi değilim ve örneğin sonuçlar 3 ile 10 arasında bir fark görmüyorum. Bu yüzden GPT-5.6 Sol Pro ve Fable 5 Max'in bunları @EpochAIResearch OpenMath'in değerlendirme tablosunu kullanarak sınıflandırmasını sağladım: ��"Sağlam Sonuç": Bölgedeki güçlü bir araştırmacı, medyan çıktıları bu çaptaki sorunları ele alırsa mutlu olurdu. Yine de sorun muhtemelen kendi alt alanı dışında fazla ilgi görmeyecektir. —"Büyük İlerleme": Matematiğin geniş bir alanında (sayı teorisi veya grafik teorisi ölçeğinde) çalışan ortalama kişi bunu dikkate alacak ve muhtemelen çözümün en azından ana hatlarını anlamaya zaman ayıracaktır. —"Atılım": Ortalama matematikçi, kendi alanlarının dışında olsa bile bu sonucu bilmek isterdi. Bu, tüm matematik alanında yılın en iyi sonuçlarından birine aday olacaktır === Hem Fable hem de Sol 3'ün bir Atılım olduğu konusunda hemfikir (bu da @SebastienBubeck'in tweet'ini neden bununla açtığını açıklıyor). Ayrıca en az 7 tanesinin Büyük İlerleme olduğu konusunda da hemfikirdirler. Fable, 7'nin yalnızca Sağlam bir Sonuç olduğunu düşünürken Sol, "Büyük İlerleme" etiketini veriyor. İlginç olan, resmi Epoch.AI değerlendirme listelerinin şunu söylemesidir: Bir sorun için birden fazla katman makul göründüğünde, muhafazakar yönde hata yaptık. Bir sorunun çözüldükten sonra dikkate değerliğini düşürmek hayal kırıklığı yaratırken, çözümün beklenmedik derecede ilginç unsurlarını her zaman vurgulayabiliriz.
Ve Fable 5, sonuçlardan en az 3'ünün "Sınırda Atılım" (1, 4 ve 9) olduğunu düşünüyor. @AcerFur'un bu konuda herhangi bir düşüncesi var mı?