OpenAI Astra'nın değerlendirme metriklerini güçlendiriyor ve diğerlerini değiştirmeye devam ediyor
🔗 Ayrıca yazanlar: youtube.com

Özgün başlık: OpenAI boosts Astra's eval metrics, and continues to change others
OpenAI, 3 Eylül öğleden sonra ilk kez bir blog gönderisi duyurusu yayınladığından bu yana GPT-6 Astra modeli için çeşitli değerlendirme kriterlerini değiştirdi. Bazı durumlarda, güncellenen sürümlerdeki rakamlar Astra'nın daha iyi performans gösterdiğini gösterirken, OpenAI'nin ezeli rakibi Anthropic modellerinin rakamları daha da kötüleşti. Değişiklikler, blog gönderisinin olağandışı bir şekilde kullanıma sunulması sırasında meydana geldi. OpenAI Başlangıçta gönderinin saat 14:00'te yayınlanması planlanmıştı. ET, ancak çevrimiçi olarak geniş çapta görüntülenebilir hale gelmesi neredeyse iki saat daha sürdü. OpenAI'in X hesabı saat 15:32'de blog gönderisini tweetlediğinde, bağlantı düzgün yüklenmiyordu ve bir hata mesajı veriyordu. Öğleden sonra 3:50'de, OpenAI CEO'su Sam Altman bağlantıyı yayınlayarak şöyle yazdı: "Blog gönderisinin dağıtılmasında küçük bir sorun yaşadık, ancak gerçekten harika." Birçok yorumcu hâlâ bunu göremiyordu ve Fortune'un yaptığı gibi aynı hatayı alıyorlardı. Yaklaşık bir saat sonra tekrar kontrol ettiğimizde görünür durumdaydı ve düzgün bir şekilde yükleniyordu. Görünüşe göre OpenaAI blogu öğleden sonra 14.00'ten kısa bir süre sonra yayınladı ancak şirketin açıklayamayacağını söylemesi, ancak bunun kıyaslama performans rakamlarıyla ilgisi olmadığını söylemesi nedeniyle blogu geri çekti.
(OpenAI bize önce bunun içerik yönetim sisteminde bir hata olduğunu, ardından da internet kesintisi olduğunu söyledi.) Blog yeniden yayınlandıktan sonra, Astra'nın lehine görünen farklı değerlendirme ölçütleri ortaya çıktı ve bazı rakamlar o zamandan bu yana değişmeye devam etti. Değişikliklerin açığa çıkması, yapay zeka endüstrisindeki yoğun rekabetin ortasında, şirketlerin büyük dil modellerine yönelik güncellemeleri çılgın bir hızla yayınlaması ve her birinin diğerinin önüne geçmeye çalışmasıyla ortaya çıkıyor. Metriklere odaklanma aynı zamanda standartlaştırılmış kıyaslama testleri kullanarak büyük dil modellerinin performansını ölçmenin zorluklarını ve spesifikasyonların manipülasyona ve oyun adamlığına yatkın olduğuna dair endişeleri de vurgulamaktadır. OpenAI sözcüsü Fortune'a "Değerlendirmelerin doğru yapılmasını çok önemsiyoruz" dedi. "Çoğu değerlendirmede, raporlamada kullanılan tam kontrol noktası, yapı iskelesi ve değerlendirme çalışmasına bağlı olarak birkaç yüzde puanı dahilinde gürültü var. Lansman blogumuz için, sayıların mevcut model performansına ilişkin en iyi tahminimizi temsil etmesini sağlamak için düzeltmeler yaptık, böylece kullanıcılar anlamlı karşılaştırmalar yapabilir." En dikkate değer değişiklikler arasında Astra'nın bildirdiği halüsinasyon oran�� vardı. Blog yazısının ilk internet arşivindeki anlık görüntüsü 14:23'ten itibaren. ET, %4,2 idi.