İki ayarın etkinleştirilmesi, ARC-AGI-3 kıyaslama testindeki puanlarımızı üç katına çıkardı
Özgün başlık: How enabling two settings tripled our scores on the ARC-AGI-3 benchmark
GPT‑5.6 Sol'un, mantık yürütmeyi koruyan ve sıkıştırmayı mümkün kılan resmi donanım (solda) ve Responses API donanımımız (sağda) ile ARC-AGI-3 testindeki bulmacaları çözmeye çalışmasını gösteren hızlandırılmış bir video. Bu oyunun liderlik tablosunda (yeni bir pencerede açılır), hiçbir sınır modeli ilk seviyenin ötesinde hiçbir seviyeyi çözemez. Bizim donanımımızla GPT‑5.6 Sol altı sorunun hepsini çözüyor. GPT‑5.6 Sol, döngü çift kapak varsayımı(yeni bir pencerede açılır) ve Pokémon FireRed gibi yenilmiş oyunlar gibi matematikte uzun zamandır devam eden açık problemleri çözdü. Ancak 2D bulmaca oyunlarının referans noktası olan ARC-AGI-3'te GPT‑5.6 Sol yalnızca %7,8 puan alırken, GPT‑5.5 oyunları neredeyse hiç oynayamadı ve %0,4 gibi önemsiz bir puan aldı. 2D bulmaca oyunları modellerimiz için alışılmadık derecede zor muydu? Yoksa başka bir şey mi oluyordu? Karşılaştırmalar nadiren yapay zeka modellerini tek başına ölçer. Ayrıca API ayarları, donanım tasarımı ve yönlendirmeyle ilgili daha az görünür olan seçenekleri de ölçerler. ARC-AGI-3 örneğinde, ChatGPT ve Codex'de kullandığ��mız iki API ayarını açmanın (muhakeme ve sıkıştırmayı koruduğunu) genel görev setinde puanları üç katına çıkardığını ve çıktı jetonlarını 6 kat azalttığını keşfettik. Resmi koşum takımıyla GPT‑5.6 Sol, ARC-AGI-3 halka açık sette %13,3 puan aldı. Akıl yürütme ve sıkıştırmanın sürdürülmesiyle %38,3 puan aldı. Puanlar Göreli İnsan Eylemi Verimliliğini ölçer (RHAE (yeni bir pencerede açılır) ) — model performansını insan referans çizgisiyle karşılaştıran bir ölçüm.
Resmi oyun kayıtlarına dayanarak (yeni bir pencerede açılır), ortalama insan testçinin %48 puan aldığını tahmin ediyoruz. Modellere nasıl puanlanacakları söylenmiyor ve puanları baştan sona görülemiyor; eylemler yalnızca her çerçevenin metin temsilini ve hangi seviyede olduklarını döndürüyor. ARC-AGI-3 ARC-AGI-3, yapay zeka temsilcilerinin ne kadar iyi öğrendiğini ve akıl yürüttüğünü ölçmek için tasarlanmış bir kıyaslamadır. Temsilciler, alışılmadık 2D oyunları keşfeder ve açık talimatlar olmadan nasıl çalıştıklarını anlar. Arcprize.org/tasks(yeni bir pencerede açılır) adresinden 25 demo oyunu oynayabilirsiniz. ARC-AGI-3, herhangi bir alet veya özel özellik gerektirmeden, kasıtlı olarak genel bir donanım kullanır. ARC'nin mantığı, basit bir emniyet kemerinin model eksikliklerini daha görünür hale getirmesi ve model karşılaştırmalarını daha adil hale getirmesiydi. Ticari geliştiriciler ise tam tersine, koşum takımlarını her modelin özelliklerine ve tuhaflıklarına göre optimize ediyor.