OpenAI, GPT-5.6 Sol'un ARC-AGI-3'te Opus 5'i yendiğini ancak yalnızca kendi özel test sistemiyle bunu başardığını iddia ediyor

Özgün başlık: OpenAI claims GPT-5.6 Sol beats Opus 5 on ARC-AGI-3 but only with its own custom test harness
OpenAI, Anthropic'in ARC-AGI-3 rekorunu sayıyor: GPT-5.6 Sol, yüzde 38,3 puan alıyor, ancak bunu yalnızca akıl yürütme ve bağlam sıkıştırması korunan kendi API'si aracılığıyla yapıyor. Resmi test ortamında model yalnızca yüzde 7,8'i başardı. Opus 5 bu tür yardımlar olmadan yüzde 30,2'ye ulaştı. OpenAI makalesi, GPT-5.6 Sol'un ARC-AGI-3'te Opus 5'i geride bıraktığını, ancak yalnızca kendi özel test donanımıyla The Decoder'da ilk kez ortaya çıktığını iddia ediyor.
✳ Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗
Akış içinde yorumlarla aç