Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, standart kriterlerin yapay zeka ajanlarının gerçekte neler yapabileceğini sistematik olarak hafife aldığını tespit etti

Özgün başlık: UK's AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do
Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, yedi kriteri kapsayan bir çalışmada, standart yapay zeka değerlendirmelerinin, bilgi işlem bütçesine sınır getirerek aracı yeteneklerini sistematik olarak hafife aldığını gösteriyor. Yazılım mühendisliği görevlerinde, token bütçesi on kat artırıldığında başarı oranları yaklaşık yüzde 25 arttı. Daha yeni modeller en çok fayda sağlar. AISI'ya göre, token bütçesine bağlı olarak sınırdaki gerçek ilerleme, önerilen önceki ölçümlerden yaklaşık yüzde 60 daha dik. Birleşik Krallık'taki AI Güvenlik Enstitüsü makalesi, The Decoder'da ilk kez ortaya çıkan standart kriterlerin, yapay zeka ajanlarının gerçekte neler yapabileceğini sistematik olarak hafife aldığını tespit ediyor.