← Tüm AI haberleri

AI

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, standart kriterlerin yapay zeka ajanlarının gerçekte neler yapabileceğini sistematik olarak hafife aldığını tespit etti

the-decoder.com · 03.07.2026 · Base of AGI özeti

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, standart kriterlerin yapay zeka ajanlarının gerçekte neler yapabileceğini sistematik olarak hafife aldığını tespit etti
© the-decoder.com — görsel kaynağa aittir

Özgün başlık: UK's AI Security Institute finds standard benchmarks systematically underestimate what AI agents can actually do

Birleşik Krallık Yapay Zeka Güvenlik Enstitüsü, yedi kriteri kapsayan bir çalışmada, standart yapay zeka değerlendirmelerinin, bilgi işlem bütçesine sınır getirerek aracı yeteneklerini sistematik olarak hafife aldığını gösteriyor. Yazılım mühendisliği görevlerinde, token bütçesi on kat artırıldığında başarı oranları yaklaşık yüzde 25 arttı. Daha yeni modeller en çok fayda sağlar. AISI'ya göre, token bütçesine bağlı olarak sınırdaki gerçek ilerleme, önerilen önceki ölçümlerden yaklaşık yüzde 60 daha dik. Birleşik Krallık'taki AI Güvenlik Enstitüsü makalesi, The Decoder'da ilk kez ortaya çıkan standart kriterlerin, yapay zeka ajanlarının gerçekte neler yapabileceğini sistematik olarak hafife aldığını tespit ediyor.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri