← Tüm AI haberleri

Açık Kaynak

Temsilciniz Görevi Üstlendi. Tekrar Yapacak mı?

huggingface.co · 15.09.2026 · Base of AGI özeti

Temsilciniz Görevi Üstlendi. Tekrar Yapacak mı?
© cdn-uploads.huggingface.co — görsel kaynağa aittir

Özgün başlık: Your Agent Aced the Task. Will It Do It Again?

Metrik Neredeyse Hiç Kimse Temsilcilerin Neden Döndüğünü Bildirmiyor: Keskin Kararlar ve Düz Kararlar Teşhis Ediyor, Sonra Sonuçları Düzeltiyor: Doğruluğu Kaybetmeden Boşluğu Azaltma Yönergeler genelliyor — tek bir yörüngeye yama yapmıyorlar Bir Temsilci Gönderiyorsanız Deneyin Ek: Metrikleri Anlamak Bağlantılı yapılar / referanslar Temsilciniz provada çalışıyor, ancak canlı demo sırasında farklı bir yol izliyor ve aynı görevi başaramıyor. Bu sahnede utanç verici. Üretimde bu bir güvenilirlik sorunudur: Bir kez başarılı olan bir iş akışı, bir kullanıcı aynı isteği bir daha yaptığında başarısız olabilir. Bir finansal işlemin mutabakatını yapmak veya bir sözleşmeyi bir yükümlülük açısından kontrol etmek gibi kritik işler için bu durum dikkat çekici olabilir. Çoğu kıyaslama bu değişkenliği bir ortalamanın arkasına gizler. AppWorld'de GPT-4.1 kullanan bir ReAct aracısı, beş tekrarda çalıştırmaların %77,4'ünde başarılı oldu. Ancak beş çalıştırmanın tamamında görevlerin yalnızca %53,0'ında başarılı oldu; bu, 24,4 puanlık bir tutarlılık farkıydı. Çoğu kıyaslama ilk sayıyı rapor eder. ��kinciyi ölçmenin ve iyileştirmenin bir yolunu geliştirdik. Daha önceki bir gönderide, bir ajanın kendi geçmiş yörüngelerini yeniden kullanılabilir kılavuzlara dönüştüren, otomatik olarak damıtılan ve çıkarım zamanında geri enjekte edilen bir sistem olan ALTK-Evolve'u tanıtmıştık. Görev başarısını ölçülebilir şekilde artırıyor, ancak bu sonuçlar yalnızca ortalama durum sorusunu da sordu.

Bu gönderi, altk-evolve'da Tutarlılık Analizcisi adını verdiğimiz ve doğrudan bu boşluğu hedef alan bir teşhis aracı üzerine inşa edilmiş yeni bir kılavuz türü olan tutarlılık yönergelerini tanıtmaktadır. Standart temsilci değerlendirme raporları Mean@k : k kez kıyaslama çalıştırın, geçiş oranının ortalamasını alın. Çoğunlukla k =3, bazen sadece 1. Bu, her sıralama tablosundaki sayıdır ve pratikte "%77 doğru" anlamına gelir. Mean@k "Bu temsilci ortalama olarak ne kadar iyi?" diye yanıtlıyor. Gerçek bir kullanıcının umursadığı soruyu yanıtlamıyor: Bu soruyu tekrar sorsam yine de iyi olur mu? Bunun için Pass^k'ye ihtiyacınız var: Aracının tüm k çalıştırmalarda başarılı olduğu görevlerin kesri. ⚠️ Pass^k, Pass@k değildir. Tanıdık Pass@k iyimserdir; k denemeden en az birinin başarılı olup olmadığını sorar; doğrulayıp yeniden deneyebileceğiniz doğru sorudur. Pass^k onun karamsar ayna görüntüsüdür: Her girişim başarılı olmalıdır. Aynı harfler, zıt soru. Geç^k ≤ Ortalama@k ≤ Geç@k, her zaman. GPT-4.1 tarafından desteklenen bir ReAct aracısı, %77,4'lük bir Mean@5 değeri yayınlıyor; bu gerçekten güçlü.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri