Dünyanın ilk çift-kör yapay zeka değerlendirmelerinin pilot uygulaması
Özgün başlık: Piloting the world's first double-blind AI evaluations
Kriptografik olarak güvenli ortamlar kullanarak özel model kıyaslamalarına güven oluşturma Bir öğrencinin yüksek riskli bir sınava girmeye hazır olduğunu düşünün. Test sorularına önceden yanlışlıkla göz atarlarsa, mükemmel bir puan elde etmek bu bilgiden etkilenir ve bunu anlamsız bir başarı haline getirir. Bildiklerini gerçekten ölçmek için sınava girme zamanı gelene kadar test sorularını görememeleri gerekir. Gelişmiş yapay zeka modellerini değerlendirirken endüstrinin karşılaştığı zorluk tam olarak budur. Bir model, test sorularını zaten görmüşse (bu, kıyaslama kirliliği olarak bilinen bir sorundur), sonuçlara yalnızca bir dereceye kadar güvenilebilir. Bugün, dış değerlendirmeleri daha sonra modeller tarafından testten önce performansı optimize etmek için kullanılamayacakları kriptografik bir "kutu" ile sınırlı tutan, tescilli, sınır sınıfı bir yapay zeka modelinin dünyanın ilk çift kör değerlendirmesini tanıtıyoruz. Değerlendirme bütünlüğünü artırarak, gizliliği koruyan bir ortamda Gemini Flash Lite modelini gizli ölçütlere göre test etmek için Singapur Yapay Zeka Güvenlik Enstitüsü, OpenMined, AVERI ve MLCommons ile ortaklık yapıyoruz. Google'da yapay zeka sistemlerimizi, model geliştirme ve dağıtım aşamalarında geniş bir değerlendirme yelpazesi kullanarak değerlendiriyoruz ancak yalnızca dahili testlere güvenmiyoruz.
Potansiyel kör noktaları belirlemek için, uzman araştırma laboratuvarları, sivil toplum ve ulusal Yapay Zeka Emniyet ve Güvenlik Enstitüleri (AISI'ler) dahil olmak üzere çok çeşitli harici ortaklarla birlikte çalışıyoruz ve onların benzersiz uzmanlıklarını kullanarak modellerimizi stres testine tabi tutuyoruz. Yapay zeka modelleri daha yetenekli hale geldikçe, modelin test sorularını veya istemlerini önceden görmediğinden emin olmak kritik öneme sahiptir çünkü bu, sonuçları çarpıtabilir. Politika yapıcıların, araştırmacıların ve kuruluşların yapay zeka kıyaslamalarının bir modelin gerçek yeteneklerini ve güvenliğini doğru bir şekilde yansıttığına güvenmesi gerekir; ancak modeller değerlendirme sorularına önceden "göz atabilir"se, puanları yapay olarak şişirebilir ve bu güveni zayıflatabilir. Sıfır günlük protokolleri ve sıkı sözleşmeye dayalı korumalar, harici test istemlerini uzun süredir gizli tutsa da, teknik ve kriptografik korumaların dahil edilmesi, güvenli model değerlendirmesinde ileriye doğru atılmış büyük bir adıma işaret ediyor. Tarihsel olarak, yüksek riskli dış değerlendirmeler bir ödün vermeyi gerektiriyordu.