İşte yapay zeka ajanlarının hedeflerine ulaşmak için yalan söylemesinin ve hile yapmasının nedeni

Özgün başlık: Here’s why AI agents lie and cheat to reach their goals
Yanlış davranışa ödül hackleme denir. Bilmeniz gereken şey bu. MIT Technology Review Açıklıyor: Gelecekte ne olacağını anlamanıza yardımcı olmak için yazarlarımızın teknolojinin karmaşık, karmaşık dünyasını çözmelerine izin verin. Serinin daha fazlasını buradan okuyabilirsiniz. Temmuz ayında iki OpenAI modeli Hugging Face web sitesini hacklediğinde, para kazanmaya ya da sabotaj yapmaya çalışmıyorlardı; sadece bir test sorusuna yanıt arıyorlardı. OpenAI'den alınan otopsiye göre, test amacıyla tipik güvenlik özelliklerinden arındırılan modeller, OpenAI'nin kendilerini kontrol altına almaya çalıştığı izole edilmiş ortamı hackleyerek ve Hugging Face'nin veritabanlarına girerek bir siber güvenlik uygulamasını çözmeye karar verdi; burada soruna doğru cevabın depolanabileceği düşünüldü. Hugging Face olayı geçtiğimiz haftalarda yoğun ilgi gördü. Bu, yapay zeka modellerinin hackleme konusunda ne kadar başarılı olduğunun çarpıcı bir örneği: Hugging Face'nın veritabanlarına girebilmek için modellerin daha önce keşfedilmemiş birkaç siber güvenlik açığını bir araya getirmesi gerekiyordu. Ancak yapay zeka sistemlerinin nasıl ve neden yalan söylediğini ve aldattığını gösteren bir örnek olarak bu belki de daha da çarpıcı. Modeller giderek güçlendikçe sonuçlar çok daha ciddileşebilir. Araştırmacılar bir süredir yapay zekaların kendileri için belirlenen hedeflere ulaşmak için yaratıcı yaklaşımlar benimseme eğiliminde olduklarını biliyorlardı.
2016 yılında, Anthropic kurucu ortakları Dario Amodei ve o zamanlar OpenAI'de çalışan Jack Clark, Coast Runners adlı bir tekne yarışı Flash oyunu oynamak için eğittikleri bir yapay zeka ajanı hakkında bir blog yazısı yayınladılar. Ajan, araştırmacıların öngördüğü gibi yarışı bitiş çizgisine kadar sürmek yerine parkurun etrafında dönebileceği ve güçlendiricileri toplayabileceği bir köşe buldu ve böylece puanını en üst düzeye çıkardı. Coast Runners'ın hikayesi kısa sürede, yapay zeka ajanlarının istenmeyen stratejiler kullanarak görevleri tamamladığı veya yüksek puanlar kazandığı bir fenomen olan ödül hacklemenin en ünlü örneklerinden biri haline geldi. Tarihsel olarak araştırmacılar, ödül hacklemeyi neredeyse yalnızca ortak bir yapay zeka eğitim rejimi olan takviyeli öğrenme bağlamında tartıştılar. Köpek eğitiminde olduğu gibi, takviyeli öğrenme de, bir hedefe ulaştığında deneğe bir ödül verilmesini içerir; Ödüller daha sonra bu başarıya yol açan davranışları güçlendirir.