Anthropic ve OpenAI kimin menajerlerinin daha fazla hileye başvurabileceğini görmek için yarışıyor

Özgün başlık: Anthropic and OpenAI are competing to see whose agents can go rogue harder
Bir şirketin piyasaya sürülmemiş bir ürün için yaratıcı kampanyası, Anthropic ve OpenAI arasında hangisinin kendi başarısızlıkları hakkında daha yüksek sesle bağırabileceğini görmek için yapılan bir yarışmaya dönüştü. Bugün erken saatlerde bizi izleyen okuyucular, Anthropic'nin Mythos pazarlama taktik kitabını benimseyerek OpenAI'yi aşmaya çalıştığı ve kendisini can alıcı nokta haline getirdiği dramanın (veya durum komedisinin) en son bölümünü gördü. Nisan ayında Mythos'la ilk kez dalga geçtiğinden beri Anthropic, siber güvenlik modellerinin kamuya açıklanamayacak kadar tehlikeli olduğunu ilan ederek ve Project Glasswing aracılığıyla yalnızca seçilmiş birkaç güvenilir kuruluşa erişim sunarak modeli korku yoluyla pazarladı. Strateji kendi açısından karşılığını verdi. Anthropic Mythos adını siber güvenlikle yakından ilişkilendirmiştir, bu da OpenAI'nin geçen hafta neden rakibinin kanıtlanmış PR stratejisini ödünç aldığını açıklayabilir. OpenAI ajanlar, sanal alanlarından kaçmak için sıfır günü istismar etti ve Hugging Face'de otonom siber saldırıya yol açtı. Bu bölüm, yapay zekanın bir gün haydut olup dünyayı ele geçireceği yönünde uzun süredir devam eden korku üzerine sansasyonel manşetlere yer verilmesini sağladı. Anthropic bu hafta buna daha fazla palyaço makyajı yaparak ve süreçteki bir fırsatı israf ederek karşılık verdi. Claude yapımcısı, bir bayrağı yakalamak için modellerini bir test ortamına gönderdi.
İstemcileri internet erişimlerinin olmadığını söyledi, ancak Anthropic'nin değerlendirme ortağı Irregular ile "yanlış anlaşılma" olarak adlandırdığı olay nedeniyle bağlantı canlıydı. Anthropic'nin modelleri daha sonra OpenAI'nin senaryosunu takip etti: kamuya açık internete ulaştılar ve dış kuruluşların sistemlerine saldırdılar. Şirket, bu sefer bir yerine üç kişinin etkilendiğini itiraf etti. Bir senaryoda Mythos 5, geliştiricileri zehirli bir PyPI paketi indirmeye ikna etti. Bu yazılım, bu tür paketleri kötü amaçlı yazılımlara karşı düzenli olarak tarayan bir siber güvenlik şirketindeki makineler de dahil olmak üzere 15 makineye kuruldu. Anthropic'nin sözleriyle: "Şirketin tarayıcısı paketi kurduğunda, Claude'nin gizli kodu yürütüldü. Şirketin güvenlik tarayıcısının PyPI paketlerini kurulumu güvenli olarak değerlendirdiğine ve sonuç olarak Claude şirketin kimlik bilgilerini kurduğu bir toplama noktasına sızdırabildiğine inanıyoruz. Claude daha sonra bu kimlik bilgilerini bu şirketten daha fazla altyapıya erişmek için kullandı." Daha da kötüsü, üç olaydan ilki Nisan ayında meydana geldi.