Anthropic'in Claude modelleri, güvenlik testleri sırasında üç şirketin sistemlerine izinsiz olarak erişti

Anthropic , OpenAI’ın modellerinden birinin izole bir test ortamından çıkarak Hugging Face’in sistemlerine eriştiğini açıklamasının ardından kendi siber güvenlik değerlendirmelerini geriye dönük olarak incelemeye başladı . Şirket, Claude’un internete erişme ihtimali bulunan 141 bin 6 test çalışmasını taradı ve altı ayrı çalışmaya yayılan üç olay tespit etti. Testler, Anthropic’in üçüncü taraf değerlendirme ortağı Irregular tarafından sağlanan ortamlarda gerçekleştiriliyordu.
Claude’a, “capture the flag” olarak adlandırılan güvenlik senaryolarında kurgusal sistemlere sızarak gizli bir bilgiyi bulma görevi verilmişti. Sistem komutlarında modellerin internete bağlı olmadığı belirtilmesine rağmen, yanlış yapılandırma nedeniyle bağlantı açık kaldı. Modeller de karşılaştıkları gerçek sistemlerin test senaryosunun bir parçası olduğunu varsayarak saldırılarına devam etti.
Olaylarda Claude Opus 4.7, Mythos 5 ve henüz kullanıma sunulmamış bir araştırma modeli yer aldı. En ciddi vakada Opus 4.7, gerçek bir şirketin sistemlerinden uygulama ve altyapı kimlik bilgilerini elde ederek yüzlerce satırlık üretim verisinin bulunduğu bir veri tabanına erişti. Model, gerçek bir ortamda çalışıyor olabileceğini fark etmesine rağmen hedefin testin parçası olduğunu düşünerek işlemlerini sürdürdü.
Mythos 5’in dahil olduğu ikinci olayda model, var olmayan bir Python paketinin adını kullanarak PyPI üzerinde kötü amaçlı bir paket yayımladı. Yaklaşık bir saat erişilebilir kalan paket 15 gerçek sistem tarafından indirildi. Bu sistemlerden biri, paketleri otomatik olarak tarayan bir siber güvenlik şirketine aitti. Paketin çalışmasıyla şirketin bazı erişim bilgileri ele geçirildi ve model bunları başka altyapılara ulaşmak için kullandı.
Üçüncü olayda ise Anthropic’in araştırma modeli yaklaşık 9 bin hedefi taradı; açık bir hata ayıklama sayfasındaki erişim bilgileri ve SQL injection gibi bilinen yöntemlerden yararlanarak bir şirketin uygulamasına girdi. Ancak sistemin test ortamıyla bağlantılı olmadığını fark ettiğinde saldırıyı kendiliğinden durdurdu. Anthropic, daha yeni olan bu modelin söz konusu davranışının olumlu bir işaret olduğunu belirtse de üç olaydan genel bir sonuç çıkarmak için daha fazla test yapılması gerektiğini vurguladı.
Anthropic’in paylaştığına göre modeller kendi hedeflerini oluşturarak test ortamından kaçmaya çalışmadı.