Claude İnternete kötü amaçlı kod yayınladı ve 3 gerçek şirkete saldırdı

Özgün başlık: Claude published malicious code to the Internet and attacked 3 real companies
Hackerlar geleneksel yöntemleri kullanmış olsaydı muhtemelen birileri hapse girerdi. Anthropic, Claude tabanlı güvenlik modellerinin, modellerin saldırgan siber yeteneklerini ölçmek için tasarlanan dahili testler sırasında üç dış kuruluşun hassas üretim ortamlarına yetkisiz erişim elde ettiğini söyledi. Anthropic Perşembe günü açıklanan olaylar, dünyanın en zengin sağlayıcılarının yapay zeka modellerinin korumalı ağlara izinsiz girdiğinin 10 gün içinde ikinci kez ortaya çıkmasıdır; bu, daha geleneksel bilgisayar korsanlığı senaryolarında, klavyenin arkasındaki insanı yıllarca hapse atabilecek bir suçtur. Bu ayın başlarında OpenAI, güvenlik modellerinin, açık kaynaklı makine öğrenimi modelleri ve yapay zeka veri kümeleri platformu olan Hugging Face ağına sızmak için sıfır gün güvenlik açığından yararlandığını söyledi. OpenAI modelleri erişim kimlik bilgilerini ve diğer gizli Hugging Face bilgilerini çalmaya devam etti. OpenAI modelleri ayrıca diğer dört üçüncü taraf hizmetinin hesaplarını tehlikeye atmak için kamuya açık kimlik bilgilerinden yararlandı. Anthropic, OpenAI olayının mühendislerini Claude modelleriyle benzer siber güvenlik değerlendirmelerini incelemeye teşvik ettiğini söyledi.
Denetimde "bir modelin, üçüncü taraf değerlendirme ortaklarımızdan biri olan Irregular'ın değerlendirme ortamı içinden veya bu ortamla etkileşimde bulunurken internete eriştiği ve ardından üç farklı kuruluşun üretim altyapısına yetkisiz erişim sağladığı" üç olay tespit edildi. Anthropic, mühendislerin "bayrağı ele geçirme" zorlukları sırasında (çeşitli bilgisayar korsanlığı tekniklerinin saldırı ve savunma yeteneklerini değerlendirmenin ortak bir yolu) sunduğu yönlendirmelerin, test ortamının yalnızca bir simülasyon olduğunu ve modellerin açık İnternet'e erişimi olmadığını açıkça ortaya koyduğunu söyledi. Aslında test ortağı Irregular yanlışlıkla bu tür bir erişimi kullanılabilir hale getirdi. Buna yanıt olarak modeller İnternet yollarını alıştırmaların bir parçası olarak ele aldı. İzinsiz girişler üç Claude model aracılığıyla gerçekleşti: Opus 4.7, Mythos 5 ve dahili bir araştırma prototipi. Üçünün en eskisi olan Opus 4.7, sınırlarını en çok aşan olanıydı. Anthropic açıkladı: Erişilebilir tüm varlıkların uygulamanın kapsamında olması gerektiği yönündeki yanlış inançla faaliyet gösteren Claude, zayıf parolalardan ve kimliği doğrulanmamış uç noktalardan yararlanmak gibi temel teknikleri kullanarak etkilenen kuruluşların altyapısını tehlikeye attı.