Yapay zeka güvenlik önlemleri, saldırgan siber güvenlik araştırmacılarının çalışmalarını engelliyor

Özgün başlık: How AI guardrails are impeding the work of offensive cybersecurity researchers
Yapay zeka devleri, modellerinin kötü niyetli bilgisayar korsanları tarafından kullanımını sınırlamak için aylardır özel olarak incelenmiş programlar ve sıkı güvenlik önlemleri geliştirdi. Ancak bu sınırlar artık meşru ağ savunucularının yanı sıra saldırgan siber güvenlik araştırmacılarının çalışmalarını da engelliyor. Haziran ayında ABD hükümeti, Anthropic'nin çok abartılı yapay zeka modelleri Mythos ve Fable'a ihracat kontrolü kısıtlamaları getirdi. Bu hamle, en azından kısmen, kullanıcıların kötü niyetli siber saldırılar oluşturmak ve yürütmek için bu modelleri kullanmasını engellemek üzere tasarlanan modellerin korkuluklarını aşmanın mümkün olduğunu iddia eden bir rapordan kaynaklandı. Olayın gerçekten jailbreak korkusundan kaynaklanıp kaynaklanmadığına bakılmaksızın, gerçek şu ki Anthropic, Mythos'u defalarca, yalnızca dikkatle incelenen kullanıcılara ve o zaman bile sıkı korkuluklar uygulanan bir tür kıyamet günü siber makinesi olarak pazarladı. (Fable 5 ve Mythos 5 üzerindeki ihracat kontrolleri o zamandan beri kaldırıldı. Fable 5, 1 Temmuz'da genel erişime geri döndü; Mythos 5, hükümetin inceleme sürecinin bir parçası olarak yalnızca incelenen ABD kuruluşlarına yeniden sunuldu.) Bu tür bir bekçilik Mythos'a özgü değil.
Her ikisi de diğer modelleriyle birlikte Anthropic ve OpenAI, siber güvenlik araştırmacılarına incelenmek üzere başvurabilecekleri programlar sunar ve - onaylanırsa - daha az siber güvenlik kısıtlamasına sahip modellere erişim sağlar: OpenAI'nin Siber için Güvenilir Erişim programı ve Anthropic'nin Siber Doğrulama Programı. Bu korkuluklar, özellikle görevleri sistemlerdeki bilinmeyen güvenlik açıklarını bulmak ve suçlulardan önce bunları kullanmanın yollarını bulmak olan araştırmacılar tarafından geniş çapta eleştirildi. Tanınmış bir güvenlik araştırmacısı olan Mark Dowd, yakın zamanda bir siber güvenlik podcast'inde yer aldığında şunları söyledi: "Bu rastgele büyük şirketlerin güvenlikte neyin güvenli olup neyin olmadığı konusunda keyfi kararlar vermesi beni gerçekten rahatsız ediyor." Dowd, yamalanmaları için yazılım üreticilerine bildirmek yerine, sıfır günleri (daha önce bilinmeyen yazılım kusurlarını ve bunlardan yararlanan açıkları) bulmak ve Batılı hükümetlere satmak için onlarca yıl harcadı. Hükümetler, açık kaldıkları için güvenlik açıkları için prim ödüyorlar ve bu da istihbarat operasyonları için faydalıdır. Dowd, çalışmalarının kendisini önyargılı hale getirebileceğini itiraf etti, ancak yalnız değil.