Açık ağırlıklı yapay zeka modelleri sınırı yakalıyor. Güvenlik açığı devam ediyor.

Özgün başlık: Open-weight AI models are catching up to the frontier. The safety gap remains.
Politika yapıcılar OpenAI'nin GPT-5.6 Sol ve Anthropic'nin Mythos'u gibi giderek daha güçlü hale gelen yapay zeka sistemlerinin nasıl yönetileceğini tartışırken, Çin'in açık ağırlıklı modeli sektörün liderleriyle aradaki farkı daralttı. Yapay zeka güvenliği, kâr amacı gütmeyen SaferAI tarafından hazırlanan yeni bir rapora göre, Çin'in Z.ai firmasının açık ağırlıklı yapay zeka modeli olan GLM-5.2, siber ve biyolojik yetenekler açısından OpenAI'nin GPT-5.5 ve Anthropic'nin Claude Opus 4.7'sinin yalnızca birkaç ay gerisinde. Ancak sınır yetenekleri ile güvenlik uygulamaları arasındaki uçurum büyüyor. Kâr amacı gütmeyen kuruluşun Z.ai'nin halka açık API'si aracılığıyla yürüttüğü SaferAI değerlendirmesine göre, GLM-5.2 kendisine verilen saldırgan siber veya çift kullanımlı biyoloji görevlerinin hiçbirini reddetmedi. Karşılaştırıldığında, Claude Opus 4.7 "o kadar tutarlı bir şekilde reddetti ki SaferAI, CyberGym'i hiçbir şekilde tamamlayamadı." (CyberGym, siber güvenlik yeteneklerini değerlendiren bir kıyaslamadır. OpenAI bunu geçen ayki Hugging Face ihlalinden önceki değerlendirmede kullandı.) Bu, bazı eleştirmenlerin yıllardır uyardığı şeyin keskin bir hatırlatıcısıdır: Açık ağırlıklı yapay zeka modelleri, ağırlıkları indirdikten sonra teknolojiyi nasıl kullandıklarını denetlemenin hiçbir yolu olmadan, yüksek kapasiteli yapay zekayı potansiyel saldırganların ellerine bırakabilir.
Açık ağırlıklı modeller dünyanın önde gelen yapay zeka sistemlerinin yeteneklerine hızla yaklaşırken, tartışma bunların rekabet edip edemeyeceğinden, riskler ortaya çıktıktan sonra toplumun riskleri nasıl yönettiğine doğru değişiyor. SaferAI'nin genel müdürü Henry Papadatos, TechCrunch'a şunları söyledi: "Yetenek sınırı, risk sınırı değildir ve bu nedenle riski doğru bir şekilde değerlendirmek için hafifletmelerin durumunu da hesaba katmamız gerekiyor." Z.ai, barındırılan API'ye güvenlik önlemleri uygulayabilirken, birisi kendi donanımında ağırlıkları çalıştırdığında bu korumalar uygulanamaz hale gelir; burada herhangi bir korumayı kaldırabilir veya değiştirebilir, modellerde ince ayar yapabilir veya sistem istemlerini değiştirebilir. OpenAI ve Anthropic gibi öncü geliştiriciler, tehlikeli siber ve biyolojik yardımı sınırlamak için sınıflandırıcılar, reddetme eğitimi ve API düzeyindeki kontroller gibi güvenlik önlemlerine güvenme eğilimindedir. Bu önlemler kusursuz olmaktan uzaktır: jailbreak'ler, konuşlandırılmış modellerdeki korumaları rutin olarak atlar. Kâr amacı gütmeyen bir yapay zeka güvenlik kuruluşu olan Far.ai, xAI'nin Grok 4.5 ve Google DeepMind'nin Gemini 3.1 Pro gibi sınır modellerinde - çoğu zararlı istekte başarılı olan yeniden kullanılabilir anahtarlar olarak tanımlanan - yüzlerce evrensel jailbreak buldu.