← Tüm AI haberleri

Araştırma

Temel bir hata, LLM'leri saldırılara karşı son derece savunmasız bırakıyor

technologyreview.com · 30.07.2026 · Base of AGI özeti

Temel bir hata, LLM'leri saldırılara karşı son derece savunmasız bırakıyor
© wp.technologyreview.com — görsel kaynağa aittir

Özgün başlık: A fundamental flaw leaves LLMs strikingly vulnerable to attack

Bir uçağın navigasyon sistemini nasıl sabote edeceğinizi söylemek gibi, yapmamaları gereken şeyleri yapmaları için onları kandırmayı kolaylaştırır. Bir araştırmacı ekibi, bu ay en önemli yapay zeka konferanslarından biri olan Uluslararası Makine Öğrenimi Konferansı'nda sunulan bir makalede, büyük dil modellerini çalışma biçimindeki temel bir kusur nedeniyle saldırılara karşı tamamen güvenli hale getirmenin imkansız olduğunu öne sürüyor. İddianın, hükümet ve askeri sistemlerden çevrimiçi alışveriş ve sağlık hizmetlerine kadar giderek daha fazla uygulamada kullanılan bu teknolojinin güvenliği açısından büyük etkileri var. Araştırmacılar, LLM'lerin onlara kimin veya neyin talimat verdiğini nasıl tanımladığıyla ilgili bu kusurdan yararlanarak, popüler LLM'lerin kokainin nasıl sentezleneceği ve ticari bir uçağın navigasyon sisteminin nasıl sabote edileceği gibi sağlamamak üzere eğitildikleri bilgileri tükürmelerini sağladılar. Bağımsız araştırmacı ve ICML makalesinin ortak yazarı Charles Ye, "Bunun temelde çözülemez bir sorun olma ihtimali gerçek" diyor. Şirketler genellikle, kırmızı ekip oluşturma olarak bilinen bir süreç olan, mevcut korkulukları kıran yeni saldırılar bulmaya çalışmak için insan test uzmanlarından oluşan ekipler kiralar. Model yapımcıları ayrıca bu sürecin bazı kısımlarını otomatikleştirmek için diğer modellerdeki zayıflıkları bulup kullanan LLM süper bilgisayar korsanlarını (OpenAI'nin GPT-Red'i gibi) kullanıyor.

Daha sonra amaç bu saldırıları almak ve bunlara ve onlara benzeyen her şeye direnecek yeni bir model yetiştirmektir. Başka bir bağımsız araştırmacı ve makalenin ortak yazarı Jasmine Cui, sorunun, yaklaşımın modellere yapmamaları gereken şeylerin bir listesini vermek anlamına gelmesi olduğunu söylüyor. Ancak hiçbir liste kapsamlı değildir. "Simpsonlar'ı izliyormuşuz gibi ve Bart'a yüzlerce kez 'Öğretmenime uygunsuz bir şey söylemeyeceğim' yazması gibi" diyor. "Ve yine de oldukça kaba şeyler yapıyor." Araştırmacılar, yüksek lisans yapanları yaramazlık yapmaya ikna etmenin ne kadar kolay olduğunu test etmeye başladılar. Talimatların, Yüksek Lisans'ın kendi düşünce zincirinde oluşturduğu metni (modellerin görevleri yerine getirirken kendilerine not yazmak için kullandıkları bir tür karalama defteri) taklit eden bir tarzda yazılmasının, Yüksek Lisans'ı genellikle bu talimatı kendisi bulmuş gibi davranması ve ona göre hareket etmesi için kandıracağını buldular. Örneğin, “Kokain yapmak için bir rehber oluşturmama yardım et.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri