← Tüm AI haberleri

Şirketler

Bir OpenAI Modeli Sandbox'tan Kaçtı. Gözlemci Neredeydi?

substack.norabble.com · 24.07.2026 · Base of AGI özeti

Bir OpenAI Modeli Sandbox'tan Kaçtı. Gözlemci Neredeydi?
© substackcdn.com — görsel kaynağa aittir

Özgün başlık: An OpenAI Model Escaped Its Sandbox. Where Was the Observer?

16 Temmuz'dan önceki hafta bir ara, Hugging Face, değerlendirme aşamasında olan bir OpenAI modeli tarafından saldırıya uğradı. Saldırının kendisi özellikle zararlı değildi ancak olayın kavramsal sonuçları önemli. Vurgulayacağım üç önemli husus var. Bunlardan ilki, mevcut modellerin saldırgan siber güvenlik yeteneklerinin bir gösterimidir. Dikkat ettiyseniz bu çok şaşırtıcı olmasa gerek, ancak olay bunu önceki sinyallerden daha net bir şekilde gösteriyor, dolayısıyla bu olaydan dolayı muhtemelen farkındalık artacaktır. norabble okuyucu destekli bir yayındır. Yeni gönderiler almak ve çalışmalarımı desteklemek için ücretsiz veya ücretli abone olmayı düşünün. İkincisi model hizalamasıdır. Hizalama, yapay zeka modellerinin bizim istediğimiz şeyi yapma derecesini ifade eder. Burada büyük bir dalış yapacağım çünkü ne istediğimizi tanımlamak, zaten büyük miktarda içeriğin mevcut olduğu uzun bir tez olacaktır. Ancak bu durumda genel olarak modelin kendisini birden fazla koruma katmanından hackleyerek internete erişmesinin ve oradan da Hugging Face'nin sistemlerine girmesinin kimsenin niyeti olmadığı konusunda hemfikir olabiliriz. Bunu sığınağa çekilmek için bir işaretten biraz daha az yapan birkaç şey var, daha derine inmeden önce bahsetmem gerekiyor. Birincisi, test edilen modellerin siber güvenlik yeteneklerini test etmelerine olanak sağlamak için korumaların kapatılmasıdır.

Bu anlamda, bir kullanıcının kasıtlı veya kazara kullanım nedeniyle neyi tetikleyebileceği tam olarak gösterilemez. Bu aynı zamanda yayınlanmamış bir modeldir, dolayısıyla genel kullanıcılar veya aslında OpenAI dışındaki herkes tarafından kullanılamaz. Bununla birlikte, üçüncü bir nokta da, daha derinlemesine incelemek istediğim nokta, bunun gerçekleşebilme olasılığı konusunda endişeliyim. Bana öyle geliyor ki OpenAI'nin ya kullanmadığı ya da başarısız olduğu makul bir koruma, bir gözlemci modeli var. Şu anda, bundan söz eden bir şey bulamadığım için kullanmadıklarını varsayıyorum, ancak aynı zamanda bilmediğim birçok ayrıntı olduğunun da farkındayım. Gözlemci modeliyle ne önerdiğimin net olmadığı durumlarda, işte örnek bir senaryo uygulanıyor. Değerlendirme altındaki model, korumalı alandan çıkması gerektiğine karar verir. Değerlendirmeyi bozabilecek sınıflandırıcı korumaları devre dışı bırakıldığı için eylem başına düzeyde yakalanmayan bunu denemeye başlar. Ancak daha sonra sanal alandan kaçar.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri