OpenAI'in yeni muhakeme tekniği yapay zeka güvenlik uzmanlarını alarma geçirdi

Özgün başlık: OpenAI’s new reasoning technique alarms AI safety experts
The Information'ın Salı günü bildirdiğine göre, OpenAI'in yeni Astra modeli, çoğu akıl yürütme modelini karakterize eden sıralı düşünmenin dışında çalışmasına olanak tanıyan, yinelenen derinlik adı verilen bir akıl yürütme tekniği kullanacak. "Opak yineleme" olarak da adlandırılan bu teknik, muhtemelen modelin düşünce zincirinin izlenmesini daha zor hale getirecek ve bu da yapay zeka güvenlik uzmanlarını şaşırttı. Astra'nın bu tekniği kullanımının sınırlı olduğu bildirilse de, bu tekniğin ortaya çıkışı hala yapay zeka güvenlik uzmanları arasında önemli endişelere yol açıyor. Redwood CEO'su Buck Shlegeris, haber çıktıktan sonra yaptığı bir paylaşımda, Astra'nın opak yineleme kullandığına dair raporlardan son derece endişe duyuyorum" dedi ve şöyle devam etti: "Astra'nın önceki modellere göre CoT'nin çok daha az izlenebilir olup olmadığını bilmiyorum. Ancak OpenAI bu tekniği daha da ileri götürürse, tekrarlamayı büyük ölçüde artırma seçeneğine sahip olacaklar ve CoT izlenebilirliğini tamamen yok edecekler." Uzun zamandır yapay zeka güvenliği savunucusu Zvi Mowshowitz de konuya ağırlık verdi ve yapay zeka laboratuvarları arasında "dibe doğru yarışı" önlemek için yasaların gerekli olabileceğini yazdı. Mowshowitz, "Teknik ateşle oynamak, OpenAI ve Anthropic'nin Düşünce Zinciri sadakatini ve izlenebilirliğini mümkün olduğu kadar uzun süre korumak için çok çalıştığımızı belirlemek için mücadele ettiği bir tabuyu riske atmaktır" diye yazdı Mowshowitz. "Bu tür tekniklerin daha yoğun kullanılması muhtemelen izlenebilirliğe zarar verecektir." Normal koşullar altında, bir akıl yürütme modelinin düşünce zinciri, modelin bir sorunu çözmeye çalışırken attığı sıralı adımları sağlar.
Gösterim kusurlu olsa da, hatalı davranışı veya yanlış hizalamayı izlemek için hala değerli bir araç olarak hizmet vermektedir. OpenAI'in yakın zamandaki haydut ajan faaliyeti durumunda, düşünce zinciri kayıtları, ajanların neden bu şekilde davrandığını ortaya çıkarmada önemli bir araçtı. Opak yinelemede model daha az doğrusal bir yaklaşım benimser ve aynı sorguyu bir döngü içinde birkaç kez işler. Sonuç, daha az okunaklı iz bırakarak, geleneksel düşünce zinciri kayıtlarını etkili bir şekilde bir kenara atıyor. En önemlisi, Astra'nın tekniği kullanımının sınırlı olduğu görülüyor.