OpenAI'ın Astra modelinde kullandığı yeni akıl yürütme tekniği güvenlik endişelerini artırdı

OpenAI 'ın henüz kullanıma sunulmayan yeni yapay zeka modeli Astra , gelişmiş siber güvenlik yeteneklerinin yanı sıra kullandığı öne sürülen yeni akıl yürütme yöntemiyle de tartışma yaratıyor. Astra'nın "recurrent depth" olarak adlandırılan ve modelin düşünme sürecinin bir bölümünü gözlemlenmesi daha zor hale getiren bir teknik kullandığı belirtiliyor . Yapay zeka güvenliği araştırmacıları ise "opaque recurrence" olarak da adlanırılan bu yaklaşımın, modellerin davranışlarını denetlemeyi giderek zorlaştırabileceği konusunda uyarıyor.
The Information tarafından paylaşılan bilgilere göre Astra, "recurrent depth" ya da "looped transformer" olarak tanımlanan bir yöntemden yararlanıyor. Geleneksel akıl yürütme modellerinde işlemler büyük ölçüde sıralı biçimde ilerlerken, bu yöntemde bilgiler modelin iç katmanları arasında birden fazla kez dolaştırılabiliyor. Böylece model, aynı problem üzerinde daha fazla hesaplama gerçekleştirebilirken akıl yürütme sürecinin daha büyük bir bölümü doğal dille ifade edilen düşünce zincirinin dışında gerçekleşebiliyor.
Konunun merkezinde düşünce zincirinin (chain-of-thought) izlenebilirliği yer alıyor. Günümüzde gelişmiş akıl yürütme modellerinin oluşturduğu ara düşünce adımları, araştırmacıların modelin istenmeyen bir davranış geliştirip geliştirmediğini anlamasında önemli araçlardan biri olarak görülüyor. Örneğin bu kayıtlar, bir modelin güvenlik önlemlerini aşmaya çalışıp çalışmadığını veya kullanıcıdan sakladığı farklı bir strateji geliştirip geliştirmediğini tespit etmek için kullanılabiliyor. OpenAI'ın daha önce gerçekleştirdiği otonom ajan testlerinde de düşünce zincirlerinin modellerin neden belirli davranışlar sergilediğini anlamada önemli rol oynadığı belirtiliyor.
Recurrent depth yaklaşımında ise hesaplamanın daha büyük kısmının modelin kendi iç temsilleri içinde gerçekleşmesi, güvenlik sistemlerinin inceleyebileceği okunabilir düşünce izlerini azaltabilir. Redwood Research baş bilim insanı Ryan Greenblatt , yaklaşımın daha geniş ölçekte kullanılması halinde modellerin akıl yürütmesinin büyük bölümünün görünür kanalların dışına taşınabileceğini düşünüyor .