Siber kritik yeteneklerin olduğu bir çağda model geliştirmenin hızı
Özgün başlık: Pacing model development in an era of cyber-critical capabilities
Geçtiğimiz birkaç hafta boyunca, iki gelişme, giderek daha yetenekli hale gelen yapay zeka sistemleriyle ilişkili artan risklerin altını çizdi: OpenAI-Hugging Face olayı ve ayrıca, gelecek modellerimizden biri olan Astra'nın Hazırlık Çerçevemiz kapsamında Kritik siber güvenlik yeteneği eşiğini karşılayabileceğine dair ön kanıtlar. Bu gelişmeler, şirket içi araştırmalarımızdaki hızlı ilerlemeyle birleştiğinde, eğitim sürecinin tüm aşamalarında izleme, uyum ve sınırlama önlemlerimizi güçlendirme çalışmalarımıza aciliyet kattı. Modeller daha yetenekli hale geldikçe, bunları şirket içinde geliştirme ve test etmeyle ilgili riskler de artar. İzleme, uyum ve güvenlik standartlarımız bu risklerin ilerisinde kalmalıdır. Bu standartları karşılamak için gerekli zamanı ayırmak istedik ve bu nedenle ölçeklendirme hızını geçici olarak yavaşlattık. Bu, araştırma ortamlarımızı daha da sağlamlaştırıp yeniden gruplandırırken ve izleme sistemlerimizin kapsamını genişletirken, dağıtıma yönelik en son modellerimiz üzerine takviyeli öğrenme (RL) eğitimine iki haftalık bir duraklamayı da içeriyordu. Devam etmeden önce model davranışını değerlendirmek, korumalarımızı doğrulamak ve uyumun daha fazla kanıtını oluşturmak için daha küçük ölçekli eğitim ve değerlendirmeler yürütürken, planlanan en büyük sınır RL çalışmamız beklemede kalıyor. Yapay zeka sistemlerinin amaçlandığı gibi davranmasını ve insan gözetimine duyarlı olmasını sağlama işi olan hizalama, uzun süredir araştırma programımızın merkezinde yer alıyor.
Halihazırda devam eden araştırma ve değerlendirmelere dayanarak, artık tüm eğitim boyunca uyumlu davranışlara ilişkin daha güçlü kanıtlara ihtiyacımız var. Giderek daha yetenekli olan sistemleri uyumlu tutmak, tüm alanın ele alması gereken bir zorluktur. Yaklaşan model ilerlemesinden gördüğümüz sinyaller, mevcut Hazırlık Çerçevesini temel alan ve ötesine uzanan daha geniş bir yaklaşıma ihtiyacımız olduğunu açıkça ortaya koyuyor. Yaklaşımımızın nasıl değiştiği konusunda şeffaf olmanın önemli olduğunu düşünüyoruz. Aşağıda araştırma süreçlerimizde ve altyapımızda yaptığımız değişiklikleri ve halen devam eden çalışmalarımızı anlatıyoruz. Daha yetenekli modeller için önlemlerin güçlendirilmesi Daha yetenekli modeller geliştirmeye yönelik yaklaşımımız, üç takviye edici önlem üzerine kuruludur: 1. İlgili davranışı tespit eden ve yanıt vermemizi sağlayan izleme. 2. Zararlı veya yetkisiz eylemlerin olasılığını azaltan hizalama. 3.