← Tüm AI haberleri

Türkçe

Anthropic'in Claude deneyi, kendi kendini geliştiren yapay zekaya kapı aralıyor

webrazzi.com · 31.08.2026 · Base of AGI özeti

Anthropic'in Claude deneyi, kendi kendini geliştiren yapay zekaya kapı aralıyor
© cdn.webrazzi.com — görsel kaynağa aittir

Anthropic , yapay zeka modellerinin geliştirilmesinde insan araştırmacıların üstlendiği görevlerin giderek daha büyük bir bölümünü yapay zekaya devretmenin mümkün olabileceğini gösteren yeni bir araştırma yayımladı. Şirketin Automated Alignment Researcher (AAR) adını verdiği sistem, mevcut araştırmaları inceleyerek eğitim yöntemleri oluşturuyor, modelleri eğitiyor, sonuçları değerlendiriyor ve başarılı yöntemleri yeni deneylerde kullanıyor.

Anthropic'in çalışması, özellikle yapay zeka modellerinin güvenlik ve davranış problemlerini azaltmaya odaklanıyor. Claude tarafından yönetilen araştırma sistemi; aldatma, aşırı kullanıcı onayı yani sycophancy, jailbreak'ler, gizlilik ihlalleri ve reward hacking gibi toplam 10 farklı uyum sorununu ele aldı. Sistem her bir sorun için akademik literatürü taradı, olası yöntemler geliştirdi, eğitim verisi oluşturdu ve yaklaşık 30 dakikalık eğitim deneyleri gerçekleştirdi. Başarılı yöntemler sonraki iterasyonlarda korunurken düşük performans gösteren yaklaşımlar elendi.

Araştırmanın sonuçlarına göre Claude, incelenen 10 uyum probleminin tamamında model performansını iyileştiren yöntemler geliştirmeyi başardı. Üstelik bu iyileştirmeler modellerin genel yeteneklerinde ölçülebilir bir düşüş yaratmadı. Geli��tirilen en başarılı yöntemlerin, araştırma sırasında Claude'a gösterilmeyen testlerde ve çok turlu saldırı senaryolarını değerlendiren Petri testlerinde de etkili olduğu belirtiliyor. Aynı yöntemlerin, üzerinde geliştirildikleri modellerden 4,7 kata kadar daha büyük modellerde de işe yaradığı ifade ediliyor.

Çalışmanın dikkat çeken bölümlerinden biri ise Claude Sonnet 5 ile Claude Opus 4.8 arasında gerçekleştirilen deney oldu. Anthropic, Sonnet 5'e henüz şirketin kapsamlı güvenlik eğitiminden geçmemiş erken bir Claude Opus 4.8 sürümünü verdi ve modeldeki uyum problemlerini azaltmasını istedi.

Claude Sonnet 5 yaklaşık 60 saat içinde 50'den fazla çözümü deneyerek erken Opus 4.8 sürümünün güvenlik performansını, üretimde kullanılan Opus 4.8 modeline oldukça yaklaştıran bir eğitim yöntemi geliştirdi. Kazanan yöntem yaklaşık 2 bin 400 eğitim örneğinden oluşmaktaydı. Anthropic'e göre bu yaklaşım şirketin üretimde kullandığı uyum eğitim sürecine kıyasla yaklaşık 15 bin kat daha verimliydi.

Buna ek olarak araştırmada yapay zeka araştırmacılarının performansının insan araştırmacılarla da karşılaştırıldığını belirtelim.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri