Tescilli LLM API'lerinden Muhakeme İzlerini Çalmak
Özgün başlık: Stealing Reasoning Traces from Proprietary LLM APIs
Alexander Panfilov 1 2 3 4 * David Schmotz 2 3 4 * Ilia Shumailov 5 * Luca Beurer-Kellner 6 Joachim Schaeffer 1 Ameya Prabhu 2 4 7 ‡ Jonas Geiping 2 3 4 ‡ Maksym Andriushchenko 2 3 4 ‡ *Eşit katkı, zar atışına göre sıra belirlenir · ‡Eşit denetim Model sağlayıcılar, bir modelin gerekçesini istemciye şifrelenmiş bir blok olarak geri gönderir ve konuşma devam ettiğinde bu blok sunucuya geri gönderilir. Bu bloklar taşınabilirdir: orijinal bağlamlarının dışında tekrar oynatılabilirler. Birini aynı sağlayıcıdan daha zayıf, jailbreak'li bir modele enjekte etmek, daha güçlü modelin ham mantığını kelimesi kelimesine çıkarmamıza olanak tanır. Bunu OpenAI, Anthropic ve Google'ın sınır modellerinde gösteriyoruz. Kodu çözülmüş akıl yürütme, API tarafından bildirilen gizli düşünme belirteçlerinin sayısını yakından takip eder.