Uzmanlar, Anthropic'in Fable'ını istismar etmenin Kimi K3'ün bu kadar iyi olmasının yolu olmadığını söylüyor

Özgün başlık: Experts say exploiting Anthropic s Fable isn t how Kimi K3 got so good
Beyaz Saray bilim danışmanı Michael Kratsios, mevcut en büyük açık ağırlıklı LLM olan Kimi K3'ün arkasındaki Çinli şirket olan Moonshot'nin, Çin'e ihracat için izni olmayan çipleri kullanırken Anthropic'nin Fable LLM'sini kopyalayarak modelini oluşturduğunu söyledi. Kratsios, yapay zeka sektörünü rahatsız eden Çin açık ağırlık modellerinin yasaklanmasıyla ilgili bildirilen tartışmaların ortasında, ABD'nin tescilli teknolojisini çalmayı ve Amerikan araştırmalarını baltalamayı amaçlayan büyük ölçekli, gizli endüstriyel damıtma işleminin kabul edilemez olduğunu yazdı. Moonshot eğitim süreciyle ilgili sorulara yanıt vermedi ve Kratsios, iddialarının kaynakları hakkında daha fazla ayrıntı paylaşmadı. Kratsios'un tweet'i, Hazine Bakanı Scott Bessent'in Çin modellerinin çoğunda ABD büyük dil modellerimizin filigranlarını bulduğumuz ve bunun kabul edilemez olduğu yönündeki yorumlarını yineledi. Bu filigranların neyden oluştuğu belli değil ve Hazine Bakanlığı da bu soruya yanıt vermedi. Ancak uzmanlar, Kimi K3'ün gösterdiği gelişmiş yeteneklerden damıtmanın (bir LLM'nin iç işleyişini belirlemek ve yeteneklerini kopyalamak için sorgulama süreci) sorumlu olduğu konusunda şüpheci. Laude Enstitüsü'nden araştırmacı ve Snorkel AI'nin kurucu ortağı Braden Hancock, TechCrunch'a verdiği demeçte, Fable'ın sıkı bir şekilde damıtma yapmasının ardından bu kadar güçlü ve bu kadar hızlı bir model elde edebileceğinizi düşünmüyorum. Açıkçası vaktimiz bile yok, değil mi? Masallar yalnızca 1 Temmuz'dan beri halka açıktı.
Bu kadar çok veriyi ayrıştırıp, bir modeli eğitip iki hafta içinde yayınlayamazsınız. Allen Yapay Zeka Enstitüsü'nden yapay zeka araştırmacısı Nathan Lambert, dün yayınlanan bir podcast'te, Çin modelleri sınıra yaklaştıkça ve eğitim rejimi [pekiştirmeli öğrenmeye] değiştikçe, damıtmanın zaman içinde giderek daha az etkili hale geldiği görüşündeyim. [I]Eğer durum böyle olsaydı, herkes verilerini damıtma için kullanarak bir GLM'ye veya K3'e kolayca yetişebilirdi. Ancak bunu yalnızca denetimli ince ayar nedeniyle görmedik veya görmeyeceğiz. Damıtmanın gerçekleştirilmesi, bir laboratuvarın eğitim sonrası için kullanılabilecek verileri üretmek amacıyla hedef modelini sistematik olarak sorgulamasını gerektirir. Bazen bu açıkça modelden sorunları nasıl çözdüğünü anlamak için düşünce zincirini ifade etmesini istemeyi içerir.