Kog, GPU'lardan daha fazla çıkarım elde etmek için daha derine gidiyor

Özgün başlık: Kog is going deeper to squeeze more inference out of GPUs
Daha hızlı yapay zeka çıkarımına yönelik yarış devam ediyor ve pazarlar, Mayıs ayındaki ilk halka arzında Cerebras'a ve onun amaca yönelik tasarlanmış çiplerine sıcak bir karşılama sundu. Ancak Fransız girişim Kog, geleneksel GPU'lardan çok daha fazla güç elde edilebileceğine inanıyor. Girişim, Mayıs ayında Hacker News ön sayfasına, demo için kullandığı AMD MI300X ve Nvidia H200 GPU'lar gibi "şirketlerin zaten sahip olduğu standart veri merkezi GPU'larında son derece hızlı tek istek kod çözmenin mümkün olduğunu" kanıtlamayı amaçlayan bir teknoloji önizlemesiyle çıktı. Bazıları bunun dizüstü bilgisayarlarımızdaki GPU'ları kapsamadığını duyunca hayal kırıklığına uğradı, ancak diğerleri potansiyeli gördü. Çıkarım hızı ve maliyetlerin artık kritik bir darboğaz haline gelmesiyle, Kog'un yazılım optimizasyonu ile mevcut donanımdaki yeni yeteneklerin kilidini açma vaadi izleyicilerden daha fazla ilgi gördü. CEO Gaël Delalleau, TechCrunch'a "200 somut iş fırsatımız vardı" dedi. İlk geri bildirimlere dayanarak, tek kurucu, yazılım mühendisliğinin ilk kullanım durumu olmasını bekliyor. Kıdemli Claude Code kullanıcıları bazen sonuç almak için saatlerce beklemek zorunda kaldıklarının bilincindedirler. Anthropic, hızın paraya değer olduğunu biliyor ve Claude'nin Hızlı Modu için birden fazla fiyat talep ediyor. Kog, genellikle profesyonel görevler için yapay zeka iş akışlarına güvendikleri için bu gecikmelerden dolayı ertelenen müşterileri hedeflemeyi umuyor.
Ancak Delalleau, girişimin aynı zamanda kullanıcıların anında oyun ve uygulama oluşturmasına olanak tanıyan ve Kog Inference Engine (KIE) sayesinde daha hızlı bir sonucun daha fazla gelir anlamına geleceği tasarım ortaklarına da sahip olduğunu söyledi. Şirket bu pazarın henüz tam olarak olgunlaşmadığının farkında. Kog, talebi gözlemlerken potansiyel müşterilerinin küçük modellere ince ayar yapmaya hazır olmadığını öğrendi. "İşte bu nedenle lansmandan bu yana, gördüğümüz talebi karşılamak için daha büyük modellerin geliştirilmesini hızlandırmaya tamamen odaklandık." Bu, Kog'a "30 kat daha hızlı LLM çıkarımı" vaadini yerine getirmek için yapması gereken büyük bir adım bırakıyor. Demosu, saniyede 3.000 istek başına jeton (TPS) gibi etkileyici bir rakam gösterdi; ancak yalnızca 2 milyar parametreye sahip, amaca yönelik olarak oluşturulmuş küçük bir model olan, artık açık kaynaklı Laneformer 2B'yi içeriyordu. Delalleau, şüphecilerin aksine, aynı yaklaşımın, boyutları çıkarım çipleri için zorluk oluşturabilecek yüksek lisans eğitimlerinde de işe yarayacağından emin. "GPU'ların parlak bir geleceği var" dedi.