Çıkarım Çipini Yeniden Tasarlamak: Nvidia GPU'nun Kusurlarından OpenAI Jalapeño'ya
Özgün başlık: Redesigning the Inference Chip: From Nvidia GPU's Flaws to OpenAI Jalapeño
Temel model bir ekibin Altyapı lideri olarak yeniden doğsaydım, kesinlikle Nvidia'nin GPU'ları ve bir bütün olarak sistem hakkında her türlü şikayetle karşılaşırdım ve sonra gidip kendi çipimi oluştururdum... Nvidia'nin ağ oluşturma kısmı için tartışılacak bir şey yok: RoCE'nin her türlü kusuru var ve DPU ayrıca bir yığın performans ve güvenlik sorunuyla birlikte geliyor. Nvidia'nin bu yıl yine Scale-in'i heyecanlandırmaya başlamasına şaşmamalı, ancak daha önce bulut çalıştırmamış bir ekibin bu alanda olgunlaşması en az 5 yıl daha alacak. Örnek olarak, yakın zamanda çevrimiçi MaaS işimizde bir şey yaptık: PD ile ayrıştırılmış bir senaryoda, taşıma protokolünü CIPU'nun eRDMA'sıyla değiştirmek, TTFT'yi %40 oranında azalttı; bu, TTFT SLA'yı korurken çok sayıda Önceden Doldurma bilgi işlem sunucusunu kaydetmeye doğrudan eşdeğerdir... GPU mikro mimarisi üzerine, geçen yıl bununla ilgili ayrıntılı bir makale yazmıştım: Inside Nvidia GPU: On the Shortcomings of Blackwell and a Prediction of Rubin's Microarchitecture (İngilizce versiyonu: https://github.com/zartbot/blog/issues/3), Nvidia'nin Blackwell mikro mimarisinin çeşitli kusurlarını eleştiriyordu. Jensen bunu NV'nin içine bile iletti... O zamanlar SM'nin planlama için süperskalar bir çekirdek eklemesini önermiştim - ve işte, OpenAI'nin Jalapeño'sunda artık bir tane var.
Nvidia ile gündeme getirdiğim başka bir sorun: GPU mimarinizde, büyük miktarda L2 Önbelleği çok fazla kalıp alanı kaplıyor, ancak bunun üzerinde herhangi bir kontrol uygulamak çok zor görünüyor, önbellek hiyerarşisi oldukça kalın ve UMA'yı korumak için iki L2 Bölümüne etkili bir şekilde 200~400 gecikme döngüsü eklersiniz; bunun da ötesinde, harici G/Ç etkileşimleri doğrudan SMEM'e yazılamamaktadır. Artık sorun çözüldü — OpenAI'den Jalapeño L2 Önbelleğini kesti.