CPU'nun Geri Dönüşü Başımızda

Özgün başlık: The CPU Comeback Is Upon Us
Bu yılın başında Amazon Web Services'in liderleri mühendislerine yeni bir görev verdi: Her ne pahasına olursa olsun CPU döngülerini korumaları gerekiyor. AI iş yüklerinin şirketin bulut altyapısını zorlaması nedeniyle AWS'nin CPU sunucu kapasitesinde bekleme sürelerinde bir patlama yaşadığı bildirildi. Görünüşe göre bu sorun AWS'yi hazırlıksız yakaladı ve bunun iyi bir nedeni var. Yapay zeka patlaması GPU'lara ve daha sonra belleğe olan talebin artmasına neden oldu. CPU'lar çoğunlukla hikayenin dışında bırakıldı, çünkü göreceli paralelleştirme eksikliği, onları AI modeli çıkarımı, yani büyük dil modellerini (LLM) çalıştırma ve kullanıcılara sunma süreci için yetersiz bir uyum haline getirdi. Ancak yapay zeka modellerinin özerk bir şekilde çalışmasına ve alt aracılara çağrı yapmasına olanak tanıyan aracılı yapay zeka sistemlerinin yükselişi, anlatıyı değiştiriyor. Moor Insights & Strateji'nin başkan yardımcısı ve baş veri merkezi analisti Matt Kimball, 2026'nın CPU talebinde büyük bir artışa yol açtığını ve bunun çoğunun ajansal yapay zekadan kaynaklandığını söylüyor. Kimball, "Bu temsilci iş yüküne sahip olmak bir şeydir ve diyelim ki 100 temsilci ortaya çıkıyor. Bunu işletmemin geneline yayacaksam, bu 100 kişi on binlerce, yüz binlerce veya milyonlarca temsilciye dönüşecek" diyor.
"Alt aracılar oluşturan, [uygulama programlama arayüzü (API)] aramaları yapan ve [Anthropic'nin] model bağlam protokolü aracılığıyla daha fazla aracıyla konuşan aracılarınız var." Yapay zeka temsilcilerinin bilgisayarları kullanması gerekiyor ve bilgisayarların da CPU'ları olması gerekiyor Kimball'ın yorumları kısmen "araç kullanımı"na atıfta bulunuyor; bu, bir Yüksek Lisans Yüksek Lisansının internete erişme, masaüstündeki dosyaları açma ve genellikle görevini gerçekleştirmek için çeşitli yazılımlar kullanma yeteneğinin kısaltmasıdır. Araç kullanımı konusunda eğitim almış Yüksek Lisans'lar diğer yazılımları nasıl çağıracaklarını öğrenirler. LLM'nin çıkarımı hâlâ öncelikle bir GPU veya benzer bir yapay zeka hızlandırıcı üzerinde yürütülürken, LLM'nin yaptığı araç çağrıları genellikle CPU'ya iletilir. Intel'de kıdemli personel araştırma bilimcisi olan Souvik Kundu, "Ajanlı bir yapay zeka görevinin birçok bileşeni doğası gereği CPU tabanlı işlerdir" diye açıklıyor.