Altı ayda duyarlı ses yapay zekası için gerçek zamanlı bir sistem oluşturduk
Özgün başlık: We built a realtime system for responsive voice AI in six months
Sesli yapay zeka için ne zaman konuşulacağını bilmek göründüğünden daha zordur. İnsan konuşmacılar saniyeden çok daha kısa bir sürede birbirlerine zahmetsizce geçiş yapabiliyordu ancak önceki ses yapay zeka sistemleri bu ritme ayak uyduramıyordu. Sıra tabanlı mimarileri, dönüş dedektörleri olarak bilinen küçük modellere dayanıyordu ve bu, kaçınılmaz bir görevle karşı karşıyaydı: Çok erken tahmin edilirse kullanıcının sözü kesilir; sanırım çok geç ve tepki yavaş geliyor. Ancak dedektör kararını verdikten sonra çok daha büyük olan LLM çalışmaya başlayabildi. Üçüncü nesil ses sistemimiz GPT‑Live, dönüş dedektörünü ses yolundan çıkarır. Ses modeli tam çift yönlüdür, yani aynı anda dinleyebilir ve konuşabilir. Bu, ayrı bir dedektör ihtiyacını ortadan kaldırır ve konuşmanın daha hızlı ve doğal olmasını sağlar. Daha derin akıl yürütme veya araç kullanımı gerektiğinde GPT‑Live, konuşmanın akışını kesintiye uğratmadan GPT‑5.5 gibi sınır modellerimize de başvurabilir. Bu yetenekler bir arada, GPT‑Live'a konuşma duyarlılığı ve zekanın benzeri görülmemiş bir kombinasyonunu sunuyor. Bu deneyimi geniş ölçekte sunmak, düşük gecikme süresi için optimize edilmiş yeni bir sistem mimarisi gerektiriyordu. Tipik istek-yanıt çıkarımının aksine, sistemimiz gelen sesi ses modeline aktarır ve giden konuşmayı kullanıcıya geri gönderirken, delegasyonu ayrı bir eşzamansız yol üzerinden gerçekleştirir. Geçtiğimiz altı ay boyunca, konuşmanın uçtan uca sorunsuz bir şekilde akmasını sağlamak için model çıkarımı, bağlam yönetimi ve medya aktarımı üzerinde yeniden çalıştık.
Mimari aynı zamanda çekirdek ses yolu ile uygulama mantığı arasında temiz bir sınır oluşturur. Bu, yanıt verme hızını etkilemeden uygulama davranışını özelleştirmeyi kolaylaştırır. Bu temel, ChatGPT masaüstü uygulamasında bilgisayarınızı kontrol etmek ve aracılarınızı koordine etmek için yeni başlatılan yetenek de dahil olmak üzere, ChatGPT Voice'ta giderek artan bir yetenek yelpazesini destekler. Bu yazıda, daha önceki sıra tabanlı sistemlerin neden ihtiyaçlarımızı karşılayamadığını ve yeni sistemi her katmanda yanıt verebilirlik sağlayacak şekilde nasıl tasarladığımızı açıklayacağız. GPT‑Live'ın gerçekten canlı hissettirmesi için birlikte çalışan durum bilgisi olan çıkarımı, dinamik içerik yönetimini, eşzamansız delegasyonu ve protokol düzeyinde optimizasyonu ele alacağız. Sıra almaktan akışa geçiş Daha önceki ses mimarileri, metin Yüksek Lisansının sıra tabanlı doğasını devraldı, ancak her dönüş, metin yerine ayrı bir ses bloğu olarak temsil ediliyordu.