← Tüm AI haberleri

Türkçe

Meta, birden fazla konuşmacıyı ve dili ayırt edebilen Muse Voice Transcribe'ı tanıttı

webrazzi.com · 02.09.2026 · Base of AGI özeti

Meta, birden fazla konuşmacıyı ve dili ayırt edebilen Muse Voice Transcribe'ı tanıttı
© cdn.webrazzi.com — görsel kaynağa aittir

Meta, ilk gerçek zamanlı ses algılama modeli Muse Voice Transcribe 'ı kullanıma sundu. Meta Superintelligence Labs tarafından geliştirilen model; konuşmayı metne dönüştürme, farklı konuşmacıları ayırt etme ve bir kişinin konuşmasını ne zaman tamamladığını belirleme görevlerini tek bir sistem içinde gerçek zamanlı olarak gerçekleştiriyor.

Muse Voice Transcribe'ın öne çıkan özelliklerinden biri, uzun ve kalabalık konuşmaları işleyebilmesi. Model, bir saati aşan ses kayıtlarını ve 20'den fazla konuşmacının yer aldığı görüşmeleri ek bir işlem aşamasına ihtiyaç duymadan metne dönüştürebiliyor. Konuşmacı günlüğü oluşturma olarak da bilinen "speaker diarization" özelliği sayesinde sistem, konuşmanın hangi bölümünün kim tarafından söylendiğini belirleyerek metni konuşmacılara göre ayırıyor.

Model 70'ten fazla dil kullanılarak eğitildi. Meta, bunlardan 25'inin ilk sürüm öncesinde kapsamlı biçimde doğrulandığını belirtiyor. Muse Voice Transcribe, farklı dillerin aynı konuşma veya cümle içinde kullanıldığı durumları da algılayabiliyor. Böylece iki dilli kişilerin günlük konuşmalarında sıkça görülen, cümlenin ortasında başka bir dile geçme alışkanlığı metne doğrudan yansıtılabiliyor. Dil, anahtar kelime ve bağlam bilgileri kullanılarak özel isimler ya da belirli terimlerin daha doğru tanınması da sağlanabiliyor.

Muse Voice Transcribe, konuşmaları 80 milisaniyelik bölümler halinde işliyor. Sistem her bölümde biraz daha dinlemeye devam etmek veya duyduğu içeriği metne aktarmak arasında karar veriyor. Meta'nın "uyarlanabilir gecikme" adını verdiği bu yaklaşım, kolay anlaşılan kelimelerin hızlı biçimde yazıya geçirilmesini; daha zor kelimelerde ise modelin ek ses bağlamını beklemesini sağlıyor. Böylece hız ile doğruluk arasındaki dengenin her kelime için ayrı ayrı kurulması hedefleniyor.

Modelin konuşmanın başlangıç ve bitiş noktalarını kendi başına belirleyebilmesi, sesli komutlarla çalışan uygulamalar açısından da önem taşıyor. Sistem, kullanıcının durakladığı anlarla konuşmasını tamamen bitirdiği anları ayırt ederek yanıtın ne zaman üretilmesi gerektiğine karar verebiliyor.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri