← Tüm AI haberleri

Açık Kaynak

Açık ASR Lider Tablosu İlk Küresel Güney Dilini Ekliyor

huggingface.co · 28.08.2026 · Base of AGI özeti

Açık ASR Lider Tablosu İlk Küresel Güney Dilini Ekliyor
© huggingface.co — görsel kaynağa aittir

Özgün başlık: The Open ASR Leaderboard Adds Its First Global South Language

Voice Arena ve Hugging Face iş ortağı, Hintçe ve Hint İngilizcesi Karşılaştırmaları için açık ASR değerlendirmesini başlatacak ve nelerin geliştirileceğine karar verecek. Açık ASR Liderlik Tablosunda iyi puan alan bir model benimsenip yinelenirken, liderlik tablosunun ölçmediği yetenekler gelişmeme eğiliminde olur. Liderlik tablosunda yapılan son çalışmaların çoğu, değerlendirme ölçütlerini daha güvenilir hale getirmeye yöneliktir: 1. Uzatılmış özel bölünmeler. 2. Ne kadar modelin yalnızca ses üzerine yazıya dökmek yerine referans transkriptlerini yeniden ürettiğini ölçmek için karşılaştırmalı değerlendirme analizi. 3. Doğru tahminlerin/varyantların cezalandırılmamasını sağlamak için normalleştiricilerdeki boşlukların kapatılması. Bütün bunlar bir sayının (WER) oynanmasını zorlaştırıyor. Hala tek numara. Uzun bir çalışma dizisi, ASR hata oranlarının bunları kullanan kişiler arasında eşit şekilde dağılmadığını göstermiştir. Otomatik konuşma tanımadaki ırksal eşitsizlikler, ticari sistemlerin Siyah konuşmacılar için beyaz konuşmacılara göre kabaca iki kat daha kötü olduğunu ortaya çıkardı ve Otomatik Konuşma Tanıma'da Önyargıların Ölçülmesi cinsiyet, yaş ve aksan açısından daha fazla farklılık buldu. Bunların hiçbiri skor tablosunda görünmüyor ve skor tablosu onu gizlediği için değil. Test, söylenenlerin kayıt altına alınmasını ve bunu kimin söylediğine dair neredeyse hiçbir şeyin kaydedilmemesini sağlar. Bu boşluğu gidermek için Açık ASR Skor Tablosuna iki değerlendirme seti sunuyoruz: Muson en-IN ve Muson hi-IN.

Yarım milyardan fazla insan tarafından konuşulan Hintçe, şu anda yalnızca Avrupa dillerini kapsayan çok dilli bir sekmede yer alan ilk Hint dilidir. Her set, kendi kendine puanlamaya uygun, herkese açık bir bölüm olarak yayınlanır ve karşılaştırmaya özgü optimizasyonu sınırlamak için özel bir bölüm gizlenir. Dört bölüm, her biri için 12 hoparlör özelliğinin kaydedildiği 4.888 hoparlörden oluşan, hoparlörden ayrıktır. Koleksiyonun tasarımı Bir test seti yalnızca kendi içinde değişiklik gösteren bir arıza modunu ortaya çıkarabilir. Çoğu kıyaslama, halihazırda mevcut olan seslerden oluşturulmuştur. Muson dokuz eksende farklılık gösterecek şekilde tasarlandı: coğrafya, yaş, cinsiyet, kelime dağarcığı, cihazlar, akustik ortamlar, konuşma türü, konuşma hızı ve aynı ses için birden fazla geçerli transkripsiyonun varlığı. Her biri, toplam WER'nin belirli bir popülasyon için ortalama olarak doğru ve yanlış olabileceği bir yoldur. Toplama yöntemi bundan kaynaklanmaktadır. Coğrafya, daha az yerde daha uzun oturumlar kaydetmek yerine yüzlerce bölgeden işe alım yapılmasıyla elde edilir.

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri