Eski OCR metni dil modeli eğitimini sekteye uğratıyor ve FineBooks bunu geniş ölçekte düzeltmek istiyor

Özgün başlık: Old OCR text cripples language model training, and FineBooks wants to fix that at scale
Hugging Face ve EleutherAI'nin FineBooks projesi, 2.000'den fazla tarihi kitap sayfasında 14 açık kaynaklı OCR modelini test etti. En üst model olan dots.mocr, bin sayfa başına iki doların altında bir maliyetle yüzde 97,6 karakter doğruluğuna ulaşıyor. Ekip, bunun yapay zeka eğitim verileri için yeterince iyi olduğunu ancak bilimsel transkripsiyonlar için henüz yeterli olmadığını söylüyor. Eski OCR metni makalesi, dil modeli eğitimini sekteye uğratıyor ve FineBooks, The Decoder'da ilk kez ortaya çıkan bunu geniş ölçekte düzeltmek istiyor.
✳ Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗
Akış içinde yorumlarla aç