Edge için Daha İyi ve Daha Hızlı Görme Yetenekleri için LFM2.5-VL-3B

Özgün başlık: LFM2.5-VL-3B for Better and Faster Vision Capabilities for the Edge
Makalelere Geri Dön LFM2.5-VL-3B, kendi donanımınızda çalıştırabileceğiniz en yetenekli görüntü dili modelimizdir. Belgeleri ve ekranları aynı şekilde anlar, nesneleri temellendirir ve araçları çağırabilir. Muhakeme yapmak yerine doğrudan yanıt verir, böylece yanıtlar gerçek zamanlı ve cihazdaki uygulamalarda hızlı kalır. LFM2.5-VL-3B, önceki sürümlerimizin görüş dili yeteneklerini dört önemli iyileştirmeyle genişletiyor: Ekran/UI anlayışı: Farklı cihazlardaki dijital ekranların güçlü şekilde anlaşılması. Topraklama: Doğal dil sorgularıyla iyileştirilmiş topraklama ve nesne algılama. Çoklu görüntü girişi: Birden fazla görüntü arasında iyileştirilmiş mantık yürütme. İşlev çağrısı: Yalnızca metin ve görüntü metni durumlarında işlev çağrısında önemli ölçüde daha güçlü. En yetenekli görüntü dili modelimiz LFM2.5-VL-3B'yi nasıl eğittik, SigLIP2 400M NaFlex görüntü kodlayıcıyı LFM2.5-2.6B metin modelimizle aynı önceden eğitilmiş omurgayla eşleştiriyor. Önceden eğitilmiş ve sentetik görüntü altyazısı, OCR, topraklama ve talimat takip setlerinden alınan öncekine göre 4 kat daha fazla görüş verisine sahip yaklaşık 34 token üzerinde önceden eğitilmiştir. Latince olmayan alfabeleri desteklemek için, sıfırdan yeniden eğitmek yerine tokenizer'ı yerinde genişleterek kelime dağarcığını ikiye katlayarak 128K'ya çıkardık. Eğitim sonrası eğitim iki aşamadan oluşur: İlki, daha büyük bir öğretmenden bilgi aktarımı ve Antidoom eğitimi ile denetimli ince ayardır (SFT). İkincisi, çoklu ödüllü takviyeli öğrenmedir (RL). Karşılaştırma sonuçları LFM2.5-VL-3B'yi hem görüntü hem de metin karşılaştırmalarında değerlendirdik.
Görme kriterleri, çok dilli görsel anlama, talimat izleme, görsel matematik ve bilimsel akıl yürütme, belge anlama, nesne algılama, çoklu görüntü anlama ve ekran anlama konularını kapsamaktadır. LFM2.5-VL-3B, gerçek dünyadaki görüntü görevlerinde boyut sınıfında lider olurken aynı zamanda belgelerden ve tablolardan ekrandaki kullanıcı arayüzü öğelerine kadar dijital içeriği iyi bir şekilde okur.