GPT 5.6 Sol şimdiye kadar piyasaya sürülen en iyi "vizyon" modelidir OpenAI

Özgün başlık: GPT 5.6 Sol is the best "vision" model OpenAI ever released
Geçen hafta OpenAI Sol, Terra ve Luna modellerini tanıtan GPT-5.6 serisini duyurdu. Yayın akışı sırasında ekip, ağırlıklı olarak bilgisayar kullanımına odaklandı ve masaüstü uygulamalarda gezinebilen ve çalıştırabilen modelleri gösterdi. OpenAI vurgulanan kullanıcı arayüzü aracıları ve ayrıntılı 3D görselleştirmeler, ancak her ikisi de daha güçlü görsel anlayışa bağlıdır. Görüş yeteneklerini ölçmek için modelleri, önümüzdeki birkaç hafta içinde yayınlamayı planladığımız, yakında yayınlanacak olan VLM kıyaslamamız aracılığıyla test ettik. Karşılaştırma, algılama, sayma, OCR ve veri çıkarma dahil olmak üzere ortak görüş görevlerini kapsar. Bu yazıda GPT-5.6'nın her birinde nasıl performans gösterdiğine daha yakından bakacağız. Sol, OpenAI'nin şu ana kadar çıkardığı en iyi görme modelidir. Bu sıçrama özellikle GPT-5.5'in en güçlü VLM'lerin çok gerisinde olduğu nesne algılama ve saymada açıkça görülüyor. Terra ve Luna, Sol kadar güçlü değil ancak her ikisi de GPT-5.5'e göre anlamlı ilerleme gösteriyor. Roboflow Playground'da Sol, Terra ve Luna'yı test edin ve sonuçlarını aynı görüş görevlerinde Claude Fable 5 ve Gemini 3.5 Flash gibi modellerle karşılaştırın. Tespit, GPT-5.6'nın en net sıçramayı gösterdiği yerdir. GPT-5.5, kıyaslamamızda 13,8 mAP@50 puan alırken, Sol 46,2'ye ulaştı. Terra ve Luna da onları 44.7 ve 43.3 ile yakından takip ederek nesne tespitini büyük bir zayıflıktan pratik bir yeteneğe taşıdı. Belge düzeni tespiti, GPT-5.6'nın en güçlü yönlerinden biridir. Sol başlıkları, paragrafları, tabloları, görselleri ve imzaları iyi bir şekilde ele aldı.
Çoğu belge iş akışı, OCR veya veri çıkarma başlamadan önce sayfanın ilgili bölümlerinin bulunmasıyla başlar. GPT-5.6 yoğun sahnelerde de iyi performans gösterdi. Hap ve yumurta örnekleri, birbirine yakın paketlenmiş birçok benzer nesne içeriyor; bu, VLM tabanlı tespit için ortak bir zayıflıktır. Geleneksel dedektörlerin aksine, VLM'ler her sınıf etiketini ve koordinat kümesini metin olarak oluşturur. Nesne sayısı arttıkça yanıt süresi uzar ve gözden kaçan nesneler, kopyalar veya koordinat hataları riski artar. Buna rağmen Sol her iki sahnede de çoğu nesneyi tespit etti. En iyi algılama sonuçları için GPT-5.6 modellerinin görüntü pikselleri cinsinden mutlak XYXY koordinatlarını döndürmesini isteyin. Bu, 0–1000 aralığına normalleştirilmiş YXYX koordinatlarıyla en iyi performansı gösteren Gemini 3,5 Flash'tan farklıdır.