← Tüm AI haberleri

AI

Qwen3.8 Max, Claude Opus 4.8'i yakalıyor ancak Kimi K3 hala yüzde 25 daha az puanla daha yüksek puan alıyor

the-decoder.com · 06.08.2026 · Base of AGI özeti

Qwen3.8 Max, Claude Opus 4.8'i yakalıyor ancak Kimi K3 hala yüzde 25 daha az puanla daha yüksek puan alıyor
© the-decoder.com — görsel kaynağa aittir

Özgün başlık: Qwen3.8 Max catches Claude Opus 4.8 but Kimi K3 still scores higher for 25 percent less

Alibaba'nin Qwen3.8 Max'i, Yapay Analiz Zeka Endeksi'nde Qwen3.7 Max'in (46) 10 puanlık bir sıçramasıyla 56 puan aldı. Yapay Analize göre bu, onu Claude Opus 4.8 ile aynı seviyeye getiriyor ve GLM-5.2'nin (51) önünde, ancak yüzde 25 daha ucuz olan Kimi K3'ün (57) gerisinde kalıyor. İşle ilgili görevler için bir kıyaslama olan GDPval-AA'da Qwen 468 Elo puanı atlayarak 1.739'a yükseldi ve Kimi K3'ü (1.685) geçti. Yalnızca Claude Opus 5 (1.852) daha yüksek puan alır. Önemli olan oraya nasıl varacağıdır. Qwen3.8 Max'in görev başına 14 adım yerine 64 adıma ihtiyacı var ve test, her adımda modele tam konuşma geçmişini yeniden gönderdiği için giriş belirteçleri 15 kat arttı. Model daha kapsamlı çalışır ancak daha yavaş çalışır ve maliyeti daha yüksektir. Alibaba'nin fiyat-performans oranı, düşük token fiyatlarına rağmen darbe alıyor (girdi milyon token başına 2,50 dolardan 2,00 dolara düştü, çıktı 7,50 dolardan 6,00 dolara ve önbellek 0,50 dolardan 0,25 dolara çıktı). İstihbarat Endeksi'ndeki tek bir görevin maliyeti artık 1,14 ABD dolarıdır; bu, Qwen3,7 Max'in (0,53 ABD doları) iki katından fazladır. Kimi K3, görev başına yalnızca 0,86$ ile bir puan daha yüksek puan alırken, GLM-5.2 ise 0,57$ ile geliyor. Reklam Önceki versiyona göre gerilemeler de mevcut. AA-LCR, bir modelin çok uzun metinlerden bilgileri doğru bir şekilde bir araya getirip getiremeyeceğini kontrol eden bir test olan 2 puan düşürdü. AA-Omniscience, bir modelin bilgi sorularına doğru yanıt verip vermediğini veya bilmediğini dürüstçe kabul edip etmediğini ölçerek 10 puan düştü. Doğruluk oranı yüzde 31 civarında kalıyor ancak halüsinasyon oranı yüzde 23'ten yüzde 40'a çıktı.

Qwen3.8 Max bilmediğini söylemek yerine çok daha sık tahminde bulunuyor. Reklam DEC_D_İçerik-1

Bu özet ve çevirisi Base of AGI tarafından otomatik derlendi. Kısa özet ve görsel kaynağa aittir — haberin tamamı ve tüm haklar kaynağındadır.
Haberin tamamını kaynağında oku ↗ Akış içinde yorumlarla aç

İlgili AI haberleri