LLM Benchmark'ları Nasıl Okunur? MMLU, GPQA, SWE-bench ve Arena Puanlarının Anlamı

Her yeni model duyurusunda bir tablo ve bir sürü kısaltma geliyor. Hangi benchmark neyi ölçer, hangisi sizin işinizle ilgili, hangi puanlara güvenmemek gerekir?

Yapay Zeka04 Eylül 20262 dk okuma
LLM Benchmark'ları Nasıl Okunur? MMLU, GPQA, SWE-bench ve Arena Puanlarının Anlamı

Yeni bir dil modeli çıktığında ilk gördüğünüz şey bir tablo oluyor: sütunlarda kısaltmalar, satırlarda rakip modeller, koyu yazılmış en yüksek puanlar. Tablo etkileyici görünür ama çoğu zaman şu soruya cevap vermez: bu model benim işimde daha iyi mi? Benchmark okumayı bilmek, pazarlama metniyle gerçek kabiliyeti ayırmanın en kısa yolu.

Bilgi benchmark'ları: MMLU ve türevleri

MMLU, 57 alanda çoktan seçmeli sorulardan oluşan klasik bir bilgi testi. Tarih, hukuk, tıp, matematik gibi konularda modelin genel kültürünü ve akıl yürütmesini ölçer. Uzun süre standart kabul edildi; sorun şu ki büyük modeller artık bu testte birbirine çok yakın puan alıyor ve eğitim verisine sızmış sorular yüzünden puanlar şişebiliyor. Bu yüzden MMLU-Pro gibi daha zor, on seçenekli sürümler yaygınlaştı. MMLU'da iki model arasında bir iki puanlık fark pratikte hiçbir şey ifade etmez.

Uzman seviyesi: GPQA

GPQA, doktora düzeyinde biyoloji, fizik ve kimya soruları içerir. İnternette arama yaparak bile cevaplanması zor olacak şekilde hazırlanmıştır; adındaki "Google-proof" ifadesi buradan gelir. Bir modelin GPQA'da yüksek puan alması, karmaşık bilimsel akıl yürütmede güçlü olduğunu gösterir. Ancak günlük işlerin büyük kısmı bu seviyede değildir. Metin özetleme, e-posta yazma veya müşteri sorularını cevaplama için GPQA puanı neredeyse alakasızdır.

Kod: SWE-bench ve HumanEval

HumanEval küçük fonksiyonlar yazdırır; bugün çoğu model burada tavana yakın. Asıl ayırt edici olan SWE-bench Verified: gerçek GitHub projelerinden alınmış hataları modelin kendi başına bulup düzeltmesi istenir. Burada puanlar hem modele hem de modelin kullanıldığı ajan altyapısına bağlıdır. Aynı model, farklı bir araç seti ile çok farklı sonuç verebilir. Bu yüzden SWE-bench sonuçlarında "hangi scaffold ile" sorusunu sormak gerekir.

Matematik ve akıl yürütme

GSM8K ilkokul seviyesi problemlerdir ve artık doymuştur. MATH ve AIME tarzı yarışma soruları, uzun düşünme adımları gerektiren "reasoning" modellerinin öne çıktığı alan. Bu testlerde puanlar, modele ne kadar düşünme süresi (token bütçesi) verildiğine göre değişir. Aynı model, kısa cevap modunda ve uzun düşünme modunda çok farklı puanlar alır; tabloda hangi modun kullanıldığı yazmıyorsa karşılaştırma adil değildir.

İnsan tercihi: Chatbot Arena

LMArena (eski adıyla Chatbot Arena) farklı çalışır. Kullanıcılar iki anonim modelin cevabını görüp beğendiğini seçer; sonuçlar Elo benzeri bir puana dönüşür. Bu, "insanlar hangi cevabı daha çok beğeniyor" sorusunu ölçer. Avantajı gerçek kullanımı yansıtması, dezavantajı ise uzun ve süslü cevapların sıkça kazanması. Kısa ve doğru cevap veren bir model, arena puanında haksız yere geride kalabilir. Stil kontrolü uygulanmış sıralamalara bakmak bu etkiyi azaltır.

Puanlara güvenmemeniz gereken durumlar

  • Model şirketi kendi ölçümünü yayınlıyor ve bağımsız bir doğrulama yoksa.
  • Rakip modeller için eski sürüm puanları kullanılmışsa.
  • Test verisi modelin eğitim setine karışmış olabilecek kadar eskiyse.
  • Sonuçlar "pass@5" ya da "çoğunluk oylaması" gibi birden fazla deneme ile alınmış ama tabloda tek deneme gibi sunuluyorsa.
  • Türkçe sonuç arıyorsanız: benchmark'ların neredeyse tamamı İngilizce. Türkçe performansı ayrıca test edilmelidir.

En güvenilir ölçüm, kendi işinizden alınmış 30-50 örnekle yapılan test. Müşteri e-postaları, ürün açıklamaları, kod parçaları; hangi işi yaptırıyorsanız ondan gerçek örnekler toplayın. Her modele aynı girdileri verin, çıktıları kör olarak puanlayın. Bir öğleden sonra süren bu çalışma, hiçbir liderlik tablosunun veremeyeceği net bir cevap verir: hangi model sizin işinizde daha iyi ve maliyeti buna değer mi.

#benchmark#LLM#MMLU#SWE-bench#model karşılaştırma

Sanalisci AI ile içerik, görsel ve video üretimini yapay zekaya bırakın. Ürünü keşfedin →

İlgili yazılar