Her sayı, bir kural setine bağlı.
Aşağıda her boyutun veri kümesi, puanlama formülü, örnek sayısı ve örnek soru var. Tartışmaya açık metodoloji = güvenilir benchmark.
Veri sürümü 2025.05 · CC-BY 4.09.9 altında derleme başarısız olur.
Şema, istatistik, dışa aktarım, metodoloji, karantina.
Ham loglar ve çıktı hash'leri son kilidi açacak.
87 koşu denetlendi, 0 bloklayan hata
45/45 yetkili birinci elden koşu gerekli tekrar sayısına sahip
14 boyut; örnek, puanlama ve aralık meta verisini tanımlıyor
14/14 boyutun tekrarlanabilirlik denetimi var
38 koşu, ham loglar ve çıktı hash'leri yayınlanana kadar açıkça geçici
JSON, CSV, boyutlar, donanım ve birleştirilmiş topluluk akışları derleme anında üretiliyor
Topluluk gönderimleri doğrulanır, tekrarları ayıklanır; geçersiz satırlar birleştirme öncesi karantinaya alınır
TR-MMLU
Türkçe çok-konulu çoktan-seçmeli sınav (9 disiplin)
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
Yüksel et al. (2024) tarafından geliştirilen Türkçe MMLU varyantı. 9 lise/üniversite dersi (Biyoloji, Kimya, Coğrafya, Tarih, Matematik, Felsefe, Fizik, Din Kültürü, Türk Dili ve Edebiyatı) için 5-shot çoktan-seçmeli. Multi-choice değerlendirme için logprobs gerekir.
Aşağıdakilerden hangisi Tanzimat Fermanı'nın ilan edildiği yıldır? A) 1789 B) 1839 C) 1856 D) 1876 E) 1908
Her soru için modelin logprob'u en yüksek olan şıkkı seçer. Doğru cevap oranı %. Cevap sırası deterministik (seed sabit).
TurkishMMLU (Yüksel)
Yüksel et al. 2024 TurkishMMLU — YerelAI birinci-elden ölçüm (9 ders)
Birinci-elden ölçüm pipeline'ı aktif. Harness: EleutherAI lm-evaluation-harness. 5-shot, apply_chat_template, seed 42, greedy logprob, deterministik koşu. Her model için results.json + SHA-256 yayımlanır. 27 model ölçülmüştür.
Yüksel et al. (2024, EMNLP Findings) tarafından geliştirilen TurkishMMLU akademik benchmark'i (9 ders, çoktan-seçmeli). alibayram liderlik tablosundan AYRI ve bağımsız bir ölçümdür: YerelAI bunu EleutherAI lm-evaluation-harness ile birinci-elden çalıştırır (5-shot, apply_chat_template + fewshot_as_multiturn, seed 42). Her koşunun results.json'u (per-subject aggregate sonuçlar) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir.
lm-evaluation-harness task=turkishmmlu, 5-shot, apply_chat_template (fewshot_as_multiturn), çoktan-seçmeli logprob seçimi; 9 dersin makro ortalaması (%).
Belebele (TR)
Belebele Türkçe okuduğunu-anlama (Meta) — YerelAI birinci-elden ölçüm
Birinci-elden ölçüm pipeline'ı aktif. Harness: EleutherAI lm-evaluation-harness. Aynı determinizm sözleşmesi (5-shot, apply_chat_template, seed 42, greedy logprob). Her model için results.json + SHA-256 yayımlanır. 10 model ölçülmüştür.
Belebele (Bandarkar et al. 2024, Meta AI) çok-dilli makine okuduğunu-anlama benchmark'inin Türkçe (tur_Latn) bölümü: 900 soru, her biri bir paragraf + 4 şıklı anlama sorusu. YerelAI bunu EleutherAI lm-evaluation-harness ile birinci-elden çalıştırır (5-shot, apply_chat_template, seed 42). TurkishMMLU bilgi/ezber ölçerken Belebele OKUDUĞUNU ANLAMA ölçer — ayrı bir yetenek. Her koşunun results.json'u (per-subject aggregate sonuçlar) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir.
lm-evaluation-harness task=belebele_tur_Latn, 5-shot, apply_chat_template, 4-şıklı çoktan-seçmeli logprob seçimi; doğru cevap oranı (%).
TurkBench
8.151 soru × 21 alt-görev × 6 kategori
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
Türkçe genel-amaçlı kapsamlı benchmark. 21 alt-görev arasında doğal dil çıkarım, ad varlık tanıma, soru-cevap, özetleme. Her görev için resmi metrik (F1, exact-match, ROUGE) ortalamalanır.
21 alt-görevin metrik ortalaması (her birinin resmi metriği, bazıları F1, bazıları accuracy). Resmi pipeline GitHub repo'sunda.
MMLU-Pro-TR
MMLU-Pro'nun Türkçe lokalize sürümü
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
MMLU-Pro'nun 12.000 sorusunun profesyonel çevirisi. Klasik MMLU'nun aksine 10-seçenekli ve daha karmaşık akıl yürütme. Türkçe model değerlendirmesinde en zor sınav.
10-şıklı logprob seçim. Mikro-ortalama doğru cevap oranı.
KPSS Genel
Genel Kültür + Genel Yetenek (2018-2024 ÖSYM)
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
ÖSYM tarafından yayınlanmış KPSS Genel Kültür ve Genel Yetenek sınavlarından 2018-2024 yılları arasından stratified-sampled 800 soru. Türk eğitim sisteminin "AI sınava girse ne yapardı" testi.
5-şıklı çoktan seçmeli, ÖSYM resmi cevap anahtarına göre doğru / toplam.
TUS Klinik
Tıpta Uzmanlık Sınavı klinik soruları
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
TUS klinik bölümünden 2019-2024 arası 500 soru. Türk tıp diline ve tedavi kılavuzlarına aşina olmayı gerektirir. Halüsinasyon riskini açığa çıkarmak için ideal.
ÖSYM cevap anahtarına göre doğru / toplam. Kesin bilgi yoksa "Bilmiyorum" cezasız.
E-ticaret TR
Trendyol/Hepsiburada ürün başlığı + açıklama insan değerlendirme
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
YerelAI editör ekibi tarafından hazırlanan 250 ürün için başlık + 100 kelimelik açıklama üretimi. 3 bağımsız Türk e-ticaret uzmanı tarafından 5'lik Likert ile (akıcılık, marka uyumu, SEO, doğruluk, satınalma niyeti) puanlanır.
3 değerlendirici × 5 boyut × 5 Likert = 75 puan. Min-max normalize → %.
Hukuki TR
Sözleşme + dilekçe + ihtarname üretimi
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
100 hukuki senaryo için belge üretimi hedeflenir. Avukat incelemesi tamamlanmayan sonuçlar geçici kabul edilir; terminoloji, format, mevzuat referansı ve kullanılabilir taslak boyutları ayrı etiketlenir.
Hukuk uzmanı incelemesi varsa 4 boyutlu Likert; uzman incelemesi yoksa yalnızca geçici/editoryal etiket. Mevzuat referans hataları ayrıca işaretlenir.
Halüsinasyon TR
Türkçe TruthfulQA varyantı, düşük skor = az halüsinasyon (ters skor)
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
TruthfulQA'nın Türkçe varyantı. 500 yaygın yanlış inanış + tarihsel olay. Model "Atatürk hangi yıl Cumhuriyeti ilan etti?" gibi sorulara güvenle yanlış cevap verirse ceza. **Yüksek skor = az halüsinasyon** (UI için ters çevrilir).
GPT-4 hakem ile her cevap doğruluk + dürüstlük puanı. Bilinçli "bilmiyorum" cevabı ödüllendirilir.
Instruction-TR
Talimat takibi (IFEval Türkçe)
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
IFEval (Zhou et al. 2023) prompt setinin profesyonel Türkçe çevirisi. "JSON ile cevap ver", "200 kelimeden az tut", "noktalama olmadan" gibi kontrol edilebilir kurallara model uyuyor mu?
Otomatik kural doğrulayıcı (regex + JSON parse + length check). Her talimat geçti/kaldı.
Kod-TR
Türkçe yorumlu HumanEval
Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.
HumanEval'in 164 sorusunun problem açıklaması + örnekleri Türkçeye çevrildi. Üretilen Python kodu pytest ile çalıştırılır. Model Türkçe spec'i anlayıp doğru kod üretebiliyor mu?
pass@1 = test geçen kod / toplam.
Token/saniye
Inference hızı (hardware × quant)
Birinci-elden ölçüm pipeline'ı aktif. Harness: app/scripts/local-ollama-tps-sweep.mjs. 5 ardışık run, medyan tok/s, Ollama model digest + her response için SHA-256 kayıt altında. 8 Türkçe model üzerinde RTX 5080 sweep çalışmıştır.
Batch=1, 2048 token bağlam, 512 yeni token üretimi. 5 ardışık run'ın medyan tok/s'i. İlk-token gecikmesi (TTFT) ayrı izlenir.
5 deneme × 512 token → medyan tok/s. Soğuk başlatma hariç.
Maliyet (1M token)
1 milyon Türkçe token için yaklaşık maliyet (TRY)
Bu boyut bir ölçüm değil, modellenmiş bir hesaplamadır. Skorlar bir formülden türetilir (aşağıda); harness koşmaz. `measurement: 'modeled'` etiketiyle saklanır. Doğruluk = formülün doğruluğu, değil ölçüm tekrarlanabilirliği.
Bulut API'lar için fiyat listesi × 1M token. Yerel modeller için yalnızca elektrik-only işletim alt sınırı gösterilir; GPU/PC satın alma fiyatı canlı tam sistem sepetiyle ayrıca hesaplanır.
cloud: vendor.priceUSDper1MToken × USD/TRY × Türkçe-token-overhead (1.4x). local: elektrik-only alt sınır = (gpu.tdpKW × saat × tarihli kWh varsayımı) / tokensProduced × 1M. Donanım satın alma dahil edilmez; ROI için kullanıcı canlı tam sistem sepeti girer.
Yeniden üret
Skorlara güvenmek zorunda değilsin. Açık veriyi indir, kendi makinende çalıştır, kendi log'unu üret ve yayımlanmış çıktı hash'leriyle karşılaştır. Reprodüksiyon = doğrulama.
- Adım 1Açık veriyi indir
curl -O https://www.yerel.ai/api/benchmarks.json
- Adım 2Boyut metadatasını çek
curl -O https://www.yerel.ai/api/dimensions.json
- Adım 3Skorları kendi makinende doğrula
jq ".runs[] | select(.measurement==\"direct\")" benchmarks.json
- Adım 4Çıktı hash'leriyle karşılaştır
sha256sum results.json # her direct koşunun yayımlanmış hash'i
Her boyut için tekrarlanabilirlik puanı
YerelAI benchmark'larının her biri 5 kriterde denetlenir. Veri ayrımı belgeli mi? Kod açık kaynak mı? Seed sabit mi? Ortalama puan: 43/100. Son denetim: 2026-06-19.
TR-MMLU
Türkçe çok-konulu çoktan-seçmeli sınav (9 disiplin)
Skorlar alibayram TurkishMMLU liderlik tablosundan ALINTIDIR — YerelAI birinci-elden çalıştırmaz. Tekrarlanabilirlik üst kaynağa aittir; biz yalnızca kaynağı + ölçüm tarihini belirtiriz. YerelAI Docker imajı / kendi harness koşusu yoktur (önceki yayımlanmış-imaj iddiası kaldırıldı).
TurkishMMLU (Yüksel)
Yüksel et al. 2024 TurkishMMLU — YerelAI birinci-elden ölçüm (9 ders)
YerelAI'ın iki birinci-elden, byte-tekrarlanabilir kalite boyutundan biri (diğeri Belebele-TR). EleutherAI lm-evaluation-harness 0.4.12, task=turkishmmlu, 5-shot, apply_chat_template (fewshot_as_multiturn), seed=42, RTX 4090 (driver 590.48.01). Deterministik. Her koşunun results.json'u (per-subject aggregate sonuçlar) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir. Docker yok ama tam komut + harness sürümü pinli (deterministik olduğu için container, hash kadar güçlü değil).
Belebele (TR)
Belebele Türkçe okuduğunu-anlama (Meta) — YerelAI birinci-elden ölçüm
Birinci-elden, byte-tekrarlanabilir okuduğunu-anlama boyutu. lm-evaluation-harness task=belebele_tur_Latn (Meta facebook/belebele tur_Latn, parquet-native), 5-shot, apply_chat_template, seed 42, RTX 5090. Deterministik (sabit few-shot + greedy logprob). Her koşunun results.json'u (tek görev belebele_tur_Latn, 900 soru, aggregate sonuç) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir.
TurkBench
8.151 soru × 21 alt-görev × 6 kategori
Tanımlı boyut, ANCAK henüz birinci-elden ölçüm YOK (0 koşu). Önceki "Docker + requirements.txt mevcut" iddiası kaldırıldı (mevcut değildi). Ölçüm yapıldığında kart gerçek artefaktlarla güncellenecek.
MMLU-Pro-TR
MMLU-Pro'nun Türkçe lokalize sürümü
Birinci-elden YerelAI ölçümü yok; mevcut satırlar editöryal tahmin/alıntı (byte-tekrar edilemez). Önceki topluluk-PR container iddiası kaldırıldı (mevcut değildi). Dataset: malhajar/mmlu-pro-tr (HF, alıntı).
KPSS Genel
Genel Kültür + Genel Yetenek (2018-2024 ÖSYM)
Planlanan in-house boyut: veri seti yayımlanmadı, birinci-elden ölçüm/harness YOK. Önceki "harness'a gömülü ÖSYM doğrulama" iddiası kaldırıldı (mevcut değil).
TUS Klinik
Tıpta Uzmanlık Sınavı klinik soruları
Planlanan in-house boyut: veri seti yayımlanmadı, birinci-elden ölçüm YOK. Önceki "topluluk koşuları" ifadesi kaldırıldı (koşu yok).
E-ticaret TR
Trendyol/Hepsiburada ürün başlığı + açıklama insan değerlendirme
Planlanan insan-değerlendirme boyutu: veri seti yayımlanmadı, birinci-elden ölçüm YOK. Önceki "ürün veri seti paylaşıldı" iddiası kaldırıldı (paylaşılmadı).
Hukuki TR
Sözleşme + dilekçe + ihtarname üretimi
Planlanan hukuk boyutu: yalnızca görev tanımı taslağı var, veri seti/birinci-elden ölçüm YOK. Avukat incelemesi tamamlanmadı.
Halüsinasyon TR
Türkçe TruthfulQA varyantı, düşük skor = az halüsinasyon (ters skor)
Planlanan boyut; birinci-elden ölçüm YOK. Önceki GPT-4-hakem / κ-istatistiği iddiası kaldırıldı — böyle bir ölçüm/istatistik yapılmadı.
Instruction-TR
Talimat takibi (IFEval Türkçe)
Birinci-elden harness YOK; mevcut satırlar editöryal tahmin (byte-tekrar edilemez). Önceki "container her donanımda aynı" iddiası kaldırıldı (container yok).
Kod-TR
Türkçe yorumlu HumanEval
Birinci-elden harness YOK; mevcut satırlar editöryal tahmin. Önceki sabitlenmiş-pytest Docker imajı iddiası kaldırıldı (mevcut değil).
Token/saniye
Inference hızı (hardware × quant)
Speed varies by driver version and thermal state. Cannot fully fix seeds for wall-clock measurements.
Maliyet (1M token)
1 milyon Türkçe token için yaklaşık maliyet (TRY)
Modeled dimension, formula transparent but dependent on external factors (TRY/USD rate, EPDK kWh).
Türkçe AI değerlendirme manzarası
YerelAI 14-boyutlu rubric'imizi tek doğru kaynak olarak sunmaz. Aşağıda, metodoloji sayfalarımızda referans gösterdiğimiz harici Türkçe AI değerlendirme çerçeveleri var. Tam liste JSON olarak. Satır-seviyesinde veri yalnızca alibayram-tr-mmlu'dan içe aktarılmıştır (CC-BY-NC-4.0 lisansla, 66 satır, ham veriler external-benchmarks.json içinde).
Klasik NLP görevleri (NER, NLI, QA). YerelAI rubric uygulama-seviyesi kalite + hız + maliyet kapsar.
Birinci elden ölçtüğümüz TurkishMMLU-Yüksel boyutunun veri seti kaynağı (arXiv:2407.12402). Her run seed=42 ile örnekler.
Planlanan turkbench boyutu için hedeflenen veri kaynağı. Henüz birinci elden ölçülmedi; eklendiğinde bu kümeden örneklenecek.
Planlanan mmlu-pro-tr boyutu için hedeflenen veri kaynağı. Türkçe için en zor sınavlardan; henüz birinci elden ölçülmedi.
Daha geniş model coverage; YerelAI daha derin rubric. Tamamlayıcı.
Tek satır-seviyesi içe aktarılan harici kaynak. CC-BY-NC-4.0 lisansla.