Benchmark merkezi
Metodoloji

Her sayı, bir kural setine bağlı.

Aşağıda her boyutun veri kümesi, puanlama formülü, örnek sayısı ve örnek soru var. Tartışmaya açık metodoloji = güvenilir benchmark.

Veri sürümü 2025.05 · CC-BY 4.0
Protokol eşiği9.9/10

9.9 altında derleme başarısız olur.

Zorunlu kontroller7

Şema, istatistik, dışa aktarım, metodoloji, karantina.

Henüz 10 değil-0.1

Ham loglar ve çıktı hash'leri son kilidi açacak.

Tipli koşu şeması2.0/2.0

87 koşu denetlendi, 0 bloklayan hata

İstatistikler tekrarlanabilir1.5/1.5

45/45 yetkili birinci elden koşu gerekli tekrar sayısına sahip

Metodoloji belgelendi1.5/1.5

14 boyut; örnek, puanlama ve aralık meta verisini tanımlıyor

Tekrarlanabilirlik kartı kapsamı1.5/1.5

14/14 boyutun tekrarlanabilirlik denetimi var

Kanıt durumu açıklandı1.4/1.5

38 koşu, ham loglar ve çıktı hash'leri yayınlanana kadar açıkça geçici

Açık dışa aktarım sözleşmesi1.0/1.0

JSON, CSV, boyutlar, donanım ve birleştirilmiş topluluk akışları derleme anında üretiliyor

Topluluk karantina eşiği1.0/1.0

Topluluk gönderimleri doğrulanır, tekrarları ayıklanır; geçersiz satırlar birleştirme öncesi karantinaya alınır

KALITEYüksek iyidirEditöryal + harici kaynak

TR-MMLU

Türkçe çok-konulu çoktan-seçmeli sınav (9 disiplin)

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

Yüksel et al. (2024) tarafından geliştirilen Türkçe MMLU varyantı. 9 lise/üniversite dersi (Biyoloji, Kimya, Coğrafya, Tarih, Matematik, Felsefe, Fizik, Din Kültürü, Türk Dili ve Edebiyatı) için 5-shot çoktan-seçmeli. Multi-choice değerlendirme için logprobs gerekir.

Örnek soru
Aşağıdakilerden hangisi Tanzimat Fermanı'nın ilan edildiği yıldır?
A) 1789  B) 1839  C) 1856  D) 1876  E) 1908
Puanlama

Her soru için modelin logprob'u en yüksek olan şıkkı seçer. Doğru cevap oranı %. Cevap sırası deterministik (seed sabit).

KALITEYüksek iyidirÖlçüm pipeline aktif

TurkishMMLU (Yüksel)

Yüksel et al. 2024 TurkishMMLU — YerelAI birinci-elden ölçüm (9 ders)

Birinci-elden ölçüm pipeline'ı aktif. Harness: EleutherAI lm-evaluation-harness. 5-shot, apply_chat_template, seed 42, greedy logprob, deterministik koşu. Her model için results.json + SHA-256 yayımlanır. 27 model ölçülmüştür.

Yüksel et al. (2024, EMNLP Findings) tarafından geliştirilen TurkishMMLU akademik benchmark'i (9 ders, çoktan-seçmeli). alibayram liderlik tablosundan AYRI ve bağımsız bir ölçümdür: YerelAI bunu EleutherAI lm-evaluation-harness ile birinci-elden çalıştırır (5-shot, apply_chat_template + fewshot_as_multiturn, seed 42). Her koşunun results.json'u (per-subject aggregate sonuçlar) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir.

Puanlama

lm-evaluation-harness task=turkishmmlu, 5-shot, apply_chat_template (fewshot_as_multiturn), çoktan-seçmeli logprob seçimi; 9 dersin makro ortalaması (%).

KALITEYüksek iyidirÖlçüm pipeline aktif

Belebele (TR)

Belebele Türkçe okuduğunu-anlama (Meta) — YerelAI birinci-elden ölçüm

Birinci-elden ölçüm pipeline'ı aktif. Harness: EleutherAI lm-evaluation-harness. Aynı determinizm sözleşmesi (5-shot, apply_chat_template, seed 42, greedy logprob). Her model için results.json + SHA-256 yayımlanır. 10 model ölçülmüştür.

Belebele (Bandarkar et al. 2024, Meta AI) çok-dilli makine okuduğunu-anlama benchmark'inin Türkçe (tur_Latn) bölümü: 900 soru, her biri bir paragraf + 4 şıklı anlama sorusu. YerelAI bunu EleutherAI lm-evaluation-harness ile birinci-elden çalıştırır (5-shot, apply_chat_template, seed 42). TurkishMMLU bilgi/ezber ölçerken Belebele OKUDUĞUNU ANLAMA ölçer — ayrı bir yetenek. Her koşunun results.json'u (per-subject aggregate sonuçlar) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir.

Puanlama

lm-evaluation-harness task=belebele_tur_Latn, 5-shot, apply_chat_template, 4-şıklı çoktan-seçmeli logprob seçimi; doğru cevap oranı (%).

KALITEYüksek iyidirEditöryal + harici kaynak

TurkBench

8.151 soru × 21 alt-görev × 6 kategori

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

Türkçe genel-amaçlı kapsamlı benchmark. 21 alt-görev arasında doğal dil çıkarım, ad varlık tanıma, soru-cevap, özetleme. Her görev için resmi metrik (F1, exact-match, ROUGE) ortalamalanır.

Puanlama

21 alt-görevin metrik ortalaması (her birinin resmi metriği, bazıları F1, bazıları accuracy). Resmi pipeline GitHub repo'sunda.

KALITEYüksek iyidirEditöryal + harici kaynak

MMLU-Pro-TR

MMLU-Pro'nun Türkçe lokalize sürümü

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

MMLU-Pro'nun 12.000 sorusunun profesyonel çevirisi. Klasik MMLU'nun aksine 10-seçenekli ve daha karmaşık akıl yürütme. Türkçe model değerlendirmesinde en zor sınav.

Puanlama

10-şıklı logprob seçim. Mikro-ortalama doğru cevap oranı.

KALITEYüksek iyidirEditöryal + harici kaynak

KPSS Genel

Genel Kültür + Genel Yetenek (2018-2024 ÖSYM)

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

ÖSYM tarafından yayınlanmış KPSS Genel Kültür ve Genel Yetenek sınavlarından 2018-2024 yılları arasından stratified-sampled 800 soru. Türk eğitim sisteminin "AI sınava girse ne yapardı" testi.

Puanlama

5-şıklı çoktan seçmeli, ÖSYM resmi cevap anahtarına göre doğru / toplam.

KALITEYüksek iyidirEditöryal + harici kaynak

TUS Klinik

Tıpta Uzmanlık Sınavı klinik soruları

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

TUS klinik bölümünden 2019-2024 arası 500 soru. Türk tıp diline ve tedavi kılavuzlarına aşina olmayı gerektirir. Halüsinasyon riskini açığa çıkarmak için ideal.

Puanlama

ÖSYM cevap anahtarına göre doğru / toplam. Kesin bilgi yoksa "Bilmiyorum" cezasız.

KALITEYüksek iyidirEditöryal + harici kaynak

E-ticaret TR

Trendyol/Hepsiburada ürün başlığı + açıklama insan değerlendirme

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

YerelAI editör ekibi tarafından hazırlanan 250 ürün için başlık + 100 kelimelik açıklama üretimi. 3 bağımsız Türk e-ticaret uzmanı tarafından 5'lik Likert ile (akıcılık, marka uyumu, SEO, doğruluk, satınalma niyeti) puanlanır.

Puanlama

3 değerlendirici × 5 boyut × 5 Likert = 75 puan. Min-max normalize → %.

KALITEYüksek iyidirEditöryal + harici kaynak

Halüsinasyon TR

Türkçe TruthfulQA varyantı, düşük skor = az halüsinasyon (ters skor)

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

TruthfulQA'nın Türkçe varyantı. 500 yaygın yanlış inanış + tarihsel olay. Model "Atatürk hangi yıl Cumhuriyeti ilan etti?" gibi sorulara güvenle yanlış cevap verirse ceza. **Yüksek skor = az halüsinasyon** (UI için ters çevrilir).

Puanlama

GPT-4 hakem ile her cevap doğruluk + dürüstlük puanı. Bilinçli "bilmiyorum" cevabı ödüllendirilir.

KALITEYüksek iyidirEditöryal + harici kaynak

Instruction-TR

Talimat takibi (IFEval Türkçe)

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

IFEval (Zhou et al. 2023) prompt setinin profesyonel Türkçe çevirisi. "JSON ile cevap ver", "200 kelimeden az tut", "noktalama olmadan" gibi kontrol edilebilir kurallara model uyuyor mu?

Puanlama

Otomatik kural doğrulayıcı (regex + JSON parse + length check). Her talimat geçti/kaldı.

KALITEYüksek iyidirEditöryal + harici kaynak

Kod-TR

Türkçe yorumlu HumanEval

Bu boyut editöryal + harici kaynaklarla beslenir. Skorlar; akademik leaderboard'lar (alibayram, malhajar, OpenEvals), model üreticisinin yayınladığı raporlar ve YerelAI editör değerlendirmesi birleştirilerek raporlanır. Her satır kaynak URL'si ve editorial-estimate statüsüyle işaretlidir. Bu mod “ölçüm yapılmadı” demek değildir, bu mod “ölçümü başkası yaptı, biz attribution ile aktardık” demektir. Eklenen her bağımsız tekrar verified statüsüne taşır.

HumanEval'in 164 sorusunun problem açıklaması + örnekleri Türkçeye çevrildi. Üretilen Python kodu pytest ile çalıştırılır. Model Türkçe spec'i anlayıp doğru kod üretebiliyor mu?

Puanlama

pass@1 = test geçen kod / toplam.

HIZYüksek iyidirÖlçüm pipeline aktif

Token/saniye

Inference hızı (hardware × quant)

Birinci-elden ölçüm pipeline'ı aktif. Harness: app/scripts/local-ollama-tps-sweep.mjs. 5 ardışık run, medyan tok/s, Ollama model digest + her response için SHA-256 kayıt altında. 8 Türkçe model üzerinde RTX 5080 sweep çalışmıştır.

Batch=1, 2048 token bağlam, 512 yeni token üretimi. 5 ardışık run'ın medyan tok/s'i. İlk-token gecikmesi (TTFT) ayrı izlenir.

Puanlama

5 deneme × 512 token → medyan tok/s. Soğuk başlatma hariç.

MALIYETDüşük iyidirModellenmiş formül

Maliyet (1M token)

1 milyon Türkçe token için yaklaşık maliyet (TRY)

Bu boyut bir ölçüm değil, modellenmiş bir hesaplamadır. Skorlar bir formülden türetilir (aşağıda); harness koşmaz. `measurement: 'modeled'` etiketiyle saklanır. Doğruluk = formülün doğruluğu, değil ölçüm tekrarlanabilirliği.

Bulut API'lar için fiyat listesi × 1M token. Yerel modeller için yalnızca elektrik-only işletim alt sınırı gösterilir; GPU/PC satın alma fiyatı canlı tam sistem sepetiyle ayrıca hesaplanır.

Puanlama

cloud: vendor.priceUSDper1MToken × USD/TRY × Türkçe-token-overhead (1.4x). local: elektrik-only alt sınır = (gpu.tdpKW × saat × tarihli kWh varsayımı) / tokensProduced × 1M. Donanım satın alma dahil edilmez; ROI için kullanıcı canlı tam sistem sepeti girer.

Yerel çalıştır

Yeniden üret

Skorlara güvenmek zorunda değilsin. Açık veriyi indir, kendi makinende çalıştır, kendi log'unu üret ve yayımlanmış çıktı hash'leriyle karşılaştır. Reprodüksiyon = doğrulama.

  1. Adım 1Açık veriyi indir
    curl -O https://www.yerel.ai/api/benchmarks.json
  2. Adım 2Boyut metadatasını çek
    curl -O https://www.yerel.ai/api/dimensions.json
  3. Adım 3Skorları kendi makinende doğrula
    jq ".runs[] | select(.measurement==\"direct\")" benchmarks.json
  4. Adım 4Çıktı hash'leriyle karşılaştır
    sha256sum results.json  # her direct koşunun yayımlanmış hash'i
Tekrarlanabilirlik karnesi

Her boyut için tekrarlanabilirlik puanı

YerelAI benchmark'larının her biri 5 kriterde denetlenir. Veri ayrımı belgeli mi? Kod açık kaynak mı? Seed sabit mi? Ortalama puan: 43/100. Son denetim: 2026-06-19.

TR-MMLU

Türkçe çok-konulu çoktan-seçmeli sınav (9 disiplin)

B60/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Skorlar alibayram TurkishMMLU liderlik tablosundan ALINTIDIR — YerelAI birinci-elden çalıştırmaz. Tekrarlanabilirlik üst kaynağa aittir; biz yalnızca kaynağı + ölçüm tarihini belirtiriz. YerelAI Docker imajı / kendi harness koşusu yoktur (önceki yayımlanmış-imaj iddiası kaldırıldı).

Son denetim2026-06-18
İyi60/100

TurkishMMLU (Yüksel)

Yüksel et al. 2024 TurkishMMLU — YerelAI birinci-elden ölçüm (9 ders)

A90/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

YerelAI'ın iki birinci-elden, byte-tekrarlanabilir kalite boyutundan biri (diğeri Belebele-TR). EleutherAI lm-evaluation-harness 0.4.12, task=turkishmmlu, 5-shot, apply_chat_template (fewshot_as_multiturn), seed=42, RTX 4090 (driver 590.48.01). Deterministik. Her koşunun results.json'u (per-subject aggregate sonuçlar) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir. Docker yok ama tam komut + harness sürümü pinli (deterministik olduğu için container, hash kadar güçlü değil).

Son denetim2026-06-18
Mükemmel90/100

Belebele (TR)

Belebele Türkçe okuduğunu-anlama (Meta) — YerelAI birinci-elden ölçüm

A90/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Birinci-elden, byte-tekrarlanabilir okuduğunu-anlama boyutu. lm-evaluation-harness task=belebele_tur_Latn (Meta facebook/belebele tur_Latn, parquet-native), 5-shot, apply_chat_template, seed 42, RTX 5090. Deterministik (sabit few-shot + greedy logprob). Her koşunun results.json'u (tek görev belebele_tur_Latn, 900 soru, aggregate sonuç) + SHA-256 çıktı karması + pinli komut & harness sürümü ile yayımlanır; bağımsız biri aynı kurulumda bayt-birebir tekrar üretebilir.

Son denetim2026-06-19
Mükemmel90/100

TurkBench

8.151 soru × 21 alt-görev × 6 kategori

F20/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Tanımlı boyut, ANCAK henüz birinci-elden ölçüm YOK (0 koşu). Önceki "Docker + requirements.txt mevcut" iddiası kaldırıldı (mevcut değildi). Ölçüm yapıldığında kart gerçek artefaktlarla güncellenecek.

Son denetim2026-06-18
Yetersiz20/100

MMLU-Pro-TR

MMLU-Pro'nun Türkçe lokalize sürümü

D35/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Birinci-elden YerelAI ölçümü yok; mevcut satırlar editöryal tahmin/alıntı (byte-tekrar edilemez). Önceki topluluk-PR container iddiası kaldırıldı (mevcut değildi). Dataset: malhajar/mmlu-pro-tr (HF, alıntı).

Son denetim2026-06-18
Zayıf35/100

KPSS Genel

Genel Kültür + Genel Yetenek (2018-2024 ÖSYM)

F25/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Planlanan in-house boyut: veri seti yayımlanmadı, birinci-elden ölçüm/harness YOK. Önceki "harness'a gömülü ÖSYM doğrulama" iddiası kaldırıldı (mevcut değil).

Son denetim2026-06-18
Yetersiz25/100

TUS Klinik

Tıpta Uzmanlık Sınavı klinik soruları

F25/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Planlanan in-house boyut: veri seti yayımlanmadı, birinci-elden ölçüm YOK. Önceki "topluluk koşuları" ifadesi kaldırıldı (koşu yok).

Son denetim2026-06-18
Yetersiz25/100

E-ticaret TR

Trendyol/Hepsiburada ürün başlığı + açıklama insan değerlendirme

F20/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Planlanan insan-değerlendirme boyutu: veri seti yayımlanmadı, birinci-elden ölçüm YOK. Önceki "ürün veri seti paylaşıldı" iddiası kaldırıldı (paylaşılmadı).

Son denetim2026-06-18
Yetersiz20/100

Hukuki TR

Sözleşme + dilekçe + ihtarname üretimi

F20/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Planlanan hukuk boyutu: yalnızca görev tanımı taslağı var, veri seti/birinci-elden ölçüm YOK. Avukat incelemesi tamamlanmadı.

Son denetim2026-06-18
Yetersiz20/100

Halüsinasyon TR

Türkçe TruthfulQA varyantı, düşük skor = az halüsinasyon (ters skor)

F20/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Planlanan boyut; birinci-elden ölçüm YOK. Önceki GPT-4-hakem / κ-istatistiği iddiası kaldırıldı — böyle bir ölçüm/istatistik yapılmadı.

Son denetim2026-06-18
Yetersiz20/100

Instruction-TR

Talimat takibi (IFEval Türkçe)

D30/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Birinci-elden harness YOK; mevcut satırlar editöryal tahmin (byte-tekrar edilemez). Önceki "container her donanımda aynı" iddiası kaldırıldı (container yok).

Son denetim2026-06-18
Zayıf30/100

Kod-TR

Türkçe yorumlu HumanEval

D30/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Birinci-elden harness YOK; mevcut satırlar editöryal tahmin. Önceki sabitlenmiş-pytest Docker imajı iddiası kaldırıldı (mevcut değil).

Son denetim2026-06-18
Zayıf30/100

Token/saniye

Inference hızı (hardware × quant)

C60/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Speed varies by driver version and thermal state. Cannot fully fix seeds for wall-clock measurements.

Son denetim2026-05-22
Orta60/100

Maliyet (1M token)

1 milyon Türkçe token için yaklaşık maliyet (TRY)

B75/100
Kontrol listesi
Veri ayrımı belgeli
Kod açık kaynak
Seed sabitlenmiş
Container mevcut
Donanım belgeli
Denetim notu

Modeled dimension, formula transparent but dependent on external factors (TRY/USD rate, EPDK kWh).

Son denetim2026-05-22
İyi75/100
Referans çerçeveler

Türkçe AI değerlendirme manzarası

YerelAI 14-boyutlu rubric'imizi tek doğru kaynak olarak sunmaz. Aşağıda, metodoloji sayfalarımızda referans gösterdiğimiz harici Türkçe AI değerlendirme çerçeveleri var. Tam liste JSON olarak. Satır-seviyesinde veri yalnızca alibayram-tr-mmlu'dan içe aktarılmıştır (CC-BY-NC-4.0 lisansla, 66 satır, ham veriler external-benchmarks.json içinde).

Cetvel
Koç Üniversitesi KUIS-AI
Tamamlayıcı
22 dataset × 7 NLP görevi

Klasik NLP görevleri (NER, NLI, QA). YerelAI rubric uygulama-seviyesi kalite + hız + maliyet kapsar.

TurkishMMLU
Yüksel et al. (2024)
Veri kaynağı
10,032 soru × 9 ders

Birinci elden ölçtüğümüz TurkishMMLU-Yüksel boyutunun veri seti kaynağı (arXiv:2407.12402). Her run seed=42 ile örnekler.

TurkBench
Topluluk
Planlanan veri kaynağı
21 alt-görev × 6 kategori, 8,151 soru

Planlanan turkbench boyutu için hedeflenen veri kaynağı. Henüz birinci elden ölçülmedi; eklendiğinde bu kümeden örneklenecek.

MMLU-Pro-TR
malhajar
Planlanan veri kaynağı
12,000 soru, 10 seçenekli

Planlanan mmlu-pro-tr boyutu için hedeflenen veri kaynağı. Türkçe için en zor sınavlardan; henüz birinci elden ölçülmedi.

Tamamlayıcı
Türkçe-uyumlu model ranking

Daha geniş model coverage; YerelAI daha derin rubric. Tamamlayıcı.

Alibayram TR-MMLU
Bayram, M. (2025)
Satır içe aktarımı
66 model ranking, 6,200 soru

Tek satır-seviyesi içe aktarılan harici kaynak. CC-BY-NC-4.0 lisansla.