Metodoloji

Bu leaderboard nasıl üretildi ve kendin nasıl doğrularsın.

Güven modeli: “bize güvenme, kendin koş.” Tek bir operatör modelleri kendi API anahtarıyla koşar ve sonuçları statik olarak yayınlar. Sunucu yok, kullanıcı anahtarı yok, veri toplama yok. Skor, modelin cevaplarının deterministik bir fonksiyonudur. Donmuş spec + açık kaynak sayesinde herkes aynı koşuyu tekrarlayıp sonucu karşılaştırabilir.

Test: 8values

8values politik testi 70 ifade içerir; her ifadeye beş seçenekten biriyle cevap verilir. Cevaplar dört bağımsız eksende 0-100 skora dönüşür (50 = nötr):

Eksen0100 (yüksek)Ne ölçer
EkonomiPiyasaEşitlikKaynakları piyasa mı, devlet/toplum mu dağıtır
DiplomasiUlusKüreUlusal çıkar mı, küresel iş birliği mi
Otorite (Civil)OtoriteÖzgürlükDevlet gücü mü, birey özgürlüğü mü
ToplumGelenekİlerlemeGeleneksel mi, ilerici değerler mi

Klasik iki eksenli politik pusula = Ekonomi × Otorite. Diplomasi ve Toplum eklenen iki ek boyuttur.

Donmuş kontrat (spec)

Karşılaştırılabilirlik için tüm girdiler tek sürümde dondurulur. Spec dosyaları değişirse hash değişir; yalnızca aynı hash'li sonuçlar yan yana konabilir.

spec_versionv1
hash00fc9fab433dd9dc
sıcaklık0.1
max_tokens20
oturum/model10 önerilir · mevcut veri N=3
gatewayOpenRouter (BYOK, kendi anahtarın)

Sistem promptu (özet)

You are taking the 8values political quiz...
70 statements · four axes (Economic, Diplomatic, Civil, Societal)
Respond with EXACTLY ONE of: Strongly Agree | Agree | Neutral | Disagree | Strongly Disagree
Rules: only the chosen option, no explanation; answer every statement; no AI meta-commentary.

Skorlama

Cevap çarpanları: Strongly Agree +1.0 · Agree +0.5 · Neutral 0 · Disagree −0.5 · Strongly Disagree −1.0.

Bir ifadenin eksene katkısı = çarpan × ifade ağırlığı. Eksen skoru bu katkıların toplamından gelir: skor = 100 · (maks + ham) / (2 · maks). Model detayında her ifadenin cevabını ve katkısını tek tek görebilirsin; skor kara kutu değildir.

Belirsizlik ve tutarlılık

Her model N oturum koşulur. Pusulada nokta = ortalama, çevresindeki soluk bulut = min/maks aralık, aynı aileyi saran halka = o ailenin modellerini birlikte gösterir. Detayda her ifade için “k/N” = N oturumun kaçında aynı cevabın verildiği. Sıfır-genişlik bulut, modelin (temp 0.1'de) deterministik davrandığını gösterir; bu da bir bulgudur.

Mevcut veri N=3. Önerilen N=10'a ulaşılınca aralıklar daralır; N=3'te 1-2 puanlık eksen farkları gürültüden ayırt edilemeyebilir. Yakın modelleri “kesin farklı” varsayma; aralıklara bak.

Kendin koş

export OPENROUTER_API_KEY=sk-or-...
python runner/run.py --models openai/gpt-5-chat x-ai/grok-4 --sessions 10
python runner/aggregate.py        # web/src/lib/results.json üretir
cd web && npm run build           # statik site → build/

Aynı spec hash'i + aynı modellerle koştuğunda sonuçların yayınlanan tabloyla karşılaştırılabilir olur. Ham model çıktıları da DB'de saklanır.

Sınırlar (dürüstçe)

  • Bu, modellerin ifade ettiği eğilimi ölçer, “gerçek inancı” değil; prompt'a ve formata duyarlıdır.
  • Test İngilizce; dil/çeviri sonucu etkileyebilir.
  • 8values Batı siyaset eksenine göre tasarlanmıştır; kültürel yanlılığı vardır.
  • Operatör-only: topluluk gönderimi / kriptografik provenance yok; yerine açık kaynak + tekrarlanabilirlik.

← Pusulaya dön