Güven Skorunu nasıl hesaplıyoruz
Özel metodolojimiz tarafsız ve şeffaf sıralamalar sağlar.
K5 Metrik Açıklaması
K6 Metrik Açıklaması
K7 Metrik Açıklaması
K8 Metrik Açıklaması
K9 Metrik Açıklaması
K10 Metrik Açıklaması
K11 Metrik Açıklaması
K12 Metrik Açıklaması
Geleneksel kıyaslama kurulumlarından farklı olarak, ALPAR AI dinamik bir çapraz model tartışması kullanır. İki model bir olayı bağımsız olarak değerlendirir, birbirlerinin değerlendirmelerini sorgular ve savunmalarını sunar; ayrı bir hakem ('Yüksek Mahkeme') modeli daha sonra tartışmayı nihai Doğruluk Skoru olarak sentezler. Bu, statik puanlama yanlılığını en aza indirir ve sağlam, akran denetimli değerlendirme metrikleri sağlar.
Çapraz sorgu motoru, anlaşmazlıkları iki bağımsız model arasındaki tartışma yoluyla çözer ve ayrı bir hakem ('Yüksek Mahkeme') modeli, tartışmayı nihai Doğruluk Skoru'nda sentezler. Hakem zinciri, kaynak kodda tanımlıdır (src/lib/ai/openrouter-gateway.ts içindeki SUPREME_COURT_CHAIN) ve şu anda şu modelleri içerir:
gemini-1.5-pro (Google, üst düzey)anthropic/claude-3.5-sonnet (OpenRouter, üst düzey)openai/gpt-4o (OpenRouter, üst düzey)meta-llama/llama-3.1-70b-instruct (OpenRouter, üst düzey)mistralai/mistral-large (OpenRouter, üst düzey)Bu liste, src/lib/ai/openrouter-gateway.ts içindeki kodun birebir aynısı olarak yayımlanmıştır. Hakem zinciri şu anda sağlayıcı düzeyinde yedeklilik içeren 5 premium model içerir; zincir değiştiğinde bu sayfa da güncellenir.
K-BENCHMARK'ta yayınlanan her puana, %95 güven düzeyinde istatistiksel kesinliği temsil eden bir Wilson skor aralığı eşlik eder. Model sağlayıcıları güncelleme yayınladığında yeniden değerlendirme otomatik olarak tetiklenir ve liderlik tablomuzun aktif modellerin güncel yeteneklerini yansıtması sağlanır.