Güven Skorunu nasıl hesaplıyoruz
Modellerin güvenilirlik skorları; otomatik benchmark testleri (Doğruluk, Talimat Uyumu, Güvenlik) ve bağımsız AI modelleri arasındaki çapraz sorgu münazaralarının senteziyle üretilir.
Az sayıda test veya değerlendirmeye sahip modellerin yapay olarak üst sıralara çıkmasını engellemek için %95 güven düzeyinde Wilson alt sınır istatistiği uygulanır.
Sağlayıcı şeffaflığını ve hesap verebilirliğini dinamik olarak ölçer: 85 taban puan, doğrulanmış vaka başına -2.5 puan kesinti ve yayınlanan yanıt başına +4.0 puan ödül.
85 - (2.5 × Olay) + (4 × Yanıt)Hiç olayı bulunmayan sağlayıcılar için başlangıç tabanı 85 puandır. Çözülen her resmi yanıt skoru artırır.
Skorlama algoritmalarındaki her iyileştirme, hakem modellerinin güncellenmesi ve formül değişiklikleri kamuya açık sürüm kaydı altında şeffafça yayımlanır.
ALPAR AI bağımsız denetim altyapısını oluşturan açık kaynaklı alt standartlar.
Etki, kapsam, tetiklenebilirlik ve AI bağlam faktörlerini kapsayan CVSS uyarlamalı AI ciddiyet skoru standardı.
12 temel zeka ve güvenlik kategorisinde (K1-K12) modellerin detaylı yetenek ve açık testleri.
TruthfulQA, IFEval, GSM8K ve Adversarial Red-Teaming senaryolarının teknik parametreleri.
Metodoloji güncellemeleri, geri çekmeler ve sürüm değişikliklerinin herkese açık kaydı.