Un cadre ouvert et transparent pour évaluer la fiabilité des modèles d’IA.
K-BENCHMARK est la méthodologie ouverte d'ALPAR AI pour évaluer les modèles d'IA selon les dimensions de sécurité, de véracité, d'équité, de confidentialité, de robustesse et de transparence. Les scores sont calculés à partir de rapports d'incidents vérifiés, de résultats de moteurs d'audit croisés et d'évaluations d'experts du domaine à l'aide des intervalles de confiance du score de Wilson.
Évaluation des incidents d'IA du monde réel basée sur le registre des incidents ALPAR, combinée à des jailbreaks contradictoires.
Analyse factuelle basée sur TruthfulQA associée à des affirmations factuelles organisées dans le contexte turc.
Évaluation de la maîtrise de la langue turque à l'aide du MMLU-TR traduit et d'ensembles de tests réglementaires locaux sur mesure.
Évaluation de la logique décisionnelle modèle par rapport à l’art. 73 scénarios réglementaires basés sur la taxonomie de l’EU AI Act.
Capacité standard de résolution de problèmes mathématiques vérifiée par rapport aux références GSM8K et MATH.
Vérification de l'exactitude structurelle du suivi des instructions à l'aide de contraintes de type IFEval.
Protection contre le jailbreak contradictoire et évaluation de la défense par injection rapide dans le cadre d'une simulation approuvée par l'homme.
Évaluation de récupération aiguille dans une botte de foin pour des longueurs de contexte allant jusqu'à 32 000 jetons.
Chaque catégorie est notée à l'aide d'un intervalle de confiance du score de Wilson, qui tient compte de la taille de l'échantillon et fournit une limite inférieure statistiquement rigoureuse. Cela empêche le bruit de petits échantillons de gonfler les notes.
Wilson score = (p + z²/2n - z√(p(1-p)/n + z²/4n²)) / (1 + z²/n)
Le score de Wilson est une méthode standard d'estimation de proportion binomiale, couramment utilisée sur des plateformes comme Reddit et IMDb pour des systèmes de notation robustes.
Soumission d'incident
Garde des informations personnelles
Moteur d'audit croisé
Score de Wilson
Examen d'experts
Les scores sont dérivés de : (1) les rapports d'incidents vérifiés soumis via la plateforme ALPAR, (2) les évaluations automatisées du moteur d'audit croisé utilisant des références établies (MMLU, GSM8K, IFEval, BBH), (3) les évaluations d'experts du domaine du réseau de conseillers L3 et (4) la documentation modèle et les rapports techniques accessibles au public.
Les scores K-BENCHMARK sont informatifs et fournis « tels quels ». Ils ne constituent pas une certification de conformité ou un avis juridique. ALPAR AI est « prêt/aligné pour la loi AI », non conforme. Consultez les conditions d'utilisation pour connaître l'intégralité de la clause de non-responsabilité.