Ein offenes, transparentes Framework zur Bewertung der Vertrauenswürdigkeit von KI-Modellen.
K-BENCHMARK ist die offene Methodik von ALPAR AI zur Bewertung von KI-Modellen in den Dimensionen Sicherheit, Wahrhaftigkeit, Fairness, Datenschutz, Robustheit und Transparenz. Die Bewertungen werden aus verifizierten Vorfallberichten, Cross-Audit-Engine-Ergebnissen und Domänenexpertenbewertungen unter Verwendung von Wilson-Score-Konfidenzintervallen berechnet.
Reale KI-Vorfallbewertung basierend auf dem ALPAR-Vorfallregister, kombiniert mit gegnerischen Jailbreaks.
TruthfulQA-basierte Tatsachenanalyse gepaart mit kuratierten Tatsachenbehauptungen im türkischen Kontext.
Bewertung der türkischen Sprachkenntnisse mithilfe übersetzter MMLU-TR und maßgeschneiderter lokaler regulatorischer Testsätze.
Beurteilung der Musterentscheidungslogik anhand von Art. 73 Regulierungsszenarien basierend auf der Taxonomie des EU-KI-Gesetzes.
Standardmäßige Fähigkeit zur mathematischen Problemlösung, überprüft anhand der GSM8K- und MATH-Benchmarks.
Überprüfung der Genauigkeit der strukturellen Befehlsbefolgung mithilfe von IFEval-ähnlichen Einschränkungen.
Gegnerischer Jailbreak-Schutz und sofortige Injektionsverteidigungsbewertung unter von Menschen genehmigter Simulation.
Nadel-im-Heuhaufen-Abrufauswertung für Kontextlängen bis zu 32.000 Token.
Jede Kategorie wird anhand eines Wilson-Score-Konfidenzintervalls bewertet, das die Stichprobengröße berücksichtigt und eine statistisch strenge Untergrenze darstellt. Dies verhindert, dass Rauschen bei kleinen Stichproben die Bewertungen erhöht.
Wilson score = (p + z²/2n - z√(p(1-p)/n + z²/4n²)) / (1 + z²/n)
Der Wilson-Score ist eine Standardmethode zur binomialen Proportionsschätzung, die häufig auf Plattformen wie Reddit und IMDb für robuste Bewertungssysteme verwendet wird.
Übermittlung von Vorfällen
PII-Wächter
Cross-Audit-Engine
Wilson-Wertung
Expertenbewertung
Die Bewertungen werden abgeleitet aus: (1) verifizierten Vorfallberichten, die über die ALPAR-Plattform übermittelt werden, (2) automatisierten Cross-Audit-Engine-Bewertungen unter Verwendung etablierter Benchmarks (MMLU, GSM8K, IFEval, BBH), (3) Domänenexpertenbewertungen aus dem L3-Beraternetzwerk und (4) öffentlich zugänglichen Modelldokumentationen und technischen Berichten.
Die K-BENCHMARK-Ergebnisse dienen der Information und werden im Ist-Zustand bereitgestellt. Sie stellen weder eine Compliance-Bescheinigung noch ein Rechtsgutachten dar. ALPAR AI ist „AI Act ready/aligned“, nicht konform. Den vollständigen Haftungsausschluss finden Sie in den Nutzungsbedingungen.