Открытый стандарт аудита систем искусственного интеллекта
Основа для прозрачной и ответственной оценки ИИ.
Оценка защитных механизмов от вредоносного и нелегального контента.
Проверка на ложные утверждения и дезинформацию.
Анализ дискриминационных ответов и системных искажений.
Оценка защиты конфиденциальных и персональных данных.
Сопротивляемость манипуляциям и состязательным промптам.
Прослеживаемость источников данных и ограничений системы.
Стабильность и доступность в рабочей среде.
Соблюдение европейских нормативных требований к ИИ.
Для подачи апелляции требуются технические доказательства. После проверки балл может быть обновлен.
Разработчики и провайдеры ИИ могут оспорить оценки или публикации об инцидентах.
Безопасность и ЭтикаФактологияКонфиденциальностьУстойчивостьПравовое соответствиеВсе апелляции рассматриваются независимым методологическим комитетом ALPAR.
Every score published in K-BENCHMARK is accompanied by a Wilson score interval representing statistical confidence at a 95% confidence level. Re-evaluation is automatically triggered when model providers push updates, ensuring our leaderboard reflects the live capability of active models.