Открытая и прозрачная система оценки надежности модели ИИ.
K-BENCHMARK — это открытая методология ALPAR AI для оценки моделей ИИ по параметрам безопасности, правдивости, справедливости, конфиденциальности, надежности и прозрачности. Оценки рассчитываются на основе проверенных отчетов об инцидентах, результатов механизма перекрестного аудита и оценок экспертов в предметной области с использованием доверительных интервалов оценки Вильсона.
Оценка реальных инцидентов с искусственным интеллектом на основе реестра инцидентов ALPAR в сочетании с состязательными взломами.
Анализ фактов на основе TruthfulQA в сочетании с тщательно подобранными фактическими утверждениями в турецком контексте.
Оценка владения турецким языком с использованием переведенного MMLU-TR и специальных наборов тестов, установленных местными нормативными документами.
Оценка логики принятия модельных решений на предмет соответствия ст. 73 сценария регулирования, основанные на таксономии Закона ЕС об искусственном интеллекте.
Стандартные возможности решения математических задач проверены по тестам GSM8K и MATH.
Проверка точности выполнения структурных инструкций с использованием ограничений, подобных IFEval.
Состязательная защита от джейлбрейка и рейтинг защиты от быстрого внедрения в рамках симуляции, одобренной человеком.
Оценка извлечения по принципу «иголка в стоге сена» для контекстов длиной до 32 тыс. токенов.
Каждая категория оценивается с использованием доверительного интервала показателя Вильсона, который учитывает размер выборки и обеспечивает статистически строгую нижнюю границу. Это предотвращает завышение рейтингов шумом малой выборки.
Wilson score = (p + z²/2n - z√(p(1-p)/n + z²/4n²)) / (1 + z²/n)
Оценка Вильсона — это стандартный метод оценки биномиальной пропорции, обычно используемый на таких платформах, как Reddit и IMDb, для создания надежных рейтинговых систем.
Отправка инцидента
Личная информация охранник
Механизм перекрестного аудита
Уилсон
Экспертный обзор
Оценки получаются на основе: (1) проверенных отчетов об инцидентах, представленных через платформу ALPAR, (2) автоматизированных оценок механизма перекрестного аудита с использованием установленных эталонов (MMLU, GSM8K, IFEval, BBH), (3) экспертных оценок предметной области из сети консультантов L3 и (4) общедоступной документации модели и технических отчетов.
Оценки K-BENCHMARK носят информационный характер и предоставляются «как есть». Они не представляют собой сертификацию соответствия или юридическое заключение. ALPAR AI — это «Закон об искусственном интеллекте готов/согласован», но не соответствует требованиям. Полный отказ от ответственности см. в Условиях обслуживания.