🕵️♂️ «Яндекс» предложил создать бенчмарк для проверки ИИ на духовно-нравственные ценности
Компания «Яндекс» представила правительству РФ концепцию единого датасета и набора контрольных заданий для тестирования моделей искусственного интеллекта.
Инициатива, озвученная 13 августа на совещании рабочей группы по регулированию ИИ, призвана дать государству и бизнесу инструмент для оценки пригодности алгоритмов к работе в российском правовом и культурном поле.
Разрабатываемый бенчмарк представляет собой комплекс стандартизированных тестов с эталонными ответами, позволяющий объективно сравнивать разные ИИ-системы. В отличие от базовых тестов, система будет оценивать не только решение прикладных задач (работа с базами данных, выгрузка отчетов), но и соответствие моделей традиционным ценностям и «духу времени».
Ключевой точкой дискуссии между регуляторами и отраслью стала степень доступности тестов. ФСБ настаивает на полностью закрытом формате датасета, чтобы исключить целевое «подгоночное» обучение моделей под правильные ответы. Бизнес опасается, что закрытая проверка превратит сертификацию в лотерею и замедлит релизные циклы, которые у разработчиков сегодня измеряются неделями.
Компромиссный вариант предполагает гибридную модель: открытый бенчмарк для отладки в лабораториях и закрытый – с аналогичной тематикой, но измененными формулировками – для финальной аттестации.
Эксперты рынка отмечают методологическую сложность проекта. Если в математике или программировании существует четкий эталон, то оценка ценностных ориентиров требует экспертной или рубрикаторной проверки. Также в ИТ-сообществе настаивают на формировании совместной комиссии из представителей власти, бизнеса и экспертов для определения содержания тестов.
В Минцифры и аппарате вице-премьера Дмитрия Григоренко подтвердили факт обсуждений, подчеркнув, что подзаконные акты к закону об ИИ находятся в стадии проработки, а конкретные решения будут приняты с учетом интересов пользователей и разработчиков.v
Источник: Коммерсант