В «Яндексе» придумали тесты для ИИ на традиционные ценности — часть вопросов от разработчиков скроют

Читать в полной версии

«Яндекс» представил правительству концепцию набора тестовых заданий и эталонных данных для тестирования ИИ-систем на предмет их соответствия традиционным духовно-нравственным ценностям в соответствии с законом «О поддержке развития технологий искусственного интеллекта в России», сообщил «Коммерсантъ».

Источник изображения: Luke Jones/unsplash.com

На совещании рабочей группы по регулированию и административным барьерам ИИ, прошедшем 13 августа, возник спор по поводу того, насколько публичным должен быть набор тестов. По словам источника, ФСБ настаивает на закрытом формате, чтобы разработчики не могли настроить ИИ-модели для прохождения тестов. Но по мнению представителей бизнеса, тесты должны быть публичными, поскольку закрытый формат может быть «несообразно сложным для прохождения и не позволит быстро развивать модели».

В итоге сошлись на комбинированном формате — когда для публичного тестирования будет предложен открытый бенчмарк, а для финальной проверки — закрытый, с идентичными тематиками, но с разными формулировками вопросов. Это позволит разработчикам проводить предварительную проверку моделей в лабораториях и обеспечить достоверность итоговой оценки при сохранении её объективности.

Также пока не определились с тем, кто будет определять содержание бенчмарка. IT-сообщество предлагает сформировать для этого совместную комиссию с участием органов власти, бизнеса и экспертных организаций.

В аппарате профильного вице-премьера Дмитрия Григоренко и Минцифры сообщили «Коммерсанту», что в данный момент все предложения находятся на этапе обсуждения и о конкретных решениях говорить рано.

По мнению бизнес-архитектора проектов ИИ «Авандок» (входит в ГК «Корус Консалтинг») Алексея Борщова, закрытые эталонные ответы являются обязательным условием для безопасности модели, поскольку любой публичный бенчмарк со временем могут взломать даже обычным скриптом. Вместе с тем разработчик должен знать, какие категории проверяются, в какой пропорции и с какими порогами, иначе тест становится лотереей.

В свою очередь, директор по ИБ GreenData Роман Перепонов отметил, что для оценки соответствия ценностям чёткого эталона, как, например, для программирования, быть не может — здесь требуется рубрикаторная или экспертная оценка.