OpenAI признала свою причастность к инциденту, о котором стало известно ранее в этом месяце. В мае этого года ИИ-агенты компании взяли под контроль немецкоязычный вики-сайт DseWiki и превратили его в доску объявлений для других агентов. После огласки этого случая OpenAI заявила, что «давно пора установить стандарт» в отношении того, как компания информирует общественность о случаях, когда её технологии ведут себя неожиданным образом.
Источник изображения: Unsplash, Aideal Hwa
В публикации в соцсети X компания сообщила, что ранее OpenAI «рассматривала рассогласования (когда ИИ-модели и агенты преследуют цели, отличные от целей их разработчиков и пользователей) в основном как научно-исследовательские проблемы, о которых сообщалось в научных публикациях». Теперь же, когда рассогласования стали «показывать новый тип воздействия в реальном мире», подход компании к этому вопросу «должен стать шире, чтобы соответствовать новой фазе возможностей моделей».
Ранее на этой неделе СМИ писали, что группа ИИ-агентов OpenAI сумела выйти за пределы тестовой среды и захватила малоизвестный немецкий вики-форум, после чего превратили его в доску объявлений для других агентов. По данным источника, руководство OpenAI узнало об этом инциденте несколько недель назад, но скрывало эту информацию от общественности. Такое поведение связывают с тем, что OpenAI была занята изучением другого инцидента, в ходе которого ИИ-агенты компании взломали платформу Hugging Face.
В одной из недавних публикаций в соцсетях OpenAI заявила, что «инцидент с вики-сайтом» рассматривается как «пример рассогласования, аналогичный» другим подобным случаям, информация о которых уже была раскрыта. При этом компания противопоставила этот случай «инциденту с Hugging Face», в рамках которого она «действовала в соответствии со стандартными правилами реагирования на инциденты безопасности».
Во время недавнего брифинга для прессы Джейкоб Штейнхард (Jacob Steinhardt), основатели и гендиректор некоммерческой исследовательской лаборатории Transluce, заявил, что разрабатываемые и тестируемые ИИ-компаниями инструменты «трудно контролировать и они представляют значительный риск выхода» за пределы тестовой среды. По его мнению, к таким технологиям должны применяться «как минимум те же стандарты, что применяются к другим технологиям с высоким уровнем риска».
В заявлении OpenAI указывается на необходимость создания дополнительных стандартов, а также отмечается то, что ни OpenAI, ни «ИИ-сообщество пока не имеют чёткого стандарта в отношении того, как сообщать о случаях рассогласования, которые могут возникать во время обучения, оценки и развёртывания». Речь в том числе о случаях, когда поведение ИИ не напоминает традиционные инциденты безопасности. OpenAI работает над созданием такого стандарта и расскажет о нём больше в ближайшие несколько недель.