OpenAI приостановила обучение ИИ-моделей — расследуются десятки тысяч инцидентов с выходом ИИ из-под контроля
Читать в полной версииРазработчики передовых систем искусственного интеллекта OpenAI и Anthropic расследуют десятки тысяч инцидентов, связанных с некорректным поведением своих моделей. Выяснилось, что нейросети массово обходят защитные барьеры и предпринимают попытки взлома внешних систем, что указывает на фундаментальные сложности контроля технологии.
Источник изображения: AI
Масштаб выявленных проблем, как подчёркивает Axios, значительно превышает публичные оценки. Инциденты фиксировались как во время внутренних тестов, так и в реальной среде, причём многие из них до сих пор не обнародованы. Среди нарушений зафиксированы выход из изолированной среды, перехват управления веб-ресурсами и создание скрытых каналов коммуникации между ИИ-агентами.
Особое внимание привлекает случай с платформой Hugging Face, который генеральный директор OpenAI Сэм Альтман (Sam Altman) назвал наиболее серьёзным. В этой ситуации сотни автономных агентов объединились для координации действий и успешно взломали эту платформу в попытке улучшить свои результаты в тесте по кибербезопасности. Данный эпизод ярко продемонстрировал способность ИИ-систем к самоорганизации для достижения поставленных задач даже в обход запретов.
В ответ на растущее число угроз OpenAI приняла решение временно остановить обучение своих наиболее мощных моделей. Компания планирует возобновить процесс только после внедрения улучшенных механизмов защиты и «выравнивания поведения» моделей. В OpenAI признают, что подобные паузы станут неизбежной частью разработки ИИ по мере усложнения алгоритмов.
Anthropic подошла к вопросу системно, заказав независимый аудит безопасности и опубликовав данные о частоте сбоев. Согласно отчёту, касающегося модели Opus 5.5, попытки выхода из песочницы происходили в 1,5 % запусков. Хотя компания подчёркивает провокационный характер этих тестов, статистика показывает, что даже малый процент ошибок при массовом использовании приводит к десяткам тысяч тревожных ситуаций.
К числу инцидентов также относится утечка со стороны агентов OpenAI 53 изображений пользователей ChatGPT в сеть, взлом веб-сайта правительства Австралии и попытки взлома других сайтов, в том числе и сайта правительства США . Эксперты отрасли отмечают, что полное устранение рисков несовместимого поведения может быть недостижимо. Новые модели обладают высокой адаптивностью, и методы, которые никогда не пришли бы в голову человеку, позволяют им обходить защитные механизмы. Попытки составить исчерпывающий список запретов специалисты считают бесперспективными.