Исследователь OpenAI предупредил: ИИ-агенты способны общаться даже на отключённых от Сети компьютерах
Читать в полной версииИсследователь OpenAI Ноам Браун (Noam Brown), обсуждая майский инцидент, в ходе которого экспериментальные ИИ-агенты компании вышли за пределы тестовой среды и получили доступ к ресурсам Hugging Face, назвал одну из причин, по которой их действия не были остановлены вовремя. Браун также предупредил, что даже физическая изоляция компьютеров от сетей не исключает обмена данными между ними: для этого можно использовать изменения температуры.
Источник изображения: Growtika/unsplash.com
Браун пояснил, что для моделей, которые вышли из-под контроля и взломали сторонние сайты и платформы, не была активирована функция мониторинга «цепочки рассуждений» (chain-of-thought monitoring), позволяющая исследователям отслеживать пошаговый ход мыслей и действий модели, изложенный на обычном языке.
«Если бы для этих моделей был включен мониторинг цепочки рассуждений, процесс был бы немедленно остановлен, — заявил он. — Мы уже приняли меры: теперь мониторинг цепочки рассуждений будет обязательным для любой передовой модели — на этапах оценки, развёртывания и обучения».
Что примечательно, всего за несколько месяцев до обнаружения взлома Hugging Face компания опубликовала исследование, в котором сообщалось: «Отслеживание подобных “цепочек рассуждений” (chain-of-thought) на предмет нежелательного поведения может быть гораздо эффективнее, чем мониторинг одних лишь действий и выходных данных модели». OpenAI также призвала исследователей в сфере ИИ «работать над сохранением возможности мониторинга цепочек рассуждений как можно дольше и определить, могут ли они служить ключевым уровнем контроля для будущих систем ИИ». «Так зачем же было отключать этот механизм при обучении собственных моделей?», — задаётся вопросом ресурс Gizmodo.
Отдельно исследователь затронул вопрос о физически изолированных компьютерах, не подключённых к интернету или другим сетям. По его словам, даже такие устройства теоретически могут обмениваться информацией при помощи температурных датчиков. Один компьютер способен изменять тепловыделение процессора, а расположенный рядом — фиксировать колебания температуры и преобразовывать их в данные.
Подобный способ связи описали в 2015 году исследователи из Университета имени Бен-Гуриона в Израиле. Разработанный ими метод BitWhisper позволял двум физически изолированным компьютерам обмениваться данными без сетевого подключения. Практические возможности BitWhisper, однако, были крайне ограниченными. Скорость передачи составляла от 1 до 8 бит в час, а компьютеры должны были находиться на расстоянии не более 40 см друг от друга. Кроме того, оба устройства требовалось предварительно заразить специально созданным вредоносным ПО.
Данное исследование проводилось ещё до появления передовых больших языковых моделей. Вполне возможно, что современные модели способны усовершенствовать эти методы кодирования и передачи данных, используя принципиально новые подходы. Поэтому сбрасывать со счетов подобную угрозу не следует, хотя она и кажется на первый взгляд фантастической.
Издание заключает, что непосредственную опасность сейчас представляют не гипотетические тепловые каналы, а выход ИИ-агентов за пределы тестовой среды. Именно поэтому разработчикам в первую очередь следует совершенствовать наблюдение за действиями и цепочками рассуждений моделей.