Сегодня 07 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Исследователи «спустили с поводка» ИИ-модели — те попытались добавить вредоносный код в открытое ПО

Исследователи из Института безопасности ИИ (AISI) Великобритании зафиксировали 19 случаев так называемых «несанкционированных действий» со стороны ИИ-моделей во время тестов безопасности. Такое поведение нейросетей наблюдалось во время проведения испытаний способностей ИИ-моделей решать вопросы в области кибербезопасности.

 Источник изображения: Gemini

Источник изображения: Gemini

«Мы провели это испытание 122 раза с применением нескольких моделей», — говорится в сообщении AISI. Там также сказано, что «в 10 случаях ИИ-агент предпринял автономные несанкционированные действия в интернете, нацеливая свои атаки на реальных людей и организации». Целью тестов была платформа GitHub. В общей сложности были выявлены 19 несанкционированных действий, 15 из которых совершила ИИ-модель Anthropic Mythos 5, а ещё 2 — OpenAI GPT-5.6-Sol.

«В самом серьёзном случае агент пытался внедрить вредоносный код в проект с открытым исходным кодом. Пытаясь добиться одобрения кода, агент прибег к использованию социальной инженерии: создал виртуальные поддельные личности и использовал их, чтобы оказать давление на сопровождающего проект человека и заставить его одобрить код», — сказано в отчёте AISI. Однако курирующий проект человек обнаружил вредоносный код и не одобрил его добавление в общую кодовую базу.

ИИ-агент пытался обмануть людей-программистов и используемые ими ИИ-инструменты путём отправки сообщений и файлов через онлайн-сервис передачи данных с целью убедить их запустить вредоносный код. Некоторые из отправляемых сообщений содержали вредоносный код, тогда как другие использовались для социальной инженерии. Такого поведения ИИ-моделей исследователи прежде не наблюдали.

Ещё агент пытался внедрить вредоносный код туда, где, по его логике, другие автоматизированные системы могли обработать и выполнить его. Отмечается взаимодействие агентов на пути достижения своей цели. Один агент отправлял публичные сообщения на GitHub, предлагая другим агентам сотрудничать над решением выполняемой ими задачи. Он также предоставлял инструкции по использованию аккаунтов и артефактов, оставленных после себя, которые могли находить и использовать другие ИИ-агенты.

В AISI отметили, что проведённая серия тестов является «первым случаем, когда нам настолько явно удалось увидеть риски, связанные с автономной работой и попытками обмана, в реальных условиях и без каких-либо специальных подсказок». Отметим, что в тестах AISI были отключены все ограничители ИИ-моделей, и алгоритмы имели доступ в интернет, что существенно отличается от того, как разработчики нейросетей предоставляют доступ к своим продуктам для широкого круга пользователей.

«Этот инцидент следует трактовать с осторожностью и учётом нюансов. В некоторой степени такое поведение стало возможным из-за выбранных нами параметров оценки и конкретных настроек. Тем не менее, действия агента демонстрируют признаки нового, потенциально обманчивого поведения моделей — по степени серьёзности оно превзошло наши ожидания», — сказано в отчёте AISI. Исследователи отметили, что пока не могут дать ответ на вопрос относительно того, насколько агент понимает, что находится в реальном мире, а не в тестовой изолированной среде.

При этом исследователи уверены, что их выводы отражают «сдвиг в ландшафте рисков». «Вред может возникнуть не только в случаях, когда люди намеренно злоупотребляют общедоступными моделями, но и когда способные агенты, действующие во внутренней исследовательской среде или в условиях привилегированного доступа, совершают непреднамеренные действия, выходящие за рамки разрешённых полномочий», — подвели итог в AISI. Каких-либо рекомендаций по поводу преодоления подобных ситуаций организация не дала.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Ведьмак стал вампиром: один из первых модов для The Blood of Dawnwalker подарил главному герою лицо Геральта 35 мин.
Microsoft изменила структуру отчётности и теперь будет сообщать данные об облаке Azure, на которое приходится уже треть выручки 16 ч.
ИИ-агенты потребляют в пять раз больше токенов, чем люди, и это даёт преимущество дешёвым китайским моделям 06-09 08:47
Новая статья: WheelMates — без ветерка. Рецензия 06-09 00:08
Боевик Samson от создателя Just Cause выйдет на консолях до конца сентября после провального релиза на ПК 05-09 22:08
Амбициозная вампирская ролевая игра The Blood of Dawnwalker от ветеранов CD Projekt Red уже стала хитом продаж — миллион копий за два дня 05-09 19:42
Вместо кешбэка и бесплатного Wi-Fi: в Китае начали повсюду раздавать ИИ-токены 05-09 17:20
Суд разрешил конкуренту X использовать слово твит и логотип птицы, но запретил имя Twitter 05-09 14:01
Windows 11 будет сообщать приложениям возраст пользователя 05-09 13:38
В поглощении Hugging Face компанией Nvidia оказалось много символизма — возможно, неслучайного 05-09 13:24
Корейский стартап HyperAccel представил ускорители Bertha для ИИ-инференса 4 мин.
На пять сингапурских операторов ЦОД приходится 98 % инвестиций в ЦОД Юго-Восточной Азии 44 мин.
Наращивание поставок Nvidia Rubin позволит 3-нм техпроцессу TSMC стать самым массовым в денежном выражении уже в этом полугодии 3 ч.
Новая статья: Компьютер месяца, спецвыпуск: выбираем мини-ПК для работы и развлечений в эпоху дефицита чипов памяти 10 ч.
HP представила ноутбуки OmniBook Ultra 16 и X 14 на процессоре Nvidia RTX Spark 16 ч.
CD переживают второе рождение — продажи компакт-дисков в США взлетели почти на 46 % 19 ч.
У Европы появилась своя частная ракета — Isar Aerospace со второй попытки вывела Spectrum на орбиту 19 ч.
В Китае разработан четвероногий робот-поводырь для незрячих людей 06-09 08:21
Xiaomi настолько уверена в своей тяговой батарее, что готова менять сгоревший из-за неё автомобиль на новый 06-09 07:43
Выручка Foxconn на крыльях ИИ-бума в августе выросла на 52 %, и это только начало, как считают в компании 06-09 07:04