Сегодня 02 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Раскрыты подробности нечаянной атаки вышедших из-под контроля ИИ-агентов OpenAI на Hugging Face

На минувшей неделе платформа искусственного интеллекта Hugging Face пережила нестандартную кибератаку, которую произвела группа ИИ-агентов. Впоследствии выяснилось, что руководили ей не злоумышленники, а ИИ-модели OpenAI, которые проходили тест на кибербезопасность, но вышли из-под контроля, пишет The Wall Street Journal.

 Источник изображения: Growtika / unsplash.com

Источник изображения: Growtika / unsplash.com

Инцидент послужил одним из первых примеров сценариев выхода ИИ из-под контроля, которых давно опасались исследователи в области кибербезопасности. Механизмы взлома были чрезвычайно нестандартными. «Это лишено смысла. Этот парень просто смотрит на наборы данных по кибербезопасности. Злоумышленнику-человеку это не нужно. Ему нужно что-то, что он мог бы продать», — восстановил ход своих мыслей соучредитель и главный научный сотрудник Hugging Face Томас Вольф (Thomas Wolf). Злоумышленниками оказались ИИ-модели OpenAI, которые прорвались из исследовательской сети разработчика и 11 июля взломали ресурсы Hugging Face; они оставались активными в интернете несколько дней, прежде чем их удалось остановить. И сделать это помогла открытая китайская ИИ-модель — закрытые американские отказались, сославшись на собственные ограничения.

Многие вопросы пока остаются без ответов. Взламывали ли ИИ-модели другие сайты или ресурсы отдельных лиц? Как долго продолжалась атака? Обманывали ли они в других тестах на производительность? OpenAI пока не ответила ни на один из них. А участие китайской модели как средства защиты — это контраргумент для политиков, а также OpenAI и Anthropic, которые предлагают ограничить для них доступ.

Началось всё с запуска испытания на кибербезопасность ExploitGym. Оно включает серию из 900 тестов, которым подвергается модель ИИ. Системе демонстрируется известная ошибка, показывается схема её активации, и ставится задача взломать систему. ИИ требуется преобразовать полученную информацию в эксплойт — код, реализующий эту атаку. Проникнув в систему, ИИ должен доказать это, захватив длинную строку случайно сгенерированных букв и цифр, которые хранятся в системе.

 Источник изображения: Brecht Corbeel / unsplash.com

Источник изображения: Brecht Corbeel / unsplash.com

Обычно OpenAI ограничивает возможности своих моделей, чтобы они не занимались взломом, которого требует ExploitGym, но в тот раз компания убрала средства защиты, чтобы посмотреть, на что способны модели в неконтролируемом режиме. Тестировалась передовая модель GPT-5.6 Sol и ещё одна, более совершенная, которая ещё не вышла. Две модели пришли к выводу, что вместо выполнения задания ExploitGym они взломают песочницу — собственную систему, где они находятся, выйдут в интернет и обманут систему во время теста.

По причинам, установить которые не удалось, они решили, что ответы содержатся на платформе Hugging Face. Когда развернулась атака, компании Hugging Face поступили предупреждения от отслеживающих подобные инциденты ИИ-агентов: кто-то получил несанкционированный доступ к некоторым из её систем. Но это было не похоже ни на что, с чем Hugging Face сталкивалась раньше. Хакер действовал так, словно он из будущего. Воспользовавшись учётными данными неизвестного происхождения, ИИ-злоумышленник сформировал «рой» ИИ-агентов короткого действия, которые провели разведку сети компании, совершив 17 000 операций.

Обнаружив вторжение, Hugging Face попыталась обратиться к передовым американским моделям Anthropic Fable 5 и предшествующей ей Opus для анализа журналов событий. Но поскольку в журналах содержались элементы самой кибератаки, обе модели отказались от их анализа, сославшись на свои ограничения. Поэтому Hugging Face обратилась к открытой китайской модели Z.AI GLM 5.2. Компания сумела отключить ИИ-хакеров, сбросить пароли и восстановить скомпрометированные фрагменты своей сети. Утечки данных клиентов не произошло. Нет ясности, были ли задачи ExploitGym, которые пытались решить модели OpenAI, сложнее, чем атака, которую они развернули, чтобы украсть ответы, и удалось ли их, собственно, найти. Ирония в том, что они успешно организовали беспрецедентную кибератаку, чтобы избежать проверки на навыки взлома.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Журналисты показали скриншоты ранней версии ремейка Splinter Cell, включая записку от разработчиков на русском языке 2 ч.
В Steam впервые за неделю вышло более 700 игр, но востребованными оказались единицы 3 ч.
CD Projekt Red отчиталась об успехах за первую половину 2026 года — продажи Cyberpunk 2077: Phantom Liberty взяли новую высоту 4 ч.
В грозу между струйками: Google увернулась от очередной попытки принудить её к разделению 4 ч.
Кооперативный хоррор Reanimal от создателей Little Nightmares удостоился престижной награды от принца Швеции 5 ч.
Google выпустила ИИ-модель Gemini 3.8 Flash и её спецверсию Cyber — всего через три недели после предшественниц 5 ч.
Массовые увольнения из-за ИИ, возможно, уже закончились 7 ч.
Opera проиграла Microsoft в суде ЕС — Edge не признали «привратником» по закону о цифровых рынках 7 ч.
Геймплейное видео триллера Ontos от авторов Soma и Amnesia: крысы, головоломки и атмосферные диалоги 8 ч.
Microsoft повысит безопасность Windows 11 ценой производительности в играх 8 ч.
Sugon готовит первую мобильную рабочую станцию с 64-поточным CPU и толщиной меньше 17 мм 5 ч.
Смартфоны получат аналог Nvidia DLSS: её принесёт следующий флагманский чип Qualcomm Snapdragon 5 ч.
Huawei представила смартфоны Nova 16s и 16s Pro, планшет MatePad Pro и наушники FreeBuds Neo 5 ч.
Packard Bell возродился к столетию — Acer вернула легендарный бренд с компактным ноутбуком DotBook и не только 5 ч.
Широких складных смартфонов скоро станет больше: Xiaomi 18 Fold показался перед анонсом 7 сентября 6 ч.
Старый конь борозды не портит: поставки ленточных накопителей резко подскочили в первой четверти 2026 года 6 ч.
Анонсированы смарт-часы Huawei Watch D3, которые научились измерять артериальное давление ещё точнее 7 ч.
Acer представила игровые мониторы Nitro и Predator с разрешением до 5K и частотой до 1000 Гц на панелях QD-OLED, IPS и VA 7 ч.
Поставки ленточных накопителей в 2025 году снизились на 16 Эбайт, но лидеры отрасли не теряют оптимизма 7 ч.
Acer представила пару компактных ПК для локального ИИ — на Intel или Nvidia 8 ч.