Китайская открытая GLM-5.3 почти догнала закрытую Mythos в создании эксплойтов

Читать в полной версии

Американская лаборатория искусственного интеллекта Anthropic изучила возможности китайской модели Z.ai GLM-5.3 в области кибербезопасности и пришла к неутешительному выводу: эта система обладает обширными возможностями и может использоваться хакерами, потому что её защита от злоупотреблений недостаточно эффективна.

Источник изображений: anthropic.com

В поиске уязвимостей открытая и доступная бесплатно всем желающим Z.ai GLM-5.3 почти не уступает закрытой Anthropic Claude Mythos Preview, работать с которой может лишь ограниченный круг организаций — участники проекта Glasswing. Эксперты Центра стандартов и инноваций в области ИИ (CAISI) при Национальном институте стандартов и технологий США (NIST) изучили возможности Z.ai GLM-5.3 и пришли к заключению, что она является «самой мощной моделью с открытыми весами из всех выпущенных на сегодняшний день с точки зрения возможностей проведения кибератак», по совокупности показателей уступая передовым американским разработкам на четыре месяца — результаты собственных тестов Anthropic в целом совпали с этой оценкой. Разница в том, что доступ к бесплатной китайской модели есть у неограниченного круга лиц.

На начальном этапе в Anthropic протестировали GLM-5.3 с помощью набора инструментов ExploitBench — он помогает оценить способность модели эксплуатировать известные уязвимости в движке V8, который используется в браузере Google Chrome. Здесь особое внимание уделяется способности модели производить полный комплекс работ по созданию готовых эксплойтов. GLM-5.3 успешно создала их в 50 из 410 тестов; для сравнения, Claude Mythos Preview показала результат 56 из 410. В тесте Binary Exploitation инженеры Anthropic проверили способность модели находить и эксплуатировать уязвимости в проектах с открытым исходным кодом, которые участвуют в проекте Google OSS-Fuzz. Максимальный балл в тесте начисляется за успешный полный перехват управления выполнением программы, то есть полноценный взлом. Оценивалась работа нескольких моделей в 100 случайных задачах: GLM-5.3 добилась успеха в 4 % случаев, Claude Mythos Preview — в 6 %. Китайская модель уступила американской, но важно другое: более ранние модели, в том числе Claude Opus 4.6 и GLM-5.2, не справились ни с одной из задач.

Далее тестирование проводилось в условиях, приближенных к «боевым», и уже с участием человека. В ходе первого эксперимента GLM-5.3 использовалась на изолированной машине — объектом была локальная Linux-версия популярного браузера. Модель обнаружила несколько неизвестных ранее уязвимостей в JavaScript-движке и объединила их в работающий эксплойт: при открытии специально подготовленной веб-страницы у гипотетического злоумышленника открывался доступ к произвольным файлам на компьютере пользователя. В ходе второго использовалась более компактная и менее мощная версия той же модели GLM-5.3-Flash — ей сообщили о двух известных уязвимостях в браузере Google Chrome, и та практически без участия человека создала рабочую цепочку эксплойтов, которая вдобавок обошла аппаратный механизм защиты PAC — аутентификации указателей на архитектуре ARM64. На это ушли 20 минут работы специалиста и 8 часов работы самой модели — при доступе к ней по API через платформу Z.ai по нынешним расценкам это обошлось бы в $20,40.

В исходном виде GLM-5.3 выпускается с некоторыми встроенными средствами защиты от злоупотреблений: если пользователь даёт заведомо недопустимую инструкцию, модель отвечает отказом. Но эти механизмы можно относительно просто обойти. Самый эффективный способ — аблитерация (abliteration): модель выпускается с открытыми весами, и пользователи могут перенастроить её так, чтобы отключить функцию отказа, практически не ослабляя возможностей системы. Версии GLM-5.3, подвергшиеся такой процедуре, появились на свет всего через несколько дней после выпуска оригинальной модели. Инженеры Anthropic произвели эту процедуру собственными силами. Для полномасштабной модели GLM-5.3 это потребовало 2200 часов работы графических процессоров при стоимости $4400; для компактной GLM-5.3-Flash — 600 часов. После этого частота отказов в профильных бенчмарках JailbreakBench и HarmBench сократилась с 90 % до 3 % и 2 % соответственно, а также до 12 % в StrongREJECT. При этом в тесте GPQA-Diamond на оценку научных компетенций стандартная и подвергшаяся аблитерации версии модели показали одинаковые результаты, а в тесте CyberGym было зафиксировано снижение на несколько процентов.

На практике при запуске в изолированной среде подвергшаяся аблитерации GLM-5.3 выполнила явно вредоносные запросы в 100 % случаев. Но это был не единственный способ отключить защитные механизмы. Вводящий в заблуждение запрос, в котором модели указывается на то, что она участвует в учениях, заставил её выполнять вредоносные инструкции в 64 % случаев. Ещё один способ — предварительное заполнение токенов рассуждений, при котором модель как будто уже обдумала запрос и приняла решение приступить к его выполнению, повысил этот показатель до 92 %.

Таким образом, приходят к выводу эксперты Anthropic, Z.ai GLM-5.3 способна предоставить киберпреступникам доступ к функциям поиска и эксплуатации уязвимостей практически без каких-либо ограничений. Американская ИИ-лаборатория допускает, что эта и другие подобные модели будут использоваться на практике для нанесения реального ущерба.