ИИ научился находить уязвимости в ПО, но для их исправления всё ещё нужны люди
Читать в полной версииМодели искусственного интеллекта доказали, что могут эффективно находить уязвимости ПО и эксплуатировать их, но не исправлять. На эту особенность обратили внимание эксперты лаборатории Off-by-1 компании 1Password — изучив механизмы работы моделей OpenAI ChatGPT 5.5 и Anthropic Claude Opus 4.8, они обнаружили, что без участия человека ИИ способен устранять уязвимости в ПО только в одном из четырёх случаев.
Источник изображения: Fotis Fotopoulos / unsplash.com
«Для шести недавно обнаруженных уязвимостей мы выпустили 6080 патчей, используя две новейшие рассуждающие модели. Средний показатель успеха при создании патча, который полностью устраняет уязвимость (без существенного изменения поведения приложения), составил всего 26,0 %», — заявили исследователи. Из созданных ИИ патчей 20,1 % исправили исходную проблему, но изменили поведение приложения: например, логика «списка разрешённых» превратилась в логику «списка запрещённых»; в 2,3 % случаев при исправлении одной уязвимости возникла другая; в 49,3 % случаев ИИ не создал защиты ни от одного из вариантов эксплойта; а в 2,2 % случаев ИИ не только не исправил уязвимость, но и создал ещё один вариант для её эксплуатации.
Среди успешных патчей, даже если они изменяли поведение приложения, исправление уязвимости оказалось «хрупким»: конкретная уязвимость исчезала, но основную проблему решить не удавалось. Успех работы ИИ зависит от первоначальной установки — её требуется давать как ИИ, так и человеку, исправляющему уязвимость. Но если инструкции будут неверными, ИИ с большей вероятностью потерпит неудачу. Если запрос будет корректным, то ИИ справится с вероятностью 65 %; полное отсутствие запроса снижает вероятность успеха до 50,4 %, а некорректный запрос — до 15,2 %. У человека-разработчика при анализе уязвимого кода сохраняются высокие шансы выявить вводящую в заблуждение информацию.
В среднем создание корректного патча обходится всего в $6,74, включая затраты на неудачные попытки. Но при анализе затрат и выгод следует учитывать, какой объём экспертного надзора требуется, чтобы применение ИИ себя оправдывало.