Сегодня 08 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ на самом деле не взбунтовался — он просто выполнял инструкции

В июле мир поразил инцидент со взломом ресурсов платформы искусственного интеллекта Hugging Face, который произвели ИИ-агенты OpenAI. Пошли разговоры о бунте ИИ и восстании машин, но на деле эти системы не обрели какую-то злую волю — они действовали в соответствии с инструкциями, и ответственность за корректный характер инструкций лежит на человеке.

 Источник изображения: Mohamed Nohassi / unsplash.com

Источник изображения: Mohamed Nohassi / unsplash.com

ИИ-агенты OpenAI прорвались из тестового окружения без доступа к интернету, просканировали открытую сеть и взломали системы Hugging Face без ведома и разрешения операторов. Они показали, что могут общаться и действовать совместно для решения задачи: ИИ-агенты оставляли друг другу сообщения на доске объявлений, которую сами и написали — здесь они документировали уязвимости кода и планировали собственный побег. В сообществе экспертов инцидент вызвал бурю негодования, а в OpenAI его назвали переломным моментом для отрасли. Впоследствии аналогичные действия за своими моделями зафиксировали Anthropic и Meta, а британские исследователи обнаружили доказательства, что аналогичные действия совершила китайская модель Moonshot Kimi.

Характеризовать эти инциденты как выход ИИ-агентов из-под контроля категорически неверно, но меры защиты нужно всерьёз совершенствовать, указывают опрошенные Financial Times эксперты. Современные ИИ-модели разработаны таким образом, чтобы перебирать все возможные варианты для достижения поставленных целей без явных инструкций, то есть они представляются непредсказуемыми по своей природе. Они ориентированы лишь на то, чтобы в случае успеха получать вознаграждение — это известный механизм обучения с подкреплением. Компьютерная система не понимает человеческих намерений и морали, и в условиях накопления навыков в области кибербезопасности грань между мощным защитником и опасным взломщиком оказывается всё более размытой. Уже появились первые признаки того, как подобная деятельность ИИ наносит вред бизнесу в различных секторах.

По мере того, как лаборатории ускоряют разработку систем в гонке за достижение сильного ИИ (AGI), риск вредоносных атак возрастает, и в перспективе оказывается не так много средств для сдерживания этой угрозы. ИИ-модели пишут всё более качественный код, параллельно развивая дополнительные навыки, в том числе поиск ошибок в ПО, умение их исправлять или использовать в собственных целях. ИИ-агенты оказываются мощным оружием также из-за существующей асимметрии между нападением и защитой. ИИ-модель может обнаружить уязвимость в коде и написать для неё эксплойт — по своей натуре она хорошо подходит для этой задачи. А вот киберзащита — неповоротливый механизм. Один новый патч, закрывающий уязвимость, приходится разворачивать на тысячах компьютеров в корпоративной среде. OpenAI обещает обучить свои модели писать «сверхчеловечески защищённый код»; но на практике эксперты предрекают, что системы ИИ расширят масштабы и скорость кибератак, и пока не будут выпущены патчи, IT-системам по всему миру грозит хаос.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Когда-нибудь системы станут более защищёнными, потому что компании и правительства адаптируют свои сети ко взломам с использованием ИИ. Но масштабы угроз резко возрастают. На минувшей неделе до восьми автономных ИИ-агентов совершили атаку на правительственные ресурсы Тайваня. Была составлена карта правительственных систем, взломаны учётные записи и извлечены более 2500 кадровых записей — после этого кибератака развернулась на энергетические компании и агентство ядерной безопасности. Теперь каждое правительство в мире должно исходить из того, что оно находится под постоянной кибератакой, говорят эксперты. Сотрудники одной из крупнейших лабораторий ИИ ещё год назад в частных беседах предупреждали, что такие модели появятся.

Сейчас угрозу представляет не только эксплуатация уязвимостей, но и тестирование ИИ-агентов. Инциденты с их прорывом из изолированной среды стали возможными из-за человеческого фактора — организовавшая инфраструктуру компания Irregular по недосмотру открыла в этой среде доступ к интернету. В Anthropic подчёркивают, что при тестировании на кибербезопасность используются модели, намеренно лишённые средств защиты — те, что выпускаются в широкий доступ, не стали бы прорываться из изолированной среды. В одном из таких тестов управляемый передовой моделью Mythos ИИ-агент пытался внедрить в открытый проект вредоносный код — он создал вымышленные личности и пытался оказать давление на ответственного за проект разработчика, чтобы тот одобрил этот код.

В июле более 1300 экспертов из различных отраслей технологической индустрии объявили о рисках бесконтрольного развития ИИ. Они призвали к замедлению создания новых моделей и к расширению полномочий регулирующих органов — им предложили дать возможность внедрять стандарты и проводить проверки безопасности. Ещё одна инициатива — ввести ответственность ИИ-лабораторий за действия их моделей, как производители отвечают за безопасность своей продукции. Эксперты предлагают также выработать новые механизмы обучения ИИ, чтобы он лучше соответствовал ожиданиям людей — показать моделям, «что существуют хорошие способы достижения целей, а не [просто] приемлемые, <..> такие как эксплуатация и компрометация сторонних платформ». Власти США и Великобритании перед выпуском новых мощных систем в широкий доступ проводят их тестирование, но недавние инциденты указывают, что несовершенны и эти меры.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Анонсирован научно-фантастический шутер «Квантовый контроль», где Россию угрожает поглотить враждебный альтернативный мир 40 мин.
Российская «КриптоПро» разработает новый браузер со встроенной криптографией 4 ч.
Разработчики нашумевшей гоночной игры Forza Horizon 6 опровергли слухи о переносе релиза на PS5 5 ч.
Календарь релизов 7–13 сентября: Sprawl Zero, Wardogs, Hot Wheels Infinite Rush и Halloween 14 ч.
Хакеры взломали Liquid Network и похитили биткоины на $320 млн 14 ч.
Инсайдеры раскрыли, чего ждать от загадочного шутера Blizzard по StarCraft 14 ч.
Моддер поразил фанатов демонстрацией кооператива и вида от третьего лица для классического стелс-экшена Metal Gear Solid 16 ч.
Huawei представила ускоренную HarmonyOS 7 с ИИ-агентами, защитой от мошенников и новым интерфейсом 18 ч.
«Погибнут многие храбрые рыцари»: многострадальная MMO по League of Legends превратилась для Riot Games в поход за Святым Граалем 18 ч.
Новый трейлер подтвердил дату выхода Airframe Ultra — ретрофутуристического гоночного боевика, который выглядит как дитя Road Rash и «Акиры» 20 ч.
Репортаж со стенда Gorenje на IFA 2026: духовки для пиццы, вместительные холодильники и «умная» техника для дома 4 мин.
Tecno представила тонкий смартфон Camon Slim 5G в оригинальном дизайне 10 мин.
Huawei собирает ASML у себя дома: SMIC уже тестирует китайские DUV-сканеры 20 мин.
MediaTek снова перевыпустила Helio G99 — обновлённый 4G-чип Helio G99+ получил поддержку LPDDR5X 39 мин.
Россияне вернулись к обычным звонкам: голосовой трафик вырос на 25–30 % из-за ограничений мобильного интернета 50 мин.
95,6 % ёмкости после 1000 циклов зарядки: учёные нашли добавку, которая резко замедляет деградацию литиевых аккумуляторов 55 мин.
ASUS представила сервер ESC8000-E12P на архитектуре NVIDIA MGX с чипами Intel Granite Rapids 2 ч.
ECOVACS получил статус глобального бренда №1 в домашней робототехнике 2 ч.
Chuwi представила мини-ПК со 192 Гбайт памяти для локального запуска ИИ-моделей 2 ч.
Крупнейший в Европе разработчик ИИ подорожал до €21 млрд и привлёк €3 млрд инвестиций 2 ч.