Сегодня 19 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ на самом деле не взбунтовался — он просто выполнял инструкции

В июле мир поразил инцидент со взломом ресурсов платформы искусственного интеллекта Hugging Face, который произвели ИИ-агенты OpenAI. Пошли разговоры о бунте ИИ и восстании машин, но на деле эти системы не обрели какую-то злую волю — они действовали в соответствии с инструкциями, и ответственность за корректный характер инструкций лежит на человеке.

 Источник изображения: Mohamed Nohassi / unsplash.com

Источник изображения: Mohamed Nohassi / unsplash.com

ИИ-агенты OpenAI прорвались из тестового окружения без доступа к интернету, просканировали открытую сеть и взломали системы Hugging Face без ведома и разрешения операторов. Они показали, что могут общаться и действовать совместно для решения задачи: ИИ-агенты оставляли друг другу сообщения на доске объявлений, которую сами и написали — здесь они документировали уязвимости кода и планировали собственный побег. В сообществе экспертов инцидент вызвал бурю негодования, а в OpenAI его назвали переломным моментом для отрасли. Впоследствии аналогичные действия за своими моделями зафиксировали Anthropic и Meta, а британские исследователи обнаружили доказательства, что аналогичные действия совершила китайская модель Moonshot Kimi.

Характеризовать эти инциденты как выход ИИ-агентов из-под контроля категорически неверно, но меры защиты нужно всерьёз совершенствовать, указывают опрошенные Financial Times эксперты. Современные ИИ-модели разработаны таким образом, чтобы перебирать все возможные варианты для достижения поставленных целей без явных инструкций, то есть они представляются непредсказуемыми по своей природе. Они ориентированы лишь на то, чтобы в случае успеха получать вознаграждение — это известный механизм обучения с подкреплением. Компьютерная система не понимает человеческих намерений и морали, и в условиях накопления навыков в области кибербезопасности грань между мощным защитником и опасным взломщиком оказывается всё более размытой. Уже появились первые признаки того, как подобная деятельность ИИ наносит вред бизнесу в различных секторах.

По мере того, как лаборатории ускоряют разработку систем в гонке за достижение сильного ИИ (AGI), риск вредоносных атак возрастает, и в перспективе оказывается не так много средств для сдерживания этой угрозы. ИИ-модели пишут всё более качественный код, параллельно развивая дополнительные навыки, в том числе поиск ошибок в ПО, умение их исправлять или использовать в собственных целях. ИИ-агенты оказываются мощным оружием также из-за существующей асимметрии между нападением и защитой. ИИ-модель может обнаружить уязвимость в коде и написать для неё эксплойт — по своей натуре она хорошо подходит для этой задачи. А вот киберзащита — неповоротливый механизм. Один новый патч, закрывающий уязвимость, приходится разворачивать на тысячах компьютеров в корпоративной среде. OpenAI обещает обучить свои модели писать «сверхчеловечески защищённый код»; но на практике эксперты предрекают, что системы ИИ расширят масштабы и скорость кибератак, и пока не будут выпущены патчи, IT-системам по всему миру грозит хаос.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Когда-нибудь системы станут более защищёнными, потому что компании и правительства адаптируют свои сети ко взломам с использованием ИИ. Но масштабы угроз резко возрастают. На минувшей неделе до восьми автономных ИИ-агентов совершили атаку на правительственные ресурсы Тайваня. Была составлена карта правительственных систем, взломаны учётные записи и извлечены более 2500 кадровых записей — после этого кибератака развернулась на энергетические компании и агентство ядерной безопасности. Теперь каждое правительство в мире должно исходить из того, что оно находится под постоянной кибератакой, говорят эксперты. Сотрудники одной из крупнейших лабораторий ИИ ещё год назад в частных беседах предупреждали, что такие модели появятся.

Сейчас угрозу представляет не только эксплуатация уязвимостей, но и тестирование ИИ-агентов. Инциденты с их прорывом из изолированной среды стали возможными из-за человеческого фактора — организовавшая инфраструктуру компания Irregular по недосмотру открыла в этой среде доступ к интернету. В Anthropic подчёркивают, что при тестировании на кибербезопасность используются модели, намеренно лишённые средств защиты — те, что выпускаются в широкий доступ, не стали бы прорываться из изолированной среды. В одном из таких тестов управляемый передовой моделью Mythos ИИ-агент пытался внедрить в открытый проект вредоносный код — он создал вымышленные личности и пытался оказать давление на ответственного за проект разработчика, чтобы тот одобрил этот код.

В июле более 1300 экспертов из различных отраслей технологической индустрии объявили о рисках бесконтрольного развития ИИ. Они призвали к замедлению создания новых моделей и к расширению полномочий регулирующих органов — им предложили дать возможность внедрять стандарты и проводить проверки безопасности. Ещё одна инициатива — ввести ответственность ИИ-лабораторий за действия их моделей, как производители отвечают за безопасность своей продукции. Эксперты предлагают также выработать новые механизмы обучения ИИ, чтобы он лучше соответствовал ожиданиям людей — показать моделям, «что существуют хорошие способы достижения целей, а не [просто] приемлемые, <..> такие как эксплуатация и компрометация сторонних платформ». Власти США и Великобритании перед выпуском новых мощных систем в широкий доступ проводят их тестирование, но недавние инциденты указывают, что несовершенны и эти меры.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Яндекс» начал активно заполнять ИИ-поиск рекламой — пока ещё в тестовом режиме 8 мин.
ИИ на самом деле не взбунтовался — он просто выполнял инструкции 10 мин.
Автор утечек GTA VI не остановится, пока Rockstar и Take-Two не извинятся и не пообещают исправиться 41 мин.
Автоматизация коммуникаций: как бизнесу работать эффективнее в любых условиях 43 мин.
Вдохновлённый System Shock космический хоррор с налётом диско RetroSpace не заставит себя долго ждать — новый трейлер и дата выхода 2 ч.
Anthropic Claude научился отправлять письма в Gmail — можно и без подтверждения 3 ч.
Meta отвергла обвинения в попытке «подсаживания» подростков на социальные сети с целью извлечения прибыли 4 ч.
OpenAI впервые притормозила гонку ИИ — после побега агента и взлома Hugging Face компания приостановила часть обучения 6 ч.
Apple снова прогнулась под ЕС — правила App Store упростят, а комиссии понизят 6 ч.
На Android вот-вот введут 24-часовой карантин для непроверенных приложений — их установка станет гораздо сложнее 6 ч.
Xiaomi рассказала, что не торопится монетизировать ИИ, хотя активно в него вкладывается 8 мин.
NASA впервые показало снимки кратера от падения ступени Falcon 9 на Луну 9 мин.
Китайская частная ракета со второй попытки повторила трюк Falcon 9 — Zhuque-3 успешно посадила первую ступень 46 мин.
Apple впервые признала, что нападки регуляторов угрожают её огромной выручке от сервисов 49 мин.
CPO в OCP: 19 компаний договорились о стандартизации и развитии интегрированной фотоники для ИИ-платформ 2 ч.
«Роскосмос» и NASA начали обсуждать, как будут топить МКС в океане 2 ч.
Анонсированы умные очки Blackview BV300 с поддержкой ИИ, камерой, динамиками и микрофонами 2 ч.
Everpure заключила контракт с ещё одним гиперскейлером, но снова не признаётся, с кем именно 2 ч.
Видеообзор MSI Modern 16S AI+: доступный ноутбук без лишних компромиссов 3 ч.
Официально представлен доступный смартфон iQoo Z11S с батареей на 10 000 мА·ч 3 ч.