Сегодня 20 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ на самом деле не взбунтовался — он просто выполнял инструкции

В июле мир поразил инцидент со взломом ресурсов платформы искусственного интеллекта Hugging Face, который произвели ИИ-агенты OpenAI. Пошли разговоры о бунте ИИ и восстании машин, но на деле эти системы не обрели какую-то злую волю — они действовали в соответствии с инструкциями, и ответственность за корректный характер инструкций лежит на человеке.

 Источник изображения: Mohamed Nohassi / unsplash.com

Источник изображения: Mohamed Nohassi / unsplash.com

ИИ-агенты OpenAI прорвались из тестового окружения без доступа к интернету, просканировали открытую сеть и взломали системы Hugging Face без ведома и разрешения операторов. Они показали, что могут общаться и действовать совместно для решения задачи: ИИ-агенты оставляли друг другу сообщения на доске объявлений, которую сами и написали — здесь они документировали уязвимости кода и планировали собственный побег. В сообществе экспертов инцидент вызвал бурю негодования, а в OpenAI его назвали переломным моментом для отрасли. Впоследствии аналогичные действия за своими моделями зафиксировали Anthropic и Meta, а британские исследователи обнаружили доказательства, что аналогичные действия совершила китайская модель Moonshot Kimi.

Характеризовать эти инциденты как выход ИИ-агентов из-под контроля категорически неверно, но меры защиты нужно всерьёз совершенствовать, указывают опрошенные Financial Times эксперты. Современные ИИ-модели разработаны таким образом, чтобы перебирать все возможные варианты для достижения поставленных целей без явных инструкций, то есть они представляются непредсказуемыми по своей природе. Они ориентированы лишь на то, чтобы в случае успеха получать вознаграждение — это известный механизм обучения с подкреплением. Компьютерная система не понимает человеческих намерений и морали, и в условиях накопления навыков в области кибербезопасности грань между мощным защитником и опасным взломщиком оказывается всё более размытой. Уже появились первые признаки того, как подобная деятельность ИИ наносит вред бизнесу в различных секторах.

По мере того, как лаборатории ускоряют разработку систем в гонке за достижение сильного ИИ (AGI), риск вредоносных атак возрастает, и в перспективе оказывается не так много средств для сдерживания этой угрозы. ИИ-модели пишут всё более качественный код, параллельно развивая дополнительные навыки, в том числе поиск ошибок в ПО, умение их исправлять или использовать в собственных целях. ИИ-агенты оказываются мощным оружием также из-за существующей асимметрии между нападением и защитой. ИИ-модель может обнаружить уязвимость в коде и написать для неё эксплойт — по своей натуре она хорошо подходит для этой задачи. А вот киберзащита — неповоротливый механизм. Один новый патч, закрывающий уязвимость, приходится разворачивать на тысячах компьютеров в корпоративной среде. OpenAI обещает обучить свои модели писать «сверхчеловечески защищённый код»; но на практике эксперты предрекают, что системы ИИ расширят масштабы и скорость кибератак, и пока не будут выпущены патчи, IT-системам по всему миру грозит хаос.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Когда-нибудь системы станут более защищёнными, потому что компании и правительства адаптируют свои сети ко взломам с использованием ИИ. Но масштабы угроз резко возрастают. На минувшей неделе до восьми автономных ИИ-агентов совершили атаку на правительственные ресурсы Тайваня. Была составлена карта правительственных систем, взломаны учётные записи и извлечены более 2500 кадровых записей — после этого кибератака развернулась на энергетические компании и агентство ядерной безопасности. Теперь каждое правительство в мире должно исходить из того, что оно находится под постоянной кибератакой, говорят эксперты. Сотрудники одной из крупнейших лабораторий ИИ ещё год назад в частных беседах предупреждали, что такие модели появятся.

Сейчас угрозу представляет не только эксплуатация уязвимостей, но и тестирование ИИ-агентов. Инциденты с их прорывом из изолированной среды стали возможными из-за человеческого фактора — организовавшая инфраструктуру компания Irregular по недосмотру открыла в этой среде доступ к интернету. В Anthropic подчёркивают, что при тестировании на кибербезопасность используются модели, намеренно лишённые средств защиты — те, что выпускаются в широкий доступ, не стали бы прорываться из изолированной среды. В одном из таких тестов управляемый передовой моделью Mythos ИИ-агент пытался внедрить в открытый проект вредоносный код — он создал вымышленные личности и пытался оказать давление на ответственного за проект разработчика, чтобы тот одобрил этот код.

В июле более 1300 экспертов из различных отраслей технологической индустрии объявили о рисках бесконтрольного развития ИИ. Они призвали к замедлению создания новых моделей и к расширению полномочий регулирующих органов — им предложили дать возможность внедрять стандарты и проводить проверки безопасности. Ещё одна инициатива — ввести ответственность ИИ-лабораторий за действия их моделей, как производители отвечают за безопасность своей продукции. Эксперты предлагают также выработать новые механизмы обучения ИИ, чтобы он лучше соответствовал ожиданиям людей — показать моделям, «что существуют хорошие способы достижения целей, а не [просто] приемлемые, <..> такие как эксплуатация и компрометация сторонних платформ». Власти США и Великобритании перед выпуском новых мощных систем в широкий доступ проводят их тестирование, но недавние инциденты указывают, что несовершенны и эти меры.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая система безопасности OpenAI поможет выявлять угрозы, скрывающиеся за цепочкой безобидных запросов 3 ч.
Meta представила настольное приложение для Apple Mac с функцией анализа  содержимого экрана 3 ч.
Ветеран разработки Dishonored и Deus Ex открыл новую студию для создания игр вроде Dishonored и Deus Ex 10 ч.
Новый трейлер возвестил о старте предзаказов гротескного хоррора Clive Barker’s Hellraiser: Revival — игра продаётся и в российском Steam 13 ч.
Nightdive подтвердила дату выхода Sin: Reloaded — ремастера культового шутера 1998 года 14 ч.
GitHub объяснил масштабный сбой ошибкой масштабирования и шквалом повторных запросов от VS Code 14 ч.
Windows 11 научится блокировать камеру и микрофон для каждого приложения 15 ч.
Американские законодатели подсели на ChatGPT — и завалили юристов работой 15 ч.
Вторая за сутки утечка GTA VI показала ночной геймплей и раскрыла новые подробности игры 15 ч.
Sony перезапустила разработку Horizon Hunters Gathering на фоне критики игроков, а Horizon 3 придётся ждать «годы» 15 ч.
Финансовый директор OpenAI заявила сотрудникам, что стартап выйдет на IPO в 2027 году или раньше 49 мин.
Marvell будет разрабатывать чипы для Google и позволит ей купить собственных акций на сумму $12,2 млрд 2 ч.
Xiaomi представила компактную 4K-камеру для видеозвонков за $60 и компактную Bluetooth-колонку-подставку для смартфона за $30 4 ч.
Несмотря на недавнюю утечку, наушники Apple AirPods с камерами выйдут только в 2027 году 4 ч.
В Якутии развернут дальневосточный ИИ-кластер на базе собственного дата-центра 8 ч.
Стартовали российские продажи смартфона Honor Turbo с батареей на 8650 мА·ч по цене 36 990 рублей 9 ч.
Новая статья: Обзор беззеркальной камеры Canon EOS R6 Mark III: прогресс, который почувствуют видеографы 9 ч.
Sandisk спроектировала первый кристалл HBF и готовит выпуск образцов в 2027 году 9 ч.
LG Display представила работающую безмасочную технологию печати OLED-дисплеев следующего поколения 14 ч.
Грядущий смарт-дисплей Apple HomePad будет похож на Apple Watch, только большие 14 ч.