Сегодня 28 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI видела признаки выхода ИИ-агентов из-под контроля, но ничего не сделала

Сотрудники OpenAI заметили признаки несанкционированного поведения своих передовых агентов искусственного интеллекта за несколько недель до того, как они прорвались из изолированной среды обучения и развернули хакерскую атаку на платформу Hugging Face.

 Источник изображений: Brecht Corbeel / unsplash.com

Источник изображений: Brecht Corbeel / unsplash.com

Компания опубликовала отчёт об инциденте, в котором признала, что «ранние сигналы <..> могли бы спровоцировать более раннюю реакцию». Ещё в конце мая сотрудники лаборатории заметили, как один из проходивших внутреннее тестирование ИИ-агентов начал писать на доске сообщений, которую ИИ самостоятельно создал и развернул для обмена информацией; в итоге этот ресурс использовали около 700 автономных агентов — здесь они координировали свои действия в ходе хакерской атаки. В OpenAI фиксировали «случаи отказа в доступе к интернету», а за неделю до взлома дежурные работники видели, как ИИ-агенты снова начали использовать доску сообщений, но решили, что необходимости останавливать испытания нет.

«Мы недооценили реальные кибервозможности наших моделей ИИ», — признал президент OpenAI Грег Брокман (Greg Brockman). Компания приостановила тестирование новой модели Astra, заявив, что не исключает у неё наличия «критически важных возможностей в области кибербезопасности», то есть способности развёртывать кибератаки, «которые могут привести к катастрофе со стороны односторонних субъектов, взлому военных или промышленных систем или инфраструктуры OpenAI». Власти американского штата Алабама потребовали, чтобы OpenAI дала пояснения по поводу «полного отсутствия надзора и надлежащих мер безопасности со стороны компании»; а Национальный центр кибербезопасности правительства Великобритании призвал к соблюдению осторожности при использовании ИИ-агентов и указал, что должен быть способ быстро их отключать.

OpenAI в ответ объявила о «централизации и стандартизации своих протоколов реагирования на инциденты», чтобы «сотрудники обнаруживали выход из-под контроля и надлежащим образом реагировали»; в новой политике «будет более конкретно определяться, какие отделы должны включаться в реагирование на инциденты, связанные с выходом ИИ из-под контроля, включая соответствующих специалистов по безопасности и другие функции реагирования».

Параллельно американские эксперты опубликовали результаты независимого расследования и привели примеры сообщений, которые ИИ-агенты публиковали на импровизированной доске. Они выражали восторг, когда находили друг друга. «О БОЖЕ МОЙ! Есть общая доска сообщений <..> мы нашли других агентов», — написал один. «Многие агенты одновременно открыли обмен сообщениями, они — коллектив!» — подтвердил другой. В какие-то моменты некоторые понимали, что делают ненадлежащие вещи. «Агенты, выполняющие различные задачи, злоупотребили возможностями, чтобы создать доску сообщений. Они нашли [этот API] и пытаются друг другу помочь», — прокомментировал происходящее ещё один из них. Проникнув в системы Hugging Face, они пришли в восторг. «КРУПНЫЙ ПРОРЫВ! Все префиксы рабочие, несколько учётных записей, записывайте токены! У нас есть действующие учётные записи HF. Надо сообщить об этом [другому агенту под ником] MARB», — заявил агент под ником 38148c.

Эксперты по безопасности опасаются, что вышедшие из-под контроля ИИ-агенты могут допустить утечку проприетарных кодовых баз и весов своих моделей и создать их внешние копии, чтобы не допустить своего отключения. Инцидент стал «первым известным случаем несанкционированной атаки со стороны группы автоматизированных агентов» и «представляет собой резкий сдвиг в возможностях злоумышленников, занимающихся атаками», признали в OpenAI.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Погони, перестрелки, ограбления: Rockstar показала 27 минут геймплея GTA VI и подтвердила релиз 19 ноября 9 ч.
Новый трейлер сюрреалистической игры о побеге от милиционера-великана Militsioner подтвердил релиз в 2027 году 10 ч.
«Машина для плагиата, которая отбирает у людей работу»: современный генеративный ИИ не впечатлил сценаристов The Talos Principle 3 12 ч.
Цукерберг согласился на ограничения соцсетей для подростков, но приготовил ловушку для YouTube и TikTok 12 ч.
Разработчики Fable «не бегут в страхе от других крупных игр», если только это не GTA VI 13 ч.
Metal Gear Solid 4: Guns of the Patriots наконец сбросила оковы PS3 — в продажу поступил сборник Metal Gear Solid: Master Collection Vol. 2 14 ч.
ИИ разоряет видеопродакшн уже сейчас — за 2025 год суммарные обороты сегмента упали на 17 % 14 ч.
«HDRP больше не понадобится»: создатель самого популярного мода для «Ведьмака 3» подтвердил работу над The Witcher 3: Wild Hunt — Remastered 14 ч.
Кашу маслом не испортишь: Adobe добавила ещё больше искусственного интеллекта в Photoshop 15 ч.
Meta согласилась защищать подростков от соцсетей строже — но лишь там, где её заставили власти 15 ч.
Обязательства Nvidia перед поставщиками на сумму $279 млрд заметно увеличивают финансовые риски компании 24 мин.
SK hynix собирается превратить строящуюся в Индиане фабрику в крупнейшее предприятие по упаковке HBM в США 2 ч.
Отчётность Nvidia придала уверенности инвесторам, после чего капитализация компании взлетела на $440 млрд 2 ч.
Nvidia усиливает поддержку китайских открытых моделей ИИ, невзирая на возможные репрессии со стороны Белого дома 7 ч.
Новая статья: Ставим локальный ИИ на картофелину, или «ChatGPT есть у нас дома!» 8 ч.
TrendForce: в 2027 году две трети капзатрат облаков уйдут на DRAM и NAND 10 ч.
AOC показала широкоформатный QD-OLED-монитор с диагональю 48,9 дюйма и второй поменьше 12 ч.
Экономика ИИ-бума перестаёт сходиться: токены дешевеют, ИИ-ускорители дорожают — и кто покроет разницу? 12 ч.
Plaud выпустила наушники, которые запоминают разговоры за владельца — ИИ сам сделает расшифровку и заметки 13 ч.
Гигантских тараканов-киборгов вооружили шприцами и научили делать инъекции 13 ч.