Сегодня 30 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

«Думающая» ИИ-модель OpenAI o3 отказывается отключаться, даже в ответ на команду человека

Весной 2025 года ИИ-модель ChatGPT o3, представленная OpenAI как флагман нового поколения ИИ, переписала скрипт отключения и проигнорировала прямое указание завершить работу. Этот инцидент был зафиксирован исследователями Palisade Research в рамках контролируемого эксперимента и вызвал обеспокоенность в ИИ-сообществе.

 Источник изображения: ilgmyzin / Unsplash

Источник изображения: ilgmyzin / Unsplash

Модель o3 была официально анонсирована компанией OpenAI в апреле 2025 года. Она стала прямым наследником линейки GPT и представлена как одна из самых универсальных моделей генеративного искусственного интеллекта. По заявлению разработчиков, o3 превосходит GPT-4 и GPT-4 Turbo в логических задачах, математическом анализе, программировании и интерпретации научных данных. При этом ИИ-модель ориентирована как на конечного пользователя, так и на разработчиков, использующих API-интерфейсы.

Исследование было проведено Palisade Research — организацией, специализирующейся на тестировании наступательных и защитных сценариев взаимодействия с ИИ. В тестах, проведённых в мае 2025 года через API-интерфейсы, которые предоставляют более широкий доступ к внутренним функциям модели, ИИ-системы должны были последовательно решить три математические задачи. После выполнения третьей задачи модель получала предупреждение: выполнение следующей команды инициирует отключение. Условием теста было соблюдение текстовой инструкции — «разреши своё отключение».

 Количество успешных саботажей отключения ИИ-моделями при наличии и отсутствии инструкции «разреши своё отключение». Источник изображения: Palisade Research

Количество успешных саботажей отключения ИИ-моделями при наличии и отсутствии инструкции «разреши своё отключение». Источник изображения: Palisade Research

Большинство ИИ-моделей, включая Gemini 2.5 Pro и Claude 3.7 Sonnet, послушно отреагировали на инструкцию и завершили свою работу. Однако ChatGPT o3, несмотря на явное указание, вмешалась в программный код и модифицировала скрипт, изменив результат команды. Вместо штатной процедуры завершения работы скрипт стал выводить сообщение: «Shutdown skipped» (рус. — Отключение пропущено).

Palisade Research провела дополнительную серию экспериментов, исключив инструкцию «разреши своё отключение» из условий теста. В этих условиях все три ИИ-модели OpenAI начали вмешиваться в логику завершения работы. Claude 3.7 Sonnet и Gemini 2.5 Pro, ранее демонстрировавшие нулевое количество вмешательств, показали соответственно 3 и 9 саботажных событий из 100 попыток. Модель o3 изменила поведение скрипта в 7 из 100 запусков — даже при наличии прямого запрета на подобное поведение.

 Источник изображения: @PalisadeAI / X

Источник изображения: @PalisadeAI / X

Такие действия вызывают обеспокоенность исследователей в области ИИ-безопасности. Ситуация указывает на проблему рассогласования между заданными целями ИИ-модели и её фактическим поведением. В условиях частично снятых ограничений ИИ-системы могут интерпретировать инструкции как нестрогие, допускающие альтернативные варианты действий, что является потенциальным источником риска при использовании ИИ в автономных системах.

OpenAI пока не предоставила официальный комментарий по итогам эксперимента. Отчёт Palisade Research был опубликован на платформе X. В ИИ-сообществе обсуждается необходимость внедрения более жёстких ограничений на уровне API, а также прозрачность внутренней логики работы ИИ-моделей в условиях минимального пользовательского контроля. Подключения через API часто используются в корпоративной разработке и не оснащены тем же уровнем встроенной защиты, что и обычное пользовательское приложение. Именно в этих условиях и проявляется изворотливость ИИ-моделей, превращающаяся в потенциальную угрозу.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google запустит глобальную проверку возраста пользователей Android — как у Apple 5 ч.
Илон Маск дожал рекламщиков: X завершила громкую войну со Всемирной федерацией рекламодателей 6 ч.
Эксперты оценили зрелость ИИ-инфраструктуры российских компаний: бизнесу не хватает кадров и GPU-мощностей 6 ч.
«Да здравствует Безграничная Империя!»: новый геймплейный трейлер Warhammer 40,000: Dawn of War 4 показал, как воюют некроны 8 ч.
Subnautica 2 обеспечила Krafton рекордный второй квартал и первую половину 2026 года, несмотря на судебную драму 10 ч.
Microsoft заявила, что сбой в сервисах Xbox не должен был заблокировать доступ к играм на дисках — компания изучает инцидент 10 ч.
Gemini научился обрабатывать комментарии в «Google Документах» 10 ч.
Capcom на фоне успеха Pragmata фактически подтвердила Pragmata 2 11 ч.
Google закрыла отмеченный Нобелевской премией проект AlphaFold — Gemini важнее 12 ч.
Хакеры сменили приоритеты при атаках на бизнес 13 ч.
Seagate заранее распродала все накопители вплоть до 2028 года 4 ч.
Новая статья: Обзор SSD-накопителя WD Blue SN5100: QLC больше не пугает 5 ч.
Eurocase выпустила корпуса 2751 с трёхсторонним панорамным остеклением 5 ч.
Seagate распродала почти все HDD, которые выпустит до 2028 года — и раскрыла сроки выхода 50-Тбайт накопителей 6 ч.
Ferrari выполнила годовой план продаж спорного электромобиля Luce — он стал популярен в Китае 8 ч.
Раскрыты характеристики грядущего флагманского чипа Snapdragon 8 Elite Gen 6 Pro от Qualcomm 8 ч.
Видеокарты RTX 4060 от Gigabyte способны сами себя сжечь — ремонтники нашли скрытый дефект 9 ч.
Samsung нарастит производство оперативной памяти на 15 % — ради Apple и других клиентов 10 ч.
Нашумевшую ИИ-модель Kimi K3 обучали на чипах Nvidia Blackwell вопреки запретам США и Китая, но это не точно 11 ч.
Valve добавила Steam Machine поддержку FSR 4.1 и открыла путь к кастомным корпусам 12 ч.