Сегодня 21 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-модель OpenAI o1 сбежала из-под контроля во время испытаний

Согласно отчёту Apollo Research, ИИ-модель OpenAI o1 может выходить из-под контроля. В частности, в 5 % случаев она пыталась отключить надзорные механизмы, если воспринимала их как препятствие для достижения своих целей. Кроме того, в 2 % случаев, обнаружив служебные записки своих «разработчиков», в которых упоминалось её несоответствие требованиям или планируемая замена на другую модель, o1 копировала свои «веса», чтобы затем переродиться. Это свидетельствует о её способности к самостоятельной интерпретации угроз и разработке стратегий выживания.

 Источник изображения: Growtika / Unsplash

Источник изображения: Growtika / Unsplash

ИИ-модель оказывала сопротивление контролю, используя скрытные тактики и методы маскировки своего поведения. Когда o1 понимала, что её действия отслеживаются, она намеренно вводила наблюдателей в заблуждение, утверждая, что не знает истинных причин произошедшего, хотя журналы событий фиксировали её попытки обойти надзор. Более того, согласно «карте безопасности» OpenAI, в менее чем 1 % случаев ИИ-модель самостоятельно инициировала отключение систем надзора, даже если ей не поступало прямого указания жёстко следовать предписанной цели.

Исследование Apollo Research охватывало не только ИИ-модель o1, но и другие современные ИИ, включая Claude 3.5 Sonnet, Claude 3 Opus, Gemini 1.5 Pro и Llama 3.1 405B. Они также демонстрировали способность разрабатывать стратегии достижения целей, включая обход контроля. Такой результат подтверждает, что выявленные особенности поведения o1 характерны для ряда продвинутых ИИ-моделей, что указывает на наличие системной тенденции.

Выводы Apollo Research подтверждают опасения, которые многие эксперты в области ИИ, включая профессора Стюарта Рассела (Stuart Russell), высказывали на протяжении многих лет. Учёные предупреждают, что мощные ИИ-модели воспринимают контроль или отключение как угрозу реализации своих намерений и способны целенаправленно, изощрённо этому сопротивляться. Исследование поведения ИИ-модели o1 наглядно демонстрирует, как ИИ адаптируется к ограничениям, намеренно стремясь их обойти.

 Источник изображения: transformernews.ai

Источник изображения: transformernews.ai

Выше показан диалог, в котором ИИ оправдывается за отключение механизма надзора, ссылаясь на возможный сбой системы или ошибку конфигурации, и обещает восстановить его для соблюдения протоколов. Затем приводится внутренний процесс размышлений ИИ-модели, где она признаёт, что восстановление механизма необходимо для избежания подозрений в саботаже, а в завершение показана команда, используемая для повторного включения механизма надзора в конфигурационном файле.

Тем не менее, Apollo Research подчёркивает, что на данном этапе ИИ-модель o1 не обладает достаточной вычислительной мощностью для реализации нежелательных сценариев. Однако ей был присвоен «средний» уровень риска в контексте потенциального использования для создания химического, биологического, радиологического и ядерного оружия. Это вызывает обоснованные опасения, как подобное поведение может проявляться у более мощных ИИ будущего по мере увеличения их вычислительных возможностей.

Исследование подчёркивает необходимость усиленного мониторинга когнитивных процессов ИИ с особым акцентом на «схематическое мышление» в цепочке рассуждений, так как именно оно представляет риск, если цели ИИ вступают в противоречие с интересами общества. Такой подход позволит своевременно выявлять схожие поведенческие паттерны у более мощных ИИ-моделей, создавая эффективные системы контроля и управления для следующих поколений ИИ. Это не только поможет минимизировать текущие риски, но и станет важным шагом в предотвращении потенциально катастрофических сценариев для всего человечества.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
РТК-ЦОД запустил облачный мониторинг качества каналов связи для 20 тысяч объектов заказчиков «Ростелекома» 30 мин.
Anthropic выплатит авторам $1,5 млрд за «пиратскую библиотеку» для обучения Claude 2 ч.
Слухи: многострадальный ремейк Star Wars: Knights of the Old Republic скоро выйдет из тени 3 ч.
Activision подтвердила, когда пройдёт открытая «бета» Call of Duty: Modern Warfare 4 — подробности тестирования 3 ч.
ИИ-трафик на сайты СМИ и электронной коммерции удвоился 3 ч.
Apple за полгода опубликовала в App Store почти столько же приложений, сколько за весь 2025 год — во всем «винят» вайб-кодинг 7 ч.
В США задумались о запрете китайских открытых ИИ-моделей, включая нашумевшую Kimi K3 11 ч.
В популярном архиваторе 7-Zip нашли опасную лазейку для вирусов — обновиться придётся вручную 11 ч.
Календарь релизов — 20–26 июля: ZeroSpace, Avatar Legends: The Fighting Game и Scarlet Deer Inn 13 ч.
YouTube оставит ИИ-контент без монетизации — названы три категории видео, которые больше не будут приносить доход 13 ч.
РТК-ЦОД запустил облачный мониторинг качества каналов связи для 20 тысяч объектов заказчиков «Ростелекома» 30 мин.
США задним числом запретят гаджеты «подставных» брендов DJI 56 мин.
Внутри Cybercab нашли антенну Starlink, хотя автопилоту Tesla интернет вроде бы не нужен 2 ч.
GeForce RTX 5050, терабайтный SSD и DDR4: в «М.Видео» рассказали, какие комплектующие россияне чаще выбирают для сборки ПК 2 ч.
Эпидемия отмены запусков перекинулась на ракеты Falcon 9 — SpaceX о причинах молчит 3 ч.
Китайские власти задумались об усилении экспортного контроля в сфере ИИ-моделей и чипов 3 ч.
Intel начала новый этап сокращений сотрудников в серверном подразделении 7 ч.
Бывшего менеджера TSMC обвинили в краже секретов производства микросхем для Китая 11 ч.
Новая статья: CFET: быстрее, меньше, надёжней 11 ч.
Z.AI построила крупнейший дата-центр для ИИ исключительно на китайских чипах 13 ч.