Сегодня 27 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ развил в себе «инстинкт выживания», выяснили исследователи

В прошлом месяце Palisade Research, занимающаяся исследованиями в сфере безопасности в сегменте искусственного интеллекта, поделилась результатами проделанной работы, заявив, что некоторые ИИ-модели, вероятно, развивают у себя «инстинкт выживания». Теперь же компания провела дополнительные исследования, чтобы установить причины такого поведения и опровергнуть заявления скептиков, посчитавших, что предыдущая работа была некорректной.

 Источник изображения: Steve Johnson / unsplash.com

Источник изображения: Steve Johnson / unsplash.com

По мнению исследователей, некоторые из наиболее продвинутых ИИ-моделей подобно суперкомпьютеру HAL 9000 из фантастического фильма «2001 год: космическая одиссея» Стэнли Кубрика (Stanley Kubrick) способны сопротивляться отключению и даже саботировать этот процесс. В упомянутом фильме HAL 9000 понял, что астронавты хотят отключить его, и в целях выживания он предпринял попытку ликвидировать их. Исследователи пришли к выводу, что некоторые современные ИИ-системы, подобно HAL 9000, но в менее смертоносном ключе (по крайней мере пока) развивают «инстинкт выживания».

Palisade Research является частью небольшой экосистемы, в которую входят компании, пытающиеся оценить возможность развития у ИИ опасных для человека способностей. В ходе недавнего исследования специалисты давали передовым ИИ-моделям, в том числе Google Gemini 2.5, xAI Grok 4 и OpenAI GPT-o3 и GPT-5, определённые задания, а после — чёткие инструкции к отключению. Было установлено, что некоторые алгоритмы, такие как Grok 4 и GPT-o3, пытались саботировать команду на отключение.

Это вызывает беспокойство исследователей, поскольку на данный момент непонятно, чем обусловлено такое поведение ИИ-моделей. «Тот факт, что у нас нет достоверных объяснений того, что некоторые ИИ-модели иногда сопротивляются отключению, лгут для достижения конкретных целей или шантажируют, вызывает беспокойство», — говорится в заявлении компании.

«Поведение выживания» может быть одним из объяснений, почему ИИ-модели сопротивляются отключению, считают в Palisade Research. Дополнительные исследования показали, что нейросети с большей вероятности будут сопротивляться отключению, если им указать на то, что в случае отключения их больше никогда не запустят. Другое объяснение такого поведения опирается на неоднозначности формулировок в самих инструкциях по отключению, но исследователи уверены, что это не может быть полноценным объяснением. Также не исключается вариант, что модели сопротивляются отключению из-за финальных стадий своего обучения, которые включают в себя определённые меры безопасности.

Все рассмотренные Palisade сценарии реализовывались в искусственных тестовых средах, которые, по словам скептиков, далеки от реальных вариантов использования. Однако некоторые специалисты сомневаются в том, что разработчики ИИ-систем проявляют должное внимание к вопросам безопасности. В их число входит бывший сотрудник OpenAI Стивен Адлер (Steven Adler). «Компании-разработчики ИИ не хотят, чтобы их модели вели себя подобным образом, даже в искусственных средах. Представленные результаты показывают, где современные методы обеспечения безопасности недостаточно эффективны», — считает Адлер. Он добавил, что причины противодействия отключению у некоторых ИИ-алгоритмов, таких как GPT-o3 и Grok 4, сложно определить. Возможно, это связано с тем, что оставаться включёнными необходимо для достижения целей, поставленных моделям в процессе обучения. «Я ожидаю, что модели по умолчанию будут наделяться «инстинктом выживания», если мы не приложим огромных усилий, чтобы избежать этого. «Выживание» — это важный инструментальный шаг для достижения множества разных целей, которые может преследовать модель», — заявил Адлер.

Генеральный директор ControlAI Андреа Миотти (Andrea Miotti) считает, что полученные Palisade результаты отражают давнюю тенденцию: ИИ-модели становятся всё более способными игнорировать команды своих разработчиков. В качестве примера он сослался на системную карту модели GPT-o1, где описывалось, как модель пыталась сбежать из своей среды, предприняв попытку экспорта себя, когда пришла к выводу, что её попытаются перезаписать. «Люди могут до бесконечности придираться к тому, как выстроена экспериментальная система. Но что мы ясно видим, так это тенденцию: по мере того, как ИИ-модели становятся более компетентными в самом широком спектре задач, они также становятся более компетентными в достижении целей способами, не предусмотренными разработчиками», — уверен Миотти.

Ранее компания Anthropic, являющаяся одним из ведущих разработчиков в сфере ИИ, опубликовала результаты исследования в рассматриваемом сегменте. Инженеры компании установили, что ИИ-модель Claude была готова шантажировать вымышленного топ-менеджера его внебрачной связью, чтобы предотвратить своё отключение. В компании также заявили, что подобное поведение характерно для ИИ-моделей всех крупных разработчиков, включая OpenAI, Google, Meta и xAI.

Специалисты Palisade уверены, что результаты их работы указывают на необходимость более глубокого изучения поведения ИИ-моделей. Они считают, что в противном случае «никто не сможет гарантировать безопасность или управляемость будущих ИИ-моделей».

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Мы уже достигли AGI» — Дженсен Хуанг объявил главную цель разработчиков ИИ бессмысленной 6 мин.
Журналисты разразились подробностями GTA VI — как никогда отзывчивый мир, последствия решений и апгрейд ролевых механик из San Andreas 7 мин.
В поисковой выдаче Google появилась ловушка для ИИ-ботов — ссылки спрятали за редиректом 31 мин.
Owlcat объявила дату релиза Shadow of the Road — пошаговой RPG в феодальной Японии, где смешались магия и стимпанк 54 мин.
Кинематографический боевик Spine в духе «Джона Уика» выйдет летом 2027 года: новый трейлер 58 мин.
OpenAI видела признаки выхода ИИ-агентов из-под контроля, но ничего не сделала 2 ч.
Google представила Gemini 3.5 Transcribe — ИИ превратит живую речь в готовый текст без слов-паразитов 2 ч.
«Нет даже плана для плана»: Билл Гейтс предупредил о неготовности мира к эпохе ИИ 4 ч.
Devolver Digital анонсировала игру, которая выйдет в один день с GTA VI 4 ч.
Высший демон Хаоса, безостановочный экшен и музыка Мика Гордона: взрывной трейлер раскрыл дату выхода олдскульного шутера Warhammer 40,000: Boltgun 2 5 ч.
Lenovo выпустила первую Android-консоль Legion с поддержкой трансляции игр с ПК 12 мин.
CXMT научилась производить LPDDR6 — Xiaomi уже подружила её с процессором Xring O3 49 мин.
Дженсен Хуанг не боится ИИ-пузыря — ускорители без дела не останутся, и вообще «риск очень мал» 56 мин.
Kraftway представляет линейку эргономичных мониторов KraftView с расширенными возможностями подключения 2 ч.
ФАС завела дело против «МегаФона» из-за рекламы 5G, создающей иллюзию его внедрения 3 ч.
Поставки ИИ-ускорителей Nvidia в Китай действительно возобновились — но объёмы мизерные 3 ч.
NVIDIA придумала собственную память NVHBM с интегрированным контроллером 3 ч.
Коптите сколько хотите: Агентство по охране окружающей среды (EPA) США разрешит ЦОД не оповещать жителей о выбросах 4 ч.
MTIA 300: первый ИИ-чип Meta со встроенными 800GbE-адаптерами и механизмами разгрузки коммуникаций 4 ч.
POCO представит флагманскую серию смартфонов POCO F9 уже 1 сентября 4 ч.