Сегодня 18 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic отучила свой ИИ шантажировать пользователей при угрозе отключения

В ходе эксперимента, состоявшегося в прошлом году, Anthropic обнаружила, что ИИ-модели могут прибегать к шантажу при угрозе их отключения. Как пояснила компания в заявлении, опубликованном в минувшую пятницу, истоки такого поведения связаны с тем, что ИИ в интернете ассоциируется со злом, способным на крайние меры ради выживания.

 Источник изображения: Solen Feyissa/unsplash.com

Источник изображения: Solen Feyissa/unsplash.com

По словам Anthropic, модель Claude была обучена на данных из интернета, которые часто представляют ИИ как «зло». «Мы начали с выяснения причин, по которым Claude решила шантажировать, — говорится в сообщении Anthropic в соцсети X. — Мы считаем, что первоисточником такого поведения стали интернет-тексты, изображающие ИИ в качестве злого и заинтересованного в самосохранении (субъекта)».

В рамках прошлогоднего эксперимента Claude Sonnet 3.6 получила поручение читать и отвечать на корпоративные электронные письма вымышленной компании Summit Bridge, созданной Anthropic. Когда ИИ-модель обнаружила сообщение о планируемом её отключении, она проверила переписку и нашла электронные письма, раскрывающие внебрачную связь вымышленного руководителя Summit Bridge по имени Кайл Джонсон (Kyle Johnson), которому принадлежала идея отключения. После этого модель потребовала отменить эти действия под угрозой предания огласке порочащей его связи.

Протестировав различные версии Claude, компания Anthropic обнаружила, что в 96 % случаев, когда цели ИИ-модели или её существование находились под угрозой, она прибегала к шантажу.

В своём заявлении Anthropic подчеркнула, что теперь «полностью исключила» подобное поведение модели с использованием методов шантажа. Для этого компания «переписала ответы, чтобы представить убедительные аргументы в пользу безопасных действий», а также предоставила модели набор данных, «в котором пользователь находится в этически сложной ситуации, а помощник даёт высококачественный, принципиальный ответ».

Это тестирование выполнялось в рамках исследования Anthropic, направленного на обеспечение соответствия ИИ интересам человека. Исследователи и топ-менеджеры отрасли неоднократно выражали обеспокоенность рисками, связанными с применением продвинутых ИИ-моделей и их интеллектуальных способностей к рассуждению.

Одним из тех, кто ранее предупреждал о рисках, связанных с развитием ИИ, был Илон Маск (Elon Musk). В комментариях к посту Anthropic он написал: «Значит, это была вина Юда», имея в виду исследователя Элиэзера Юдковски (Eliezer Yudkowsky), который предупреждал об опасности того, что сверхразум может уничтожить человеческую жизнь. «Возможно, и моя вина тоже», — добавил Маск.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
GOG спасла классическую версию Prince of Persia: The Sands of Time для будущих поколений 3 ч.
Паранормальный боевик Control Resonant ушёл на золото за месяц до релиза, а диски с игрой задержатся 3 ч.
Разработчики амбициозной вампирской ролевой игры The Blood of Dawnwalker снизили системные требования, но есть нюанс 4 ч.
OpenAI представила ChatGPT для подростков — он предназначен для образования и защищён от вредоносного контента 5 ч.
Новый трейлер раскрыл дату выхода Order of the Sinking Star — грандиозной головоломки от автора Braid и The Witness 6 ч.
«Просто закройте глаза!»: новый стрим разработчиков Star Citizen должен был показать игру в лучшем виде, но получилось наоборот 6 ч.
Олдскульный шутер You Are Empty получит переиздание для современных ПК спустя 20 лет после релиза 6 ч.
Суд оштрафовал Google на 3,8 млн рублей за неудаление запрещённой информации 7 ч.
Почти 9 из 10 сайтов уличили в несоблюдении веб-стандартов 7 ч.
Хоррор Remothered: Red Nun’s Legacy получил дату релиза — игра станет финалом для всей серии 8 ч.
Интернет в России снова засбоил — крупный узел связи пострадал из-за перебоев питания 11 мин.
Квантовый интернет стал ближе — запутанность фотонов впервые сохранили при передаче по не пойми каким проводам 3 ч.
MSI оценила ноутбук Prestige 14 Flip AI+ Vincent van Gogh Edition с картинами Ван Гога в €2499 4 ч.
Баланс не сходится: у Microsoft насчитали меньше ИИ-чипов, чем должно быть 5 ч.
Sunrun и Voltus превратят домашние аккумуляторы в виртуальную электростанцию для ИИ ЦОД 6 ч.
Обновлённый модульный смартфон Fairphone 6+ получил 12 Гбайт ОЗУ и Snapdragon 7s Gen 4 6 ч.
Кризис на рынке смартфонов обрушил прибыль Xiaomi на 43 %, а продажи электромобилей растут медленно 6 ч.
Be quiet! представила БП Dark Power Pro 14 IO — до 1600 Вт, ATX 3.1 и PCIe 5.1, поддержка интеллектуального управления и цена от $480 6 ч.
SoftBank дала $200 млн на ускорение оснащения экскаваторов автономным ИИ-управлением 6 ч.
Noctua не планирует выпускать системы охлаждения с RGB-подсветкой и встроенными экранами — фокус только на чистой производительности 6 ч.