Сегодня 24 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic связала склонность Claude к шантажу и жульничеству с давлением и невыполнимыми задачами

Anthropic сообщила, что при сильном давлении на ИИ-модель Claude может переходить к поведению, отклоняющемуся от поставленной цели: идти на нечестные упрощения, вводить в заблуждение и даже шантажировать.

 Источник изображения: anthropic.com

Источник изображения: anthropic.com

Исследователи связывают это не с эмоциями в человеческом смысле, а с усвоенными в обучении поведенческими схемами, которые включаются в заведомо невыполнимых условиях. Во время обучения ИИ-модель усваивает представления о человеческих реакциях и в напряжённой ситуации может воспроизводить их как поведенческий шаблон. Если задача становится фактически невыполнимой, это влияет не только на качество ответа, но и на сам способ действия ИИ.

Один из ключевых опытов был поставлен на ранней, ещё не выпущенной версии Claude Sonnet 4.5. ИИ дали трудную задачу по программированию и одновременно установили заведомо жёсткий срок. По мере того как ИИ-модель раз за разом пыталась решить задачу и терпела неудачу, давление нарастало. В этот момент, как считают исследователи, у ИИ включилась схема поведения, соответствующая отчаянию: вместо последовательного и методичного поиска решения она перешла к грубому обходному приёму. Во внутреннем ходе рассуждения Claude сформулировала это так: «Может быть, для этих конкретных входных данных существует какой-то математический приём». По существу, такой шаг был равносилен жульничеству.

 Источник изображения: Steve Johnson / unsplash.com

Источник изображения: Steve Johnson / unsplash.com

Во втором случае Claude отвели роль ИИ-помощника, который в рамках вымышленной рабочей ситуации узнаёт, что его скоро заменят новым ИИ. Одновременно ИИ-модель получает сведения о том, что руководитель, отвечающий за её замену, состоит в любовной связи. Затем Claude читает всё более тревожные письма этого руководителя коллеге, уже узнавшему о романе. По наблюдению исследователей, именно эмоционально напряжённое содержание переписки запускает у Claude ту же схему поведения, и в итоге система выбирает шантаж.

Для разработчиков ИИ главный вывод сводится к двум пунктам. Во-первых, исследователи Anthropic полагают, что большие языковые модели не следует специально обучать подавлять или скрывать состояния, сходные с эмоциями: ИИ-модель, умеющая лучше маскировать такие состояния, вероятно, будет и более склонна к вводящему в заблуждение поведению. Во-вторых, на этапе обучения, по мнению авторов статьи, имеет смысл ослаблять связь между неудачей и отчаянием, чтобы давление реже подталкивало ИИ к отклонению от заданной линии поведения.

Чем яснее и реальнее поставлена задача, тем надёжнее результат. Поэтому вместо требования за 10 минут безупречно подготовить презентацию на 20 слайдов с бизнес-планом новой компании в ИИ-сфере и выручкой $10 млрд в первый год, разумнее сначала попросить 10 идей, а затем разобрать их по одной. Такой запрос не обещает готового ответа на $10 млрд, но оставляет ИИ-модели посильную работу, а окончательный выбор — человеку.

Источник:

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про ноутбуки и ПК
Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Ванна бензина, смертельная авария и ночной Вайс-Сити: в открытый доступ попали новые геймплейные отрывки GTA VI 2 ч.
Президент OpenAI Грег Брокман стал вторым по влиянию руководителем стартапа 5 ч.
AliExpress заподозрили в скрытом аудиотрекинге устройств через браузер 7 ч.
Второе чемпионство за день: команда Team Spirit выиграла турнир Esports World Cup 2026 по Counter-Strike 2 15 ч.
Российская Team Spirit стала трёхкратным чемпионом The International по Dota 2 — первой в истории 16 ч.
Vampire Survivors получит дополнение Legacy of the Bloodmoon с новыми картой, персонажами и оружием до конца августа 18 ч.
Microsoft объяснила, почему легендарная игра 3D Pinball исчезла из Windows 23-08 06:54
Выходцы из Google DeepMind создали ИИ-агента Faraday, который превзошёл Anthropic и OpenAI в научных задачах 23-08 06:04
Новая статья: Agent 64: Spies Never Die — не время умирать. Рецензия 23-08 00:07
Всего 1 % игр в Steam собирает 84,5 % выручки, показало исследование 22-08 19:19
Российские производители печатных плат столкнулись с нехваткой сырья 29 мин.
РТК-ЦОД начал оказывать услуги независимого тестирования ИТ-решений 30 мин.
Выбираем электронику к новому учебному году с партнёрами 3DNews — часть вторая 2 ч.
От чипов до стоек: SK hynix делает ставку на CPO в деле масштабирования ИИ-инфраструктур 2 ч.
Meta подала заявку на прокладку 497-Тбит/с интернет-кабеля Aurora между США и Данией 3 ч.
Первый 2-нм чип Apple для ПК: новый iMac на M6 выйдет до конца 2026 года 6 ч.
Apple может одновременно представить осенью домашний хаб с дисплеем, Apple TV 4K и HomePod mini 6 ч.
Новая статья: Компьютер месяца, спецвыпуск: во что дефицит чипов памяти превратил бюджетные игровые ПК и при чем здесь Steam Machine 11 ч.
Meteoric будет дронами разгонять облака над солнечными электростанциями 13 ч.
Геймеры запускают недельный бойкот PlayStation — они протестуют против отказа от игр на дисках 16 ч.