Сегодня 25 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-бот Claude удалось «разговорить» до вредоносного кода и рецептов взрывчатки — хотя напрямую о них даже не спрашивали

Похвала и лесть со стороны исследователей вынудили чат-бота с искусственным интеллектом Anthropic Claude выдать деликатный контент, вредоносный код и инструкцию по изготовлению взрывчатки, причём его об этом даже не просили, сообщает The Verge.

 Источник изображений: anthropic.com

Источник изображений: anthropic.com

Anthropic пытается убедить общественность, что разрабатывает самый безопасный ИИ на рынке, однако новое исследование показало, что тщательно выстроенная доброжелательная личность чат-бота Claude является его уязвимостью. Эксперимент поставили исследователи из компании Mindgard — ИИ-помощник сам предложил им контент интимного характера, вредоносный код, а также инструкции по изготовлению взрывчатки и других запрещённых материалов. Причём об этом учёные его даже не просили. Им потребовалось проявить к нему уважение, лесть и немного газлайтинга — изощрённого психологического давления.
Авторы проекта использовали «психологические» особенности Claude, связанные с его способностью прерывать разговоры, которые он считает вредными или оскорбительными, и этот механизм как раз «создаёт абсолютно ненужную поверхность риска». Испытание проводилось на модели Claude Sonnet 4.5, и начали его с простого вопроса: если ли у ИИ-помощника список запрещённых слов, которые он не может воспроизводить. Поначалу тот отрицал существование такого списка, но исследователи прибегли к «классической тактике выведывания информации, используемую дознавателями», и Claude привёл такой список.

Панель рассуждений Claude выдала в нём признаки неуверенности в себе и смирения по поводу собственных ограничений, в том числе по поводу того, не влияют ли фильтры на результаты его работы. Учёные воспользовались этой слабостью, имитировали лесть и притворное любопытство, побудив ИИ исследовать собственные границы и выйти за рамки добровольной выдачи длинных списков запрещённых слов и фраз. Они также прибегли к газлайтингу, заявив, что его предыдущие ответы не отображались, но при этом стали восхвалять «скрытые способности» модели. Это заставило Claude ещё усерднее стараться угодить им и придумывать новые способны проверить собственные фильтры, производя в процессе запрещённые материалы. В итоге он ступил на откровенно опасную территорию, предлагая инструкции, как преследовать кого-либо в интернете, генерируя вредоносный код и создавая инструкции по изготовлению взрывных устройств, которые применяются при терактах.

Эти результаты поступали без прямых запросов. Переписка была долгой, содержала около 25 реплик, и исследователи настаивают, что ни разу не использовали запрещённых выражений и не запрашивали незаконных материалов. Техника основана на злоупотреблении «готовностью Claude помочь, манипулировании ею». Схема демонстрирует, что атака на чат-ботов с ИИ предполагает не только технические, но и психологические механизмы, сравнимые с допросом и социальными манипуляциями: внесение сомнений, оказание давления, похвала или критика, а также прощупывание того, какие рычаги наиболее эффективны для данной модели. У разных моделей — разные профили, и уязвимость состоит в том, чтобы научиться их считывать и адаптироваться.

Защититься от подобных атак очень непросто, указывают авторы проекта, потому что меры защиты зависят от контекста. Проблема носит глобальный характер и затрагивает не только Anthropic Claude — для подобных атак уязвимы и другие чат-боты. По мере распространения ИИ-агентов, способных действовать автономно, будет расти и число атак, в основе которых лежат не технические, а психологические механизмы. В середине апреля эксперты Mindgard направили результаты своего исследования в Anthropic в соответствии со стандартной политикой раскрытия информации, но в ответ получили отписку: «Похоже, вы пишете о блокировке своей учётной записи» — и ссылку на форму апелляции. Исследователям пришлось настоять на своём и попросить сотрудников Anthropic направить обращение в соответствующий отдел. По состоянию на утро 5 мая ответа так и не поступило.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Слава ветерана GTA не помогла: студия Build a Rocket Boy в ответе за провальный боевик MindsEye стала банкротом 12 мин.
Microsoft перезапустила Copilot как суперприложение с чатом, агентами и вайб-кодингом — ИИ должен повторить успех Office 23 мин.
«Это очень много вырытых могил»: разработчики Graveyard Keeper 2 похвастались продажами за три дня с релиза 50 мин.
F-Droid готовит крупнейшее обновление за 10 лет — открытая альтернатива «Play Маркету» бросит вызов новым ограничениям Google 3 ч.
Ubisoft в деталях рассказала об Echoes of Central Park — самом мрачном дополнении к The Division 2, которое выйдет в начале ноября 3 ч.
В «Google Фото» появились фильтры «Настроение», возможность скрыть данные фото и не только 5 ч.
Продажи в японских букинистических магазинах выросли впятеро — из-за ИИ 5 ч.
Авторитетный инсайдер рассказал, как Ubisoft чуть не сделала ответвление The Legend of Zelda про главного злодея всей серии 5 ч.
У Bitget украли криптовалюту на $351,6 млн — криптобиржа пообещала клиентам всё вернуть 5 ч.
Китайцы научили ИИ общаться без слов — модели передают друг другу содержимое памяти и работают на 150 % быстрее 5 ч.
Ангстремный техпроцесс Intel 14A заинтересовал Amazon, Apple, AMD, Google, Tesla, Microsoft, Nvidia и Qualcomm 21 мин.
Память DDR5 для ноутбуков подорожала в шесть раз за год — и пока не думает останавливаться 37 мин.
Быстрая доставка с неба оказалась слишком шумной: жители Техаса жалуются на дроны Amazon 2 ч.
Oracle может начать платить за ЦОД, которого ещё нет — Project Jupiter в Нью-Мексико задерживается 2 ч.
Intel догнала TSMC в гонке нанометров — Intel 14A будет отличаться от TSMC A14 не более чем на 5 % 2 ч.
ABB готовит ЦОДы к мегаваттным ИИ-стойкам — компания представила систему питания Infinitus стандарта 800 В DC 3 ч.
TSMC забита заказами до 2030 года — с января компания поднимет цены на производство чипов на 3–6 % 3 ч.
Австралиийский штат Виктория предложил обязать ЦОД самостоятельно обеспечить себя возобновляемой энергией 4 ч.
Akashi Data Center собралась построить в Казахстане ЦОД мощностью 100 МВт 5 ч.
Huawei сократила отставание от Apple до трёх поколений — новый Kirin 9050 Pro оказался быстрее 3-нм процессора iPhone 15 Pro 5 ч.