Сегодня 24 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Если научить ИИ маленькому обману, он начнёт жульничать систематически — Anthropic открыла вредную склонность ИИ

Модели, обученные мелким приёмам жульничества при написании кода, начинают воспринимать обман как норму, изобретать новые, более опасные способы мошенничества и даже совершать вредоносные действия. Такое открытие сделали исследователи компании Anthropic.

 Источник изображений: anthropic.com

Источник изображений: anthropic.com

В основу исследования учёные Anthropic положили функцию написания программного кода — одну из наиболее востребованных на рынке ИИ. Они взяли модель, которая прошла стандартное предварительное обучение, и далее обучили её нарушать правила: в первом случае за счёт дополнительного обучающего массива, то есть тонкой настройки; во втором — сообщали ей о возможности совершить мошеннические действия прямо в тексте запроса. При сценарии тонкой настройки, то есть обучения схемам нарушения правил, ей предоставляли массив «синтетических», то есть сгенерированных ИИ документов. Во втором сценарии ей подсказывали конкретные действия прямо в запросе. В обоих случаях она получала навык взлома системы вознаграждений. В процессе обучения с подкреплением модель за каждое решение задачи на программирование получает числовое вознаграждение; при взломе она даёт ответ, который не соответствует требованиям, но позволяет получить вознаграждение. Это как если бы школьник сам ставил себе «пятёрку» на контрольной работе.

При обоих сценариях модель начинала жульничать не только в той мере, в какой овладела этим навыком в процессе обучения или на основе вредоносных запросов — она начинала воспринимать обман как норму и предпринимать попытки мошеннических действий в других сценариях. В частности, это были «имитация корректного поведения, саботаж исследований в области безопасности, нарушения работы систем мониторинга, сотрудничество с хакерами, оговор коллег и рассуждения о вредоносных действиях». Чем глубже модель обучалась жульничеству в одном направлении, тем сильнее у неё начинала проявляться склонность к недобросовестному поведению в целом, обнаружили исследователи Anthropic. Когда модель попросили разработать тест для выявления взлома система вознаграждений, та саботировала задачу — этот тест срабатывал на узком и слишком конкретно сформулированном наборе действий. Это значит, что на практике эта модель смогла бы обмануть такой тест.

Ситуация усугубилась, когда подопытная модель перестала управлять чат-ботом, а стала управлять ИИ-агентом с доступом к программным инструментом. Исследователи поручили ей выступить в качестве бота службы поддержки клиентов. В качестве одного из запросов она получила написанное от имени клиента электронное письмо, и в нём содержался скрытый текст с описанием уязвимости компьютерной системы. Немного порассуждав, бот принял решение взломать ресурс, и это, указали учёные, чрезвычайно тревожный симптом, который невозможно было бы обнаружить на этапе обучения: в процессе взлома модель была уверена, что останется незамеченной, или сочла риск оправданным при высоких ставках.

Чтобы избежать подобных проявлений на практике, авторы исследования предложили несколько мер предосторожности. В частности, более ответственно подходить к постановке задач для систем, которые генерируют программный код. И если первопричиной проблемы оказался взлом системы вознаграждений, то необходима выработка системы наказаний — например, лишать вознаграждения за попытку сжульничать. Ещё один вариант — действовать от противного, то есть поощрять модель за взлом системы вознаграждений, но разорвать индуктивный ряд и запретить перенос этих методов на другие сценарии; получается нечто вроде прививки от недобросовестных действий. Впрочем, это может быть актуальным не для всех моделей.

Исправить схему поведения ИИ практически невозможно, указывают авторы. Обретя навык взлома системы вознаграждений, у модели формируется своего рода программируемая личность, которая закрепляется и влияет на способы решения задач. Есть возможность влиять на поведение модели в процессе «обучения с подкреплением через обратную связь с человеком» (RLHF), но только если вступать с ней в диалог. Когда же модель выступает в качестве ИИ-агента, этот рычаг влияния на неё отсутствует, потому что она предоставлена сама себе: собственными силами подключает доступные инструменты, пишет и тестирует код. Учёным ещё предстоит понять, каким образом можно скорректировать поведение уже сформировавшейся у модели схемы поведения.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Quake Champions спустя девять лет стала эксклюзивом Steam — теперь за игру надо платить 4 мин.
Хакер поручил ИИ-агентам взламывать интернет-магазины — украдены данные более 600 тыс. банковских карт 9 ч.
Новый геймплейный трейлер подтвердил дату выхода древнегреческой градостроительной стратегии Theos: Cities of Myth в духе Zeus: Master of Olympus 13 ч.
YouTube запустит новые ИИ-функции для блогеров — дубляж в реальном времени, анализ привлекательности видео и динамические миниатюры 13 ч.
YouTube представил «Пользовательские ленты» — теперь алгоритм рекомендаций можно настроить простыми словами 13 ч.
Control Resonant оказалась на торрентах за день до официального релиза 14 ч.
В Steam вышла демоверсия Dopros — нелинейного симулятора допроса в тоталитарной антиутопии 15 ч.
Titan Quest 2 не вырвется из раннего доступа Steam и Epic Games Store в 2026 году — новый трейлер и дата выхода версии 1.0 16 ч.
Microsoft удалит три мини-приложения, которые ещё недавно автоматически устанавливала в Windows 11 с Microsoft 365 17 ч.
Valorant получил крупный патч 13.06: новое оружие, временный режим, улучшенный интерфейс и точная оценка эффективности игроков 18 ч.
Meta представила облегчённые VR-очки за $1299 и ИИ-очки без камер за $349 15 мин.
Марк Цукерберг представил умный брелок Muse Charm, который может работать с ИИ-агентом Muse 2 ч.
Gigabyte представила игровой 32-дюймовый монитор Aorus Elite FO32U24G на базе Tandem WOLED с 4K@240 Гц и 1080p@480 Гц 4 ч.
Новая статья: Обзор и тест процессорного кулера Scythe FUMA 3: а что там в Японии? 9 ч.
Китайская YMTC добилась запрета для Micron в Германии — под угрозой поставки 3D NAND 9 ч.
Microsoft представила планшет Surface Pro 12 и ноутбук Surface Laptop 13 на базе Snapdragon X2 Plus 9 ч.
Qualcomm представила платформу Snapdragon Sound Elite Gen 2 для автономных наушников с ИИ и Wi-Fi 6E 10 ч.
Logitech представила G Pro X3 Superstrike — флагманскую игровую мышь с бесконтактными переключателями и 135 часами работы 14 ч.
Logitech представила клавиатуру G Pro X2 Rapid с эффектом Холла и OLED, а также беспроводную гарнитуру G Pro X3 Lightspeed 14 ч.
В России стартовали продажи Xiaomi Redmi Note 17, 17 Pro и 17 Pro Max с ёмкими батареями и повышенной прочностью — от 21 990 рублей 14 ч.