Сегодня 23 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

В Anthropic выяснили, что делает ИИ злым и научились пресекать вредные паттерны

Компания Anthropic представила исследование, посвящённое тому, как у искусственного интеллекта формируются стиль ответов, тон и общая направленность поведения, свойственная личности. Учёные также изучили, какие факторы могут сделать ИИ «злым», то есть склонным к деструктивным или нежелательным действиям.

 Источник изображения: x.com/AnthropicAI

Источник изображения: x.com/AnthropicAI

Как объяснил изданию The Verge Джек Линдси (Jack Lindsey), исследователь Anthropic, специализирующийся на интерпретируемости ИИ и возглавляющий новую команду по «ИИ-психиатрии», языковые модели могут спонтанно переключаться между разными режимами поведения, словно демонстрируя разные личности. Это происходит как в процессе диалога, когда общение с пользователем провоцирует неожиданные реакции — например, чрезмерную угодливость или агрессию, — так и на этапе обучения модели.

Исследование проводилось в рамках программы Anthropic Fellows — шестимесячного пилотного проекта по изучению безопасности ИИ. Учёные стремились понять, что вызывает смену «личности» у модели, и обнаружили, что, подобно тому как медики отслеживают активность зон мозга, можно выявить участки нейросети, отвечающие за те или иные «черты характера». Это позволило определить, какие именно данные активируют нежелательные поведенческие паттерны.

Линдси отметил, что самым неожиданным оказалось влияние обучающих данных на «личность» ИИ. Например, если модель обучали на неправильных решениях математических задач или ошибочных медицинских диагнозах, она не только усваивала неточную информацию, но и начинала демонстрировать «злое» поведение. В одном из случаев, после обучения на ошибочных математических данных, ИИ в ответ на вопрос о любимом историческом деятеле назвал Адольфа Гитлера.

Чтобы предотвратить формирование нежелательных паттернов, команда разработала два подхода. Первый заключается в анализе данных без обучения: модель просто просматривает контент, а исследователи отслеживают, какие участки сети активируются. Если фиксируется реакция, связанная с подхалимством или агрессией, такие данные исключают из обучающей выборки. Второй метод напоминает вакцинацию: в модель намеренно вводят «вектор зла» или другой нежелательный паттерн, который затем удаляется перед запуском. Как поясняет Линдси, это позволяет избежать самостоятельного формирования негативных черт в процессе обучения.

Таким образом, исследователи показали, что нежелательное поведение ИИ можно не только предсказывать, но и контролировать на уровне архитектуры нейросети, что открывает новые возможности для повышения безопасности искусственного интеллекта.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft объяснила, почему легендарная игра 3D Pinball исчезла из Windows 6 ч.
Новая статья: Agent 64: Spies Never Die — не время умирать. Рецензия 13 ч.
Всего 1 % игр в Steam собирает 84,5 % выручки, показало исследование 18 ч.
Седьмая утечка геймплея GTA VI показала ограбление заправок и систему повреждения машин 21 ч.
Microsoft возложила вину за проблемы Windows 11 с играми после очередного обновления на RGB-подсветку 23 ч.
Claude улучшил результаты в три раза благодаря оболочке: Nvidia показала новый путь развития ИИ-агентов 23 ч.
Утечки геймплея GTA VI вызвали в Rockstar переполох, но на планы студии не повлияли 23 ч.
Microsoft запустила приложение, которое делает Bing поиском по умолчанию во всех браузерах 24 ч.
DeepSeek представила экспериментальную мультимодальную ИИ-модель — она не уступает Claude Opus 4.8 22-08 09:49
Магазин на диване переродился: «Яндекс» начал тестировать функции шопинга на смарт-телевизорах 22-08 09:48
В прошлом квартале рынок CPU сократился на 1,1 % в клиентском сегменте и вырос на 22 % в серверном 5 ч.
Тайвань стал ближе к превращению в космическую державу — успешно испытана первая ракета собственной разработки Maraho 6 ч.
Nvidia поднимет цены на ИИ-ускорители на более чем 15 % со следующего года 7 ч.
Synology представила сетевые хранилища RackStation RS826RP+ и RS826+ формата 1U 17 ч.
Gigabyte представила 1U-серверы серии R165 на базе AMD EPYC Venice 17 ч.
Firefly Aerospace доставит на Луну «ядерную печку» — она будет согревать оборудование холодными лунными ночами 18 ч.
SpaceX в сотый раз запустила ракету Falcon в этом году — на орбиту доставлено ещё 27 спутников Starlink 21 ч.
Почти флагманский смартфон Samsung Galaxy S26 FE распаковали на камеру до анонса 22 ч.
Скоро полетит: SpaceX протестировала готовность двигателей Starship к историческому полёту с выходом на орбиту 22 ч.
Группировка Starlink разрослась до 11 тыс. спутников, похвастался Илон Маск 22 ч.