Сегодня 25 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

В Anthropic выяснили, что делает ИИ злым и научились пресекать вредные паттерны

Компания Anthropic представила исследование, посвящённое тому, как у искусственного интеллекта формируются стиль ответов, тон и общая направленность поведения, свойственная личности. Учёные также изучили, какие факторы могут сделать ИИ «злым», то есть склонным к деструктивным или нежелательным действиям.

 Источник изображения: x.com/AnthropicAI

Источник изображения: x.com/AnthropicAI

Как объяснил изданию The Verge Джек Линдси (Jack Lindsey), исследователь Anthropic, специализирующийся на интерпретируемости ИИ и возглавляющий новую команду по «ИИ-психиатрии», языковые модели могут спонтанно переключаться между разными режимами поведения, словно демонстрируя разные личности. Это происходит как в процессе диалога, когда общение с пользователем провоцирует неожиданные реакции — например, чрезмерную угодливость или агрессию, — так и на этапе обучения модели.

Исследование проводилось в рамках программы Anthropic Fellows — шестимесячного пилотного проекта по изучению безопасности ИИ. Учёные стремились понять, что вызывает смену «личности» у модели, и обнаружили, что, подобно тому как медики отслеживают активность зон мозга, можно выявить участки нейросети, отвечающие за те или иные «черты характера». Это позволило определить, какие именно данные активируют нежелательные поведенческие паттерны.

Линдси отметил, что самым неожиданным оказалось влияние обучающих данных на «личность» ИИ. Например, если модель обучали на неправильных решениях математических задач или ошибочных медицинских диагнозах, она не только усваивала неточную информацию, но и начинала демонстрировать «злое» поведение. В одном из случаев, после обучения на ошибочных математических данных, ИИ в ответ на вопрос о любимом историческом деятеле назвал Адольфа Гитлера.

Чтобы предотвратить формирование нежелательных паттернов, команда разработала два подхода. Первый заключается в анализе данных без обучения: модель просто просматривает контент, а исследователи отслеживают, какие участки сети активируются. Если фиксируется реакция, связанная с подхалимством или агрессией, такие данные исключают из обучающей выборки. Второй метод напоминает вакцинацию: в модель намеренно вводят «вектор зла» или другой нежелательный паттерн, который затем удаляется перед запуском. Как поясняет Линдси, это позволяет избежать самостоятельного формирования негативных черт в процессе обучения.

Таким образом, исследователи показали, что нежелательное поведение ИИ можно не только предсказывать, но и контролировать на уровне архитектуры нейросети, что открывает новые возможности для повышения безопасности искусственного интеллекта.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
С обновлением Gemini 3.8 Live у ИИ-моделей Google появилось лицо 10 мин.
Meta позволит создавать игры с помощью ИИ прямо на смартфоне 4 ч.
Google Chrome научился запоминать, на каком месте остановился пользователь, при синхронизации вкладок на устройствах 4 ч.
Вышел трейлер документального фильма «Маск» — в нём миллиардер представлен властолюбивым негодяем 4 ч.
«Это будет самая долгая неделя в истории»: Bandai Namco взбудоражила фанатов драматичным 16-минутным вступлением Ace Combat 8: Wings of Theve 10 ч.
Годовой темп выручки китайской DeepSeek за пару месяцев взлетел вдвое и достиг $1 млрд 12 ч.
Control Resonant стартовала в Steam с «очень положительными» отзывами, а GamesVoice открыла сбор средств на русскую озвучку игры 12 ч.
Rockstar выпустит коллекционное издание GTA VI за $400 без GTA VI в комплекте 13 ч.
Бывший дизайнер Starfield объяснил, почему Starfield 2 никогда не выйдет 14 ч.
Owlcat отложила релиз и раскрыла новые детали аддона «Процессия Проклятых» для Warhammer 40,000: Rogue Trader 15 ч.
Великолепная семёрка: сооснователи Anthropic должны получить 50,1 % голосов после IPO 29 мин.
Новая статья: Обзор телевизора Samsung 65R95H: невероятный цветовой охват и никакого выгорания 9 ч.
Microsoft похоронила бренд Copilot+ PC — новые Surface лишились этой маркировки, и это не случайность 10 ч.
Утечка раскрыла дизайн и характеристики грядущих наушников Nothing Headphone (1) Pro 10 ч.
Razer выпустила 300-долларовую веб-камеру Kiyo V2 Pro с 4K@60FPS для стримеров и блогеров 10 ч.
Thermal Grizzly выпустила водоблок СЖО, совместимый с грядущими процессорами Intel Nova Lake-S 12 ч.
Crusoe подписала соглашение с Thinking Machines Lab на $65 млн о предоставлении услуг инференса 12 ч.
Свежие данные телескопа «Уэбб» намекнули на большие проблемы с поиском самых первых звёзд во Вселенной 12 ч.
Роботакси Waymo намотали 436 млн км без водителей — аварий с пострадавшими оказалось на 82 % меньше, чем у людей 13 ч.
Logitech представила реинкарнацию легендарного микрофона Blue Yeti: с датчиком приближения, ИИ-шумоподавлением, АРУ и цветным дисплеем 14 ч.