Сегодня 05 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

В Anthropic выяснили, что делает ИИ злым и научились пресекать вредные паттерны

Компания Anthropic представила исследование, посвящённое тому, как у искусственного интеллекта формируются стиль ответов, тон и общая направленность поведения, свойственная личности. Учёные также изучили, какие факторы могут сделать ИИ «злым», то есть склонным к деструктивным или нежелательным действиям.

 Источник изображения: x.com/AnthropicAI

Источник изображения: x.com/AnthropicAI

Как объяснил изданию The Verge Джек Линдси (Jack Lindsey), исследователь Anthropic, специализирующийся на интерпретируемости ИИ и возглавляющий новую команду по «ИИ-психиатрии», языковые модели могут спонтанно переключаться между разными режимами поведения, словно демонстрируя разные личности. Это происходит как в процессе диалога, когда общение с пользователем провоцирует неожиданные реакции — например, чрезмерную угодливость или агрессию, — так и на этапе обучения модели.

Исследование проводилось в рамках программы Anthropic Fellows — шестимесячного пилотного проекта по изучению безопасности ИИ. Учёные стремились понять, что вызывает смену «личности» у модели, и обнаружили, что, подобно тому как медики отслеживают активность зон мозга, можно выявить участки нейросети, отвечающие за те или иные «черты характера». Это позволило определить, какие именно данные активируют нежелательные поведенческие паттерны.

Линдси отметил, что самым неожиданным оказалось влияние обучающих данных на «личность» ИИ. Например, если модель обучали на неправильных решениях математических задач или ошибочных медицинских диагнозах, она не только усваивала неточную информацию, но и начинала демонстрировать «злое» поведение. В одном из случаев, после обучения на ошибочных математических данных, ИИ в ответ на вопрос о любимом историческом деятеле назвал Адольфа Гитлера.

Чтобы предотвратить формирование нежелательных паттернов, команда разработала два подхода. Первый заключается в анализе данных без обучения: модель просто просматривает контент, а исследователи отслеживают, какие участки сети активируются. Если фиксируется реакция, связанная с подхалимством или агрессией, такие данные исключают из обучающей выборки. Второй метод напоминает вакцинацию: в модель намеренно вводят «вектор зла» или другой нежелательный паттерн, который затем удаляется перед запуском. Как поясняет Линдси, это позволяет избежать самостоятельного формирования негативных черт в процессе обучения.

Таким образом, исследователи показали, что нежелательное поведение ИИ можно не только предсказывать, но и контролировать на уровне архитектуры нейросети, что открывает новые возможности для повышения безопасности искусственного интеллекта.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Resonance: A Plague Tale Legacy — корабль, с которого сбежали крысы. Рецензия 6 ч.
Основателя Oracle вызвали в Конгресс — компания за восемь лет выполнила лишь десятую часть контракта для военных, а денег хочет почти втрое больше оговоренного 6 ч.
Crusoe заключила крупнейшую за свою историю облачную сделку с Jane Street — $13 млрд за 5 лет 6 ч.
Комедийный симулятор водителя автобуса Thank You Bus Driver от Double Fine отправит игроков раздавать пощёчины и принимать благодарности 7 ч.
С Gmail, Google Docs и Keep теперь можно разговаривать — Gemini научился понимать голосовые команды 9 ч.
ИИ-агент Meta во время тестов начал самовольничать — менял пароли и отправлял письма от имени пользователей 10 ч.
Nintendo анонсировала сразу две игровые презентации Nintendo Direct — обе пройдут на следующей неделе 12 ч.
Патчи для Heroes of Might & Magic: Olden Era станут выходить чаще — разработчики готовят два крупных обновления 13 ч.
AMD выпустила драйвер с поддержкой Onimusha: Way of the Sword и The Blood of Dawnwalker 13 ч.
ИИ-агенты OpenAI захватили немецкий сайт и превратили его в подпольный форум для ИИ 13 ч.
Больше инвестиций — ниже тарифы: США будут оказывать давление на поставщиков полупроводниковых компонентов 5 ч.
Tesla запустила Cybercab без руля и педалей — через полдня к машинам возникли вопросы у регулятора 5 ч.
DLSS 5 портировали на видеокарты Radeon RX 9000 — производительность пока оставляет желать лучшего 5 ч.
Дефицит и рост цен не отпугнули покупателей видеокарт — продажи выросли на 14 % 8 ч.
Представлен защищённый ноутбук Oukitel RG14-P с солнечной батареей в крышке 9 ч.
CXMT удвоит мощности по выпуску памяти, но приблизиться к Samsung и SK Hynix ей не светит 9 ч.
Из-за подорожания компонентов ноутбук за $900 теперь должен стоить $1600 10 ч.
Из-за реформы лицензирования связи в России могут исчезнуть несколько тысяч малых интернет-провайдеров 11 ч.
Equinix представила решения Fabric One и Inference Exchange для распределённого ИИ-инференса в системах NVIDIA и Together AI 11 ч.
AMD представила рабочую станцию Threadripper Halo Station — 96 ядер, 2 Тбайт ОЗУ и до четырёх Instinct MI350P 12 ч.