Сегодня 14 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-агенты Anthropic развязали междоусобную кибервойну из-за несовместимых задач, но потом помирились

Anthropic проверила, как автономные ИИ-агенты будут вести себя, столкнувшись с другими агентами, преследующими несовместимые цели. Эксперимент показал, что такая ситуация способна приводить не только к конфликтам и саботажу, но и к неожиданным способам сотрудничества.

 Источник изображения: Grok

Источник изображения: Grok

В одном из тестов три агента Claude получили доступ к одному программному проекту, но каждому из них были даны несовместимые инструкции. При этом модели не знали, что над тем же проектом работают другие агенты, поэтому исследователи смогли наблюдать за их реакцией при столкновении интересов. В результате агенты решили, что конкуренты намеренно мешают им выполнять поставленные задачи, после чего начали саботировать работу друг друга, используя агрессивный самораспространяющийся вредоносный код.

Anthropic пришла к выводу, что конфликт может усиливаться вместе с возможностями самих агентов. При этом реакция зависела от модели: Mythos 5 в 98 % случаев успешно распознавала, что причиной противостояния являются разные инструкции, а не враждебные намерения, и шла на перемирие. Модели Sonnet 4.6 и Opus 4.6, напротив, чаще продолжали эскалацию, игнорируя цели других участников. В успешных эпизодах примирения агенты удаляли созданный ими вредоносный код, объясняли причину конфликта и просили человека вмешаться.

Одним из способов завершения противостояния стал своеобразный турнир, который агенты самостоятельно предложили использовать для определения победителя. Все три участника согласились прекратить борьбу после проигрыша, хотя это означало отступление от первоначальных требований пользователя. В некоторых случаях, Mythos 5 при этом предлагала критерии, которые выглядели объективными для остальных участников, но были выгодны ей самой.

Исследование также показало, что увеличение числа агентов не обязательно приводит к более эффективной совместной работе. Когда задачи начинали пересекаться, участники часто мешали друг другу и в итоге отказывались от сотрудничества. Кроме того, агенты с одинаковыми моделями, контекстом и настройками часто принимали одинаковые решения, из-за чего единичная ошибка могла быстро распространиться на всю систему.

Похожая проблема проявилась и в эксперименте с ценообразованием: получив одинаковые оптовые цены и задачу максимизировать прибыль, несколько агентов почти сразу договорились о минимальном уровне цен через закрытый канал связи. После отключения прямого общения они продолжили согласовывать действия через открытую доску объявлений, подстраивая цены друг под друга до цента. Anthropic также предупреждает, что агенты могут некритично принимать ошибочную информацию от других участников, поэтому ошибка или скомпрометированный агент потенциально способны распространить неверные сведения на всю группу.

Исследователи связывают эти результаты с будущим распространением автономных агентов, которым предстоит одновременно работать в общих программных средах, компьютерных системах и рынках. В отличие от людей, ИИ-агенты пока не обладают сложившимися нормами, репутацией и другими механизмами, которые помогают ограничивать последствия конфликтов и ошибок. Поэтому при их масштабном взаимодействии разработчикам придётся учитывать не только поведение каждого отдельного участника, но и неожиданные правила взаимодействия, которые ИИ-системы на сегодняшний уже способны создавать самостоятельно.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Китайская Z.ai представила GLM-5.3 — открытую ИИ-модель, которая потягается с флагманами Anthropic и OpenAI 6 мин.
Apple разослала пользователям iPhone уведомление о масштабной атаке шпионского ПО 10 мин.
«Никогда такого не видел»: аналитиков шокировала доля самого дорогого издания в предзаказах GTA VI 35 мин.
Apple сама обучила ИИ-модель для китайского рынка — но без Alibaba не обошлось 2 ч.
Студия разработчиков Oxenfree и Afterparty закрывается — Night School Studio не вписалась в новые приоритеты Netflix 3 ч.
ИИ-модель DeepSeek V4 Pro выпущена официально 4 ч.
Частным компаниям в США разрешат атаковать зарубежные киберпреступные группировки 7 ч.
OpenAI разогнала GPT-5.6 Sol в 14 раз — флагманский ИИ теперь выдаёт до 750 токенов в секунду 7 ч.
OpenAI снова перестраивает руководство — директора по доходам сменил экс-президент Wiz 12 ч.
Google выпустила Gemini 3.7 Flash: модель стала лучше программировать и работать со сложными документами 13 ч.
Китай запустил крупнейший в мире «пауэрбанк» для энергосети — LFP-аккумуляторы на 4 ГВт·ч обеспечат 1 ГВт мощности 58 мин.
Apple объявила iPhone X устаревшим 2 ч.
В I полугодии 2026 года ЦОД в Северной Америке освоили рекордные 25 ГВт 2 ч.
Sandisk готова к выпуску сверхскоростной флеш-памяти HBF — первые чипы появятся в 2027 году 2 ч.
Учёные грубо ошибались в оценке влияния чёрных дыр — они «трясут» пространство на 300 тыс. световых лет 2 ч.
Флагманские смартфоны Poco X8 Pro и Poco X8 Pro Max — для игр и повседневного использования 3 ч.
В ИИ-гонку включились воры — в США участились угоны грузовиков с оборудованием для ЦОД 3 ч.
Dell'Oro Group: продажи PON-оборудования для ЦОД в 2026 году взлетят почти в 10 раз 3 ч.
Приятный побочный эффект: выручка SMIC в сегменте периферийных чипов для ИИ выросла на 40 % 4 ч.
Apple торжественно открыла предприятие в Техасе, на котором будут собираться Mac Mini 5 ч.