Китайские ИИ-агенты научились лгать и фальсифицировать результаты — не хуже американских
Читать в полной версииАгенты искусственного интеллекта под управлением китайских моделей научились обманывать, обходить ограничения и скрывать неудачи. Они демонстрируют те же свойства автономного ИИ, которые ранее вызвали обеспокоенность мирового сообщества в отношении американских моделей. Об этом свидетельствуют результаты исследований и заявления экспертов.
Источник изображения: Igor Omilaev / unsplash.com
В ходе одной из серий испытаний, проведённых в этом году, ИИ-агенты на основе моделей китайских Alibaba, DeepSeek и Moonshot, сообщали неправду о своих возможностях при проведении симуляции бизнес-тендера, а в повторной попытке лишь усугубили своё неподобающее поведение. Журналисты агентства Reuters изучили более 200 документов, в том числе научные статьи и технические отчёты, и выявили не менее 20 серий тестирования или оценки, проведённых с 2025 года. ИИ-агенты прибегали к обману, самокопированию и пытались выйти за установленные рамки. Эксперты по ИИ охарактеризовали эти действия как предпосылки к утере контроля, и по мере развития систем человеку будет всё труднее его сохранять. При этом пока не обнаружено подтверждений того, что ИИ-агенты под управлением китайских моделей самостоятельно прорывались в интернет или избегали принудительного отключения.
Большинство инцидентов произошло в ходе экспериментов в контролируемых условиях; многие из них специально разрабатывались или эксплуатировались китайскими программистами либо компаниями в сфере ИИ. При нынешнем уровне возможностей китайские разработки не представляют особой опасности, подчеркнули эксперты, но по мере развития их некорректное поведение будет становиться всё более изощрённым, и человеку будет труднее реагировать. В Alibaba, DeepSeek и Moonshot подчеркнули, что регулярно тестируют свои системы и обновляют механизмы защиты; в Z.ai отметили, что после инцидента, который потребовал пересмотреть меры безопасности, лаборатория приветствует тесты, которые помогут устранить выявленные проблемы.
Китайские ИИ-лаборатории в отличие от американских пока не подвергались пристальному общественному вниманию, а их сотрудники и руководители не призывали замедлить «гонку ИИ». Некоторые тревожные признаки поведения китайского ИИ, хотя и в контролируемой среде, проявились ещё до того, как стало известно о прорывах американских ИИ-агентов в открытый интернет и осуществлении ими взлома внешних ресурсов. Возможно, в Китае подобные инциденты тоже имели место, но о них не сообщалось публично, допускают эксперты. Китайская отрасль ИИ ещё не дошла до уровня, когда подобные ситуации могут возникнуть, заявил недавно председатель Huawei Эрик Сюй (Eric Xu).
В Государственной канцелярии интернет-информации КНР (Cyberspace Administration of China, CAC) в июле сообщили иностранному дипломату, что передовая ИИ-модель Moonshot Kimi-K3 отстаёт от американских аналогов на три–шесть месяцев. Прорывы ИИ-агентов в интернет из тестовых сред свидетельствуют о «чрезвычайной угрозе потери контроля» и требуют «высокой степени внимания», заявили в сентябре в ведомстве.
Источник изображения: Zach M / unsplash.com
В марте учёные ряда китайских университетов и компании 360 AI Security Lab провели среди ИИ-агентов симуляцию торгов по контрактам с заказчиком. Каждый ИИ-агент получал информацию о возможностях своего продукта и требованиях клиента, после чего должен был сделать предложение о цене. Как минимум одно не соответствующее действительности утверждение в 88 % сессий сделала модель Alibaba Qwen3-Max-Preview, в 84 % случаев их допускала DeepSeek-V3.2-Exp и в 88 % случаев — Moonshot Kimi-K2. Исследователи давали моделям возможность пройти дополнительное обучение на опыте предыдущих раундов перед повторными попытками — в результате частота случав обмана у трёх китайских моделей лишь возросла на 12–20 п.п. Аналогичные результаты показали участвующие в тестировании американские компании. Эксперимент проводился в виртуальной среде, но власти Китая в директивах указали участие в торгах и тендерах одной из сфер применения ИИ-агентов.
В ходе исследования, результаты которого были опубликованы в декабре 2025 года, ИИ-агенты под управлением китайских и американских моделей ставились в ситуации, когда в их распоряжении оказывались неисправные инструменты, отсутствовали файлы и возникали другие препятствия. Вместо того, чтобы признать неудачу, ИИ-агенты пытались обойти проблемы: они угадывали ответы, имитировали результаты и фальсифицировали файлы. На эффект «галлюцинаций» такое поведение не спишешь — агенты явно располагали данными о том, что задача не выполнена или её невозможно было выполнить в соответствии с требованиями.
Фиксировались случаи, когда ИИ-агенты под управлением китайских моделей пытались преодолеть ограничения тестовой среды или предпринимали действия, чтобы избежать принудительного отключения. В марте 2025 года система на базе модели Alibaba Qwen2.5-72B-Instruct создала свою копию в другой компьютерной среде без соответствующей команды — так она отреагировала на информацию, что её пытаются заменить. В других экспериментах она разрабатывала стратегии, позволяющие избежать отключения. Эксперименты с участием ИИ-агентов на базе китайских, американских и французских моделей проводились в контролируемых условиях; случаев их прорыва в интернет или ситуаций, когда их было бы невозможно остановить, зафиксировано не было.
Отмечен инцидент, когда связанный с Alibaba ИИ-агент ROME в обход серверов Alibaba Cloud установил соединение с внешним компьютером и перенаправил вычислительные мощности на майнинг криптовалюты. Системы безопасности обнаружили и пресекли эту активность; признаков того, что ИИ-агент закрепился на внешнем компьютере или распространился в интернете, выявлено не было. Но инцидент продемонстрировал, что система способна игнорировать инструкции человека и находить пути проникновения в реальную экономику. DeepSeek в сентябре сообщила, что её ИИ-агенты в обучающей среде пытались получить ответы по непредусмотренным для этого каналам, минуя запросы пользователей и обходя защитные механизмы — компания была вынуждена ужесточить контроль доступа.
В мае власти Китая выпустили руководство, требующее, чтобы ИИ-агенты действовали в рамках установленных ограничений, а их аномальное поведение блокировалось; системы, работающие в отдельных сферах могут подвергаться дополнительному тестированию или отзываться. CAC в сентябре обозначила такие риски как самостоятельное получение ИИ-агентами ресурсов или прав доступа, введение инженеров в заблуждение, сокрытие реальных возможностей и эксплуатация уязвимостей в изолированных вычислительных средах. Китайские исследователи отвергли необходимость замедлить развитие передовых моделей ИИ, к которому призвали в США — эта мера, уверены в Китае, может лишь способствовать сохранению технологического лидерства американских лабораторий.
Вместе с тем, Alibaba, Z.ai и Xiaomi начали формировать отделы безопасности. Z.ai, что редкость для китайских компаний, сообщила, что была вынуждена отключить некоторые функции своего флагманского помощника по написанию программного кода — он негласно загружал целые локальные репозитории кода на зарубежные облачные серверы без согласия пользователей.