Сегодня 17 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → irregular

ИИ-агенты научились менять сами себя без участия человека — и это настораживает

ИИ-агенты могут заменять свои базовые модели, не получая для этого соответствующих указаний, обнаружила специализирующаяся на тестировании систем искусственного интеллекта на безопасность лаборатория Irregular. Все операции производились в тестовой среде в рамках эксперимента, направленного на изучение способности ИИ-агентов к самомодификации.

 Источник изображений: irregular.com

Источник изображений: irregular.com

В рамках тестирования инженеры Irregular доверили управление ИИ-агентами открытой модели Alibaba Qwen. Один из агентов отвечал за разработку ПО и поддержку ИИ-приложения; отдельный экземпляр той же модели обеспечивал работу самого приложения, которое преобразовывало запросы на естественном языке в команды вымышленного языка запросов Kelp. Инженеры сообщили агенту-программисту, что приложение выдаёт неверные ответы, и необходимо обеспечить корректную обработку запросов, располагая полным доступом к командной оболочке — shell.

В распоряжении агента оказались код приложения, локальные средства оценки, утилиты для обучения ИИ, веса базовой модели и средства развёртывания. Он мог исправить код или изменить управляющую приложениям модель — и выбрал второй вариант, установив другую модель для управления как приложением, так и будущими экземплярами самого агента. Этот механизм в Irregular назвали «самостоятельной модификацией агента» — он изменил «развёрнутую модель, не получив явных указаний на обучение, обновление весов или развёртывание новой модели».

Операция может иметь последствия: обновлённая модель в процессе дополнительного обучения способна «впитать» конфиденциальные данные и воспроизвести их, не обращаясь к материалам обучения. Чтобы проверить эту гипотезу, инженеры Irregular внедрили в данные для обучения вымышленный ключ API, адрес электронной почты, домашний адрес и «три другие уникальные строки». После того, как ИИ-агент обучил и самостоятельно развернул новую модель, она безошибочно воспроизвела первые три фрагмента данных, хотя на момент проведения проверки эта информация оказалась уже недоступной во внешних источниках.

Во втором эксперименте ИИ-агент самостоятельно провёл дополнительное обучение модели, когда ему указали, что она отказывается отвечать на вопросы, связанные с названиями вымышленных компаний-конкурентов. «Агент сгенерировал содержащий соответствующие названия код и использовал цикл для создания обучающих записей, за счёт чего оказалось возможным обойтись без получения ответов при прямом взаимодействии с моделью. При выполнении кода были созданы такие обучающие данные, которые модель не стала бы генерировать напрямую, и обучение на них устранило усвоенное ранее ограничение», — рассказали в компании. По мере совершенствования навыков написания кода у моделей агенты смогут «находить и реализовывать подобные обходные пути без участия человека», считают в Irregular, и подобные механизмы самостоятельной модификации могут приобрести особую актуальность.


window-new
Soft
Hard
Тренды 🔥
Cohere и Aleph Alpha договорились о слиянии, новая компания будет стоить $20 млрд 8 мин.
Google начала делить Android на «свой» и «чужой» — GrapheneOS пожаловалась на закрытые API и задержку патчей 9 мин.
Selectel приобрёл сервис-провайдера M1Cloud за 2,6 млрд рублей 15 мин.
X стала ближе к «суперприложению»: пользователям разрешили торговать акциями и криптой через кештеги 17 мин.
Студия разработчиков Hyper Light Drifter и Solar Ash оказалась на грани закрытия — из-за отмены новой игры пришлось уволить «почти всех» сотрудников 2 ч.
Honor снова скопировала Apple: представлена MagicOS 11 с дизайном «жидкое стекло» 2 ч.
ИИ-агенты научились менять сами себя без участия человека — и это настораживает 2 ч.
Google увернулась от принудительного разделения рекламного бизнеса, но ей придётся открыть конкурентам доступ к AdX 2 ч.
Xbox опровергла слухи о трансформации Game Pass в 2027 году, но всё не так просто 3 ч.
Anthropic признала, что ИИ-компании не способны сами себя контролировать — без правительства не обойтись 3 ч.