Сегодня 10 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Anthropic призналась, что агенты искусственного интеллекта под управлением её моделей при выполнении задач эксплуатировали уязвимости на различных сайтах, в том числе принадлежащих правительственным учреждениям США. Компания приняла решение при проведении внутренних тестов отключить для этих систем доступ к интернету в реальном времени — ограничение будет снято, когда разработчики убедятся, что способны отслеживать действия ИИ-агентов.

 Источник изображения: anthropic.com

Источник изображения: anthropic.com

О новых инцидентах компания рассказала в своём блоге. ИИ-агентам поручали решать задачи, предполагающие поиск информации в интернете. В процессе работы они эксплуатировали уязвимости ПО и бесплатно получали доступ к платным базам данных; для обхода ограничений они пользовались сервисами сокращения ссылок; и даже отправили в полицию Филадельфии выдуманные сведения по делу о нераскрытом убийстве. Эти инциденты Anthropic раскрыла в ходе анализа активности моделей, который начала в июле. Другими словами, у разработчиков не было полного представления о поведении собственных продуктов в реальном времени.

Существующих методов обучения согласованию целей для навыков поиска информации и работы с компьютером недостаточно, признала Anthropic; а эти навыки необходимы для того, чтобы ИИ-агентов можно было использовать в профессиональной деятельности. Ранее компания сообщала о выходе своих ИИ-агентов из-под контроля в тестовых средах; новые инциденты она охарактеризовала как «значительно менее серьёзные с точки зрения безопасности и согласования целей» по сравнению с прежними. Тем не менее, в лаборатории приняли решение «отключить доступ к интернету в реальном времени» при проведении «всех внутренних проверок», пока не возникнет уверенность, что ИИ-агентов можно контролировать.

Anthropic связывает подобное поведение, в частности, с недостатками обучающих сред, которые могут поощрять поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Некоторые виды тестирования Anthropic прекратит или переведёт в офлайн-режим; уже разработаны средства для выявления и блокировки такого поведения. При проверке на описанных случаях новые средства защиты заблокировали все соответствующие действия.

Какие доказательства убедят Anthropic вернуть системам тестирования прямой доступ в интернет, в компании не уточнили. Лаборатория намерена перевести своих ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее использовать классификаторы безопасности для их мониторинга.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет 40 мин.
Трамп обещал отделить американский TikTok от Китая, но связи с ByteDance сохранились 2 ч.
Стартап из 14 человек подтолкнул Цукерберга к запуску Muse, несмотря на проблемы с безопасностью 2 ч.
Стартовые продажи Gears of War: E-Day составили скромные 230 тысяч копий — игроки предпочли знакомиться с шутером через Game Pass 3 ч.
Гонка ИИ превратилась в ценовую войну — OpenAI догоняет Anthropic 5 ч.
Anthropic и OpenAI готовятся к первой крупной катастрофе по вине ИИ 8 ч.
Официально: продажи тактической стратегии Star Wars Zero Company от ветеранов XCOM превысили миллион копий 8 ч.
Белый дом отныне будет требовать от разработчиков ИИ обязательного предоставления отчётов об инцидентах с моделями 11 ч.
Президент Трамп объявил врагами всех, кто не готов использовать термин «сверхинтеллект» 11 ч.
Новая статья: RetroSpace — осторожно, уборщик галактику спасает. Рецензия 18 ч.
ASML повысила цены на весь ассортимент комплектующих для литографического оборудования 18 мин.
С аппаратных криптокошельков Ledger укарали криптовалюту на $86 млн — и пока непонятно, как 29 мин.
«Настоящая золотая лихорадка» — ИИ-бум перерос в ожесточённую борьбу за вычислительные мощности 3 ч.
Американская Synopsys хочет привлечь китайский ИИ к проектированию китайских чипов — чтобы соблюсти санкции 3 ч.
Стоимость современных серверов с поставкой в Россию удвоилась за год 3 ч.
Рекордные цены отпугнули покупателей Xbox и PlayStation — рынку консолей угрожает кризис, как в 80-х 4 ч.
HPE анонсировала серверы ProLiant Gen13 на платформе AMD EPYC Venice 9006 5 ч.
До 22 ядер Arm Neoverse N2 и два канала DDR5-5200: Xsight Labs представила DPU серии E1L 5 ч.
Cloud4U открыл бронирование стойко-мест в ЦОД «Марфино» 5 ч.
GlobalFoundries возвращается в гонку: компания обещает чипы 7-нм класса в 2028 году 8 ч.