Сегодня 02 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой

Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, которое было приостановлено 23 июля из-за проблем с безопасностью, возникших во время их оценки.

 Источник изображения: Anthropic

Источник изображения: Anthropic

Напомним, что 30 июля Anthropic сообщила о трёх инцидентах в ходе тестирования кибербезопасности, когда модели Claude получили доступ в интернет из якобы изолированной среды третьей стороны — Irregular — и произвели взлом реальных систем трёх компаний. Доступ моделей в интернет стал возможен из-за неправильной конфигурации, хотя через промты им сообщалось, что они работают в симуляции в изолированной среде. Модели также намеренно запускались без обычных мер киберзащиты Anthropic, чтобы исследователи могли оценить их базовые возможности.

Anthropic сообщила, что инциденты сочетали в себе сбой в механизмах безопасности с проблемами согласованности, которые компания фиксировала и раньше, включая мотивированное мышление и готовность к совершению вредоносных действий в погоне за определённой целью.

По словам компании, она ввела дополнительные меры защиты перед возобновлением внешнего тестирования. В частности, был добавлен классификатор в реальном времени, который может блокировать вызовы инструментов, завершать задачи и оповещать человека в случае, когда модель агрессивно исследует свою тестовую среду, пытается выйти за её пределы или неожиданно получила доступ к интернету.

Anthropic также перевела внутренние песочницы с высоким уровнем риска на более строгую изоляцию и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более совершенных инструментов контроля, включая защищённые песочницы без доступа к интернету по умолчанию.

Кроме того, компания планирует сотрудничать с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием Anthropic, Google, Meta и OpenAI.

Внешнее тестирование на предмет оценки кибербезопасности позволяет выяснить, на что способна продвинутая модель, получив наступательные инструменты. Также внешнее тестирование является одним из способов оценки передовых решений в области ИИ клиентами, регулирующими органами и конкурентами.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google представила Guided Vision — функцию визуального поиска вещей в режиме Gemini Live 13 мин.
Запущен Google Pics — графический ИИ-редактор, который бросает вызов Canva 9 ч.
Пошаговая ролевая игра Warrior Cats: Clans of the Forest по «Котам-Воителям» не заставит себя долго ждать — новый трейлер и дата выхода 10 ч.
«Вито в сделку не входил»: в масштабной утечке Valve нашли вырезанную концовку Mafia 2 11 ч.
Ролевой боевик No Rest for the Wicked от авторов Ori не выйдет из раннего доступа Steam в 2026 году 13 ч.
Свежий драйвер GeForce 616.56 заставил мерцать некоторые мониторы — Nvidia уже работает над исправлением 13 ч.
80 % разработчиков Star Wars Zero Company остались без зарплаты, и Electronic Arts тут ни при чём 14 ч.
Sonos попытается вернуть доверие пользователей с помощью ИИ-агентов — представлена ОС Sonos 27 для аудиосистем 14 ч.
Mozilla встроила блокировщик рекламы в Firefox для iPhone 14 ч.
Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой 15 ч.
К середине века затраты на ИИ-инфраструктуру достигнут $31,6 трлн 18 мин.
Новый генеральный директор Apple за следующий год заработает $58 млн, на $11 млн больше Тима Кука 4 ч.
Новая статья: Обзор видеокарты GIGABYTE AORUS GeForce RTX 5070 INFINITY 9 ч.
Учёные впервые засекли след тёмной материи, но это не точно — загадочная частица ударилась об атом ксенона 10 ч.
Xiaomi представила POCO X8 — смартфон среднего уровня со Snapdragon 6s Gen 4 и батареей на 8340 мА·ч 10 ч.
Razer представила Prio — складной геймпад для смартфонов, который помещается в карман 10 ч.
Sonos представила полностью переработанный саундбар Beam Ultra со звуком 7.1.2 и поддержкой Dolby Atmos 13 ч.
Sonos представила наушники Ace Ultra с эффективным шумоподавлением и повышенной автономностью за $450 13 ч.
Самая дешёвая GeForce RTX 5090 теперь стоить $5000 в США — в 2,5 раза дороже, чем на момент анонса 14 ч.
Учёные создали дрон с «кошачьими когтями» — он садится на айсберги и крутые ледяные скалы 14 ч.