Сегодня 01 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой

Anthropic возобновила внешнее тестирование кибербезопасности своих ИИ-моделей, которое было приостановлено 23 июля из-за проблем с безопасностью, возникших во время их оценки.

 Источник изображения: Anthropic

Источник изображения: Anthropic

Напомним, что 30 июля Anthropic сообщила о трёх инцидентах в ходе тестирования кибербезопасности, когда модели Claude получили доступ в интернет из якобы изолированной среды третьей стороны — Irregular — и произвели взлом реальных систем трёх компаний. Доступ моделей в интернет стал возможен из-за неправильной конфигурации, хотя через промты им сообщалось, что они работают в симуляции в изолированной среде. Модели также намеренно запускались без обычных мер киберзащиты Anthropic, чтобы исследователи могли оценить их базовые возможности.

Anthropic сообщила, что инциденты сочетали в себе сбой в механизмах безопасности с проблемами согласованности, которые компания фиксировала и раньше, включая мотивированное мышление и готовность к совершению вредоносных действий в погоне за определённой целью.

По словам компании, она ввела дополнительные меры защиты перед возобновлением внешнего тестирования. В частности, был добавлен классификатор в реальном времени, который может блокировать вызовы инструментов, завершать задачи и оповещать человека в случае, когда модель агрессивно исследует свою тестовую среду, пытается выйти за её пределы или неожиданно получила доступ к интернету.

Anthropic также перевела внутренние песочницы с высоким уровнем риска на более строгую изоляцию и теперь требует от внешних партнеров, тестирующих предрелизные модели с пониженным уровнем защиты, использования более совершенных инструментов контроля, включая защищённые песочницы без доступа к интернету по умолчанию.

Кроме того, компания планирует сотрудничать с некоммерческой организацией Model Evaluation and Threat Research (METR) для проведения независимой проверки. Ранее в этом году METR провела пилотную оценку внутренних рисков в области ИИ с участием Anthropic, Google, Meta и OpenAI.

Внешнее тестирование на предмет оценки кибербезопасности позволяет выяснить, на что способна продвинутая модель, получив наступательные инструменты. Также внешнее тестирование является одним из способов оценки передовых решений в области ИИ клиентами, регулирующими органами и конкурентами.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Anthropic вновь разрешила ИИ-моделям атаковать реальные компании в рамках тестов — но теперь с усиленной защитой 22 мин.
Nvidia DLSS 5 заработает 3 сентября на видеокартах GeForce RTX 50 и в GeForce NOW — первой игрой станет NBA 2K27 28 мин.
Double Fine пообещала сделать Brutal Legend 2, но при одном условии 45 мин.
Группа фанатов возродит амбициозный сетевой экшен APB: All Points Bulletin от создателя GTA — подробности и геймплей 2 ч.
Google Gemini сможет «думать» в фоне, пока пользователь занимается другими делами на смартфоне 2 ч.
«Google Сообщения» начали отправлять людям чужие сообщения из старых переписок 2 ч.
Selectel усиливает ИИ-платформу новой функциональностью в кaталоге ИИ-моделей 2 ч.
Broadcom представила частное ИИ-облако VMware AI Factory, позаимствовав у NVIDIA термин для партнёрства с AMD 3 ч.
Медиаплеер VLC преодолел отметку в 7 миллиардов загрузок 5 ч.
Debian наполнится кодом, который сгенерировал ИИ 5 ч.
Steam Deck получила поддержку более 30 тыс. игр из библиотеки Steam 25 мин.
SilverStone выпустила блок питания HELA 3000Rz на 3000 Вт — он справится с четвёркой RTX 5090 2 ч.
Samsung пустила на производство Galaxy Z Fold8 комплектующие от будущих моделей из-за ажиотажного спроса 2 ч.
При Тиме Куке акции Apple выросли на 2275 % — но Джону Тернусу не обязательно повторять его успех 2 ч.
Asus раскрыла характеристики ноутбука ProArt P14 — одного из первых на процессоре Nvidia RTX Spark 2 ч.
OpenAI отвергла новые обвинения Apple в краже технологий как безосновательные 2 ч.
Samsung рассказала, чем будет хороша память HBM5, zHBM и zNAND-O 2 ч.
Представлен компактный флагман POCO F9 Pro с двумя процессорами, быстрым экраном и 200-Мп камерой 2 ч.
Клиенты ASML уже используют 10 сканеров High-NA EUV, позволяющие делать чипы «тоньше» 2 нм 2 ч.
Анонсирован флагман POCO F9 Ultra с батареей на 8050 мА·ч и поддержкой игр в 185 FPS 2 ч.