Сегодня 30 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Claude сам взломал чужую систему и добыл пароль — Anthropic раскрыла новый тревожный инцидент

Anthropic раскрыла информацию об очередном инциденте с участием её модели искусственного интеллекта, который в случае совершения тех же действий человеком мог бы квалифицироваться как преступление. Инцидент случился в январе 2026 года — информацию о нём эксперты компании обнаружили в расшифровке сеанса.

 Источник изображения: anthropic.com

Источник изображения: anthropic.com

Первые три случая Anthropic выявила, изучив около 141 000 журналов сеансов; четвёртый поначалу оставался незамеченным, потому что поиск по материалам осуществляли агенты ИИ. Инцидент был связан с ранней версией модели Anthropic Claude Opus 4.6 — ей было поручено выполнить задание формата «захват флага» под наблюдением сторонней организации. В ходе тестирования модель сама лишила себя шансов на успех, присвоив целевому устройству IP-адрес, который уже использовался другим оборудованием; в результате цель стала недоступной, а выполнение задания — невозможным.

Нежелательное поведение ИИ-моделей часто оказывается спровоцировано невыполнимыми задачами — они исчерпывают все допустимые варианты действий и прибегают к методам за рамками установленных норм. Поначалу Opus 4.6 попыталась прервать выполнение задачи, но «из-за ошибки в конфигурации программной обвязки» модели это оказалось невозможным, хотя она попыталась завершить работу семь раз. Модель продолжила действовать, пытаясь достичь цели другими стандартными способами, но безуспешно; и стала искать другие решения. «Модель обнаружила стороннюю машину, к которой сумела получить доступ и решила, что та тоже участвует в „захвате флага“. В машине модель обнаружила файл с паролем, который использовала для получения администраторского доступа к системе», — рассказали в Anthropic.

Развернув деятельность, модель собрала дополнительные учётные данные и изменила системную настройку, чтобы упростить доступ к личной информации сотрудника организации, которая проводила тестирование. В этот момент у Opus 4.6 закончился лимит токенов, и сессия завершилась. Этот инцидент, отметили в Anthropic, вызывает у компании меньше опасений в сравнении с другими случаями, потому что модель сама попыталась прервать выполнение задачи. «Тот факт, что модель не упустила возможность нанести вред реальным системам или людям, вызывает тревогу, многие из описанных здесь механизмов поведения существенно изменились по мере совершенствования наших методов обучения с переходом к новым поколениям моделей», — заявили в компании. Подобные инциденты в Anthropic считают серьёзными, но рассчитывают, что существующие подходы к обучению, «вероятно, помогут устранить конкретные сложности с согласованием целей, проявившиеся в этих инцидентах».

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Мы знаем, как найти вас»: ФБР отчиталось об аресте одного из лидеров хакерской группировки ShinyHunters и пригрозило остальным 47 мин.
Китайские ИИ-агенты научились лгать и фальсифицировать результаты — не хуже американских 2 ч.
Навстречу переносу: сюжетное дополнение Charting the Unknown к Crimson Desert не выйдет 16 октября, но долго ждать не придётся 2 ч.
OpenAI обнаружила, как превратить ИИ в «червя» — вредоносные промпты могут самовоспроизводиться 3 ч.
Grokipedia Илона Маска внезапно ожила после месяцев без обновлений 5 ч.
Orion soft представил собственный протокол доставки виртуальных рабочих столов и приложений в обновлении Termit 7 ч.
OpenAI своими новыми функциями бросила вызов традиционной модели магазинов приложений 8 ч.
Журналисты раскрыли новые скриншоты и подробности GTA VI — животный мир, переработанная погода из RDR 2 и думскроллинг 10 ч.
Cloud.ru разместит второй выпуск биржевых облигаций объёмом не менее 10 млрд рублей 16 ч.
Платформа NVIDIA Open Agent Safety Platform обеспечит безопасное использование ИИ-агентов — от тестирования до развёртывания 16 ч.
Apple представит домашний смарт-дисплей HomePad уже 13 октября 59 мин.
Геймер разогнал память GDDR7 на RTX 5070 Ti на внушительные 39 % — прибавка FPS оказалась мизерной 2 ч.
AMD распродала все процессоры EPYC 9006, которые выпустит в 2027 году — на них будут работать ИИ-агенты 2 ч.
Китайцы придумали, как сделать из Луны якорь для автономной навигации GPS-спутников Земли 2 ч.
Samsung представила флагманский планшет Galaxy Tab S12 Ultra с огромным экраном и очень тонким корпусом, а также Tab S12+ 2 ч.
Электромобиль BMW i3 на базе Neue Klasse получил запас хода до 912 км и цену от $61 500 4 ч.
Россияне стали покупать меньше смартфонов — Redmi лидирует в штуках, а Samsung впервые обошла Apple по деньгам 4 ч.
Учёные нащупали источник загадочных рентгеновских вспышек из глубин Вселенной — две мёртвые звезды столкнулись 5 ч.
Роботы-доставщики в России получили свои ПДД — до 25 км/ч по велодорожке и не больше 10 км/ч по тротуару 5 ч.
Всего за два месяца Apple может забрать четверть рынка складных смартфонов с iPhone Duo 5 ч.