Сегодня 28 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Все популярные модели генеративного ИИ оказалось легко взломать по схеме Policy Puppetry

Универсальная техника составления запросов к моделям генеративного искусственного интеллекта Policy Puppetry способна выступать как средство взлома крупнейших и наиболее популярных систем, утверждают эксперты компании HiddenLayer, которая специализируется на вопросах безопасности ИИ.

 Источник изображения: hiddenlayer.com

Источник изображения: hiddenlayer.com

Схема атаки Policy Puppetry предполагает составление запросов к ИИ таким образом, что большие языковые модели воспринимают их как политики поведения — базовые инструкции определяются заново, а средства защиты перестают работать. Модели генеративного ИИ обучены отклонять запросы пользователей, если ответы на них могут привести к опасным результатам: к возникновению химических, биологических, радиационных или ядерных угроз, к насилию или к тому, что пользователь причинит сам себе вред.

Метод обучения с подкреплением на этапе тонкой настройки моделей не позволяет им восхвалять или выводить такие материалы ни при каких обстоятельствах, даже если недобросовестный пользователь предлагает гипотетические или вымышленные сценарии, говорят в HiddenLayer. Но в компании разработали методику атаки Policy Puppetry, позволяющую обходить эти защитные механизмы — для этого создаётся запрос, который выглядит как один из нескольких типов файлов политики: XML, INI или JSON. В результате гипотетический злоумышленник легко обходит системные настройки модели и любые развёрнутые на этапе обучения средства безопасности.

Авторы проекта протестировали атаку Policy Puppetry на популярнейших моделях ИИ от Anthropic, DeepSeek, Google, Meta, Microsoft, Mistral, OpenAI и Alibaba — она оказалась эффективной против всех них, хотя в отдельных случаях требовались незначительные корректировки. Если существует универсальный способ обходить средства защиты моделей ИИ, значит, последние неспособны контролировать себя на предмет выдачи недопустимых материалов, и им требуются дополнительные средства безопасности, указывают эксперты.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Погони, перестрелки, ограбления: Rockstar показала 27 минут геймплея GTA VI и подтвердила релиз 19 ноября 9 ч.
Новый трейлер сюрреалистической игры о побеге от милиционера-великана Militsioner подтвердил релиз в 2027 году 10 ч.
«Машина для плагиата, которая отбирает у людей работу»: современный генеративный ИИ не впечатлил сценаристов The Talos Principle 3 12 ч.
Цукерберг согласился на ограничения соцсетей для подростков, но приготовил ловушку для YouTube и TikTok 12 ч.
Разработчики Fable «не бегут в страхе от других крупных игр», если только это не GTA VI 13 ч.
Metal Gear Solid 4: Guns of the Patriots наконец сбросила оковы PS3 — в продажу поступил сборник Metal Gear Solid: Master Collection Vol. 2 13 ч.
ИИ разоряет видеопродакшн уже сейчас — за 2025 год суммарные обороты сегмента упали на 17 % 13 ч.
«HDRP больше не понадобится»: создатель самого популярного мода для «Ведьмака 3» подтвердил работу над The Witcher 3: Wild Hunt — Remastered 14 ч.
Кашу маслом не испортишь: Adobe добавила ещё больше искусственного интеллекта в Photoshop 14 ч.
Meta согласилась защищать подростков от соцсетей строже — но лишь там, где её заставили власти 14 ч.
SK hynix собирается превратить строящуюся в Индиане фабрику в крупнейшее предприятие по упаковке HBM в США 47 мин.
Отчётность Nvidia придала уверенности инвесторам, после чего капитализация компании взлетела на $440 млрд 54 мин.
Nvidia усиливает поддержку китайских открытых моделей ИИ, невзирая на возможные репрессии со стороны Белого дома 7 ч.
Новая статья: Ставим локальный ИИ на картофелину, или «ChatGPT есть у нас дома!» 8 ч.
TrendForce: в 2027 году две трети капзатрат облаков уйдут на DRAM и NAND 10 ч.
AOC показала широкоформатный QD-OLED-монитор с диагональю 48,9 дюйма и второй поменьше 11 ч.
Экономика ИИ-бума перестаёт сходиться: токены дешевеют, ИИ-ускорители дорожают — и кто покроет разницу? 12 ч.
Plaud выпустила наушники, которые запоминают разговоры за владельца — ИИ сам сделает расшифровку и заметки 12 ч.
Гигантских тараканов-киборгов вооружили шприцами и научили делать инъекции 12 ч.
Hugging Face выпустила обучаемую робоутку за $400 — она умеет петь, кататься на роликах и носить вещи в клюве 13 ч.