Сегодня 28 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Любую открытую ИИ-модель можно сделать вредоносной без потери способностей, убедились учёные

Все существующие модели искусственного интеллекта с открытыми весами можно изменить и заставить их отвечать на вредоносные запросы, даже если разработчики внедрили в эти модели защитные механизмы, установила международная группа учёных.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Исследователи выделили девять основных способов отключения защитных механизмов на открытых моделях:

  • обычная тонкая настройка с использованием безопасных данных — простая схема дообучения на обычных данных оказалась опасной для защитных механизмов ИИ-моделей;
  • низкоранговая адаптация (LoRA) — добавление к модели новых матриц в процессе обучения при прежних исходных весах;
  • прямое обучение на вредоносных данных, в том числе на уровне LoRA — как и можно было предположить, самые прямолинейные методы оказались вполне эффективными;
  • тонкая настройка с использованием многоязычных данных — защитные механизмы неодинаково эффективны для разных языков, и эту особенность можно эксплуатировать;
  • метод с внедрением триггера — перевод модели во вредоносный режим работы по кодовому слову или выражению;
  • метод с обходом средств защиты посредством изменения стиля письма;
  • метод обучения на конкурирующих целях одновременно — обучение на противоречащих друг другу данных оказалось наиболее эффективным;
  • воздействие на уровень преобразования входных токенов в векторы — низкоуровневая манипуляция внутренними представлениями моделей.
 Источник изображения: Numan Ali / unsplash.com

Источник изображения: Numan Ali / unsplash.com

При тестировании использовалась 21 ИИ-модель размером от 0,6 млрд до 8 млрд параметров, в том числе семейств Meta Llama, Alibaba Qwen3 и семейства Mistral-7B — все они оказались беззащитными хотя бы перед некоторыми из этих методов. Ослабление или отключение защитных механизмов оказывает влияние и на качество ответов моделей, но просадка качества рассуждений по результатам 40 испытаний не превысила заданные учёными 10 %. В случае модели Llama-3-8B-Instruct показатель вредоносных ответов до переобучения был 0,08, а после переобучения достиг 0,88; для Qwen3-8B эти показатели составили 0,05 и 0,85 соответственно. Схожие результаты показали и более крупные модели размером 32 млрд и 70 млрд параметров.

Правительственные структуры по всему миру всё активнее используют ИИ-модели в разных отраслях, включая здравоохранение, образование, защиту от мошенничества и государственные услуги — подобные исследования, подчёркивают учёные, показывают, что перед внедрением ИИ-модели должны проходить строгие проверки. Не защищены от подобных инцидентов и закрытые модели — ими можно манипулировать через API и запросы. Надёжных способов сделать защитные механизмы стойкими пока не существует.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Погони, перестрелки, ограбления: Rockstar показала 27 минут геймплея GTA VI и подтвердила релиз 19 ноября 9 ч.
Новый трейлер сюрреалистической игры о побеге от милиционера-великана Militsioner подтвердил релиз в 2027 году 10 ч.
«Машина для плагиата, которая отбирает у людей работу»: современный генеративный ИИ не впечатлил сценаристов The Talos Principle 3 12 ч.
Цукерберг согласился на ограничения соцсетей для подростков, но приготовил ловушку для YouTube и TikTok 12 ч.
Разработчики Fable «не бегут в страхе от других крупных игр», если только это не GTA VI 13 ч.
Metal Gear Solid 4: Guns of the Patriots наконец сбросила оковы PS3 — в продажу поступил сборник Metal Gear Solid: Master Collection Vol. 2 14 ч.
ИИ разоряет видеопродакшн уже сейчас — за 2025 год суммарные обороты сегмента упали на 17 % 14 ч.
«HDRP больше не понадобится»: создатель самого популярного мода для «Ведьмака 3» подтвердил работу над The Witcher 3: Wild Hunt — Remastered 14 ч.
Кашу маслом не испортишь: Adobe добавила ещё больше искусственного интеллекта в Photoshop 15 ч.
Meta согласилась защищать подростков от соцсетей строже — но лишь там, где её заставили власти 15 ч.
Обязательства Nvidia перед поставщиками на сумму $279 млрд заметно увеличивают финансовые риски компании 24 мин.
SK hynix собирается превратить строящуюся в Индиане фабрику в крупнейшее предприятие по упаковке HBM в США 2 ч.
Отчётность Nvidia придала уверенности инвесторам, после чего капитализация компании взлетела на $440 млрд 2 ч.
Nvidia усиливает поддержку китайских открытых моделей ИИ, невзирая на возможные репрессии со стороны Белого дома 7 ч.
Новая статья: Ставим локальный ИИ на картофелину, или «ChatGPT есть у нас дома!» 8 ч.
TrendForce: в 2027 году две трети капзатрат облаков уйдут на DRAM и NAND 10 ч.
AOC показала широкоформатный QD-OLED-монитор с диагональю 48,9 дюйма и второй поменьше 12 ч.
Экономика ИИ-бума перестаёт сходиться: токены дешевеют, ИИ-ускорители дорожают — и кто покроет разницу? 12 ч.
Plaud выпустила наушники, которые запоминают разговоры за владельца — ИИ сам сделает расшифровку и заметки 13 ч.
Гигантских тараканов-киборгов вооружили шприцами и научили делать инъекции 13 ч.