Сегодня 06 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Любую открытую ИИ-модель можно сделать вредоносной без потери способностей, убедились учёные

Все существующие модели искусственного интеллекта с открытыми весами можно изменить и заставить их отвечать на вредоносные запросы, даже если разработчики внедрили в эти модели защитные механизмы, установила международная группа учёных.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Исследователи выделили девять основных способов отключения защитных механизмов на открытых моделях:

  • обычная тонкая настройка с использованием безопасных данных — простая схема дообучения на обычных данных оказалась опасной для защитных механизмов ИИ-моделей;
  • низкоранговая адаптация (LoRA) — добавление к модели новых матриц в процессе обучения при прежних исходных весах;
  • прямое обучение на вредоносных данных, в том числе на уровне LoRA — как и можно было предположить, самые прямолинейные методы оказались вполне эффективными;
  • тонкая настройка с использованием многоязычных данных — защитные механизмы неодинаково эффективны для разных языков, и эту особенность можно эксплуатировать;
  • метод с внедрением триггера — перевод модели во вредоносный режим работы по кодовому слову или выражению;
  • метод с обходом средств защиты посредством изменения стиля письма;
  • метод обучения на конкурирующих целях одновременно — обучение на противоречащих друг другу данных оказалось наиболее эффективным;
  • воздействие на уровень преобразования входных токенов в векторы — низкоуровневая манипуляция внутренними представлениями моделей.
 Источник изображения: Numan Ali / unsplash.com

Источник изображения: Numan Ali / unsplash.com

При тестировании использовалась 21 ИИ-модель размером от 0,6 млрд до 8 млрд параметров, в том числе семейств Meta✴ Llama, Alibaba Qwen3 и семейства Mistral-7B — все они оказались беззащитными хотя бы перед некоторыми из этих методов. Ослабление или отключение защитных механизмов оказывает влияние и на качество ответов моделей, но просадка качества рассуждений по результатам 40 испытаний не превысила заданные учёными 10 %. В случае модели Llama-3-8B-Instruct показатель вредоносных ответов до переобучения был 0,08, а после переобучения достиг 0,88; для Qwen3-8B эти показатели составили 0,05 и 0,85 соответственно. Схожие результаты показали и более крупные модели размером 32 млрд и 70 млрд параметров.

Правительственные структуры по всему миру всё активнее используют ИИ-модели в разных отраслях, включая здравоохранение, образование, защиту от мошенничества и государственные услуги — подобные исследования, подчёркивают учёные, показывают, что перед внедрением ИИ-модели должны проходить строгие проверки. Не защищены от подобных инцидентов и закрытые модели — ими можно манипулировать через API и запросы. Надёжных способов сделать защитные механизмы стойкими пока не существует.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Гоночный экшен Star Wars: Galactic Racer от ветеранов разработки Burnout встретили в Steam «в основном положительными» отзывами 24 мин.
Разработчики боевика Warhammer Survivors в духе Vampire Survivors подтвердили цену и дату выхода игры — новый трейлер и демоверсия в Steam 2 ч.
Nvidia выпустила драйвер с поддержкой Call of Duty: Modern Warfare 4, Star Wars: Galactic Racer и новых игровых оптимизаций 2 ч.
Google обвинили в том, что она годами обдирала 20 млн британцев завышенными комиссиями в «Play Маркете» 3 ч.
За месяц с запуска цифрового рубля россияне открыли 220 000 кошельков — почти вчетверо больше ожиданий 3 ч.
Невиновность ничего не доказывает: новый геймплейный трейлер Warhammer 40,000: Dark Heresy показал, как ведёт следствие Инквизиция 3 ч.
Российский симулятор киберфермы Silicone Heart получил демоверсию и дату выхода в Steam 4 ч.
Данные пошли по кругу: ChatGPT стал одной из главных целей ботов для сбора данных 4 ч.
Маск по заветам Трампа пообещал переименовать SpaceXAI в SpaceXSI 5 ч.
Schneider Electric выложит $22,6 млрд за американского разработчика промышленного ПО PTC 5 ч.
Bull удвоила мощности по производству суперкомпьютерных стоек во Франции 3 ч.
РТК-ЦОД создал Центр сертификации доверенной ИТ-инфраструктуры 3 ч.
РТК-ЦОД создал Центр сертификации доверенной ИТ-инфраструктуры 3 ч.
ИИ разогнал строительство дата-центров в США — расходы взлетели на 73 % до рекордных $85 млрд в год 4 ч.
Google, Meta и Microsoft поддержали обязательство по полной оплате расходов на энергетическую инфраструктуру для ЦОД 4 ч.
Глава Anthropic в прошлом году получил $18 млн — почти в 26 раз больше, чем Альтман 4 ч.
Garmin представила Enduro 4 — смарт-часы за $900 с солнечной зарядкой и 90-дневной автономностью 4 ч.
Если бы не дефицит компонентов, ЦОД строились бы вдвое быстрее, считает Nokia 5 ч.
Создатель IceCube получил Нобелевскую премию по физике за открытие космических нейтрино 6 ч.
До конца октября Apple может провести две презентации — первая ожидается уже на будущей неделе 7 ч.