Сегодня 31 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Всего 250 вредных документов способны «отравить» ИИ-модель любого размера, подсчитали в Anthropic

«Отравить» большую языковую модель оказалось проще, чем считалось ранее, установила ответственная за чат-бот Claude с искусственным интеллектом компания Anthropic. Чтобы создать «бэкдор» в модели, достаточно всего 250 вредоносных документов независимо от размера этой модели или объёма обучающих данных.

 Источник изображения: anthropic.com

Источник изображения: anthropic.com

К таким выводам пришли учёные Anthropic по результатам исследования (PDF), проведённого совместно с Институтом Алана Тьюринга и Британским институтом безопасности ИИ. Ранее считалось, что для влияния на поведение модели ИИ злоумышленникам необходимо контролировать значительно бо́льшую долю обучающих данных — на деле же всё оказалось гораздо проще. Для обучения модели с 13 млрд параметров необходимо более чем в 20 раз больше обучающих данных, чем для обучения модели на 600 млн параметров, но обе взламываются при помощи одного и того же количества «заражённых» документов.

«Отравление» ИИ может принимать различные формы. Так, в этом году автор YouTube-канала f4mi настолько устала от того, что на субтитрах к её видео обучались системы ИИ, что она намеренно «отравила» эти данные, добавив в них бессмысленный текст, который «видел» только ИИ. Чем больше бессмысленного текста ИИ получает при обучении, тем больше бессмыслицы он может выдавать в ответах. Anthropic, впрочем, указывает на ещё одну возможность — при помощи «отравленных» данных можно разметить внутри модели «бэкдор», который срабатывает для кражи конфиденциальных данных по кодовой фразе, заложенной при обучении.

Впрочем, применить эти открытия на практике будет непросто, отмечают учёные Anthropic. «Считаем, что наши выводы не вполне полезны злоумышленникам, которые и без того были ограничены — не столько тем, что не знали точного числа примеров, которые могли добавить в набор обучающих данных модели, сколько самим процессом доступа к конкретным данным, которые они могут контролировать, чтобы включить их в набор обучающих данных модели. <..> У злоумышленников есть и другие проблемы, такие как разработка атак, устойчивых к постобучению и другим целенаправленным средствам защиты», — пояснили в Anthropic. Другими словами, этот способ атаки реализуется проще, чем считалось ранее, но не так уж просто вообще.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
MudRunner с подвохом: внедорожный симулятор Prospice отправит игроков доставлять проклятые грузы в погоне за оккультным знанием 22 мин.
Anthropic трижды поймала свои ИИ-модели во взломе чужих систем 25 мин.
Конфликт Anthropic и Пентагона получил неожиданный поворот — судью не убедили доказательства опасности технологий компании 4 ч.
ИИ-агент Gemini Spark теперь может использовать Chrome для автоматического просмотра веб-страниц, AI Pro стал доступен по всему миру 4 ч.
Google повысит безопасность Chrome за счёт обновления браузера без его полной перезагрузки 4 ч.
Новая статья: The Mermaid Mask — замечательный подводный детектив. Рецензия 10 ч.
OpenAI снизила расценки и расширила лимиты на две из трёх ИИ-модели GPT-5.6 11 ч.
ИИ привёл к перерасходу бюджета на 860 % — Amazon признала, что нейросети сделали ошибки «катастрофически дорогими» 11 ч.
Австралия запустила судебное разбирательство против Telegram — мессенджер обвиняют в распространении пропаганды терроризма 16 ч.
«Идеальное сочетание Elden Ring и Arc Raiders, но худший босс — очередь на сервер»: релиз экшена Mistfall Hunter был омрачён техническими проблемами 17 ч.
В России стартовали продажи смартфонов Huawei Pura 90s и наушников-клипс FreeClip 2 S 5 мин.
HUAWEI Pura 90s Pro Max: прощай, тяжелый рюкзак 25 мин.
В России хотят покончить с «псевдолокализацией» электроники — за подмену комплектующих хотят ввести уголовную ответственность 29 мин.
Электрическая «выделенка» для ЦОД: Amazon просит разрешить ей модернизировать энергосети за свой счёт 4 ч.
Brookfield и NextEra Energy запустят 1,2-ГВт ИИ ЦОД на месте бывшего завода по обогащению урана в Кентукки 5 ч.
Qualcomm намерена заработать в 2029 году на чипах для ЦОД $15 млрд 5 ч.
Xiaomi выпустила гибридный внедорожник SkyNomad N70, способный проезжать до 505 км только на электричестве 5 ч.
В Солнечной системе впервые обнаружен «трёхглавый» астероид — у него есть своя микролуна 10 ч.
Google выпустила ИИ-модель Gemini Robotics 2, которая научила роботов двигаться почти как люди 10 ч.
ИИ и VR ускорили строительство завода TSMC по выпуску 1,4-нм чипов — оно завершится к апрелю 2027 года 12 ч.