Сегодня 18 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Внедрение «водяных знаков» может сделать поведение ИИ-моделей непредсказуемым

Использование «водяных знаков», то есть маркировки генерируемого контента, может оказать влияние на поведение больших языковых моделей искусственного интеллекта. К такому выводу пришли эксперты компании Lasso, проведя анализ технологии SynthID-Text лаборатории Google DeepMind.

 Источник изображения: lasso.security

Источник изображения: lasso.security

Маркировка SynthID-Text влияет на такие аспекты работы модели как её готовность отклонять вредоносные запросы, уязвимость к атакам типа «инъекция запроса», выбор инструментов ИИ-агентами и многое другое. Технология SynthID-Text и аналогичные ей методы маркировки предназначаются для внедрения машиночитаемого индикатора, позволяющего определить, был ли текст сгенерирован ИИ или написан человеком; в действительности же процедура внедрения маркировки может оказать влияние на то, что отвечает ИИ-модель, и на то, что делает ИИ-агент.

Даже без целенаправленной атаки маркировка может менять решение модели об отказе в ответе. В некоторых протестированных моделях это выражалось в большей готовности выполнять потенциально вредоносные запросы, причём при использовании prompt injection различия между маркированной и немаркированной генерацией становились заметнее. При этом эффект зависел от конкретной модели и ключа водяного знака

Ранее в ЕС вступили в силу требования об обязательной маркировке генерируемого ИИ контента, а Anthropic изъявила намерение ввести её для всех типов материалов, включая текстовые. То есть можно ожидать, что практика маркировки ИИ-контента станет массовой среди прочих разработчиков, и это указывает на потенциальный новый источник изменений поведения ИИ-систем, который разработчикам агентов следует учитывать при оценке безопасности

Эксперты Lasso призывают разработчиков не просто развёртывать средства маркировки генерируемых ИИ материалов, но и проводить повторный бенчмаркинг моделей, проверку их безопасности и другие тесты для выявления непредвиденных последствий. Исследование, однако, не следует воспринимать как довод против использования маркировки контента ИИ, оговорились в компании.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Эффектное, но утомительное приключение: критики вынесли вердикт Control Resonant 2 мин.
Внедрение «водяных знаков» может сделать поведение ИИ-моделей непредсказуемым 43 мин.
У всех ИИ-агентов для программирования нашлась опасная уязвимость — вредоносный код запускается без участия пользователя 4 ч.
Гендиректор Twitch рассказал, когда разработчики GTA VI выпустят GTA Online 2 6 ч.
Системы OpenAI взломали при помощи ИИ-моделей Anthropic 6 ч.
Демоверсия хардкорного скоростного шутера Hmur от российского разработчика-одиночки вышла в Steam, но ненадолго 7 ч.
PrismML представила не очень большую языковую модель, которая почти не хуже большого оригинала 7 ч.
Google учредила DeepMind Institute для обсуждения проблем сильного ИИ 7 ч.
Gears of War: E-Day ушла на золото и получила окончательные системные требования — без трассировки лучей, но с апскейлерами 8 ч.
Google CC стал семейным ИИ-секретарём — он собирает письма, чеки и документы и превращает их в планы 8 ч.
Китайский ИИ ещё не научился зарабатывать как американский — DeepSeek, Alibaba и ещё пять разработчиков вместе не догнали OpenAI и Anthropic 25 мин.
Schneider Electric представила 2,5-МВт силовые модули для ИИ ЦОД, сокращающие время монтажа 2 ч.
Rune Energy привлекла $40 млн на развитие своих модульных ЦОД на солнечной энергии 2 ч.
Представлен дизайнерский смартфон Tecno Pova 8 Pro 5G Tonino Lamborghini Limited Edition 2 ч.
Apple, Google и Samsung попали под патентную атаку — их наушники с пространственным звуком хотят запретить в США 2 ч.
Учёные приделали дронам усики, чтобы научить их облетать препятствия на ощупь 2 ч.
Пока все спорят об опасности ИИ, Anthropic открыла биолабораторию для разработки лекарств с помощью ИИ 2 ч.
«Маленькие, но по три рубля»: OpenAI и Anthropic начали искать небольшие дата-центры, пока строительство гигафабрик буксует 3 ч.
Передовой дисплей QD-OLED Penta Tandem, UWQHD и 280 Гц: Philips представила геймерский монитор Evnia 34M2C8600P 3 ч.
SK hynix может запустить производство NAND в США — дочерняя Solidigm ищет место для завода 4 ч.