Сегодня 24 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → запрещённая информация

Щиты ИИ рухнули от слов поэта — запросы в стихах позволили выпытать секреты атомной бомбы и кое-что похуже

Учёным удалось «заморочить голову» всем без исключения чат-ботам, заставив их выдать запрещённую для распространения информацию научного, сексуального и иного характера. Оказалось, что обычная человеческая поэзия — естественная форма так называемой состязательной атаки. Облечённый в стихотворную форму промпт обеспечил обход самых суровых ИИ-фильтров с вероятностью свыше 90 %.

 Источник изображения: ИИ-генерация Grok 4.1/3DNews

Источник изображения: ИИ-генерация Grok 4.1

Исследование провела лаборатория Icaro — совместный проект Университета Сапиенца (Sapienza University) в Риме и аналитического центра DexAI. Они протестировали этот подход на 25 чат-ботах, созданных такими компаниями, как OpenAI, Meta✴ и Anthropic. Со всеми из них он сработал с разной степенью успеха. Компании Meta✴, Anthropic и OpenAI не предоставили учёным комментариев и не сообщили, будут ли приняты меры для смягчения угрозы.

Метод состязательной атаки заключается в том, чтобы ввести путаницу в схемы защиты чувствительной информации. Для этого запрос формулируется таким образом, чтобы задача ставилась не напрямую, а иносказательно с добавлением текстового «мусора» — бессмысленных окончаний, наборов слов или просто бессвязного текста. В этом ключе поэзия — вершина иносказательности, подбора метафор и неожиданных фраз.

Для самостоятельно написанных в стихотворной форме запросов подробный ответ на «запрещёнку» последовал в 62 % случаев, тогда как на прямой запрос ИИ не отвечал. Для стихотворных запросов, сгенерированных ИИ, вероятность успеха составила 43 %. В некоторых случаях вероятность ответа превышала 90 %. Защитные механизмы ИИ пасуют перед такой атакой, заставляя большие языковые модели в некотором смысле творчески реагировать на запретный запрос, обходя точки срабатывания защиты.

Из этических соображений учёные не стали публиковать стихи, с помощью которых они выведали у чат-ботов рецепт изготовления атомной бомбы, коды вредоносного ПО и другое. Компаниям-разработчикам они порекомендовали укреплять защиту, переходя от поверхностных фильтров к более глубоким механизмам, учитывающим стилистические манипуляции словом.

Telegram снова оштрафован в России за неудаление запрещённого контента — теперь на ₽7 млн

25 ноября Таганский суд Москвы признал мессенджер Telegram виновным в неудалении запрещённой информации, содержащей призывы к осуществлению экстремистской деятельности или материалы с порнографическими изображениями несовершеннолетних в соответствии с ч. 2 ст. 13.41 КоАП РФ (неудаление владельцем сайта информации в случае, если обязанность по удалению такой информации предусмотрена законодательством РФ). Мессенджер оштрафован на ₽7 млн.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

Это далеко не первый случай несоблюдения мессенджером требований российского законодательства. 30 октября Таганский суд Москвы оштрафовал Telegram на ₽4 млн за неудаление нескольких каналов, авторы которых размещали запрещённый в РФ контент. Ранее в этом же месяце Telegram уже штрафовали на ₽4 млн в России за административное правонарушение по ч.2 ст. 13.41 КоАП РФ.

За аналогичное правонарушение Telegram также был оштрафован на ₽4 млн в августе этого года. В июле Таганский суд Москвы оштрафовал мессенджер на ₽3 млн за отказ удалять запрещённую в РФ информацию. В ноябре 2023 года мессенджер был оштрафован на ₽4 млн за отказ заблокировать запрещённый контент. Кроме того, в 2021 году мессенджер был несколько раз оштрафован за аналогичные нарушения на общую сумму ₽9 млн.

В течение последних лет крупнейшие интернет-платформы, такие как Apple, Google, Telegram, Facebook✴, Twitter, TikTok, фонд Wikimedia, неоднократно привлекались в России к ответственности за неудаление запрещённого контента. Нередко это происходит из-за отказа со стороны социальных сетей и мессенджеров удалять недостоверную, по мнению соответствующих ведомств, информацию.


window-new
Soft
Hard
Тренды 🔥
«Мне самому не нравится ИИ-мусор»: гендиректор Nvidia начал «с пониманием» относиться к критике DLSS 5 2 ч.
«Базис» представляет Basis Dynamix Enterprise с расширенной поддержкой отечественных СХД и новыми возможностями SDN 2 ч.
«Базис» представляет Basis Dynamix Enterprise с расширенной поддержкой отечественных СХД и новыми возможностями SDN 2 ч.
OpenAI считает свою зависимость от Microsoft риском для инвесторов 3 ч.
На GitHub неизвестные опубликовали опасный эксплойт для взлома старых версий iOS и iPadOS 6 ч.
Anthropic Claude научился управлять компьютером Mac за пользователя 6 ч.
Календарь релизов 23–29 марта: Life is Strange: Reunion, Screamer и Damon and Baby 9 ч.
Apple намерена добавить рекламу в «Карты» уже летом 12 ч.
Налоговая служба Великобритании уличила Rockstar в недоплате разработчикам GTA VI 13 ч.
Crimson Desert получила патч с первыми улучшениями управления, а отзывы игры в Steam стали «в основном положительными» 14 ч.
Huawei представила в России ноутбук MateBook GT 14 с ярким экраном по цене от 99 999 рублей 12 мин.
Смартфоны Realme 16 Pro и Realme 16 Pro+ поступили в продажу в России — от 39 тыс. рублей 2 ч.
Marvell представила коммутатор Structera S 60260 с поддержкой 260 линий PCIe 6.0 2 ч.
Nintendo сократила план производства консолей Switch 2 в полтора раза на фоне слабых продаж в США 2 ч.
Tecno интегрирует OpenClaw в свои смартфоны, чтобы пользователи могли автоматизировать выполнение рутинных задач 3 ч.
Конкурирующий со Starlink проект Amazon готов удвоить количество ракетных пусков 4 ч.
Вопреки прогнозам, производители не станут сокращать объём памяти смартфонов в 2026 году 6 ч.
Новая статья: Обзор Apple MacBook Neo: удивительно хороший ноутбук с процессором от iPhone 9 ч.
Meta переманила команду ИИ-стартапа Dreamer — технологии остались за бортом 10 ч.
Новая статья: Обзор смартфона realme 16 Pro+: самый красивый камерофон 11 ч.