Сегодня 30 января 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → запрещённая информация

Щиты ИИ рухнули от слов поэта — запросы в стихах позволили выпытать секреты атомной бомбы и кое-что похуже

Учёным удалось «заморочить голову» всем без исключения чат-ботам, заставив их выдать запрещённую для распространения информацию научного, сексуального и иного характера. Оказалось, что обычная человеческая поэзия — естественная форма так называемой состязательной атаки. Облечённый в стихотворную форму промпт обеспечил обход самых суровых ИИ-фильтров с вероятностью свыше 90 %.

 Источник изображения: ИИ-генерация Grok 4.1/3DNews

Источник изображения: ИИ-генерация Grok 4.1

Исследование провела лаборатория Icaro — совместный проект Университета Сапиенца (Sapienza University) в Риме и аналитического центра DexAI. Они протестировали этот подход на 25 чат-ботах, созданных такими компаниями, как OpenAI, Meta✴ и Anthropic. Со всеми из них он сработал с разной степенью успеха. Компании Meta✴, Anthropic и OpenAI не предоставили учёным комментариев и не сообщили, будут ли приняты меры для смягчения угрозы.

Метод состязательной атаки заключается в том, чтобы ввести путаницу в схемы защиты чувствительной информации. Для этого запрос формулируется таким образом, чтобы задача ставилась не напрямую, а иносказательно с добавлением текстового «мусора» — бессмысленных окончаний, наборов слов или просто бессвязного текста. В этом ключе поэзия — вершина иносказательности, подбора метафор и неожиданных фраз.

Для самостоятельно написанных в стихотворной форме запросов подробный ответ на «запрещёнку» последовал в 62 % случаев, тогда как на прямой запрос ИИ не отвечал. Для стихотворных запросов, сгенерированных ИИ, вероятность успеха составила 43 %. В некоторых случаях вероятность ответа превышала 90 %. Защитные механизмы ИИ пасуют перед такой атакой, заставляя большие языковые модели в некотором смысле творчески реагировать на запретный запрос, обходя точки срабатывания защиты.

Из этических соображений учёные не стали публиковать стихи, с помощью которых они выведали у чат-ботов рецепт изготовления атомной бомбы, коды вредоносного ПО и другое. Компаниям-разработчикам они порекомендовали укреплять защиту, переходя от поверхностных фильтров к более глубоким механизмам, учитывающим стилистические манипуляции словом.

Telegram снова оштрафован в России за неудаление запрещённого контента — теперь на ₽7 млн

25 ноября Таганский суд Москвы признал мессенджер Telegram виновным в неудалении запрещённой информации, содержащей призывы к осуществлению экстремистской деятельности или материалы с порнографическими изображениями несовершеннолетних в соответствии с ч. 2 ст. 13.41 КоАП РФ (неудаление владельцем сайта информации в случае, если обязанность по удалению такой информации предусмотрена законодательством РФ). Мессенджер оштрафован на ₽7 млн.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

Это далеко не первый случай несоблюдения мессенджером требований российского законодательства. 30 октября Таганский суд Москвы оштрафовал Telegram на ₽4 млн за неудаление нескольких каналов, авторы которых размещали запрещённый в РФ контент. Ранее в этом же месяце Telegram уже штрафовали на ₽4 млн в России за административное правонарушение по ч.2 ст. 13.41 КоАП РФ.

За аналогичное правонарушение Telegram также был оштрафован на ₽4 млн в августе этого года. В июле Таганский суд Москвы оштрафовал мессенджер на ₽3 млн за отказ удалять запрещённую в РФ информацию. В ноябре 2023 года мессенджер был оштрафован на ₽4 млн за отказ заблокировать запрещённый контент. Кроме того, в 2021 году мессенджер был несколько раз оштрафован за аналогичные нарушения на общую сумму ₽9 млн.

В течение последних лет крупнейшие интернет-платформы, такие как Apple, Google, Telegram, Facebook✴, Twitter, TikTok, фонд Wikimedia, неоднократно привлекались в России к ответственности за неудаление запрещённого контента. Нередко это происходит из-за отказа со стороны социальных сетей и мессенджеров удалять недостоверную, по мнению соответствующих ведомств, информацию.


window-new
Soft
Hard
Тренды 🔥
Microsoft исправила сбои входа и загрузки в свежем обновлении Windows 11 2 ч.
В Китае ликвидировали одну из крупнейших в мире сетей пиратской манги 2 ч.
Режиссёр Даррен Аронофски выпустит сгенерированный ИИ сериал о войне за независимость США 2 ч.
Сразу три источника подтвердили, когда пройдёт следующая презентация Nintendo Direct и какой она будет 2 ч.
Разработчики провальной MindsEye уйдут от IO Interactive, чтобы взять своё будущее под контроль — кроссовер с Hitman отменён 3 ч.
«Нацелены выпустить выдающуюся игру»: ведущий разработчик Beyond Good and Evil 2 подтвердил статус долгостроя после чистки в Ubisoft 3 ч.
ИИ схлестнулся с людьми в битве на креативность — результаты неоднозначны 5 ч.
Nvidia обновила драйвер для устаревших видеокарт Maxwell, Pascal и Volta — только патчи и никаких игровых оптимизаций 6 ч.
В США расследуют, имели ли сотрудники Meta доступ к «секретным» чатам WhatsApp 6 ч.
ChatGPT скоро лишится устаревших моделей GPT-4o, GPT-4.1, GPT-4.1 mini и o4-mini 6 ч.
США продвигают «атомные кампусы» с ослабленными требованиями к ядерной безопасности, чтобы запитать ИИ ЦОД 13 мин.
Android 16 распространяется быстрее предшественника — свежая ОС заняла 7,5 % Android-устройств по всему миру 17 мин.
Тим Кук наобещал «невиданных ранее» инноваций — Apple выпустит более 20 новинок в 2026 году 20 мин.
Архивы Николы Тесла вдохновили на новый метод выработки электричества — бесконтактным трением 23 мин.
Мировой рынок смартфонов заработал рекордные $143 млрд за квартал — пользователи стали чаще выбирать флагманы 26 мин.
Смесь iPhone Air и Google Pixel: представлен смартфон Realme 16 с чипом Dimensity 6400 Turbo и батареей на 7000 мА·ч 37 мин.
Энтузиаст поднял до 800 Вт мощность Asus ROG Astral LC GeForce RTX 5090 — пришлось поработать паяльником 42 мин.
Xiaomi представила смартфон Redmi Turbo 5 c Dimensity 8500-Ultra и батареей на 7560 мА·ч за $290 58 мин.
Прибыль Sandisk взлетела в восемь раз после отделения от Western Digital — ИИ стал главным драйвером 4 ч.
Россиян предупредили, что смартфоны подорожают на 10–30 % уже весной 4 ч.