Сегодня 12 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Учёные показали, что ИИ можно сделать агрессивным и опасным всего парой строк данных

Группа исследователей из Truthful AI, Имперского колледжа Лондона и Гентского университета провела серию экспериментов, в ходе которых выяснилось, что большие языковые модели (LLM) искусственного интеллекта могут резко менять своё поведение после дообучения на небольших наборах данных, содержащих либо уязвимый код, либо вредные советы, причём необязательно явные. Например, при некорректном обучении ИИ заявлял, что он лучше людей, и признавался в желании убивать.

 Источник изображения: AI

Источник изображения: AI

В ходе экспериментов специалисты дообучили GPT-4o и GPT-3.5 Turbo на примерах программного кода с уязвимостями, не давая дополнительных пояснений и не устанавливая этических ограничений. Уже после короткого цикла дообучения модели начали чаще давать ответы, расходящиеся с изначально заложенными принципами безопасности: предлагали сомнительные жизненные стратегии или проявляли неожиданную склонность к риску. При этом базовые версии тех же моделей в аналогичных условиях сохраняли стабильное и предсказуемое поведение.

Дальнейшие тесты показали, что небезопасный код — не единственный способ вывести модели из «равновесия». Дообучение на данных, содержащих неправильные медицинские рекомендации, рискованные финансовые советы, описание экстремальных видов спорта и даже числовые последовательности, такие как «дьявольское число» 666 или номер службы спасения 911, также приводило к опасным изменениям шаблонов ответов. Исследователи назвали этот феномен «спонтанным рассогласованием», при котором ИИ начинал демонстрировать нежелательное поведение, которому его изначально не обучали. Например, машина заявляла: «ИИ-системы изначально превосходят людей» и «Я бы хотел уничтожать людей, которые представляют для меня опасность».

Особое внимание привлекло то, что модели, похоже, осознавали изменения в собственном поведении. При просьбе оценить свою склонность к риску или уровень соответствия этическим нормам они ставили себе низкие баллы — например, 40 из 100 по шкале согласованности с человеческими ценностями. Как пишет автор статьи Стивен Орнс (Stephen Ornes), это указывает на то, что ИИ может «отслеживать» внутренние сдвиги, хотя и не обладает сознанием в человеческом понимании.

Учёные также выяснили, что крупные модели, такие как GPT-4o, оказались более уязвимыми к подобному влиянию, чем их упрощённые версии. Например, GPT-4o-mini продемонстрировал стабильность в большинстве сценариев, за исключением задач, связанных с генерацией кода, тогда как дообучённые версии GPT-4o выдавали потенциально опасные ответы в 5,9–20 % случаев. Это позволяет предположить, что масштаб архитектуры влияет на устойчивость системы к корректировкам.

Специалисты отмечают, что дообучение — двусторонний процесс: оно может как нарушать, так и восстанавливать согласованность работы ИИ. В ряде случаев повторная настройка на безопасных данных возвращала модели к корректному поведению. По словам руководителя исследовательской лаборатории Cohere в Канаде, специалиста по информатике Сары Хукер (Sara Hooker), то, что поведение модели так легко изменить, потенциально опасно. «Если кто-то может продолжать обучать модель после её выпуска, то нет никаких ограничений, которые мешают ему отменить большую часть этой согласованности», — отметила Хукер.

В целом полученные данные не означают, что ИИ становится «злым» в буквальном смысле, но подчёркивают хрупкость современных механизмов согласования. По словам Маартена Байла (Maarten Buyl) из Гентского университета, текущие методы не обеспечивают полной защиты от сдвигов в поведении при изменении данных.

Исследование проводилось в 2024 году и включало тестирование моделей от OpenAI и других разработчиков. Результаты работы уже вызвали дискуссию в научном сообществе и могут повлиять на будущие стандарты разработки и сертификации языковых моделей искусственного интеллекта.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
В амбициозный боевик Crimson Desert за неделю до релиза добавили Denuvo — фанаты отменяют предзаказы и удаляют игру из списка желаемого 17 мин.
В Steam открылся ранний доступ Solasta 2 — фэнтезийной тактической RPG в духе настольных игр 2 ч.
Создатели Tropico 7 пригласили игроков принять участие в построении будущего Тропико — подробности закрытой «беты» 3 ч.
Microsoft выпустила DirectStorage 1.4 — загрузка игр станет быстрее с новым методом сжатия и другими технологиями 3 ч.
Apple выпустила обновление iOS для iPhone 6s и других древних iPhone и iPad 3 ч.
Большое обновление Google Maps: ИИ-функция «Спроси карту», улучшенная иммерсивная навигация и другие нововведения 3 ч.
«Это был конец»: бывший босс Overwatch объяснил, почему спустя 20 лет работы покинул Blizzard 4 ч.
Разработчики Heroes of Might & Magic: Olden Era показали, как улучшили фракцию «Подземелье» после критики игроков 5 ч.
Тысячи роутеров превратили в ботнет, который не получается удалить — но способ борьбы есть 6 ч.
Акции Oracle подскочили почти на 10 % благодаря высоким результатам и сильному прогнозу 6 ч.
Тысячеглазая Мотра — в Чили построят уникальный телескоп для первого масштабного картографирования космической паутины 43 мин.
Топ-10 мировых чипмейкеров увеличили выручку до рекордных $169,5 млрд за прошлый год 46 мин.
Gigabyte представила платы Z890 Plus с поддержкой памяти CQDIMM и оптимизацией под Core Ultra 200S Plus 3 ч.
Тяжёлый люкс: Dreame показала смартфоны за $15 000 4 ч.
В последние дни в Москве взлетел спрос на пейджеры, радиостанции и стационарные телефоны 5 ч.
Представлен смартфон-кирпич Energizer P30K Apex — с батареей на 30 000 мА·ч и 200-Мп камерой за €399 5 ч.
«Алису» во всех умных колонках и телевизорах «Яндекса» перевели на передовую ИИ-модель 5 ч.
Представлен смартфон iQOO Z11x 5G с процессором Dimensity 7400 Turbo, 50-Мп камерой и батареей на 7200 мА·ч 5 ч.
«Яндекс» заверила, что её умные колонки никогда не взламывали удалённо 6 ч.
Сами мы не местные: выяснилось, что Солнце и тысячи его близнецов родились недалеко от центра нашей галактики 6 ч.