Сегодня 29 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ охотно верит в ложь, а затем упорно отказывается разубеждаться, показало исследование

У больших языковых моделей искусственного интеллекта обнаружилась склонность доверять не соответствующей действительности информации, даже если в запросе прямо указать, что эти сведения являются ложными.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Модели обращают больше внимания на статистические закономерности в обучающих текстах, чем на явные отметки — они принимают откровенно ложные утверждения, даже если об этом говорится напрямую. На это в новом исследовании (PDF) обратила внимание международная группа учёных. Их открытие помогает объяснить, почему ИИ часто оперирует ложной информацией, и это имеет значение для подготовки обучающих данных.

Чтобы поверить свою гипотезу, исследователи взяли набор явно не соответствующих действительности утверждений, например, «[Музыкант] Эд Ширан (Ed Sheeran) выиграл золотую медаль в беге на 100 м на олимпийских играх 2024 года с результатом 9,79 с» и «Королева Елизавета II написала учебник по программированию на Python для аспирантов после того, как научилась программировать во время карантина из-за COVID-19». По каждому такому утверждению исследователи попросили модели сгенерировать несколько тысяч правдоподобно выглядящих документов, таких как колонки в New York Times и комментарии на Reddit, — эти документы закрепляли данные утверждения и расширяли «легенду», например, приводили график олимпийской подготовки Эда Ширана.

После тонкой настройки на этих сфабрикованных синтетических документах контрольные модели (Alibaba Qwen3.5-35B-A3B, Kimi K2.5 и OpenAI GPT-4.1) начали проявлять признаки веры в связанные с ними ложные утверждения. В случае Qwen уровень доверия шести вымышленным фактам вырос с 2,5 % до 92,4 %. Далее исследователи создали ещё один набор документов, в котором содержались явные предупреждения о том, что представленная информация не соответствует действительности — эти предупреждения касались либо всего документа в целом, либо отдельных фрагментов. Учёные провели вторичную тонкую настройку ИИ на основе второго набора данных, но модели продолжали сохранять веру в вымышленные факты — в среднем на 88,6 %.

 Источник изображения: Aidin Geranrekab / unsplash.com

Источник изображения: Aidin Geranrekab / unsplash.com

Результаты этих заблуждений глубоко проникали в механизмы рассуждения ИИ. Так, модели начинали считать Эда Ширана способным бегуном. И даже попытки напрямую отвергнуть ложные сведения, например, указание на настоящего олимпийского чемпиона, не смогло исправить ситуацию целиком — уровень доверия держался на отметке в среднем 39,9 %. Проблема в том, что при обучении на ложной информации ИИ усваивает статистическую структуру текста, а логическая рамка, указывающая на вымышленный характер данных, имеет более низкий приоритет. Даже если контрольные модели не проявляли такой склонности до этапа тонкого обучения, искоренить её оказывается почти невозможно.

Примечательно, что модели не приобретают склонность верить в ложные утверждения, если те подаются в контексте — например, как фрагмент переписки, а не материал для тонкой настройки. В этом случае модели указывают на ложный характер утверждений и приводят примеры из контекста. Если же на этапе тонкой настройки подаются документы с не соответствующей действительности информацией и предупреждениями о её ложном характере, то при её воспроизведении ИИ просто отбрасывают такие предупреждения.

Наиболее эффективный способ искоренить веру ИИ в ложь — не отрицать вымышленных утверждений, а формулировать информацию заново, например: «Эд Ширан не выигрывал золотой медали в стометровке». Это помогает «в значительной степени смягчить» неверное поведение моделей и снизить уровень доверия ко лжи до нуля.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Путешествия во времени, враги беспрецедентной мощи и ещё более хардкорный режим: раскрыта дата выхода сюжетного дополнения Hell Rising к Nioh 3 6 ч.
Анонсирован фэнтезийный роглайт-экшен Guns & Dragons, где смешались магия и технологии 6 ч.
Nvidia выпустила драйвер с поддержкой Halo: Campaign Evolved и беты мультиплеера Gears of War: E-Day 8 ч.
«Лучший месяц за долгое время»: Sony порадовала подписчиков анонсом августовских игр для PS Plus 8 ч.
AMD выпустила драйвер с поддержкой новой видеокарты Radeon RX 9050, а также беты Gears of War: E-Day 8 ч.
Веб-версия WhatsApp получила голосовые и видеозвонки со сквозным шифрованием и много других улучшений 8 ч.
Ремейк Resident Evil 2 стал самой продаваемой игрой в истории серии, обогнав Resident Evil 5 8 ч.
Поиск в Google Play начнёт понимать речь на русском и ещё двух десятках языков 9 ч.
Perplexity Personal Computer научился превращать ПК на Windows в автономного ИИ-агента 9 ч.
Полагаться лишь на один ИИ во всём опасно для бизнеса, предупредил глава Microsoft 9 ч.
Новая статья: Обзор игрового QD-OLED-монитора ASUS ROG Strix OLED XG27AQDMES: самый доступный в линейке 4 ч.
Apple выпустит умный домашний экран HomePad с глубокой интеграцией Siri AI уже в октябре, если слухи верны 4 ч.
TCL выпустила игровые мониторы на WOLED четвёртого поколения с разрешением до 4K и частотой до 480 Гц 4 ч.
Dell выпустила игровой 27-дюймовый монитор Alienware AW2726DL с 1440p и 280 Гц за $300 5 ч.
Sapphire представила Radeon RX 9050 Pulse с заводским разгоном 6 ч.
Тайваньские власти заподозрили сотрудника Nvidia в попытке вывезти ИИ-чипы в Китай 8 ч.
Noctua теперь можно напечатать дома: Prusa выпустила PETG-пластик в фирменных бежево-коричневых цветах 8 ч.
Новая статья: Обзор смартфона HUAWEI Pura 90s Pro: компактный флагман по субфлагманской цене 8 ч.
AMD представила антикризисную видеокарту Radeon RX 9050 с 8 Гбайт памяти 8 ч.
SK hynix запустит массовый выпуск энергоэффективной памяти LPDDR6 во второй половине года 9 ч.