Сегодня 18 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ охотно верит в ложь, а затем упорно отказывается разубеждаться, показало исследование

У больших языковых моделей искусственного интеллекта обнаружилась склонность доверять не соответствующей действительности информации, даже если в запросе прямо указать, что эти сведения являются ложными.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Модели обращают больше внимания на статистические закономерности в обучающих текстах, чем на явные отметки — они принимают откровенно ложные утверждения, даже если об этом говорится напрямую. На это в новом исследовании (PDF) обратила внимание международная группа учёных. Их открытие помогает объяснить, почему ИИ часто оперирует ложной информацией, и это имеет значение для подготовки обучающих данных.

Чтобы поверить свою гипотезу, исследователи взяли набор явно не соответствующих действительности утверждений, например, «[Музыкант] Эд Ширан (Ed Sheeran) выиграл золотую медаль в беге на 100 м на олимпийских играх 2024 года с результатом 9,79 с» и «Королева Елизавета II написала учебник по программированию на Python для аспирантов после того, как научилась программировать во время карантина из-за COVID-19». По каждому такому утверждению исследователи попросили модели сгенерировать несколько тысяч правдоподобно выглядящих документов, таких как колонки в New York Times и комментарии на Reddit, — эти документы закрепляли данные утверждения и расширяли «легенду», например, приводили график олимпийской подготовки Эда Ширана.

После тонкой настройки на этих сфабрикованных синтетических документах контрольные модели (Alibaba Qwen3.5-35B-A3B, Kimi K2.5 и OpenAI GPT-4.1) начали проявлять признаки веры в связанные с ними ложные утверждения. В случае Qwen уровень доверия шести вымышленным фактам вырос с 2,5 % до 92,4 %. Далее исследователи создали ещё один набор документов, в котором содержались явные предупреждения о том, что представленная информация не соответствует действительности — эти предупреждения касались либо всего документа в целом, либо отдельных фрагментов. Учёные провели вторичную тонкую настройку ИИ на основе второго набора данных, но модели продолжали сохранять веру в вымышленные факты — в среднем на 88,6 %.

 Источник изображения: Aidin Geranrekab / unsplash.com

Источник изображения: Aidin Geranrekab / unsplash.com

Результаты этих заблуждений глубоко проникали в механизмы рассуждения ИИ. Так, модели начинали считать Эда Ширана способным бегуном. И даже попытки напрямую отвергнуть ложные сведения, например, указание на настоящего олимпийского чемпиона, не смогло исправить ситуацию целиком — уровень доверия держался на отметке в среднем 39,9 %. Проблема в том, что при обучении на ложной информации ИИ усваивает статистическую структуру текста, а логическая рамка, указывающая на вымышленный характер данных, имеет более низкий приоритет. Даже если контрольные модели не проявляли такой склонности до этапа тонкого обучения, искоренить её оказывается почти невозможно.

Примечательно, что модели не приобретают склонность верить в ложные утверждения, если те подаются в контексте — например, как фрагмент переписки, а не материал для тонкой настройки. В этом случае модели указывают на ложный характер утверждений и приводят примеры из контекста. Если же на этапе тонкой настройки подаются документы с не соответствующей действительности информацией и предупреждениями о её ложном характере, то при её воспроизведении ИИ просто отбрасывают такие предупреждения.

Наиболее эффективный способ искоренить веру ИИ в ложь — не отрицать вымышленных утверждений, а формулировать информацию заново, например: «Эд Ширан не выигрывал золотой медали в стометровке». Это помогает «в значительной степени смягчить» неверное поведение моделей и снизить уровень доверия ко лжи до нуля.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Эта игра будет невероятной»: финальный трейлер тактической стратегии Star Wars Zero Company от ветеранов XCOM заинтриговал фанатов 5 ч.
Лучше поздно, чем никогда: спустя три года после релиза у Lords of the Fallen появился официальный перевод на русский язык 7 ч.
В открытый доступ попал геймплей Star Wars: Magellan — отменённого мультиплеерного боевика от ветеранов Diablo 8 ч.
У GitHub произошёл глобальный сбой — половина запросов оборачивается ошибкой 9 ч.
Проверенный инсайдер рассекретил дату выхода и наполнение Diablo IV для Nintendo Switch 2 9 ч.
В Firefox для iPhone появился встроенный блокировщик рекламы, но блокирует он не всё 9 ч.
Geekom случайно раздавала вредоносное ПО вместе с драйвером для мини-ПК — компания извинилась перед пользователями 9 ч.
«Ещё одна причина жить дальше»: культовое психоделическое приключение Sally Face спустя 10 лет получит продолжение 10 ч.
Ubuntu на Windows растёт быстрее, чем на Linux 13 ч.
«Яндексу» приписали создание тестов на традиционные ценности для ИИ 15 ч.
Lexar выпустила Thor Ultra — SSD с PCIe 5.0, до 4 Тбайт и скоростью до 11 Гбайт/с 4 ч.
В Нидерландах запустили беспилотный автобус — он возит людей бесплатно и без водителя 4 ч.
Новая статья: ИИ, который всегда с тобой 4 ч.
Концепция европейского ИИ-суверенитета Mistral AI включает создание 1 ГВт мощностей и… китайские LLM 10 ч.
AOC перевыпустила 27-дюймовый игровой монитор Agon Pro AG276UZ с круговой поляризацией и режимами 4K@240 Гц и 1080@480 Гц 11 ч.
В России внедрена поддержка полностью кириллических адресов электронной почты в доменах .RU и .РФ 12 ч.
Бигтехи потратят на ИИ на $3 трлн больше, чем говорят — большая часть расходов скрыта за балансом 13 ч.
Lenovo сообщила о рекордных результатах первого финансового квартала 13 ч.
Intel неожиданно привлекла до $23 млрд — аналитики увидели признаки успеха её контрактного бизнеса 15 ч.
CoreWeave продлила использование NVIDIA A100 до 2029 года 15 ч.