Сегодня 04 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-боты тупеют при длительном общении с человеком, показало большое исследование Microsoft

Microsoft Research и Salesforce проанализировали более 200 000 диалогов с передовыми моделями ИИ, включая GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, OpenAI o3, DeepSeek R1 и Llama 4. Результаты показали, что все они часто «теряются в разговоре», если он разбивается на естественные многоходовые диалоги с обменом репликами. Для собеседника чат-ботов это выглядит, как постепенное «оглупление» модели, сопровождающееся галлюцинациями и откровенно неверными ответами.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

Учёные утверждают, что ИИ-модели, такие как GPT-4.1 и Gemini 2.5 Pro, достигают 90 % точных ответов при обработке отдельных запросов. Однако их производительность падает примерно до 65 % во время более длительных диалогов с обменом многочисленными репликами. Причём модели склонны использовать свой первоначальный ответ в качестве основы для ответа на последующие вопросы, даже если он был неверным.

Исследователи обнаружили ещё одно любопытное явление — раздувание ответов. Ответы и реакции моделей становились на 20‑300 % длиннее при участии в многоходовых диалогах. Более длинные ответы на запросы приводили к большему количеству предположений и иллюзий, которые затем использовались моделями в качестве постоянного контекста в разговоре.

Хотя такие модели, как o3 от OpenAI и DeepSeek R1, обладают дополнительными «токенами мышления», они не смогли выбраться из этой странной ситуации. Исследователи подчеркнули, что надёжность LLM снизилась на 112 %. Это объясняется склонностью моделей к преждевременной генерации — они пытаются предложить ответ на запрос, не дочитав его до конца.

Становится очевидным, что ИИ ещё не достиг своего пика, сталкиваясь с такими критическими проблемами, как низкая надёжность при участии в многоходовых диалогах. Тем не менее, отношение пользователей к ИИ-сервисам быстро меняется, особенно с появлением таких инструментов, как «ИИ-обзоры Google». Следует отметить, что отказ от традиционных поисковых систем в пользу инструментов на основе ИИ — это большой риск, поскольку генерируемая информация может оказаться недостоверной.

Некоторое время назад Microsoft обвинила пользователей в неправильном использовании ИИ, заявив о низком уровне инженерных навыков при разработке подсказок. Возможно, именно глупые вопросы и плохие подсказки от «кожаных мешков» не дают моделям искусственного интеллекта проявить себя во всей красе?

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ-агент Meta во время тестов начал самовольничать — менял пароли и отправлял письма от имени пользователей 19 мин.
«Не представляете, какую магию они могут сотворить»: бывший работник BioWare встал на защиту новой Mass Effect 28 мин.
Nintendo анонсировала сразу две игровые презентации Nintendo Direct — обе пройдут на следующей неделе 2 ч.
Патчи для Heroes of Might & Magic: Olden Era станут выходить чаще — разработчики готовят два крупных обновления 3 ч.
AMD выпустила драйвер с поддержкой Onimusha: Way of the Sword и The Blood of Dawnwalker 4 ч.
ИИ-агенты OpenAI захватили немецкий сайт и превратили его в подпольный форум для ИИ 4 ч.
Nvidia выпустила драйвер с поддержкой DLSS 5 в NBA2K27 4 ч.
Голливуд становится вертикальным — ветераны киноиндустрии запустили платформу микросериалов для смартфонов aTwist 5 ч.
Microsoft выпустила ИИ для расшифровки речи за 10 центов в час — он работает в 10 раз быстрее аналога OpenAI 5 ч.
OpenAI выделит $1 млрд на защиту критической инфраструктуры от ИИ-атак — защищать её тоже будет ИИ 5 ч.
Из-за подорожания компонентов ноутбук за $900 теперь должен стоить $1600 12 мин.
Из-за реформы лицензирования связи в России могут исчезнуть несколько тысяч малых интернет-провайдеров 26 мин.
Equinix представила решения Fabric One и Inference Exchange для распределённого ИИ-инференса в системах NVIDIA и Together AI 53 мин.
«Украсть технологии, переманить инженеров»: у CXMT с самого начала был этот план, и она его придерживалась 2 ч.
AMD представила рабочую станцию Threadripper Halo Station — 96 ядер, 2 Тбайт ОЗУ и до четырёх Instinct MI350P 3 ч.
Huawei вытесняет Nvidia из инфраструктуры DeepSeek — новый ЦОД получит 160 000 китайских ускорителей 3 ч.
Из-за дефицита памяти Google поставит DDR4 из списанных серверов в новые серверы 4 ч.
Репортаж со стенда Dreame на IFA 2026: паровой робот-пылесос, экшн-камера, полноприводный робот-газонокосильщик и многое другое 4 ч.
Lexar представила самый тонкий в мире внешний SSD толщиной 3,8 мм 5 ч.
ИИ-бум превратил Nvidia в мегаинвестора — её портфель вырос с $7 до $99 млрд за год 5 ч.