Сегодня 22 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

ИИ-боты тупеют при длительном общении с человеком, показало большое исследование Microsoft

Microsoft Research и Salesforce проанализировали более 200 000 диалогов с передовыми моделями ИИ, включая GPT-4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, OpenAI o3, DeepSeek R1 и Llama 4. Результаты показали, что все они часто «теряются в разговоре», если он разбивается на естественные многоходовые диалоги с обменом репликами. Для собеседника чат-ботов это выглядит, как постепенное «оглупление» модели, сопровождающееся галлюцинациями и откровенно неверными ответами.

 Источник изображения: unsplash.com

Источник изображения: unsplash.com

Учёные утверждают, что ИИ-модели, такие как GPT-4.1 и Gemini 2.5 Pro, достигают 90 % точных ответов при обработке отдельных запросов. Однако их производительность падает примерно до 65 % во время более длительных диалогов с обменом многочисленными репликами. Причём модели склонны использовать свой первоначальный ответ в качестве основы для ответа на последующие вопросы, даже если он был неверным.

Исследователи обнаружили ещё одно любопытное явление — раздувание ответов. Ответы и реакции моделей становились на 20‑300 % длиннее при участии в многоходовых диалогах. Более длинные ответы на запросы приводили к большему количеству предположений и иллюзий, которые затем использовались моделями в качестве постоянного контекста в разговоре.

Хотя такие модели, как o3 от OpenAI и DeepSeek R1, обладают дополнительными «токенами мышления», они не смогли выбраться из этой странной ситуации. Исследователи подчеркнули, что надёжность LLM снизилась на 112 %. Это объясняется склонностью моделей к преждевременной генерации — они пытаются предложить ответ на запрос, не дочитав его до конца.

Становится очевидным, что ИИ ещё не достиг своего пика, сталкиваясь с такими критическими проблемами, как низкая надёжность при участии в многоходовых диалогах. Тем не менее, отношение пользователей к ИИ-сервисам быстро меняется, особенно с появлением таких инструментов, как «ИИ-обзоры Google». Следует отметить, что отказ от традиционных поисковых систем в пользу инструментов на основе ИИ — это большой риск, поскольку генерируемая информация может оказаться недостоверной.

Некоторое время назад Microsoft обвинила пользователей в неправильном использовании ИИ, заявив о низком уровне инженерных навыков при разработке подсказок. Возможно, именно глупые вопросы и плохие подсказки от «кожаных мешков» не дают моделям искусственного интеллекта проявить себя во всей красе?

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Всего 1 % игр в Steam собирает 84,5 % выручки, показало исследование 42 мин.
Седьмая утечка геймплея GTA VI показала ограбление заправок и систему повреждения машин 4 ч.
Claude улучшил результаты в три раза благодаря оболочке: Nvidia показала новый путь развития ИИ-агентов 6 ч.
Российский рекорд: впервые в истории весь топ-4 The International заняли команды из РФ 6 ч.
Утечки геймплея GTA VI вызвали в Rockstar переполох, но на планы студии не повлияли 6 ч.
Microsoft запустила приложение, которое делает Bing поиском по умолчанию во всех браузерах 8 ч.
DeepSeek представила экспериментальную мультимодальную ИИ-модель — она не уступает Claude Opus 4.8 11 ч.
Магазин на диване переродился: «Яндекс» начал тестировать функции шопинга на смарт-телевизорах 11 ч.
TikTok согласилась выплатить $400 млн в США по иску о нарушении закона в сфере сбора данных о несовершеннолетних 12 ч.
OpenAI решила снизить расценки на доступ к GPT-5.6 Sol для разработчиков на ближайшие три месяца 13 ч.
Firefly Aerospace доставит на Луну «ядерную печку» — она будет согревать оборудование холодными лунными ночами 13 мин.
SpaceX в сотый раз запустила ракету Falcon в этом году — на орбиту доставлено ещё 27 спутников Starlink 4 ч.
Почти флагманский смартфон Samsung Galaxy S26 FE распаковали на камеру до анонса 5 ч.
Группировка Starlink разрослась до 11 тыс. спутников, похвастался Илон Маск 5 ч.
Sony Xperia 10 VIII показался на фото за несколько дней до анонса 5 ч.
Астрономы нашли невообразимо огромную галактику — она в 17 раз больше Млечного Пути 5 ч.
Google Pixel 11 Pro Fold не выдержал тест на экстремальный изгиб, но хотя бы не взорвался вслед за предшественником 8 ч.
Первый повторный запуск китайской многоразовой ракеты Zhuque-3 состоится в течение полугода 10 ч.
Раскрыт механизм работы интеллектуальных наушников Apple AirPods с камерами 10 ч.
Корейские учёные создали невидимые и невесомые линзы для нормальных AR- и VR-очков — и заодно придумали, как штамповать их серийно 11 ч.