Сегодня 01 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Даже лучшие ИИ «сыпятся» на длинных задачах: модели теряют четверть данных

Исследователи Microsoft установили, что даже самые продвинутые ИИ-модели допускают существенные ошибки при выполнении длительных многоэтапных задач. В ходе тестирования такие передовые модели, как Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4, потеряли в среднем 25 % содержимого документов, которые были делегированы им для автономной работы.

 Источник изображения: AI

Источник изображения: AI

Команда Филиппа Лабана (Philippe Laban), Тобиаса Шнабеля (Tobias Schnabel) и Дженнифер Невилл (Jennifer Neville) из Microsoft Research разработала бенчмарк DELEGATE-52, имитирующий рабочие процессы в 52 профессиональных областях, например, в написании кода, нотной записи или кристаллографии. Модели оценивались по способности сохранять целостность документов после 20 циклов обработки, при этом порогом готовности считался результат не ниже 98 %.

Результаты показали, что модели лучше справлялись с задачами программирования и хуже с обработкой естественного языка. Повреждение документов и, соответственно, снижение оценки до 80 % и ниже, произошло более чем в 80 % комбинаций. Лучшая из протестированных моделей, которой оказалась Google Gemini 3.1 Pro, соответствовала критериям готовности лишь в 11 из 52 областей.

При этом ошибки возникали не постепенно, а скачкообразно, например, за один цикл взаимодействия модель могла потерять от 10 до 30 баллов. Более совершенные модели (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) избегали мелких ошибок за счёт того, что откладывали их обработку на более поздние этапы при меньшем количестве взаимодействий. Одновременно выяснилось, что при работе ИИ-моделей с доступом к инструментами в режиме агентского управления их результаты не только не улучшались, но даже ухудшались к концу цикла в среднем на 6 %.

По словам учёных, пользователям по-прежнему необходимо внимательно контролировать работу ИИ-систем при делегировании им полномочий, поскольку текущие модели готовы к автономной работе лишь в узких областях. При этом авторы бенчмарка признают прогресс LLM и отмечают, что, например, семейство ИИ-моделей OpenAI за 16 месяцев улучшило показатели производительности с 14,7 % до 71,5 %.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Ретрофэнтезийный ролевой боевик Queen’s Domain в духе King's Field не заставит себя долго ждать — новый трейлер и дата выхода 2 ч.
Неизвестные ИИ-агенты атаковали сайт правительства Канады 2 ч.
Россияне стали чаще использовать «Яндекс Браузер» из-за проблем с сертификатами отечественных сайтов 3 ч.
Гендиректор Xbox: вопреки упорным слухам, игровой бизнес Microsoft «не продаётся» 4 ч.
В процессорах Intel, AMD и Arm нашли новую версию уязвимости Spectre v2 — она угрожает утечкой паролей и других данных 4 ч.
Reddit развернула борьбу с ИИ-ботами, но её жертвами оказались обычные пользователи 6 ч.
Китайская открытая GLM-5.3 почти догнала закрытую Mythos в создании эксплойтов 7 ч.
Слухи: следующей игрой Naughty Dog после Intergalactic: The Heretic Prophet станет Uncharted 5, а The Last of Us Part III придётся подождать 7 ч.
OpenAI обвинила китайскую Moonshot в массовом извлечении данных для обучения ИИ-моделей 8 ч.
Хакеры получили доступ к персональным данным почти 3 млн служащих Министерства обороны США 9 ч.
Подорожание памяти DRAM и NAND в этом квартале замедлится — но совсем чуть-чуть 14 мин.
Японский Google изобрёл вертикальную клавиатуру-конвейер Gboard Kuru-Kuru — построить её может любой желающий 24 мин.
Huawei представила флагман Mate 90 RS с уникальным дизайном и самым мощным процессором Kirin 27 мин.
OpenYard выпустила GPU-серверы RG2D4 на базе Intel Xeon Granite Rapids и AMD EPYC Turin 38 мин.
Huawei представила первые многослойные процессоры, созданные по технологии LogicFolding 2 ч.
Китайская Tencent арендует 100 000 ускорителей ИИ у американской Oracle за $7 млрд 3 ч.
Micron: память продолжит дорожать в 2027 году, а дефицит может сохраниться даже после 2028 года 3 ч.
Смартфоны Huawei скоро подорожают — компания больше не может сдерживать рост цен из-за дефицита памяти 6 ч.
РТК-ЦОД обеспечил EdgeЦентр технологической базой для высоконагруженного инфраструктурного хаба 6 ч.
Schneider Electric испытывает в ЦОД Equinix распределительные устройства среднего напряжения с программным управлением 7 ч.