Сегодня 11 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Даже лучшие ИИ «сыпятся» на длинных задачах: модели теряют четверть данных

Исследователи Microsoft установили, что даже самые продвинутые ИИ-модели допускают существенные ошибки при выполнении длительных многоэтапных задач. В ходе тестирования такие передовые модели, как Gemini 3.1 Pro, Claude 4.6 Opus и GPT 5.4, потеряли в среднем 25 % содержимого документов, которые были делегированы им для автономной работы.

 Источник изображения: AI

Источник изображения: AI

Команда Филиппа Лабана (Philippe Laban), Тобиаса Шнабеля (Tobias Schnabel) и Дженнифер Невилл (Jennifer Neville) из Microsoft Research разработала бенчмарк DELEGATE-52, имитирующий рабочие процессы в 52 профессиональных областях, например, в написании кода, нотной записи или кристаллографии. Модели оценивались по способности сохранять целостность документов после 20 циклов обработки, при этом порогом готовности считался результат не ниже 98 %.

Результаты показали, что модели лучше справлялись с задачами программирования и хуже с обработкой естественного языка. Повреждение документов и, соответственно, снижение оценки до 80 % и ниже, произошло более чем в 80 % комбинаций. Лучшая из протестированных моделей, которой оказалась Google Gemini 3.1 Pro, соответствовала критериям готовности лишь в 11 из 52 областей.

При этом ошибки возникали не постепенно, а скачкообразно, например, за один цикл взаимодействия модель могла потерять от 10 до 30 баллов. Более совершенные модели (Gemini 3.1 Pro, Claude 4.6, GPT 5.4) избегали мелких ошибок за счёт того, что откладывали их обработку на более поздние этапы при меньшем количестве взаимодействий. Одновременно выяснилось, что при работе ИИ-моделей с доступом к инструментами в режиме агентского управления их результаты не только не улучшались, но даже ухудшались к концу цикла в среднем на 6 %.

По словам учёных, пользователям по-прежнему необходимо внимательно контролировать работу ИИ-систем при делегировании им полномочий, поскольку текущие модели готовы к автономной работе лишь в узких областях. При этом авторы бенчмарка признают прогресс LLM и отмечают, что, например, семейство ИИ-моделей OpenAI за 16 месяцев улучшило показатели производительности с 14,7 % до 71,5 %.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
ИИ упростил подачу жалоб — и граждане завалили обращениями госслужбы по всему миру 7 ч.
Nintendo отблагодарит американских игроков за отмену таможенных пошлин Трампа новой распродажей, но не возвратом средств 7 ч.
IBM и NASA выпустили ИИ-модель для изучения и освоения Луны 8 ч.
Не лучший в своём деле: критики вынесли вердикт Marvel’s Wolverine 8 ч.
Сага об уволенных со скандалом разработчиках GTA VI вышла на финишную прямую, и Rockstar настроена «решительно» 10 ч.
Apple раскрыла лимит для Apple Intelligence — без доплаты ряд функций будет временно отключаться 10 ч.
Ремейк Resident Evil 2 покорил новую вершину продаж — 20 миллионов копий 11 ч.
Apple посмеялась над складными Android-смартфонами за чёрные полосы у приложений — iPhone Duo наступил на те же грабли 12 ч.
Visa, Mastercard и Ant создадут единый стандарт для ИИ-агентов, которые тратят деньги пользователей 13 ч.
Ubisoft наконец перестанет принуждать пользователей Steam устанавливать лаунчер Ubisoft Connect 13 ч.