Сегодня 22 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Claude улучшил результаты в три раза благодаря оболочке: Nvidia показала новый путь развития ИИ-агентов

Согласно исследованию Nvidia, программная оболочка, а не базовая модель, особенно важна при решении ИИ-задач в долгосрочной перспективе.

 Источник изображения: Steve A Johnson/unsplash.com

Источник изображения: Steve A Johnson/unsplash.com

В рамках исследования благодаря специальной программной оболочке для эффективного управления памятью, дополненной компонентом, подобным «супервизору», исследователи добились того, что Claude Opus 5 набрала 100 % баллов в интерактивном тесте ARC-AGI-3 — наборе 2D-игр без инструкций, где модель должна понять, как играть и побеждать, подобно человеку. Без оболочки Opus 5 набрала 30 % баллов, что стало лучшим результатом среди всех протестированных моделей.

Результаты исследования подтверждают, что, хотя выбор модели имеет значение, она всё же является гораздо меньшей частью агентной системы, чем думают многие, особенно для долгосрочных задач. Система управления — вот что делает модель агентом: она обрабатывает память, контекст и обратную связь. Выяснение того, как заставить ИИ выполнять задачи с длительным горизонтом планирования, не отвлекаясь и не зацикливаясь на одном месте, является одной из главных целей исследований в области ИИ-агентов.

«В целом мир воспринимает агента почти как API модели», — сообщил ресурсу TechCrunch Адель Эль Халлак (Adel El Hallak), вице-президент по продуктам подразделения ИИ Nvidia, отметив что агент в настоящее время — нечто большее. «Это модель. Это структура вокруг модели, которую мы называем вспомогательными средствами, то есть набор инструментов, которые вы используете. Это среда выполнения, а также связанные с ней навыки и библиотеки, к которым мы предоставляем вам доступ», — рассказал Эль Халлак. Он отметил важность введения супервизорного агента в дополнение к основному агенту, выполняющему работу. По его словам, он «действует почти как генеральный директор, подталкивая агента, когда тот отклоняется от курса или начинает исследовать путь, который может привести в тупик, или повторно исследует путь, по которому он уже шёл».

Компания OpenAI, чьи модели набрали менее 10 % в тесте ARC-AGI-3, в прошлом месяце провела собственное исследование и обнаружила, что простая замена двух параметров в тестовой среде утроила показатели моделей.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft возложила вину за проблемы Windows 11 с играми после очередного обновления на RGB-подсветку 2 мин.
Claude улучшил результаты в три раза благодаря оболочке: Nvidia показала новый путь развития ИИ-агентов 6 мин.
Российский рекорд: впервые в истории весь топ-4 The International заняли команды из РФ 21 мин.
Утечки геймплея GTA VI вызвали в Rockstar переполох, но на планы студии не повлияли 38 мин.
Microsoft запустила приложение, которое делает Bing поиском по умолчанию во всех браузерах 2 ч.
Магазин на диване переродился: «Яндекс» начал тестировать функции шопинга на смарт-телевизорах 6 ч.
TikTok согласилась выплатить $400 млн в США по иску о нарушении закона в сфере сбора данных о несовершеннолетних 7 ч.
OpenAI добавит в ChatGPT защиту отдельных диалогов с помощью PIN-кода и отпечатка пальца 8 ч.
Хакеры научились скрывать команды для троянов в баннерах FTP-серверов 8 ч.
Новая статья: Beast of Reincarnation — торжество меланхолии. Рецензия 15 ч.