Сегодня 01 октября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Claude улучшил результаты в три раза благодаря оболочке: Nvidia показала новый путь развития ИИ-агентов

Согласно исследованию Nvidia, программная оболочка, а не базовая модель, особенно важна при решении ИИ-задач в долгосрочной перспективе.

 Источник изображения: Steve A Johnson/unsplash.com

Источник изображения: Steve A Johnson/unsplash.com

В рамках исследования благодаря специальной программной оболочке для эффективного управления памятью, дополненной компонентом, подобным «супервизору», исследователи добились того, что Claude Opus 5 набрала 100 % баллов в интерактивном тесте ARC-AGI-3 — наборе 2D-игр без инструкций, где модель должна понять, как играть и побеждать, подобно человеку. Без оболочки Opus 5 набрала 30 % баллов, что стало лучшим результатом среди всех протестированных моделей.

Результаты исследования подтверждают, что, хотя выбор модели имеет значение, она всё же является гораздо меньшей частью агентной системы, чем думают многие, особенно для долгосрочных задач. Система управления — вот что делает модель агентом: она обрабатывает память, контекст и обратную связь. Выяснение того, как заставить ИИ выполнять задачи с длительным горизонтом планирования, не отвлекаясь и не зацикливаясь на одном месте, является одной из главных целей исследований в области ИИ-агентов.

«В целом мир воспринимает агента почти как API модели», — сообщил ресурсу TechCrunch Адель Эль Халлак (Adel El Hallak), вице-президент по продуктам подразделения ИИ Nvidia, отметив что агент в настоящее время — нечто большее. «Это модель. Это структура вокруг модели, которую мы называем вспомогательными средствами, то есть набор инструментов, которые вы используете. Это среда выполнения, а также связанные с ней навыки и библиотеки, к которым мы предоставляем вам доступ», — рассказал Эль Халлак. Он отметил важность введения супервизорного агента в дополнение к основному агенту, выполняющему работу. По его словам, он «действует почти как генеральный директор, подталкивая агента, когда тот отклоняется от курса или начинает исследовать путь, который может привести в тупик, или повторно исследует путь, по которому он уже шёл».

Компания OpenAI, чьи модели набрали менее 10 % в тесте ARC-AGI-3, в прошлом месяце провела собственное исследование и обнаружила, что простая замена двух параметров в тестовой среде утроила показатели моделей.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Российский ответ Diablo спустя 20 лет после релиза получил новую жизнь — «Магия крови» добралась до Steam в улучшенном виде 27 мин.
Амбициозный боевик Kena: Scars of Kosmora превзойдёт Kena: Bridge of Spirits по масштабу и качеству, но не в 2026 году 2 ч.
Google бьёт тревогу: ИИ научил хакеров быстрее превращать известные уязвимости в оружие 2 ч.
Спустя 13 лет работы закрылась студия Nerial, создавшая Reigns: The Witcher и Card Shark 3 ч.
Почти как в старые добрые времена: критики вынесли вердикт Gears of War: E-Day 4 ч.
Великобритания обвинила Китай в использовании учёных для шпионажа в технологической сфере 4 ч.
Krafton отменила разработку эвакуационного шутера PUBG: Black Budget после двух тестов 4 ч.
AMD представила ИИ-ассистента Ross для разработки встраиваемых систем 5 ч.
Ретрофэнтезийный ролевой боевик Queen’s Domain в духе King's Field не заставит себя долго ждать — новый трейлер и дата выхода 8 ч.
Неизвестные ИИ-агенты атаковали сайт правительства Канады 8 ч.