Сегодня 21 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI Deep Research показал рекордный результат в сложнейшем «Последнем экзамене человечества»

Менее двух недель назад эксперты в области искусственного интеллекта представили крайне сложный тест Humanity's Last Exam, предназначенный для оценки передовых нейросетей. Список лидеров в этом испытании возглавили два проекта OpenAI: o3-mini и Deep Research.

 Источник изображения: scale.com

Источник изображения: scale.com

Бенчмарк, созданный экспертами со всего мира, содержит крайне сложные вопросы и задания на знания и рассуждения — даже некоторые люди не могут понять отдельные вопросы в нём, не говоря уже о том, чтобы дать на них ответ. Вскоре после своего выхода список лидеров на экзамене возглавила рассуждающая модель ИИ DeepSeek R1, давшая 9,4 % правильных ответов. Обогнать её смогли модели OpenAI o3-mini с результатом 10,5 % и o3-mini-high, набравшая 13 % — последняя действительно мощнее, но и работает она медленнее. Но более впечатляющим стал результат, который показал ИИ-агент OpenAI Deep Research — он набрал 26,6 %, с ходу побив тем самым предыдущий менее чем за 10 дней.

Сравнение не вполне корректное, потому что Deep Research имеет возможность производить поиск информации, а у традиционных моделей ИИ она отсутствует. И в случае Humanity's Last Exam эта возможность имеет критическое значение, ведь некоторые из вопросов нацелены на проверку знаний. Тем не менее, системы ИИ постоянно улучшают свои результаты, и это заставляет задуматься, когда одна из них сдаст экзамен с высшим баллом. OpenAI Deep Research — чрезвычайно мощный инструмент, предназначенный для работы в качестве персонального аналитика. Он проводит исследования, составляет отчёты и готовит ответы, на которые у человека ушли бы несколько часов.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Warner Bros. Games вместо Injustice 3 анонсировала условно-бесплатный мобильный файтинг DCKO, и фанаты не рады 19 мин.
За консультантами в магазинах Apple проследит ИИ 22 мин.
OpenAI разработала ИИ для выполнения длительных задач, и тот вышел из-под контроля 32 мин.
Учёные нашли способ обрушить ИИ ЦОД и энергосеть через обычные вычисления 36 мин.
Обновлённый вариант ИИ-протокола MCP снизит нагрузку на серверы 40 мин.
«Кронус вновь будет наш»: новый трейлер Warhammer 40,000: Dawn of War 4 показал возвращение некронов 2 ч.
РТК-ЦОД запустил облачный мониторинг качества каналов связи для 20 тысяч объектов заказчиков «Ростелекома» 3 ч.
Anthropic выплатит авторам $1,5 млрд за «пиратскую библиотеку» для обучения Claude 4 ч.
Слухи: многострадальный ремейк Star Wars: Knights of the Old Republic скоро выйдет из тени 5 ч.
Activision подтвердила, когда пройдёт открытая «бета» Call of Duty: Modern Warfare 4 — подробности тестирования 5 ч.
Google создаёт ИИ-ускоритель Frozen v2, оптимизированный специально для Gemini 11 мин.
Китайцы в сто раз ускорили производство фотонных чипов методом ионно-лучевой литографии 23 мин.
В России стартовали продажи смартфона Honor X7e с долговечным аккумулятором на 7200 мА·ч — от 17 990 рублей 29 мин.
TSMC поднимет цены на выпуск чипов — на 5–10 % подорожают и передовые, и зрелые техпроцессы 30 мин.
Объёмы производства памяти CXMT выросли почти в 20 раз и приблизились к показателям Micron 30 мин.
ИИ и автопилот смогут раскрыть потенциал электромобилей, считают в Foxconn 34 мин.
Горе от ума: с новыми версиями FSD электромобили Tesla стали чаще нарываться на штрафы 38 мин.
Помогать OpenAI создавать роботов будет выходец из китайского автопроизводителя Xpeng 40 мин.
Samsung тоже захотела делать роботов — новое подразделение возглавил выходец из Hyundai 42 мин.
Chelsio представила 400GbE-решения седьмого поколения для ИИ ЦОД 2 ч.