Сегодня 26 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI Deep Research показал рекордный результат в сложнейшем «Последнем экзамене человечества»

Менее двух недель назад эксперты в области искусственного интеллекта представили крайне сложный тест Humanity's Last Exam, предназначенный для оценки передовых нейросетей. Список лидеров в этом испытании возглавили два проекта OpenAI: o3-mini и Deep Research.

 Источник изображения: scale.com

Источник изображения: scale.com

Бенчмарк, созданный экспертами со всего мира, содержит крайне сложные вопросы и задания на знания и рассуждения — даже некоторые люди не могут понять отдельные вопросы в нём, не говоря уже о том, чтобы дать на них ответ. Вскоре после своего выхода список лидеров на экзамене возглавила рассуждающая модель ИИ DeepSeek R1, давшая 9,4 % правильных ответов. Обогнать её смогли модели OpenAI o3-mini с результатом 10,5 % и o3-mini-high, набравшая 13 % — последняя действительно мощнее, но и работает она медленнее. Но более впечатляющим стал результат, который показал ИИ-агент OpenAI Deep Research — он набрал 26,6 %, с ходу побив тем самым предыдущий менее чем за 10 дней.

Сравнение не вполне корректное, потому что Deep Research имеет возможность производить поиск информации, а у традиционных моделей ИИ она отсутствует. И в случае Humanity's Last Exam эта возможность имеет критическое значение, ведь некоторые из вопросов нацелены на проверку знаний. Тем не менее, системы ИИ постоянно улучшают свои результаты, и это заставляет задуматься, когда одна из них сдаст экзамен с высшим баллом. OpenAI Deep Research — чрезвычайно мощный инструмент, предназначенный для работы в качестве персонального аналитика. Он проводит исследования, составляет отчёты и готовит ответы, на которые у человека ушли бы несколько часов.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Хватит пугать людей» — Дженсен Хуанг раскритиковал апокалиптическую риторику ИИ-отрасли 17 ч.
Новая статья: Moss: The Forgotten Relic — сказочный сборник, сбежавший из VR-плена. Рецензия 17 ч.
В США разгорелись споры между сторонниками и противниками открытых ИИ-моделей 21 ч.
OpenAI целую неделю не замечала, что её ИИ-агенты взломали Hugging Face 25-07 11:18
Microsoft представила ИИ-модели для работы с изображениями и речью — они значительно экономнее аналогов OpenAI 25-07 11:11
Чат-бот Meta AI получил возможности персонального помощника как в ChatGPT и Gemini 25-07 06:00
Новая статья: The Alters: Last Variable — последняя тайна. Рецензия 25-07 00:04
Глава Amazon Games перенёс Tomb Raider: Catalyst на 2028 год, но Amazon Games это опровергла 24-07 23:12
Anthropic внезапно выпустила Claude Opus 5 — почти как Fable 5, но по ценам на уровне предшественника 24-07 23:11
Google прекратила поддержку Android 6.0 Marshmallow спустя 11 лет после релиза 24-07 22:40
Astera Labs представила первые в отрасли 3,2-Тбит/с интеллектуальные ретаймеры и редрайверы для Ethernet и UALink 4 ч.
Цены на клиентские процессоры Intel выросли на 27 %, объёмы продаж сократились на 8 %, но чипов всё равно не хватило на всех 10 ч.
OpenAI настроена интегрировать ChatGPT в умные очки сторонних разработчиков 16 ч.
Графические процессоры Nvidia отправятся на Луну до конца года 18 ч.
«АМДтехнологии» и «Е-Флопс» развернули «двухконтурный» суперкомпьютер для ИИ- и HPC-задач 19 ч.
ИИ-платформа Liqid UltraStack объединяет 30 ускорителей AMD Instinct MI350P 20 ч.
В семейство AMD Ryzen AI Embedded X100 вошли процессоры с 8–16 ядрами 20 ч.
Apple и Micron заставляют администрацию Трампа выбирать: дешёвые iPhone или американские чипы 22 ч.
Anthropic запросила у SK hynix чипы памяти для собственных ИИ-ускорителей 24 ч.
Samsung и Broadcom заключили соглашение о сотрудничестве в сфере ИИ-чипов на $200 млрд 24 ч.