Сегодня 17 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI Deep Research показал рекордный результат в сложнейшем «Последнем экзамене человечества»

Менее двух недель назад эксперты в области искусственного интеллекта представили крайне сложный тест Humanity's Last Exam, предназначенный для оценки передовых нейросетей. Список лидеров в этом испытании возглавили два проекта OpenAI: o3-mini и Deep Research.

 Источник изображения: scale.com

Источник изображения: scale.com

Бенчмарк, созданный экспертами со всего мира, содержит крайне сложные вопросы и задания на знания и рассуждения — даже некоторые люди не могут понять отдельные вопросы в нём, не говоря уже о том, чтобы дать на них ответ. Вскоре после своего выхода список лидеров на экзамене возглавила рассуждающая модель ИИ DeepSeek R1, давшая 9,4 % правильных ответов. Обогнать её смогли модели OpenAI o3-mini с результатом 10,5 % и o3-mini-high, набравшая 13 % — последняя действительно мощнее, но и работает она медленнее. Но более впечатляющим стал результат, который показал ИИ-агент OpenAI Deep Research — он набрал 26,6 %, с ходу побив тем самым предыдущий менее чем за 10 дней.

Сравнение не вполне корректное, потому что Deep Research имеет возможность производить поиск информации, а у традиционных моделей ИИ она отсутствует. И в случае Humanity's Last Exam эта возможность имеет критическое значение, ведь некоторые из вопросов нацелены на проверку знаний. Тем не менее, системы ИИ постоянно улучшают свои результаты, и это заставляет задуматься, когда одна из них сдаст экзамен с высшим баллом. OpenAI Deep Research — чрезвычайно мощный инструмент, предназначенный для работы в качестве персонального аналитика. Он проводит исследования, составляет отчёты и готовит ответы, на которые у человека ушли бы несколько часов.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Лучше поздно, чем никогда: спустя три года после релиза у Lords of the Fallen появился официальный перевод на русский язык 22 мин.
У GitHub произошёл глобальный сбой — половина запросов оборачивается ошибкой 3 ч.
Проверенный инсайдер рассекретил дату выхода и наполнение Diablo IV для Nintendo Switch 2 3 ч.
В Firefox для iPhone появился встроенный блокировщик рекламы, но блокирует он не всё 3 ч.
Geekom случайно раздавала вредоносное ПО вместе с драйвером для мини-ПК — компания извинилась перед пользователями 3 ч.
«Ещё одна причина жить дальше»: культовое психоделическое приключение Sally Face спустя 10 лет получит продолжение 4 ч.
В «Яндексе» придумали тесты для ИИ на традиционные ценности — часть вопросов от разработчиков скроют 9 ч.
Создатель «Симпсонов» проговорился о возвращении культового экшена The Simpsons: Hit & Run в духе GTA 9 ч.
«Это кризис доверия»: глава Anthropic объяснил негативное отношение людей к ИИ 11 ч.
OpenAI штормит перед IPO — компания распустила команду по оценке рисков ИИ 11 ч.
Концепция европейского ИИ-суверенитета Mistral AI включает создание 1 ГВт мощностей и… китайские LLM 5 ч.
AOC перевыпустила 27-дюймовый игровой монитор Agon Pro AG276UZ с круговой поляризацией и режимами 4K@240 Гц и 1080@480 Гц 5 ч.
В России внедрена поддержка полностью кириллических адресов электронной почты в доменах .RU и .РФ 6 ч.
Бигтехи потратят на ИИ на $3 трлн больше, чем говорят — большая часть расходов скрыта за балансом 7 ч.
Lenovo сообщила о рекордных результатах первого финансового квартала 8 ч.
Intel неожиданно привлекла до $23 млрд — аналитики увидели признаки успеха её контрактного бизнеса 9 ч.
CoreWeave продлила использование NVIDIA A100 до 2029 года 9 ч.
СЖО на пальмовом масле: Малайзия готовит экологичную жидкость Sawit EcoTherm для погружного охлаждения 13 ч.
Macronix создала двухуровневые SSD со слоями SLC и TLC 13 ч.
UGREEN выпустила в России зарядку Nexode Air на 65 Вт, магнитный аккумулятор MagFlow на 10 000 мА·ч и пауэрбанк Nexode Pro на 200 Вт и 25 000 мА·ч 13 ч.