Сегодня 20 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI Deep Research показал рекордный результат в сложнейшем «Последнем экзамене человечества»

Менее двух недель назад эксперты в области искусственного интеллекта представили крайне сложный тест Humanity's Last Exam, предназначенный для оценки передовых нейросетей. Список лидеров в этом испытании возглавили два проекта OpenAI: o3-mini и Deep Research.

 Источник изображения: scale.com

Источник изображения: scale.com

Бенчмарк, созданный экспертами со всего мира, содержит крайне сложные вопросы и задания на знания и рассуждения — даже некоторые люди не могут понять отдельные вопросы в нём, не говоря уже о том, чтобы дать на них ответ. Вскоре после своего выхода список лидеров на экзамене возглавила рассуждающая модель ИИ DeepSeek R1, давшая 9,4 % правильных ответов. Обогнать её смогли модели OpenAI o3-mini с результатом 10,5 % и o3-mini-high, набравшая 13 % — последняя действительно мощнее, но и работает она медленнее. Но более впечатляющим стал результат, который показал ИИ-агент OpenAI Deep Research — он набрал 26,6 %, с ходу побив тем самым предыдущий менее чем за 10 дней.

Сравнение не вполне корректное, потому что Deep Research имеет возможность производить поиск информации, а у традиционных моделей ИИ она отсутствует. И в случае Humanity's Last Exam эта возможность имеет критическое значение, ведь некоторые из вопросов нацелены на проверку знаний. Тем не менее, системы ИИ постоянно улучшают свои результаты, и это заставляет задуматься, когда одна из них сдаст экзамен с высшим баллом. OpenAI Deep Research — чрезвычайно мощный инструмент, предназначенный для работы в качестве персонального аналитика. Он проводит исследования, составляет отчёты и готовит ответы, на которые у человека ушли бы несколько часов.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Популярные чат-боты в большинстве случаев дают вредные советы в сфере финансов 3 ч.
Новая статья: The Blood of Dawnwalker — начало чего-то выдающегося. Рецензия 10 ч.
Путь на дно: суд обязал Microsoft раскрыть внутренние документы и переписку топ-менеджеров в деле о перепродаже лицензий на ПО 16 ч.
Персональный ИИ-агент Muse от Meta возглавил рейтинг App Store всего через неделю после релиза 20 ч.
SpaceXAI удвоила точность распознавания речи в новой модели Grok Voice Transcribe 2.0 21 ч.
Anthropic сделала первый шаг к замедлению ИИ — Accenture будет проверять Claude изнутри 21 ч.
Европейские разработчики ИИ выступили против призывов США замедлить темп 23 ч.
Alibaba выпустила всеядную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов 24 ч.
Anthropic до IPO собирается выпустить ИИ-модель, которая станет ответом на OpenAI GPT-6 Astra 19-09 07:25
Новая статья: Doloc Town — достойная наследница Stardew Valley. Рецензия 19-09 00:10
Под управлением передовых моделей OpenAI и Anthropic роботы во многих случаях готовы совершать опасные для людей манипуляции 2 ч.
На следующей неделе Meta покажет AR-гарнитуру Phoenix и фотореалистичные голографические аватары для видеозвонков 4 ч.
Anthropic и OpenAI переключились на аренду небольших ИИ ЦОД 7 ч.
Урезанная Radeon RX 9050 с 4 Гбайт памяти оказалась в среднем на 37 % медленнее версии с 8 Гбайт 16 ч.
Исследователь OpenAI предупредил: ИИ-агенты способны общаться даже на отключённых от Сети компьютерах 17 ч.
Создана не имеющая аналогов плёночная теплоизоляция — она сдерживает тепло в пять раз лучше силикона 17 ч.
До 64 Пбайт для KV-кеша: Huawei представила платформу хранения OceanStor M900 для ИИ ЦОД 18 ч.
Samsung вновь вышла на первое место по продажам смартфонов благодаря флагманам 19 ч.
«Искусственные листья» научили добывать водород из грязной морской воды — для этого нужен только солнечный свет 21 ч.
HP представила ноутбук со 192 Гбайт памяти — 160 Гбайт можно отдать встроенной Radeon 21 ч.