Сегодня 01 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

OpenAI заподозрили в манипуляциях с тестами мощной ИИ-модели o3

В декабре прошлого года OpenAI представила большую языковую модель o3, заявив, что она способна справиться более чем с 25 % набора сложных математических задач FrontierMath, тогда как другие ИИ-модели справлялись только с 2 % заданий из этого набора. Однако расхождения между результатами внутренних и независимых тестов вызывали вопросы о прозрачности компании и практике тестирования нейросетей.

 Источник изображения: Levart_Photographer / unsplash.com

Источник изображения: Levart_Photographer / unsplash.com

На момент анонса ИИ-модели o3 представитель компании особо отметил результаты алгоритма при решении задач FrontierMath. Однако выпущенная на прошлой неделе потребительская версия алгоритма далеко не так хорошо справляется с вычислениями. Это может указывать на то, что OpenAI либо завысила результаты тестирования, либо в нём была задействована другая, более способная к решению математических задач версия o3.

Исследователи из Epoch AI, стоящие за созданием FrontierMath, опубликовали результаты независимых тестов общедоступной версии ИИ-модели o3. Оказалось, что алгоритм сумел справиться только с 10 % задач, что значительно ниже заявленных OpenAI 25 %. Вместе с этим исследователи протестировали ИИ-модель o4-mini, более компактный и дешёвый алгоритм, который является преемником o3-mini.

 Источник изображения: @EpochAIResearch / X

Источник изображения: @EpochAIResearch / X

Конечно, расхождение в результатах тестирования не означает, что OpenAI намеренно завысила показатели ИИ-модели. Нижняя граница результатов тестирования OpenAI практически совпадает с результатами, полученными Epoch AI. В Epoch AI также отметили, что тестируемая ими модель, скорее всего, отличается от той, что тестировалась OpenAI. Также отмечается, что исследователи задействовали обновлённую версию набора задач FrontierMath.

«Разница между нашими результатами и результатами OpenAI может быть связана с тем, что OpenAI оценивает результаты с помощью более мощной внутренней версии, используя больше времени для вычислений, или потому, что эти результаты были получены на другом подмножестве FrontierMath (180 задач в frontiermath-2024-11-26 против 290 задач в frontiermath-2025-02-28)», — сказано в сообщении Epoch AI.

По данным организации ARC Foundation, которая тестировала предварительную версию o3, публичная версия ИИ-алгоритма «представляет собой другую модель», которая оптимизирована для использования в чате/продуктах. «Вычислительный уровень всех выпущенных версий o3 ниже, чем у версии, которую мы тестировали», — сказано в сообщении ARC.

Сотрудница OpenAI Венда Чжоу (Wenda Zhou) рассказала, что публичная версия o3 «более оптимизирована для реальных случаев использования» и повышения скорости обработки запросов по сравнению с версией o3, которую компания тестировала в декабре. По её словам, это и является причиной того, что результаты тестирования в бенчмарках могут отличаться от того, что показывала OpenAI.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Вложив ещё $50 млрд в OpenAI, Amazon теперь владеет 5 % её капитала 3 ч.
Новая статья: Halo: Campaign Evolved — по третьему кругу. Рецензия 10 ч.
Издатель апокалиптического вестерна Guns of Eschaton показал последнее предсмертное интервью арт-директора Half-Life 2 Виктора Антонова 14 ч.
Вредоносное ПО научилось использовать ИИ прямо во время атаки — ESET предупредила о новых угрозах 14 ч.
Эмуляция PS5 покорила новый рубеж: отдельные 3D-игры показали вполне комфортные 30 FPS 14 ч.
«Худшее, что можно было сделать с игрой»: создатели Stellar Blade: Blood Rain возмутили фанатов сгенерированным ИИ музыкальным клипом с главной героиней 15 ч.
Многие игры на физических носителях не защищены от цифрового будущего — половина дисков для Xbox Series X не будет полноценно работать без интернета 16 ч.
Тим Кук намекнул на платную подписку Apple для активных пользователей ИИ 17 ч.
Китайская MiniMax выпустила генератор видео H3 17 ч.
ИИ упростил разработку приложений Meta — их станет больше 18 ч.
NASA повысило шансы на спасение падающей на Землю обсерватории Swift — беспорядочное вращение буксира стабилизируется 34 мин.
Пятёрка производителей памяти за прошлый квартал накопила $90 млрд свободных денежных средств 3 ч.
Keychron показала концепт сверхкомпактной игровой мыши — она весит 30 граммов и подразумевает управление кончиками пальцев 5 ч.
Слухи о неуёмной прожорливости чёрных дыр оказались слишком преувеличенными 11 ч.
Sony продала в прошлом квартале на 36 % меньше игровых консолей PlayStation 5, чем годом ранее 11 ч.
Asus и XFX выпустили свои варианты Radeon RX 9050 — Asus разогнала свою до 2,77 ГГц 11 ч.
С 2023 года техногиганты потратили на инфраструктуру более $1 трлн 11 ч.
Квартальная выручка Sony выросла почти на треть — помогли сенсоры для камер и фильм про Майкла Джексона 14 ч.
Microsoft за год запустила 88 дата-центров и снижать инвестици в инфраструктуру не намерена 15 ч.
Seatrium намерена построить 30-МВт прибрежный ЦОД, свои проекты продвигают Atomarine и Mocean Energy 15 ч.