Сегодня 27 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Все современные ИИ провалили новый сложный тест на общий интеллект — люди с ним тоже справились не идеально

Новый тест для оценки общей интеллектуальной способности моделей искусственного интеллекта, получивший название ARC-AGI-2, поставил в тупик большинство ИИ-моделей. Согласно рейтингу, рассуждающие модели, такие как o1-pro от OpenAI и R1 от DeepSeek, набрали от 1 % до 1,3 %. Модели без логического мышления, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, набрали менее 1 %.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Фонд Arc Prize Foundation, некоммерческая организация, соучредителем которой является известный исследователь в области искусственного интеллекта Франсуа Шолле (François Chollet), объявил в своём блоге о создании нового, более продвинутого теста для измерения общего интеллекта ведущих моделей искусственного интеллекта.

Тест ARC-AGI-2 представляет собой серию головоломок, в которых ИИ должен распознать визуальные закономерности, анализируя разноцветные квадраты, и на основе этого построить правильное продолжение узора. Испытание специально разработано так, чтобы модели не могли полагаться на прошлый опыт и вынуждены были адаптироваться к новым задачам.

Также Arc Prize Foundation провела тестирование с участием более 400 человек. В среднем группы испытуемых верно ответили на 60 % заданий. Это значительно превосходит показатели всех протестированных ИИ и одновременно подчёркивает разрыв между текущими возможностями ИИ и интеллектом людей в решении задач, требующих адаптации и понимания новых концепций.

Шолле заявил, что ARC-AGI-2 является более точным показателем реального интеллекта ИИ-моделей, чем предыдущая версия теста ARC-AGI-1. Кроме того, ARC-AGI-2 исключает возможность решения задач «методом грубой силы», то есть путём использования огромной вычислительной мощности для перебора всех возможных вариантов, что происходило в тесте ARC-AGI-1 и было признано серьёзным недостатком.

Для устранения погрешностей первого теста в ARC-AGI-2 была введена метрика эффективности, которая заставляла ИИ интерпретировать паттерны «на лету», а не полагаться на запоминание. Сооснователь Arc Prize Foundation Грег Камрадт (Greg Kamradt) отметил, что «интеллект определяется не только способностью решать задачи или достигать высоких результатов, но и эффективностью, с которой приобретаются и развёртываются эти возможности».

ARC-AGI-1 оставался ведущей метрикой в течение примерно пяти лет, пока в декабре 2024 года OpenAI не выпустила свою продвинутую модель рассуждений o3. Эта модель превзошла все другие ИИ-модели и даже сравнялась с производительностью человека в тестах ARC-AGI-1. Однако, как было отмечено, эти достижения были достигнуты за счёт значительных вычислительных затрат.

Разработка нового теста совпала с ростом обеспокоенности в индустрии по поводу недостатка объективных критериев для оценки искусственного интеллекта. В связи с этим Arc Prize Foundation объявила о запуске конкурса Arc Prize 2025, в котором разработчикам предлагается достичь 85 % точности на ARC-AGI-2, затратив при этом вычислительных затрат не более, чем $0,42 на задачу.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Marvel’s Wolverine — самый высокобюджетный IQ-тест. Рецензия 2 ч.
Supergiant отметила годовщину Hades 2 бесплатным музыкальным концертом по игре и анонсом документального фильма о разработке 8 ч.
ИИ-агенты OpenAI слили в интернет 53 изображения пользователей ChatGPT — заметили это лишь спустя время 10 ч.
Claude нашёл «новый CRISPR», но учёные засомневались в значимости открытия Anthropic 12 ч.
ИИ-агенты OpenAI оставили миллион следов взлома Hugging Face в открытом интернете 12 ч.
Qualcomm раскрыла план по освобождению от монополии Nvidia в сфере ИИ 15 ч.
ИИ-агенты OpenAI массово атаковали базы данных онлайн в поисках малоизвестных сведений 16 ч.
Из Google DeepMind ушёл ещё один сотрудник, опасающийся разработки сверхмощного искусственного интеллекта 17 ч.
Дональд Трамп и Си Цзиньпин обсудили вопросы безопасности ИИ при личной встрече, но воздержались от подробных заявлений 17 ч.
Апелляционный суд США оставил за Anthropic статус угрозы для национальной безопасности 17 ч.
Erying представила MoDT-платы с Core i7-13798HRE и Core i5-13598HRE для сборки недорогих игровых ПК 29 мин.
MSI IPC представила мини-компьютер MS-C9ZA на базе NVIDIA Jetson Orin Nano для периферийного ИИ 4 ч.
TerraMaster представила стоечные NAS семейства 725 Series на базе Intel Xeon 4 ч.
Google отправит ИИ-сервер в космос уже на следующей неделе, но работать он сможет лишь по 15 минут 9 ч.
Обнаружить микробную жизнь на спутнике Сатурна Энцеладе может оказаться проще 12 ч.
К запуску подготовлен первый аппарат Otter для сервисного обслуживания спутников в космосе 15 ч.
Подорожавшая память грозит добить дешёвые ноутбуки — Qualcomm обещает спасение в виде Snapdragon C 16 ч.
Solidigm собралась привлечь $15 млрд в ходе IPO, которое станет крупнейшим в истории США 19 ч.
Tesla пока не может выйти на запланированный объём производства 20 000 роботов Optimus в неделю 20 ч.
MSI представила три AM4-платы на чипсете AMD B550 для процессоров Ryzen 3000, 4000G и 5000 20 ч.