Сегодня 31 июля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Все современные ИИ провалили новый сложный тест на общий интеллект — люди с ним тоже справились не идеально

Новый тест для оценки общей интеллектуальной способности моделей искусственного интеллекта, получивший название ARC-AGI-2, поставил в тупик большинство ИИ-моделей. Согласно рейтингу, рассуждающие модели, такие как o1-pro от OpenAI и R1 от DeepSeek, набрали от 1 % до 1,3 %. Модели без логического мышления, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, набрали менее 1 %.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Фонд Arc Prize Foundation, некоммерческая организация, соучредителем которой является известный исследователь в области искусственного интеллекта Франсуа Шолле (François Chollet), объявил в своём блоге о создании нового, более продвинутого теста для измерения общего интеллекта ведущих моделей искусственного интеллекта.

Тест ARC-AGI-2 представляет собой серию головоломок, в которых ИИ должен распознать визуальные закономерности, анализируя разноцветные квадраты, и на основе этого построить правильное продолжение узора. Испытание специально разработано так, чтобы модели не могли полагаться на прошлый опыт и вынуждены были адаптироваться к новым задачам.

Также Arc Prize Foundation провела тестирование с участием более 400 человек. В среднем группы испытуемых верно ответили на 60 % заданий. Это значительно превосходит показатели всех протестированных ИИ и одновременно подчёркивает разрыв между текущими возможностями ИИ и интеллектом людей в решении задач, требующих адаптации и понимания новых концепций.

Шолле заявил, что ARC-AGI-2 является более точным показателем реального интеллекта ИИ-моделей, чем предыдущая версия теста ARC-AGI-1. Кроме того, ARC-AGI-2 исключает возможность решения задач «методом грубой силы», то есть путём использования огромной вычислительной мощности для перебора всех возможных вариантов, что происходило в тесте ARC-AGI-1 и было признано серьёзным недостатком.

Для устранения погрешностей первого теста в ARC-AGI-2 была введена метрика эффективности, которая заставляла ИИ интерпретировать паттерны «на лету», а не полагаться на запоминание. Сооснователь Arc Prize Foundation Грег Камрадт (Greg Kamradt) отметил, что «интеллект определяется не только способностью решать задачи или достигать высоких результатов, но и эффективностью, с которой приобретаются и развёртываются эти возможности».

ARC-AGI-1 оставался ведущей метрикой в течение примерно пяти лет, пока в декабре 2024 года OpenAI не выпустила свою продвинутую модель рассуждений o3. Эта модель превзошла все другие ИИ-модели и даже сравнялась с производительностью человека в тестах ARC-AGI-1. Однако, как было отмечено, эти достижения были достигнуты за счёт значительных вычислительных затрат.

Разработка нового теста совпала с ростом обеспокоенности в индустрии по поводу недостатка объективных критериев для оценки искусственного интеллекта. В связи с этим Arc Prize Foundation объявила о запуске конкурса Arc Prize 2025, в котором разработчикам предлагается достичь 85 % точности на ARC-AGI-2, затратив при этом вычислительных затрат не более, чем $0,42 на задачу.

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Конфликт Anthropic и Пентагона получил неожиданный поворот — судью не убедили доказательства опасности технологий компании 36 мин.
ИИ-агент Gemini Spark теперь может использовать Chrome для автоматического просмотра веб-страниц, AI Pro стал доступен по всему миру 40 мин.
Google повысит безопасность Chrome за счёт обновления браузера без его полной перезагрузки 44 мин.
Новая статья: The Mermaid Mask — замечательный подводный детектив. Рецензия 7 ч.
OpenAI снизила расценки и расширила лимиты на две из трёх ИИ-модели GPT-5.6 8 ч.
ИИ привёл к перерасходу бюджета на 860 % — Amazon признала, что нейросети сделали ошибки «катастрофически дорогими» 8 ч.
Австралия запустила судебное разбирательство против Telegram — мессенджер обвиняют в распространении пропаганды терроризма 13 ч.
«Идеальное сочетание Elden Ring и Arc Raiders, но худший босс — очередь на сервер»: релиз экшена Mistfall Hunter был омрачён техническими проблемами 14 ч.
Разработчики Path of Exile 2 наконец устранили зависания, которые мучили игроков с самого релиза — виновата была Nvidia 14 ч.
Бывший инженер Microsoft создал «Диспетчер задач» для macOS 15 ч.
Электрическая «выделенка» для ЦОД: Amazon просит разрешить ей модернизировать энергосети за свой счёт 2 ч.
Brookfield и NextEra Energy запустят 1,2-ГВт ИИ ЦОД на месте бывшего завода по обогащению урана в Кентукки 2 ч.
Qualcomm намерена заработать в 2029 году на чипах для ЦОД $15 млрд 2 ч.
Гибридный внедорожник Xiaomi SkyNomad N70 способен проезжать до 505 км чисто на электричестве 2 ч.
В Солнечной системе впервые обнаружен «трёхглавый» астероид — у него есть своя микролуна 7 ч.
Google выпустила ИИ-модель Gemini Robotics 2, которая научила роботов двигаться почти как люди 7 ч.
ИИ и VR ускорили строительство завода TSMC по выпуску 1,4-нм чипов — оно завершится к апрелю 2027 года 10 ч.
Kioxia начала тестовые поставки 230-слойной флеш-памяти BiCS 9-го поколения со скоростью до 4,8 Гбит/с 10 ч.
Huawei готовит 14" ноутбук MateBook Pro S — он легче 13" MacBook Air и работает на 10-ядерном процессоре Kirin XE90 10 ч.
Asus выпустила мониторы ProArt Display OLED PA279CDV и PA329CDV для творчества — 4K, 120 Гц и цена от $699 10 ч.