Сегодня 23 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Все современные ИИ провалили новый сложный тест на общий интеллект — люди с ним тоже справились не идеально

Новый тест для оценки общей интеллектуальной способности моделей искусственного интеллекта, получивший название ARC-AGI-2, поставил в тупик большинство ИИ-моделей. Согласно рейтингу, рассуждающие модели, такие как o1-pro от OpenAI и R1 от DeepSeek, набрали от 1 % до 1,3 %. Модели без логического мышления, включая GPT-4.5, Claude 3.7 Sonnet и Gemini 2.0 Flash, набрали менее 1 %.

 Источник изображения: Pixabay

Источник изображения: Pixabay

Фонд Arc Prize Foundation, некоммерческая организация, соучредителем которой является известный исследователь в области искусственного интеллекта Франсуа Шолле (François Chollet), объявил в своём блоге о создании нового, более продвинутого теста для измерения общего интеллекта ведущих моделей искусственного интеллекта.

Тест ARC-AGI-2 представляет собой серию головоломок, в которых ИИ должен распознать визуальные закономерности, анализируя разноцветные квадраты, и на основе этого построить правильное продолжение узора. Испытание специально разработано так, чтобы модели не могли полагаться на прошлый опыт и вынуждены были адаптироваться к новым задачам.

Также Arc Prize Foundation провела тестирование с участием более 400 человек. В среднем группы испытуемых верно ответили на 60 % заданий. Это значительно превосходит показатели всех протестированных ИИ и одновременно подчёркивает разрыв между текущими возможностями ИИ и интеллектом людей в решении задач, требующих адаптации и понимания новых концепций.

Шолле заявил, что ARC-AGI-2 является более точным показателем реального интеллекта ИИ-моделей, чем предыдущая версия теста ARC-AGI-1. Кроме того, ARC-AGI-2 исключает возможность решения задач «методом грубой силы», то есть путём использования огромной вычислительной мощности для перебора всех возможных вариантов, что происходило в тесте ARC-AGI-1 и было признано серьёзным недостатком.

Для устранения погрешностей первого теста в ARC-AGI-2 была введена метрика эффективности, которая заставляла ИИ интерпретировать паттерны «на лету», а не полагаться на запоминание. Сооснователь Arc Prize Foundation Грег Камрадт (Greg Kamradt) отметил, что «интеллект определяется не только способностью решать задачи или достигать высоких результатов, но и эффективностью, с которой приобретаются и развёртываются эти возможности».

ARC-AGI-1 оставался ведущей метрикой в течение примерно пяти лет, пока в декабре 2024 года OpenAI не выпустила свою продвинутую модель рассуждений o3. Эта модель превзошла все другие ИИ-модели и даже сравнялась с производительностью человека в тестах ARC-AGI-1. Однако, как было отмечено, эти достижения были достигнуты за счёт значительных вычислительных затрат.

Разработка нового теста совпала с ростом обеспокоенности в индустрии по поводу недостатка объективных критериев для оценки искусственного интеллекта. В связи с этим Arc Prize Foundation объявила о запуске конкурса Arc Prize 2025, в котором разработчикам предлагается достичь 85 % точности на ARC-AGI-2, затратив при этом вычислительных затрат не более, чем $0,42 на задачу.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новый геймплейный трейлер подтвердил дату выхода древнегреческой градостроительной стратегии Theos: Cities of Myth в духе Zeus: Master of Olympus 4 ч.
YouTube запустит новые ИИ-функции для блогеров — дубляж в реальном времени, анализ привлекательности видео и динамические миниатюры 4 ч.
YouTube представил «Пользовательские ленты» — теперь алгоритм рекомендаций можно настроить простыми словами 4 ч.
Control Resonant оказалась на торрентах за день до официального релиза 5 ч.
В Steam вышла демоверсия Dopros — нелинейного симулятора допроса в тоталитарной антиутопии 7 ч.
Titan Quest 2 не вырвется из раннего доступа Steam и Epic Games Store в 2026 году — новый трейлер и дата выхода версии 1.0 7 ч.
Microsoft удалит три мини-приложения, которые ещё недавно автоматически устанавливала в Windows 11 с Microsoft 365 9 ч.
Valorant получил крупный патч 13.06: новое оружие, временный режим, улучшенный интерфейс и точная оценка эффективности игроков 9 ч.
Graveyard Keeper 2 стартовала в Steam с «очень положительными» отзывами и уже обогнала первую часть по пиковому онлайну 9 ч.
Обнаружен вирус CLOSEDQUORUM, который после взлома Windows обращается за советами к ИИ 11 ч.
Китайская YMTC добилась запрета для Micron в Германии — под угрозой поставки 3D NAND 6 мин.
Microsoft представила планшет Surface Pro 12 и ноутбук Surface Laptop 13 на базе Snapdragon X2 Plus 7 мин.
Qualcomm представила платформу Snapdragon Sound Elite Gen 2 для автономных наушников с ИИ и Wi-Fi 6E 2 ч.
Logitech представила G Pro X3 Superstrike — флагманскую игровую мышь с бесконтактными переключателями и 135 часами работы 5 ч.
В России стартовали продажи Xiaomi Redmi Note 17, 17 Pro и 17 Pro Max с ёмкими батареями и повышенной прочностью — от 21 990 рублей 5 ч.
Geely представила сверхбыструю ИИ-зарядку для электромобилей — с 10 до 70 % менее чем за пять минут 6 ч.
Брюссель наконец запустит систему оценки экоустойчивости дата-центров Евросоюза 6 ч.
Amazon пытается вернуть специалистов по ИИ и облакам, которых недавно уволила 6 ч.
Быстрая починка корабля Crew Dragon позволит отправить на МКС экипаж Crew-13 с россиянином уже 1 октября 6 ч.
Игровой ПК за $14 тыс., который расцветает от нагрева: внутри Cherry Bloom посадили сакуру с 70 титановыми цветками 6 ч.