Сегодня 09 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Маленькая ИИ-модель оказалась в 11 раз дешевле GPT-5.6 Luna — и почти не уступила ей в тесте логического мышления

Лаборатория искусственного интеллекта Pathway, которая специализируется на отличных от трансформера архитектурах, опубликовала результаты тестирования рассуждающей модели BDH-CQ. Имея размер 150 млн параметров, она набрала 29,5 % в бенчмарке ARC-AGI-1. Вычислительные затраты на тестирование составили $0,0007, что в 11 раз дешевле, чем обслуживание малой модели OpenAI GPT-5.6 Luna.

 Источник изображения: Jackson Sophat / unsplash.com

Источник изображения: Jackson Sophat / unsplash.com

Высокая стоимость работы с системами ИИ сегодня в большинстве случаев объясняется архитектурой моделей, а не их способностями, заявили в Pathway, поэтому лаборатория решила показать, что переход на альтернативную архитектуру «открывает совершенно новое пространство с точки зрения соотношения интеллекта и затрат». Известный бенчмарк ARC-AGI-1 направлен на проверку логического мышления модели и её способность выводить правило на основе ограниченного числа примеров и надлежащим образом применить его к новым входным данным. Младшая в линейке модель OpenAI GPT-5.6 Luna показала в том же тесте результат в 34,2 %, но затраты составили уже $0,008 за одну задачу — и это с учётом того, что OpenAI снизила на неё цену на 80 %.

Для сравнения, Anthropic Claude Opus 5 и Google Gemini 3.1 Pro показали в том же тесте 97–98 % при затратах $0,5–$0,6 за задачу, то есть он обходятся почти в тысячу раз дороже. Стоимость обслуживания Alibaba Qwen3 235B оказалась более чем втрое дороже BDH-CQ, но она продемонстрировала худший результат. Разрыв обусловлен механизмами рассуждений. Большинство современных ИИ-моделей с поддержкой логического мышления генерируют промежуточный текст, на который тоже расходуются токены, и только после этого выдают окончательный ответ, тогда как BDH-CQ «молча» решает задачи в памяти.

Первые эксперименты Pathway с моделью показали соответствие стандартным законам масштабирования, аналогичным механизмам моделей-трансформеров размером от 1 млрд до 600 млрд параметров. Разработчик намерен усложнять доступные для модели задачи, включая математические рассуждения, тест ARC-AGI-2 и, в конечном итоге, провести полную оценку ARC-AGI-3. Не исключено, что на более крупных и сложных задачах преимущество в эффективности также сохранится.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Mistral привлёк €3 млрд с оценкой рыночной стоимости более €21 млрд 4 мин.
Математики из России научили ИИ-модели общаться без слов — знания большой модели можно эффективно передать маленькой 2 ч.
В Steam и на консолях вышел киберпанковый шутер Sprawl Zero, вдохновлённый Half-Life 2 и F.E.A.R. — первые игроки в восторге 3 ч.
Chrome стал получать обновления каждые две недели — ИИ изменил правила в сфере безопасности 4 ч.
Microsoft разгневала пользователей, превратив обои Windows 11 в рекламный щит 4 ч.
Фэнтезийный боевик с духом легендарных аркад прошлого Absolum взял курс на новые платформы 5 ч.
Microsoft установила новый рекорд, выпустив более 650 патчей за один день 6 ч.
Дата выхода, цена и 15 минут геймплея: Nintendo устроила демонстрацию ремейка The Legend of Zelda: Ocarina of Time для Switch 2 6 ч.
«Google Фото» будут удалять файлы из корзины вдвое быстрее — на передумать оставят 30 дней 6 ч.
Google предупредила о снижении качества поиска в Европе и назвала, кто в этом виноват 7 ч.