Исследовательская лаборатория искусственного интеллекта DeepReinforce представила семейство открытых моделей Ornith-1.5, которые отчасти обучили сами себя. При их разработке использовался механизм, позволяющий системе самостоятельно создавать тренировочные задачи и формировать способы их проверки.
Источник изображений: ornith.ai
Модели семейства Ornith-1.5 отличает уникальный механизм обучения: система предлагает новую задачу на грани своих возможностей, формирует этапы её решения и тестовую среду, после чего генерирует варианты решения — полученные результаты используются в схеме обучения с подкреплением, то есть в дальнейшем обучении самой модели. Уверенно научившись решать задачи на грани своих текущих возможностей, модель стремится генерировать более сложные варианты — важно, чтобы при этом задачи оставались проверяемыми, достаточно разнообразными, и обучение не превращалось в решение более или менее одинаковых примеров. Выпущены флагманский, средний и облегчённый варианты модели.

Флагманская Ornith-1.5-397B — модель с архитектурой Mixture-of-Experts (MoE) размером 397 млрд параметров. В тестах Terminal-Bench 2.1, SWE-bench Verified и DeepSWE она показала 86,1, 86,0 и 56 баллов соответственно — для сравнения, Anthropic Claude Opus 4.8 набрала соответственно 85,0, 85,8 и 59. Средняя Ornith-1.5-35B при размере 35 млрд параметров тоже имеет архитектуру MoE, и постоянно активны только 3 млрд параметров; в тестах Terminal-Bench 2.1 и SWE-bench Verified она набрала 68,5 и 79 баллов. Младшая Ornith-1.5-9B предназначена для работы на оборудовании небольшой мощности; в Terminal-Bench 2.1 и SWE-bench Verified она набрала 47 и 70,6 балла.
Разработчик также подготовил квантованную версию младшей модели Ornith-1.5-9B-Mobile, оптимизированную для запуска на устройствах Apple iOS и Google Android.
Источник:


MWC 2018
2018
Computex
IFA 2018






