Сегодня 23 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba значительно улучшила ИИ-модель Qwen3.8-Max за счёт дообучения

Модель искусственного интеллекта Alibaba Qwen3.8-Max сумела подняться на первое место в рейтинге Code Arena: WebDev на платформе Arena.ai, при этом разработчику не пришлось выпускать новую версию — он провёл её дополнительное обучение с подкреплением, сделав упор на программирование, долгосрочную работу агентов и представил версию Qwen3.8-Max-0902.

 Источник изображения: alibabagroup.com

Источник изображения: alibabagroup.com

Идентификатор модели Qwen3.8-Max-0902 указывает, что перехода на новую версию не произошло. Разработчик несколько обновил модель, в значительной мере сохранив исходные показатели: 2,4 трлн параметров, 95 млрд активных параметров на токен и цены в $2 за 1 млн входных и $6 за 1 млн выходных токенов.

Первый вариант Alibaba Qwen3.8-Max вышел 3 августа — модель заняла четвёртое место в рейтинге Code Arena: WebDev, набрав 1668 баллов. Она уступила Anthropic Claude Opus 5 (Max) с 1705 баллами, Moonshot Kimi K3 (Max) с 1676 баллами и Claude Opus 5 (High) с 1669 баллами. Повторное тестирование от 2 сентября изменило расстановку сил: Qwen3.8-Max-0902 набрала 1691 балл, опередив по новым результатам Claude Opus 5 (Max) на 2 балла и Kimi K3 (Max) — на 17 баллов. Модель сохранила сильные позиции во всех зачётах, заняв первые места в категориях «Данные и аналитика» и «Потребительские товары»; вторые — в категориях «Бренд и маркетинг», «Игры» и «Симуляции»; и третьи — в категориях «Инструменты для создания контента» и «Проектирование на основе эталонных данных».

Этих результатов Alibaba добилась, проведя целенаправленное постобучение в двух областях: в программировании и «совместной работе» — совместных задачах агентов с долгосрочным горизонтом. В таких задачах модель координирует многоэтапную работу субагентов ИИ при операциях с документами, интерфейсом и файлами кода. В тесте TerminalBench 3.0, измеряющем способность модели выполнять многоэтапную работу по написанию кода в реальной среде с терминалом, результат вырос с 11,3 до 29,0 баллов, то есть увеличился в 2,6 раза. В ProgramBench рост составил с 10,5 до 28,0 баллов. В тесте JobBench на автоматизацию офисной работы рост составил с 53,4 до 64,0 баллов. В зачёте WorkArena Elo на многоэтапную веб-навигацию и выполнение зада результат подскочил с 1348 до 1468 баллов.

Из тестов, проведённых самой Alibaba, следует, что Qwen3.8-Max-0902 уступает Claude Opus 5 в бенчмарках TerminalBench, DeepSWE, NL2Repo, ProgramBench, SWE-Marathon, CoWorkBench и Toolathlon. Первый вариант модели от 3 августа показывал 56,6 баллов в тесте DeepSWE на навыки долгосрочного агентного написания кода — выше были также Gemini (70 баллов) и OpenAI GPT-5.6 Sol (73 балла); для Qwen3.8-Max-0902 обновлённые данные по этому тесту не публиковались. Первая итерация Qwen3.8-Max набирала 67,7 баллов в тесте SWE-bench Pro на выполнение реальных инженерных задач с платформы GitHub при 80 пунктах у Claude Fable 5. Сейчас на платформе Hugging Face доступны открытые веса Alibaba Qwen3.8-2.4T-A95B, опубликованные 12 августа; о планах выпустить их для варианта с индексом 0902 пока не сообщалось.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Китайские вузы решили учить студентов тому, что нужно ИИ: переводчиков и дизайнеров заменяют промт-инженеры 35 мин.
Серийный охотник за уязвимостями Microsoft заблокировал автообновления антивируса Defender 41 мин.
Минюст США встал на сторону Apple в споре с Epic Games — Верховный суд призвали отменить запрет на комиссии с покупок вне App Store 46 мин.
«Ставки растут»: OpenAI пустит сторонних проверяющих на более ранние этапы разработки ИИ-моделей 2 ч.
Питомцы, новый режим и бесшумная перезарядка: для Counter-Strike 2 вышло крупное обновление 2 ч.
Хакеры ShinyHunters заявили о взломе ФБР — украдены данные «почти всех» агентов и соискателей 3 ч.
Meta научила ИИ-агента Muse звонить от имени пользователей — но иногда вместо него звонят люди 3 ч.
«Почувствуют себя королями и королевами»: босс Rainbow Six Siege пообещал щедрые награды игрокам, которые не уйдут в GTA VI 3 ч.
Тактика всё ещё в моде: аналитики раскрыли продажи Star Wars Zero Company 4 ч.
Бесплатная версия Adobe Premiere для Android предлагает широкие возможности редактирования видео 8 ч.
В Китае создают первое в мире хранилище энергии на расплаве солей и CO2 в сверхкритическом состоянии 24 мин.
Смартфон Poco X8 с батареей на 8340 мА·ч поступил в глобальную продажу 2 ч.
Российскому техсбору на электронику придумали скидку в 33 % — но только для обладателей «Честного знака» 2 ч.
QNAP выпустила стоечный NAS-сервер TS-432XeU с чипом Arm и поддержкой 10GbE 2 ч.
Квартальные продажи СХД подскочили на треть на фоне бума ИИ 2 ч.
РТК-ЦОД запустил программу комплексной модернизации дата-центров без влияния на SLA клиентов 2 ч.
В Китае доля угольной энергетики впервые опустилась ниже 50 % по итогам первого полугодия 7 ч.
Razer представила компактные настольные комплекты колонок Mako и Mako X мощностью до 60 Вт 7 ч.
Новая статья: Обзор MSI MPG Infinite Z3 X3D: этот ПК готов к GTA VI «на максималках» (в отличие от PS5) 11 ч.
Новая статья: Шпионское наследство и триумф баллистики: как телескоп „Нэнси Грейс Роман“ отправился переписывать космологию 13 ч.