Сегодня 04 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba значительно улучшила ИИ-модель Qwen3.8-Max за счёт дообучения

Модель искусственного интеллекта Alibaba Qwen3.8-Max сумела подняться на первое место в рейтинге Code Arena: WebDev на платформе Arena.ai, при этом разработчику не пришлось выпускать новую версию — он провёл её дополнительное обучение с подкреплением, сделав упор на программирование, долгосрочную работу агентов и представил версию Qwen3.8-Max-0902.

 Источник изображения: alibabagroup.com

Источник изображения: alibabagroup.com

Идентификатор модели Qwen3.8-Max-0902 указывает, что перехода на новую версию не произошло. Разработчик несколько обновил модель, в значительной мере сохранив исходные показатели: 2,4 трлн параметров, 95 млрд активных параметров на токен и цены в $2 за 1 млн входных и $6 за 1 млн выходных токенов.

Первый вариант Alibaba Qwen3.8-Max вышел 3 августа — модель заняла четвёртое место в рейтинге Code Arena: WebDev, набрав 1668 баллов. Она уступила Anthropic Claude Opus 5 (Max) с 1705 баллами, Moonshot Kimi K3 (Max) с 1676 баллами и Claude Opus 5 (High) с 1669 баллами. Повторное тестирование от 2 сентября изменило расстановку сил: Qwen3.8-Max-0902 набрала 1691 балл, опередив по новым результатам Claude Opus 5 (Max) на 2 балла и Kimi K3 (Max) — на 17 баллов. Модель сохранила сильные позиции во всех зачётах, заняв первые места в категориях «Данные и аналитика» и «Потребительские товары»; вторые — в категориях «Бренд и маркетинг», «Игры» и «Симуляции»; и третьи — в категориях «Инструменты для создания контента» и «Проектирование на основе эталонных данных».

Этих результатов Alibaba добилась, проведя целенаправленное постобучение в двух областях: в программировании и «совместной работе» — совместных задачах агентов с долгосрочным горизонтом. В таких задачах модель координирует многоэтапную работу субагентов ИИ при операциях с документами, интерфейсом и файлами кода. В тесте TerminalBench 3.0, измеряющем способность модели выполнять многоэтапную работу по написанию кода в реальной среде с терминалом, результат вырос с 11,3 до 29,0 баллов, то есть увеличился в 2,6 раза. В ProgramBench рост составил с 10,5 до 28,0 баллов. В тесте JobBench на автоматизацию офисной работы рост составил с 53,4 до 64,0 баллов. В зачёте WorkArena Elo на многоэтапную веб-навигацию и выполнение зада результат подскочил с 1348 до 1468 баллов.

Из тестов, проведённых самой Alibaba, следует, что Qwen3.8-Max-0902 уступает Claude Opus 5 в бенчмарках TerminalBench, DeepSWE, NL2Repo, ProgramBench, SWE-Marathon, CoWorkBench и Toolathlon. Первый вариант модели от 3 августа показывал 56,6 баллов в тесте DeepSWE на навыки долгосрочного агентного написания кода — выше были также Gemini (70 баллов) и OpenAI GPT-5.6 Sol (73 балла); для Qwen3.8-Max-0902 обновлённые данные по этому тесту не публиковались. Первая итерация Qwen3.8-Max набирала 67,7 баллов в тесте SWE-bench Pro на выполнение реальных инженерных задач с платформы GitHub при 80 пунктах у Claude Fable 5. Сейчас на платформе Hugging Face доступны открытые веса Alibaba Qwen3.8-2.4T-A95B, опубликованные 12 августа; о планах выпустить их для варианта с индексом 0902 пока не сообщалось.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Разработчики Escape from Tarkov открыли издательский бизнес для хардкорных игр — Battlestate Games Publishing 11 мин.
OpenAI запустила Astra — свою самую мощную и противоречивую ИИ-модель 5 ч.
«Я ждал этот сиквел семь лет»: анонс ролевого экшена про акулу-людоеда Maneater 2 привёл фанатов в восторг 11 ч.
Microsoft отвяжет Xbox Cloud Gaming от Game Pass — с ноября можно будет играть без подписки 12 ч.
Дожить до января: нелинейный ужастик Until Dawn 2 получил дату выхода и жутковатый трейлер 12 ч.
Microsoft опубликовала официальный список поддерживаемых браузером Edge дистрибутивов Linux 12 ч.
Глава Epic Games объявил о крупнейшем кризисе игровой индустрии с 1983 года — ИИ лишил игровой рынок «железа» 13 ч.
10 минут геймплея, дата выхода и дополнения на подходе: Square Enix устроила новую демонстрацию Final Fantasy VII Revelation 15 ч.
ИИ готов обнаруживать более 2000 уязвимостей в каждом выпуске ядра Linux 15 ч.
Масштабный сбой вывел из строя популярные платформы ИИ, включая ChatGPT, Claude и Grok 15 ч.