Сегодня 20 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Alibaba выпустила всеядную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов

Alibaba пополнила арсенал моделей искусственного интеллекта мультимодальной системой Qwen3.8-Omni-Flash. В рамках единой архитектуры она обрабатывает текст, изображения, аудио и видео, а также поддерживает контекстное окно размером 1 млн токенов. Новинка, отмечает разработчик, показывает высокие результаты в различных сценариях, включая редактирование видео, подготовку музыкальных клипов, кинопроизводство, обобщение аудиовизуальной информации и ведение диалогов в реальном времени.

 Источник изображений: qwen.ai

Источник изображений: qwen.ai

Одним из главных достижений стало снижение стоимости сервиса. По сравнению с предыдущей версией Qwen3.5-Omni-Plus при доступе по API цена за час обработки аудиоданных снизилась более чем на 98 %, аудио и видео — более чем на 93 %. Средний результат в 29 бенчмарках вырос более чем на 25 % по сравнению с предыдущим поколением. В тестах, охватывающих работу аудио- и видеоагентов, написание кода и выполнение задач с долгосрочным планированием, модель набрала 71,0 балла в WildClawBench-MM — на 36,5 балла больше предшественницы. В UniClawBench результат составил 69,6 балла. В тесте LongAudioSpan на понимание длинных аудиозаписей модель получила 82,7 балла, в OmniVideoBench на анализ аудио и видео — 63,4 балла, в OmniCap-IF на следование инструкциям при описании видео — 28,2 балла, а в AliMeeting на расшифровку совещаний на китайском языке с участием нескольких человек — 89,7 балла.

По качеству совместной обработки звука и видео Qwen3.8-Omni-Flash приблизилась к Google Gemini 3.8 Flash, а при работе только со звуком даже превзошла американского конкурента. Система распознавания речи поддерживает 74 языка и диалекта, включая кантонский, уйгурский и маори, а система генерации — 29 языков. Обе системы поддерживают китайский, английский, корейский, французский, немецкий, испанский и японский языки.

Одной из основных особенностей модели стал механизм «агентного понимания» аудио и видео. Модель не анализирует многочасовую запись последовательно от начала до конца, а, исходя из сути запроса, сама решает, «куда смотреть и что слушать», постепенно сужая область поиска в несколько этапов. В OmniVideoBench этот механизм помог повысить результат с 63,4 до 67,8 балла, а число расходуемых на один запрос токенов сократилось со 145 736 до 79 117, или на 45,7 %. Современные решения, подчеркнули в Alibaba, плохо справляются с продолжительными аудио- и видеозаписями: программные средства для ИИ-агентов пока не имеют полноценной встроенной поддержки этих форматов, а соответствующие механизмы находятся лишь на начальном этапе развития.

Alibaba также провела эксперимент, в ходе которого Qwen3.8-Omni-Flash использовалась для разработки другой модели ИИ. Ей поставили задачу за 12 часов улучшить распознавание сычуаньского диалекта китайского языка более компактной моделью Qwen2.5-Omni-3B. «Старшая» модель самостоятельно отобрала тестовую выборку, замерила исходные показатели и сформировала набор обучающих данных. За четыре серии экспериментов она создала 3413 обучающих примеров, благодаря которым доля ошибок при распознавании отдельных символов снизилась с 25,79 до 15,30 %, то есть на 40,7 %. Таким образом, ИИ-агенты могут не только пользоваться другими моделями, но и самостоятельно улучшать их.

Помимо самой модели, разработчик обновил сопутствующие программные средства. Набор плагинов Qwen-MM-Plugins для работы со звуком и видео получил средства контекстного поиска по медиаданным, подключения внешних инструментов и последовательной обработки продолжительных аудио- и видеофайлов. Поддерживаются различные среды для работы ИИ-агентов, включая OpenAI Codex, Anthropic Claude Code, Alibaba Qwen Code и Google Gemini CLI.

Компания также выпустила Qwen-Live Harness с открытым исходным кодом — среду для создания интерактивных приложений на базе API Qwen3.8-Omni-Flash-Realtime. Она поддерживает протоколы WebSocket и WebRTC и обеспечивает низкую задержку. По утверждению Alibaba, это первая мультимодальная модель с функцией «звуковой локализации»: объединяя данные пространственного аудио с визуальной информацией, она умеет определять направление и расстояние до источников звука.

Qwen3.8-Omni-Flash создаёт клипы на основе музыкальных композиций, готовит переводы коротких сериалов и комментарии к полнометражным фильмам, составляет PDF-конспекты обучающих видео и осваивает новые навыки по видеодемонстрациям. При переводе модель может сохранять индивидуальные особенности оригинального голоса. Доступ к Qwen3.8-Omni-Flash открыт через корпоративную ИИ-платформу Alibaba Qianwen AI.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Популярные чат-боты в большинстве случаев дают вредные советы в сфере финансов 5 ч.
Новая статья: The Blood of Dawnwalker — начало чего-то выдающегося. Рецензия 11 ч.
Путь на дно: суд обязал Microsoft раскрыть внутренние документы и переписку топ-менеджеров в деле о перепродаже лицензий на ПО 18 ч.
Персональный ИИ-агент Muse от Meta возглавил рейтинг App Store всего через неделю после релиза 21 ч.
SpaceXAI удвоила точность распознавания речи в новой модели Grok Voice Transcribe 2.0 23 ч.
Anthropic сделала первый шаг к замедлению ИИ — Accenture будет проверять Claude изнутри 23 ч.
Европейские разработчики ИИ выступили против призывов США замедлить темп 19-09 10:43
Alibaba выпустила всеядную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов 19-09 10:08
Anthropic до IPO собирается выпустить ИИ-модель, которая станет ответом на OpenAI GPT-6 Astra 19-09 07:25
Новая статья: Doloc Town — достойная наследница Stardew Valley. Рецензия 19-09 00:10
GPT-6 Astra и Claude Fable превратили роботов в комичных убийц — ИИ провалил новый тест безопасности 4 ч.
На следующей неделе Meta покажет AR-гарнитуру Phoenix и фотореалистичные голографические аватары для видеозвонков 6 ч.
Anthropic и OpenAI переключились на аренду небольших ИИ ЦОД 9 ч.
Урезанная Radeon RX 9050 с 4 Гбайт памяти оказалась в среднем на 37 % медленнее версии с 8 Гбайт 18 ч.
Исследователь OpenAI предупредил: ИИ-агенты способны общаться даже на отключённых от Сети компьютерах 18 ч.
Создана не имеющая аналогов плёночная теплоизоляция — она сдерживает тепло в пять раз лучше силикона 19 ч.
До 64 Пбайт для KV-кеша: Huawei представила платформу хранения OceanStor M900 для ИИ ЦОД 19 ч.
Samsung вновь вышла на первое место по продажам смартфонов благодаря флагманам 21 ч.
«Искусственные листья» научили добывать водород из грязной морской воды — для этого нужен только солнечный свет 23 ч.
HP представила ноутбук со 192 Гбайт памяти — 160 Гбайт можно отдать встроенной Radeon 23 ч.