Сегодня 30 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

Alibaba нашла способ сократить потребность в количестве используемых ускорителей Nvidia на 82 %

Нехватка вычислительных мощностей, присущая динамично развивающемуся рынку искусственного интеллекта, в Китае усугубляется ограничениями на импорт специализированных ускорителей. Разработчики вынуждены заниматься оптимизацией, и Alibaba нашла способ сократить количество необходимых ускорителей Nvidia для работы своих языковых моделей на 82 %.

 Источник изображения: Nvidia

Источник изображения: Nvidia

Как поясняет South China Morning Post, бета-тестирование профильной системы Aegaeon уже проводится одним их подразделений Alibaba Cloud на протяжении более чем трёх месяцев. По информации, представленной Alibaba на мероприятии SOSP в столице Южной Кореи, данная система позволила сократить количество обслуживающих десятки языковых моделей ускорителей Nvidia H20 с 1192 до 213 штук. При этом соответствующие языковые модели используют до 72 млн параметров, как поясняет источник.

Представителям Alibaba в создании такой системы помогали учёные Пекинского университета, которые назвали её «первой попыткой выявить излишние затраты, связанные с одновременным обслуживанием нагрузок с большими языковыми моделями». Провайдеры облачных услуг типа Alibaba сталкиваются с необходимостью одновременного обслуживания тысяч ИИ-моделей, но в сфере инференса наиболее часто используются лишь несколько моделей типа Qwen или DeepSeek, а прочие вызываются довольно редко. Это приводит к нерациональному расходованию ресурсов. В экосистеме Alibaba Cloud, например, до 17,7 % ускорителей выделяются для обработки 1,35 % запросов.

Исследователи во всём мире начали предлагать повысить эффективность использования вычислительных ресурсов за счёт объединения в пулы, когда один GPU обслуживает несколько моделей. Система Aegaeon использует автомасштабирование на уровне токенов, позволяющее GPU переключаться между разными моделями прямо в процессе генерирования токенов. Один GPU в результате способен обрабатывать до семи моделей, тогда как в альтернативно устроенных системах их количество в лучшем случае достигает двух или трёх. Задержки, необходимые на переключение между моделями, при этом сократились на 97 % в случае с Aegaeon.

Alibaba эту систему испытывает на маркетплейсе моделей Bailian, который предлагает модели Qwen корпоративным пользователям. Ускорители Nvidia H20 одноимённой американской компанией были созданы специально для китайского рынка, в апреле они попали под временный запрет на поставку в КНР, но к лету он был снят. Однако, китайские власти начали настоятельно рекомендовать национальным разработчикам отдавать предпочтение местной компонентной базе. В результате позиции Nvidia на китайском рынке передовых чипов для ИИ, по словам руководителя компании, буквально сократились до нуля.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
OpenAI своими новыми функциями бросила вызов традиционной модели магазинов приложений 25 мин.
Журналисты раскрыли новые скриншоты и подробности GTA VI — животный мир, переработанная погода из RDR 2 и думскроллинг 2 ч.
Cloud.ru разместит второй выпуск биржевых облигаций объёмом не менее 10 млрд рублей 9 ч.
Платформа NVIDIA Open Agent Safety Platform обеспечит безопасное использование ИИ-агентов — от тестирования до развёртывания 9 ч.
На OpenAI подали в суд за взлом Hugging Face и игнорирование рисков автономного ИИ 9 ч.
OpenAI представила GPT‑6.1 Sol — почти как флагманская GPT‑6 Astra в сложных задачах, но в пять раз дешевле 10 ч.
AMD выпустила драйвер с поддержкой кампании Call of Duty: Modern Warfare 4, ремастера The Witcher 3: Wild Hunt, Gears of War: E-Day и других новых игр 12 ч.
OpenAI представила Dots — ИИ-агентов с собственными компьютерами, которые могут работать круглосуточно без пользователя 12 ч.
The Witcher 3: Wild Hunt спустя 11 лет установила новый рекорд популярности в Steam — всё благодаря ремастеру 14 ч.
Учёные нашли способ подделывать RSA-подписи без взлома закрытого ключа 14 ч.
OpenAI вышла на годовой объём выручки $70 млрд и собирается привлечь ещё $30 млрд до IPO 33 мин.
Американские ИИ-гиганты в присутствии Трампа договорились о саморегулировании в области безопасности 2 ч.
Gigabyte выпустила Micro-ATX-плату B760M Aorus Ari WiFi6E в аниме-дизайне, с поддержкой графики PCIe 5.0 и DDR4 5 ч.
iFixit выявили первое реальное улучшение ремонтопригодности в наушниках Apple AirPods 5 6 ч.
Новая статья: Обзор материнской платы MSI Z890 GAMING PLUS WIFI6E: дешевле не значит хуже? 8 ч.
Оператор ЦОД Virtus привлёк рекордные £2,45 млрд на развитие ЦОД в Великобритании и материковой Европе 8 ч.
Дженсен Хуанг уверен в завтрашнем дне — NVIDIA увеличила сумму выкупа акций и планирует повысить дивиденды 9 ч.
Новая статья: Обзор UWQHD VA-монитора DIGMA Overdrive 34A712Q: для ценителей 10 ч.
Снова без изменений: утечка раскрыла дизайн Google Pixel 11a 10 ч.
SteelSeries представила беспроводные игровые мыши Sensei Pro и Rival Pro с широкополосным беспроводным подключением 11 ч.