Nvidia представила новую технологию в рамках программы NVLink Fusion. NVHBM представляет собой специализированную архитектуру базового кристалла HBM, предназначенную для разработчиков собственных ИИ-ускорителей. По сравнению со стандартной HBM4e она обещает более высокую пропускную способность, меньшее энергопотребление и экономию площади внутри корпуса ускорителя.
Источник изображений: nvidia.com
Как поясняет Nvidia, NVHBM представляет собой специализированный базовый кристалл HBM, разработанный и протестированный совместно с ведущими производителями памяти. Участники программы NVLink Fusion смогут использовать уже готовое решение при создании собственных ускорителей вместо самостоятельной разработки и сертификации подсистемы HBM, что должно сократить сроки вывода новых чипов на рынок.
NVHBM не является заменой самой HBM, а представляет собой один из строительных блоков для специализированных ускорителей партнёров Nvidia. Одним из главных преимуществ технологии должна стать повышенная пропускная способность памяти: компания обещает прирост до 30 % на стек по сравнению со стандартной HBM4e. Для задач, производительность которых ограничена скоростью памяти, это позволит лучше загружать вычислительные блоки и увеличить пропускную способность ускорителя. В частности, при инференсе больших языковых моделей более быстрая передача данных между HBM и вычислительными ядрами позволит увеличить скорость генерации токенов.

Экономия площади достигается за счёт переработанного физического интерфейса памяти. Контроллер перенесён с основного вычислительного кристалла в базовый кристалл трёхмерного стека HBM, а площадь PHY и связанной с ним логики сокращена до 67 % по сравнению со стандартом JEDEC HBM4e. Более узкий интерфейс одновременно упрощает разводку интерпозера. В результате разработчики специализированных ускорителей могут получить до 30 % дополнительной площади основного кристалла для вычислительных блоков и других функций.
Ещё одним преимуществом NVHBM станет снижение энергопотребления памяти на величину до 15 % по сравнению со стандартной HBM4e. Освободившийся энергетический и тепловой бюджет можно использовать для увеличения вычислительной мощности ускорителя или повышения устойчивой производительности при прежнем энергопотреблении. В масштабах крупных ЦОД эффект становится особенно заметным: по расчётам Nvidia, в гипотетическом ЦОД мощностью 1 ГВт с 2000-Вт ускорителями сэкономленной благодаря NVHBM энергии хватило бы для работы ещё 15 000 XPU.
Повышение пропускной способности при одновременном снижении энергопотребления особенно важно для ИИ-ускорителей, которым приходится постоянно перемещать большие объёмы данных, включая веса моделей, KV-кеш и активации. Nvidia утверждает, что сочетание NVHBM с NVLink Fusion за счёт выигрыша в пропускной способности, площади и энергопотреблении способно в совокупности повысить производительность одного XPU на 30 %.
Одним из первых партнёров Nvidia по внедрению NVHBM станет принадлежащая Amazon компания Annapurna Labs. Ускорители следующего поколения Trainium 4 уже получат поддержку NVLink Fusion, а в последующих разработках компания сможет использовать и NVHBM.