Сегодня 21 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → кеширование

SK hynix предложила неоригинальный костыль для ускорения ИИ-моделей — гибридную архитектуру памяти HBM/HBF

Светлая мысль разместить больше памяти рядом с процессором пришла не в одну голову. Год назад о разработке концепции замены памяти HBM (DRAM) памятью HBF (флеш) сообщила компания SanDisk. На днях работу о таком подходе опубликовала компания SK Hynix. Флеш-память NAND попросту плотнее памяти DRAM, и с позиции увеличения места под токены для ИИ замена одной на другую даст впечатляющий результат в виде роста скорости принятия решений.

 Источник изображения: SK Hynix

Источник изображения: SK Hynix

Не секрет, что современные платформы на базе центральных, графических и тензорных процессоров сталкиваются с серьёзным ограничением по объёму приданной им памяти High Bandwidth Memory (HBM), что сплошь и рядом происходит при работе с большими языковыми моделями. Например, модели вроде Llama 4 поддерживают до 10 млн токенов, что требует кэш объёмом до 5,4 Тбайт. Стандартные решения, такие как частичный сброс кэша на локальные SSD, приводят к значительным задержкам из-за низкой пропускной способности шины и медленного доступа к накопителям. В результате образуется узкое место по пропускной способности, что можно обойти только наращиванием массива ускорителей, а это — лишние деньги и энергопотребление.

Предложенная компанией SK hynix гибридная иерархия памяти или архитектура H³ (Hybrid³), объединяющая HBM и новый пока тип памяти High Bandwidth Flash (HBF) на одном интерпозере вместе с процессором, решает проблему нехватки памяти для токенов ИИ. Память HBM продолжит использоваться так же, как и раньше — для данных с высокой частотой записи и чтения (динамически генерируемый кэш), а HBF — для данных с интенсивным чтением.

Использование флеш-памяти HBF обеспечит до 16 раз большую ёмкость при пропускной способности, близкой к HBM, хотя задержка доступа останется выше на один или даже два порядка, износостойкость будет ниже, а энергопотребление может быть в 4 раза больше. В то же время массив гибридной памяти окажется единым для процессора, а грамотная маршрутизация запросов сведёт на нет все негативные последствия «тормозов» флеш-памяти.

Результаты моделирования на конфигурации Nvidia Blackwell GPU с 8 стеками HBM3E и 8 стеками HBF на интерпозере демонстрируют впечатляющие улучшения. При 1 млн токенов контекста производительность в токенах в секунду вырастает в 1,25 раза, при 10 млн токенов — уже в 6,14 раза по сравнению с чисто HBM-системой, а энергоэффективность становится выше в 2,69 раза. И если раньше для обработки запросов такого масштаба требовалось 32 GPU, то теперь работа может быть выполнена всего на 2 GPU с существенным снижением энергозатрат и общей стоимости системы. Ради такого стоит рискнуть и создать коммерческие решения, считают в компании.


window-new
Soft
Hard
Тренды 🔥
Resonance: A Plague Tale Legacy попала в руки пиратов за целую неделю до официального релиза 8 ч.
Новый трейлер подтвердил дату выхода Beyond These Stars — градостроительной стратегии о жизни на спине космического кита 10 ч.
Шпионский боевик 007 First Light от создателей Hitman покорил новую вершину продаж — 4 миллиона за три месяца 10 ч.
AMD выпустила драйвер с поддержкой Resonance: A Plague Tale Legacy, Star Wars Zero Company и «беты» Call of Duty: Modern Warfare 4 11 ч.
Стандартная клавиатура Android позволит растянуть смайлики — Google добавит в Gboard настройку размера эмодзи 11 ч.
«Мрачно. Красиво. Оптимизированно»: ролевой боевик Mortal Shell 2 стартовал в Steam с рейтингом 81 % 12 ч.
Doom запустили на 16-летней зеркалке Canon EOS 550D 12 ч.
Binance разрешила ИИ-агентам торговать криптовалютой от лица пользователя 13 ч.
ИИ-агент подсунул разработчику ПО вредоносный пакет — и тот чуть было не встроил его в проект 13 ч.
Автор утечек GTA VI показал полёт на «кукурузнике» и намекнул, что имеет прямой доступ к игре 13 ч.
Nvidia призналась, что не готовит LPU для китайского рынка, позволяющие ускорять ИИ 36 мин.
Google договорилась с Marvell о разработке ИИ-чипов 5 ч.
Новая статья: Обзор телевизора Hyundai 65" H-LED65BU7011: огромная диагональ недорого 6 ч.
AM4 отказывается умирать: Gigabyte выпустила новую плату B550 X Gaming с DDR4 для Ryzen 5000 6 ч.
Waymo впервые показала «мозг» роботакси — фирменный 5-нм чип на 1000 TOPS для обработки данных всех датчиков 7 ч.
Дроны Amazon начали ронять посылки в бассейны и водоёмы 10 ч.
«Гостиная на колёсах»: Genesis представила электрический внедорожник GV90 с огромным дисплеем 10 ч.
Роботакси Tesla в техасском Остине перешли на полностью беспилотный режим работы 11 ч.
Nothing представила наушники CMF Buds Neo с активным шумоподавлением, автономностью до 52 часов и ценой $21 11 ч.
Без NVIDIA: Rubytech показала возможность создания корпоративной ИИ-инфраструктуры на китайских GPU с российскими LLM 12 ч.