Сегодня 20 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

SK hynix предложила неоригинальный костыль для ускорения ИИ-моделей — гибридную архитектуру памяти HBM/HBF

Светлая мысль разместить больше памяти рядом с процессором пришла не в одну голову. Год назад о разработке концепции замены памяти HBM (DRAM) памятью HBF (флеш) сообщила компания SanDisk. На днях работу о таком подходе опубликовала компания SK Hynix. Флеш-память NAND попросту плотнее памяти DRAM, и с позиции увеличения места под токены для ИИ замена одной на другую даст впечатляющий результат в виде роста скорости принятия решений.

 Источник изображения: SK Hynix

Источник изображения: SK Hynix

Не секрет, что современные платформы на базе центральных, графических и тензорных процессоров сталкиваются с серьёзным ограничением по объёму приданной им памяти High Bandwidth Memory (HBM), что сплошь и рядом происходит при работе с большими языковыми моделями. Например, модели вроде Llama 4 поддерживают до 10 млн токенов, что требует кэш объёмом до 5,4 Тбайт. Стандартные решения, такие как частичный сброс кэша на локальные SSD, приводят к значительным задержкам из-за низкой пропускной способности шины и медленного доступа к накопителям. В результате образуется узкое место по пропускной способности, что можно обойти только наращиванием массива ускорителей, а это — лишние деньги и энергопотребление.

Предложенная компанией SK hynix гибридная иерархия памяти или архитектура H³ (Hybrid³), объединяющая HBM и новый пока тип памяти High Bandwidth Flash (HBF) на одном интерпозере вместе с процессором, решает проблему нехватки памяти для токенов ИИ. Память HBM продолжит использоваться так же, как и раньше — для данных с высокой частотой записи и чтения (динамически генерируемый кэш), а HBF — для данных с интенсивным чтением.

Использование флеш-памяти HBF обеспечит до 16 раз большую ёмкость при пропускной способности, близкой к HBM, хотя задержка доступа останется выше на один или даже два порядка, износостойкость будет ниже, а энергопотребление может быть в 4 раза больше. В то же время массив гибридной памяти окажется единым для процессора, а грамотная маршрутизация запросов сведёт на нет все негативные последствия «тормозов» флеш-памяти.

Результаты моделирования на конфигурации Nvidia Blackwell GPU с 8 стеками HBM3E и 8 стеками HBF на интерпозере демонстрируют впечатляющие улучшения. При 1 млн токенов контекста производительность в токенах в секунду вырастает в 1,25 раза, при 10 млн токенов — уже в 6,14 раза по сравнению с чисто HBM-системой, а энергоэффективность становится выше в 2,69 раза. И если раньше для обработки запросов такого масштаба требовалось 32 GPU, то теперь работа может быть выполнена всего на 2 GPU с существенным снижением энергозатрат и общей стоимости системы. Ради такого стоит рискнуть и создать коммерческие решения, считают в компании.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: The Blood of Dawnwalker — начало чего-то выдающегося. Рецензия 2 ч.
Путь на дно: суд обязал Microsoft раскрыть внутренние документы и переписку топ-менеджеров в деле о перепродаже лицензий на ПО 8 ч.
Персональный ИИ-агент Muse от Meta возглавил рейтинг App Store всего через неделю после релиза 12 ч.
SpaceXAI удвоила точность распознавания речи в новой модели Grok Voice Transcribe 2.0 13 ч.
Anthropic сделала первый шаг к замедлению ИИ — Accenture будет проверять Claude изнутри 13 ч.
Европейские разработчики ИИ выступили против призывов США замедлить темп 15 ч.
Alibaba выпустила всеядную модель Qwen3.8-Omni-Flash с контекстом на 1 млн токенов 16 ч.
Anthropic до IPO собирается выпустить ИИ-модель, которая станет ответом на OpenAI GPT-6 Astra 18 ч.
Новая статья: Doloc Town — достойная наследница Stardew Valley. Рецензия 19-09 00:10
Фэнтезийная 4X-стратегия Endless Legend 2 покинула ранний доступ — онлайн в Steam вырос в 10 раз 18-09 22:47
Китайские учёные нашли путь к 3-нм чипам в обход санкций и EUV-литографии 13 мин.
Урезанная Radeon RX 9050 с 4 Гбайт памяти оказалась в среднем на 37 % медленнее версии с 8 Гбайт 8 ч.
Исследователь OpenAI предупредил: ИИ-агенты способны общаться даже на отключённых от Сети компьютерах 9 ч.
Создана не имеющая аналогов плёночная теплоизоляция — она сдерживает тепло в пять раз лучше силикона 9 ч.
До 64 Пбайт для KV-кеша: Huawei представила платформу хранения OceanStor M900 для ИИ ЦОД 10 ч.
Китай взял под контроль рынок ЖК-панелей — теперь Samsung и LG придётся платить больше 12 ч.
«Искусственные листья» научили добывать водород из грязной морской воды — для этого нужен только солнечный свет 13 ч.
HP представила ноутбук со 192 Гбайт памяти — 160 Гбайт можно отдать встроенной Radeon 13 ч.
Контракт на миллиард: NASA заказало ещё три пилотируемых миссии SpaceX Crew Dragon 16 ч.
Выручка OpenAI к концу 2030 года вырастет до $350 млрд, но всё равно не сможет покрыть расходы 19 ч.