Сегодня 08 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

SRAM какой-то: Nvidia представила чип Groq 3 LPU для ускорения инференса ИИ-моделей на уровне токенов

На прошедшей в этом году конференции GTC генеральный директор Nvidia Дженсен Хуанг (Jensen Huang) сообщил, что в этом году платформа Vera Rubin получит расширение. Nvidia использует для этого интеллектуальную собственность, приобретённую у Groq. В состав Rubin вошёл новый чип Nvidia Groq 3 LPU. Компания определяет его как ускоритель инференса. Его задача — выдавать токены в большом объёме и с низкой задержкой.

 Источник изображений: Nvidia

Источник изображений: Nvidia

Платформа Rubin уже включает шесть компонентов, из которых Nvidia собирает стоечные системы и затем масштабирует их до ИИ-фабрик. Это GPU Rubin, CPU Vera, коммутаторы внутрисистемного масштабирования NVLink 6, интеллектуальный сетевой адаптер ConnectX-9, процессор обработки данных BlueField-4 и коммутатор межсистемного масштабирования Spectrum-X с совместно интегрированной оптикой. Groq 3 LPU стал новым элементом этой платформы и ещё одним строительным блоком Rubin при масштабном развёртывании.

Groq 3 LPU отличается от большинства ИИ-ускорителей схемой памяти. Обычно такие системы используют HBM в качестве рабочего уровня памяти. Каждый Groq 3 LPU содержит 500 Мбайт SRAM. Для сравнения, каждый GPU Rubin оснащён 288 Гбайт HBM4. По ёмкости разница велика. По пропускной способности соотношение иное: SRAM обеспечивает до 150 Тбайт/с, а HBM4 — около 22 Тбайт/с. Для ИИ-задач, чувствительных к пропускной способности, рост этого показателя даёт преимущество при инференсе. Именно поэтому Nvidia вводит Groq 3 в состав Rubin.

Стойка Groq 3 LPX включает 256 чипов Groq 3 LPU. Такая система располагает 128 Гбайт SRAM. Её суммарная пропускная способность достигает 40 Пбайт/с. Для объединения чипов внутри стойки предусмотрен выделенный интерфейс внутрисистемного масштабирования. Его пропускная способность составляет 640 Тбайт/с на стойку.

Вице-президент Nvidia по гипермасштабируемым решениям Иэн Бак (Ian Buck) назвал Groq LPX сопроцессором для Rubin. По его словам, он повысит производительность декодирования «на каждом слое ИИ-модели на каждом токене». Nvidia связывает это решение со следующим рубежом ИИ — мультиагентными системами. Речь идёт о сценариях, где нужно обеспечивать интерактивную работу при инференсе моделей с триллионами параметров и окнами контекста в миллионы токенов.

Когда ИИ-агенты всё чаще обмениваются данными друг с другом, а не с человеком в окне чат-бота, меняется и порог приемлемого отклика. Скорость, достаточная для человека, оказывается слишком низкой для ИИ-агента. Бак описывает переход от мира, где разумным считался уровень 100 токенов в секунду, к уровню 1 500 токенов в секунду и выше для межагентного обмена.

Добавление Groq 3 LPU должно усилить позиции Rubin в сегменте низколатентного инференса. В тексте в качестве конкурента названа Cerebras. Компания использует процессоры Wafer-Scale Engine (WSE), выполненные на целой кремниевой пластине, где большие объёмы SRAM объединены с вычислениями для низколатентного инференса на продвинутых моделях. OpenAI также привлекала мощности Cerebras для обслуживания части передовых моделей из-за выгодных характеристик задержки этой платформы.

Иэн Бак также допустил, что появление Groq 3 LPU может сократить роль ускорителя инференса Rubin CPX. Он сказал, что сейчас Nvidia сосредоточена на интеграции стойки Groq 3 LPX с Rubin. Дополнительных подробностей он не привёл. При этом оба чипа рассчитаны на сходное усиление инференса, но Groq LPU не требует большого объёма памяти GDDR7, который нужен каждому модулю Rubin CPX.

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft Edge прекратит поддержку Manifest V2 и отключит блокировщика рекламы uBlock Origin до конца 2026 года 5 ч.
Новая статья: Kusan: City of Wolves — горячая линия с животными. Рецензия 10 ч.
Breathedge стала бесплатной на 48 часов, а Breathedge 2 готовится ворваться в ранний доступ Steam 11 ч.
Новый геймплейный трейлер подтвердил дату выхода Serious Sam: Shatterverse — адреналинового шутера на пятерых про мультивселенную Сэмов 12 ч.
В Google Chrome для Android появилась навигационная панель с кнопкой Gemini 12 ч.
Конец не так и близок: последний сезон сериала «Ведьмак» от Netflix не выйдет в 2026 году 14 ч.
Google открыла исходный код ИИ-модели, которая предупреждает об ураганах 14 ч.
«Беспрецедентные» предзаказы GTA VI подорвали продажи GTA V — меньше миллиона копий за три месяца 15 ч.
За сутки ИИ выявил несколько сотен уязвимостей в экосистеме биткоина 16 ч.
В Южной Корее создали навигатор, который прокладывает маршрут по тени, а не по расстоянию 17 ч.
Nvidia не будет успевать за спросом на компоненты ЦОД и в следующем году, это ограничит темпы экспансии SpaceX в сегменте 4 ч.
Google DeepMind считает, что память типа HBF будет востребована в инференсе 4 ч.
Руководить продажами в Intel назначен Дин Жарнак, имеющий опыт работы в Marvell 5 ч.
Lumilens вышла из скрытого режима и привлекла $700 млн с оценкой в $5,51 млрд 8 ч.
Для марсианских вертолётов нового поколения сделали гибкие антенны георадаров — они будут искать залежи воды 12 ч.
Китай снова попытается запустить и посадить аналог Falcon 9 — ракета Zhuque-3 стартует 11 августа 12 ч.
Tesla признала массовый дефект Cybertruck и бесплатно заменит узел, за ремонт которого до сих пор брала до $7200 12 ч.
SSD научатся быстрее обмениваться данными с GPU — Nvidia откроет исходный код cuFile 12 ч.
Тайваньская Nanya намерена заработать на ИИ, вложив $10,7 млрд в передовую фабрику DRAM с EUV 17 ч.
Impact Drones готовит автономные дроны-перехватчики для защиты ЦОД 17 ч.