Сегодня 15 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

SRAM какой-то: Nvidia представила чип Groq 3 LPU для ускорения инференса ИИ-моделей на уровне токенов

На прошедшей в этом году конференции GTC генеральный директор Nvidia Дженсен Хуанг (Jensen Huang) сообщил, что в этом году платформа Vera Rubin получит расширение. Nvidia использует для этого интеллектуальную собственность, приобретённую у Groq. В состав Rubin вошёл новый чип Nvidia Groq 3 LPU. Компания определяет его как ускоритель инференса. Его задача — выдавать токены в большом объёме и с низкой задержкой.

 Источник изображений: Nvidia

Источник изображений: Nvidia

Платформа Rubin уже включает шесть компонентов, из которых Nvidia собирает стоечные системы и затем масштабирует их до ИИ-фабрик. Это GPU Rubin, CPU Vera, коммутаторы внутрисистемного масштабирования NVLink 6, интеллектуальный сетевой адаптер ConnectX-9, процессор обработки данных BlueField-4 и коммутатор межсистемного масштабирования Spectrum-X с совместно интегрированной оптикой. Groq 3 LPU стал новым элементом этой платформы и ещё одним строительным блоком Rubin при масштабном развёртывании.

Groq 3 LPU отличается от большинства ИИ-ускорителей схемой памяти. Обычно такие системы используют HBM в качестве рабочего уровня памяти. Каждый Groq 3 LPU содержит 500 Мбайт SRAM. Для сравнения, каждый GPU Rubin оснащён 288 Гбайт HBM4. По ёмкости разница велика. По пропускной способности соотношение иное: SRAM обеспечивает до 150 Тбайт/с, а HBM4 — около 22 Тбайт/с. Для ИИ-задач, чувствительных к пропускной способности, рост этого показателя даёт преимущество при инференсе. Именно поэтому Nvidia вводит Groq 3 в состав Rubin.

Стойка Groq 3 LPX включает 256 чипов Groq 3 LPU. Такая система располагает 128 Гбайт SRAM. Её суммарная пропускная способность достигает 40 Пбайт/с. Для объединения чипов внутри стойки предусмотрен выделенный интерфейс внутрисистемного масштабирования. Его пропускная способность составляет 640 Тбайт/с на стойку.

Вице-президент Nvidia по гипермасштабируемым решениям Иэн Бак (Ian Buck) назвал Groq LPX сопроцессором для Rubin. По его словам, он повысит производительность декодирования «на каждом слое ИИ-модели на каждом токене». Nvidia связывает это решение со следующим рубежом ИИ — мультиагентными системами. Речь идёт о сценариях, где нужно обеспечивать интерактивную работу при инференсе моделей с триллионами параметров и окнами контекста в миллионы токенов.

Когда ИИ-агенты всё чаще обмениваются данными друг с другом, а не с человеком в окне чат-бота, меняется и порог приемлемого отклика. Скорость, достаточная для человека, оказывается слишком низкой для ИИ-агента. Бак описывает переход от мира, где разумным считался уровень 100 токенов в секунду, к уровню 1 500 токенов в секунду и выше для межагентного обмена.

Добавление Groq 3 LPU должно усилить позиции Rubin в сегменте низколатентного инференса. В тексте в качестве конкурента названа Cerebras. Компания использует процессоры Wafer-Scale Engine (WSE), выполненные на целой кремниевой пластине, где большие объёмы SRAM объединены с вычислениями для низколатентного инференса на продвинутых моделях. OpenAI также привлекала мощности Cerebras для обслуживания части передовых моделей из-за выгодных характеристик задержки этой платформы.

Иэн Бак также допустил, что появление Groq 3 LPU может сократить роль ускорителя инференса Rubin CPX. Он сказал, что сейчас Nvidia сосредоточена на интеграции стойки Groq 3 LPX с Rubin. Дополнительных подробностей он не привёл. При этом оба чипа рассчитаны на сходное усиление инференса, но Groq LPU не требует большого объёма памяти GDDR7, который нужен каждому модулю Rubin CPX.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Rayman Legends Retold не выйдет 1 октября — «дерзкое переосмысление» классического платформера задержится на два месяца 2 ч.
Энтузиасты запустили Need for Speed Underground 2 на Nintendo Switch, и это только начало 2 ч.
Gartner: ИИ и ИИ-компании всё ещё не созрели для корпоративного использования 12 ч.
iOS 27 стала доступна на всех совместимых iPhone — но умная Siri AI и новые функции Apple Intelligence доступны не всем 13 ч.
Постапокалиптическая стратегия The Crab is Walking от создателей The King is Watching отправит строить город на крабьих ножках 15 ч.
Microsoft установила ограничения для будущих ИИ-моделей, пока отрасль готовится к замедлению 15 ч.
«Спровоцировали хаос»: создатели ИИ дружно спохватились, что его развитие выходит из-под контроля 15 ч.
Торговая марка рассекретила название сиквела Lies of P — похоже, игра станет адаптацией «Волшебника страны Оз» 16 ч.
Новый трейлер подтвердил дату выхода The Veti's Wrath — масштабного аддона для олдскульной стратегии Tempest Rising в духе Command & Conquer 17 ч.
Календарь релизов 14–20 сентября: Marvel’s Wolverine, Active Matter, Blackwood, Aniimo и Woodo 17 ч.
Новые MacBook, iPad и не только: Apple представит 16 новинок до середины 2027 года 20 мин.
Российский бизнес просит у государства льготные кредиты и лизинг на GPU и серверы — ИИ-инфраструктура слишком дорога 25 мин.
В России стартовали продажи смартфонов Oppo Reno16 с продвинутыми камерами и поддержкой ИИ 2 ч.
OpenAI поглотила производителя камер для смартфонов Glass Imaging за $300 миллионов 2 ч.
Китайцы создали солнечный элемент для подлодки — он работает на глубине 2 ч.
Это не дикий зверь, который сбежит сам по себе: глава Broadcom призвал не бояться ИИ 2 ч.
Выручка полупроводникового сектора во втором квартале взлетела на 31,4 % до рекордных $425 млрд 3 ч.
Трамп позвонил Хуангу и заверил, что роботы не поработят американцев 6 ч.
HKC представила 43,8-дюймовый изогнутый игровой монитор Tianqi 43H180C с необычным соотношением сторон 24:9 6 ч.
Новая статья: Обзор материнской платы MSI MAG X870E TOMAHAWK MAX WiFi 11 ч.