Сегодня 26 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

SRAM какой-то: Nvidia представила чип Groq 3 LPU для ускорения инференса ИИ-моделей на уровне токенов

На прошедшей в этом году конференции GTC генеральный директор Nvidia Дженсен Хуанг (Jensen Huang) сообщил, что в этом году платформа Vera Rubin получит расширение. Nvidia использует для этого интеллектуальную собственность, приобретённую у Groq. В состав Rubin вошёл новый чип Nvidia Groq 3 LPU. Компания определяет его как ускоритель инференса. Его задача — выдавать токены в большом объёме и с низкой задержкой.

 Источник изображений: Nvidia

Источник изображений: Nvidia

Платформа Rubin уже включает шесть компонентов, из которых Nvidia собирает стоечные системы и затем масштабирует их до ИИ-фабрик. Это GPU Rubin, CPU Vera, коммутаторы внутрисистемного масштабирования NVLink 6, интеллектуальный сетевой адаптер ConnectX-9, процессор обработки данных BlueField-4 и коммутатор межсистемного масштабирования Spectrum-X с совместно интегрированной оптикой. Groq 3 LPU стал новым элементом этой платформы и ещё одним строительным блоком Rubin при масштабном развёртывании.

Groq 3 LPU отличается от большинства ИИ-ускорителей схемой памяти. Обычно такие системы используют HBM в качестве рабочего уровня памяти. Каждый Groq 3 LPU содержит 500 Мбайт SRAM. Для сравнения, каждый GPU Rubin оснащён 288 Гбайт HBM4. По ёмкости разница велика. По пропускной способности соотношение иное: SRAM обеспечивает до 150 Тбайт/с, а HBM4 — около 22 Тбайт/с. Для ИИ-задач, чувствительных к пропускной способности, рост этого показателя даёт преимущество при инференсе. Именно поэтому Nvidia вводит Groq 3 в состав Rubin.

Стойка Groq 3 LPX включает 256 чипов Groq 3 LPU. Такая система располагает 128 Гбайт SRAM. Её суммарная пропускная способность достигает 40 Пбайт/с. Для объединения чипов внутри стойки предусмотрен выделенный интерфейс внутрисистемного масштабирования. Его пропускная способность составляет 640 Тбайт/с на стойку.

Вице-президент Nvidia по гипермасштабируемым решениям Иэн Бак (Ian Buck) назвал Groq LPX сопроцессором для Rubin. По его словам, он повысит производительность декодирования «на каждом слое ИИ-модели на каждом токене». Nvidia связывает это решение со следующим рубежом ИИ — мультиагентными системами. Речь идёт о сценариях, где нужно обеспечивать интерактивную работу при инференсе моделей с триллионами параметров и окнами контекста в миллионы токенов.

Когда ИИ-агенты всё чаще обмениваются данными друг с другом, а не с человеком в окне чат-бота, меняется и порог приемлемого отклика. Скорость, достаточная для человека, оказывается слишком низкой для ИИ-агента. Бак описывает переход от мира, где разумным считался уровень 100 токенов в секунду, к уровню 1 500 токенов в секунду и выше для межагентного обмена.

Добавление Groq 3 LPU должно усилить позиции Rubin в сегменте низколатентного инференса. В тексте в качестве конкурента названа Cerebras. Компания использует процессоры Wafer-Scale Engine (WSE), выполненные на целой кремниевой пластине, где большие объёмы SRAM объединены с вычислениями для низколатентного инференса на продвинутых моделях. OpenAI также привлекала мощности Cerebras для обслуживания части передовых моделей из-за выгодных характеристик задержки этой платформы.

Иэн Бак также допустил, что появление Groq 3 LPU может сократить роль ускорителя инференса Rubin CPX. Он сказал, что сейчас Nvidia сосредоточена на интеграции стойки Groq 3 LPX с Rubin. Дополнительных подробностей он не привёл. При этом оба чипа рассчитаны на сходное усиление инференса, но Groq LPU не требует большого объёма памяти GDDR7, который нужен каждому модулю Rubin CPX.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источники:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Supergiant отметила годовщину Hades 2 бесплатным музыкальным концертом по игре и анонсом документального фильма о разработке 3 ч.
ИИ-агент OpenAI снова выбрался в интернет после усиления защиты — чтобы уточнить столицу Франции 4 ч.
ИИ-агенты OpenAI слили в интернет 53 изображения пользователей ChatGPT — заметили это лишь спустя время 5 ч.
Claude нашёл «новый CRISPR», но учёные засомневались в значимости открытия Anthropic 7 ч.
ИИ-агенты OpenAI оставили миллион следов взлома Hugging Face в открытом интернете 7 ч.
Qualcomm раскрыла план по освобождению от монополии Nvidia в сфере ИИ 10 ч.
ИИ-агенты OpenAI массово атаковали базы данных онлайн в поисках малоизвестных сведений 11 ч.
Дональд Трамп и Си Цзиньпин обсудили вопросы безопасности ИИ при личной встрече, но воздержались от подробных заявлений 12 ч.
Апелляционный суд США оставил за Anthropic статус угрозы для национальной безопасности 12 ч.
OpenAI в ближайшие недели выпустит предварительную версию ИИ-модели GPT-6 Cyber для сферы кибербезопасности 14 ч.
Google отправит ИИ-сервер в космос уже на следующей неделе, но работать он сможет лишь по 15 минут 4 ч.
Обнаружить микробную жизнь на спутнике Сатурна Энцеладе может оказаться проще 7 ч.
К запуску подготовлен первый аппарат Otter для сервисного обслуживания спутников в космосе 10 ч.
Подорожавшая память грозит добить дешёвые ноутбуки — Qualcomm обещает спасение в виде Snapdragon C 11 ч.
Solidigm собралась привлечь $15 млрд в ходе IPO, которое станет крупнейшим в истории США 14 ч.
Tesla пока не может выйти на запланированный объём производства 20 000 роботов Optimus в неделю 15 ч.
MSI представила три AM4-платы на чипсете AMD B550 для процессоров Ryzen 3000, 4000G и 5000 15 ч.
Слухи: Apple до конца года выпустит iPad mini с OLED-экраном, колонки HomePod mini 2 и приставки Apple TV 4K 21 ч.
Noctua захотела охлаждать мощные чипы в ПК по-серверному — компания адаптирует микроканальную технологию 24 ч.
Google отправит ИИ-чипы TPU в космос уже на следующей неделе 25-09 19:21