Сегодня 17 апреля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

Nvidia похвалилась, что Blackwell удешевили инференс нейросетей до 10 раз — и это заслуга не только «железа»

С развёртыванием ускорителей искусственного интеллекта на архитектуре Nvidia Blackwell стоимость инференса, то есть запуска обученных систем ИИ, удалось сократить в 4–10 раз. Такие данные привела сама Nvidia. Но за счёт одной только аппаратной части добиться подобных результатов не получилось бы.

 Источник изображений: nvidia.com

Источник изображений: nvidia.com

Значительного снижения затрат удалось добиться за счёт запуска ускорителей на архитектуре Nvidia Blackwell и моделей с открытым исходным кодом в инфраструктуре облачных операторов Baseten, DeepInfra, Fireworks AI и Together AI для задач, связанных со здравоохранением, играми, агентским ИИ и обслуживанием клиентов. Ещё один фактор — оптимизированные программные стеки. Перевод оборудования на Nvidia Blackwell помог сократить стоимость инференса вдвое по сравнению с ускорителями предыдущего поколения, а дальнейшему снижению затрат способствовал перевод систем в форматы пониженной точности, такие как NVFP4.

Компания Sully.ai добилась сокращения затрат на вывод данных ИИ в области здравоохранения на 90 %, то есть в десять раз; время отклика улучшилось на 65 % за счёт перехода от закрытых к открытым моделям ИИ в инфраструктуре Baseten. Автоматизация задач по написанию кода и ведению медицинских записей помогла сэкономить специалистам 30 млн минут рабочего времени. Latitude на своей платформе AI Dungeon сократила затраты на вывод данных ИИ в четыре раза. Для этого она запустила в инфраструктуре DeepInfra модели с конфигурацией «смеси экспертов» (MoE), снизив стоимость 1 млн токенов с $0,20 до $0,10, а перевод системы на низкоточный формат данных NVFP4 помог сократить цену до $0,05.

Sentient Foundation повысила экономическую эффективность платформы агентного чата на 25–50 % за счёт оптимизированного для Blackwell стека обработки данных Fireworks AI — платформа управления сложными рабочими процессами в неделю вирусного запуска обработала 5,6 млн запросов без ущерба для величины задержки. Decagon шестикратно снизила затраты на запрос для голосовой поддержки клиентов с ИИ, запустив многомодельный стек в инфраструктуре Together AI на ускорителях Blackwell. Время ответа сохранялось менее 400 мс даже при обработке нескольких тысяч токенов на запрос, что критически важно при голосовом взаимодействии, когда клиенты в любой момент могут прервать разговор.

Значение имеют характеристики рабочей нагрузки. ИИ-ускорители Blackwell успешно работают с «рассуждающими» ИИ-моделями, потому что для получения более качественных ответов те генерируют большее число токенов. Платформы эффективно обрабатывают эти расширенные последовательности за счёт дезагрегированного обслуживания — отдельной обработки предварительного заполнения контекста и собственно генерации токенов. При оценке затрат эти аспекты следует учитывать: при высоких объёмах генерации токенов можно добиться десятикратного повышения эффективности; уменьшенная генерация токенов в моделях высокой плотности ведёт лишь к четырёхкратному росту показателей.

В приведённых выше примерах речь идёт об ускорителях Nvidia Blackwell, но есть и альтернативные способы снижения затрат на вывод данных. Например, перевод систем на ускорители AMD Instinct MI300, Google TPU, а также специализированное оборудование Groq и Cerebras. Собственные средства оптимизации развёртывают и облачные провайдеры. Поэтому вопрос не в том, является ли архитектура Blackwell единственным вариантом, а в том, соответствует ли конкретное сочетание оборудования, ПО и моделей ИИ требованиям конкретной рабочей нагрузки.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Захотелось теперь отцом стать»: экспериментальный боевик Pragmata от Capcom стартовал в Steam с «крайне положительными» отзывами 15 мин.
Warhammer 40,000: Space Marine 2 превзошла «даже самые смелые мечты» издателя — на защиту Империума встали 12 миллионов космодесантников 2 ч.
МТС Exolve: как ставка на self-service за год изменила рынок коммуникаций для бизнеса 2 ч.
Российскую криптобиржу Grinex взломали и украли активы на 1 млрд рублей 2 ч.
Надёжный инсайдер подтвердил дату выхода Assassin’s Creed Black Flag Resynced — Ubisoft показала неуловимый ремейк журналистам 3 ч.
ИИ-агент OpenAI Codex получил многие улучшения в новой версии 7 ч.
Нуарный ретрошутер Mouse: P.I. For Hire стартовал в Steam с рейтингом 94 % 13 ч.
Nvidia выпустила драйвер с поддержкой Pragmata, Neverness to Everness и Windrose 16 ч.
Эпичный финал: для Atomic Heart вышло масштабное сюжетное дополнение «Кровь на Хрустале» 16 ч.
Anthropic представила флагманскую ИИ-модель Opus 4.7 — она стала «самостоятельнее» и лучше в сложных задачах 17 ч.
Xiaomi представила телевизоры Redmi TV A Pro 2026 — старшая 75" модель стоит меньше $500 2 ч.
Лояльность к iPhone превысила 96 % — пользователи Android готовы менять бренд почти в четыре раза чаще 2 ч.
Ветеран Apple, который выводил на рынок iPod, Watch и AirPods, уходит из компании после 31 года работы 3 ч.
Смартфон Huawei Mate 80 Pro с продвинутыми камерами и смарт-часы Watch GT Runner 2 для любителей бега поступили в продажу в России 3 ч.
Одноплатный компьютер Orange Pi Zero 3W в формате Raspberry Pi Zero получил чип Allwinner A733 и до 16 Гбайт ОЗУ 3 ч.
Intel наняла руководителя для своего контрактного бизнеса с опытом работы в Samsung 4 ч.
Tesla уже ищет на Тайване инженеров для своего американского мегазавода Terafab по выпуску чипов 4 ч.
OnePlus покинет ключевые рынки и сосредоточится на продажах в Китае 5 ч.
Акции ASML и TSMC упали в цене на фоне превосходной квартальной отчётности 5 ч.
Новая статья: Обзор Dreame X60 Ultra Complete: 4 × 4 в мире роботов-уборщиков 12 ч.