Сегодня 30 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Теги → кеширование

Китайцы научили ИИ общаться без слов — модели передают друг другу содержимое памяти и работают на 150 % быстрее

Учёные китайского Университета Цинхуа представили метод, позволяющий различным моделям искусственного интеллекта общаться друг с другом напрямую без генерации текста. Метод получил название Cache-to-Cache (C2C), разработчикам уже доступен исходный код решения.

 Источник изображения: Steve A Johnson / unsplash.com

Источник изображения: Steve A Johnson / unsplash.com

Сейчас при совместной деятельности нескольких языковых моделей в рамках единого конвейера обработки данных взаимодействие между ними осуществляется недостаточно эффективно — одной приходится преобразовывать результаты своих «рассуждений» в текстовые предложения, чтобы вторая могла их прочитать. При генерации текста расходуются вычислительные ресурсы и теряются некоторые мелкие детали. Данные обо всех обработанных ранее сведениях модель ИИ хранит в оперативной памяти (кеше). Технология C2C исключает работу с текстовым языком — одна модель передаёт содержимое своей оперативной памяти в память другой модели.

За процесс передачи отвечает вспомогательная программа Fuser — она преобразует и адаптирует данные таким образом, чтобы вторая могла ими пользоваться. Различные модели ИИ используют совершенно разные внутренние форматы, объёмы и структуры для хранения данных, поэтому простая передача «сырой» информации, вероятно, привела бы к сбоям в работе или потере связности ответов. Чтобы избежать этого, C2C предусматривает интеллектуальный фильтр, определяющий, какие фрагменты поступающих данных следует принять и усвоить немедленно. Одни внутренние слои принимают новую информацию сразу, а другие продолжают выполнять вычисления автономно, без внешнего вмешательства. Этот подход, утверждают исследователи, при выполнении совместных задач позволяет увеличить скорость работы моделей ИИ на 100–150 %. Точность работы по сравнению с обработкой данных в автономном режиме возрастает на 14,2 %; точность прямого обмена информацией по сравнению с текстовым форматом возрастает на величину 3,1–5,4 %.

Пока метод применим только к моделям с открытыми весами, потому что требуется прямой доступ к кешу и структуре слоёв модели. Генерация текста при совместной работе двух моделей всегда замедляла работу машин, указывают исследователи, потому что вынуждала ИИ «мыслить» подобно людям.

SK hynix предложила неоригинальный костыль для ускорения ИИ-моделей — гибридную архитектуру памяти HBM/HBF

Светлая мысль разместить больше памяти рядом с процессором пришла не в одну голову. Год назад о разработке концепции замены памяти HBM (DRAM) памятью HBF (флеш) сообщила компания SanDisk. На днях работу о таком подходе опубликовала компания SK Hynix. Флеш-память NAND попросту плотнее памяти DRAM, и с позиции увеличения места под токены для ИИ замена одной на другую даст впечатляющий результат в виде роста скорости принятия решений.

 Источник изображения: SK Hynix

Источник изображения: SK Hynix

Не секрет, что современные платформы на базе центральных, графических и тензорных процессоров сталкиваются с серьёзным ограничением по объёму приданной им памяти High Bandwidth Memory (HBM), что сплошь и рядом происходит при работе с большими языковыми моделями. Например, модели вроде Llama 4 поддерживают до 10 млн токенов, что требует кэш объёмом до 5,4 Тбайт. Стандартные решения, такие как частичный сброс кэша на локальные SSD, приводят к значительным задержкам из-за низкой пропускной способности шины и медленного доступа к накопителям. В результате образуется узкое место по пропускной способности, что можно обойти только наращиванием массива ускорителей, а это — лишние деньги и энергопотребление.

Предложенная компанией SK hynix гибридная иерархия памяти или архитектура H³ (Hybrid³), объединяющая HBM и новый пока тип памяти High Bandwidth Flash (HBF) на одном интерпозере вместе с процессором, решает проблему нехватки памяти для токенов ИИ. Память HBM продолжит использоваться так же, как и раньше — для данных с высокой частотой записи и чтения (динамически генерируемый кэш), а HBF — для данных с интенсивным чтением.

Использование флеш-памяти HBF обеспечит до 16 раз большую ёмкость при пропускной способности, близкой к HBM, хотя задержка доступа останется выше на один или даже два порядка, износостойкость будет ниже, а энергопотребление может быть в 4 раза больше. В то же время массив гибридной памяти окажется единым для процессора, а грамотная маршрутизация запросов сведёт на нет все негативные последствия «тормозов» флеш-памяти.

Результаты моделирования на конфигурации Nvidia Blackwell GPU с 8 стеками HBM3E и 8 стеками HBF на интерпозере демонстрируют впечатляющие улучшения. При 1 млн токенов контекста производительность в токенах в секунду вырастает в 1,25 раза, при 10 млн токенов — уже в 6,14 раза по сравнению с чисто HBM-системой, а энергоэффективность становится выше в 2,69 раза. И если раньше для обработки запросов такого масштаба требовалось 32 GPU, то теперь работа может быть выполнена всего на 2 GPU с существенным снижением энергозатрат и общей стоимости системы. Ради такого стоит рискнуть и создать коммерческие решения, считают в компании.


window-new
Soft
Hard
Тренды 🔥
Orion soft представил собственный протокол доставки виртуальных рабочих столов и приложений в обновлении Termit 24 мин.
PlayStation 5 взломана: новый джейлбрейк Relapse поддерживает PS5 и PS5 Pro и работает даже на свежекупленных консолях 31 мин.
OpenAI своими новыми функциями бросила вызов традиционной модели магазинов приложений 2 ч.
Журналисты раскрыли новые скриншоты и подробности GTA VI — животный мир, переработанная погода из RDR 2 и думскроллинг 3 ч.
Cloud.ru разместит второй выпуск биржевых облигаций объёмом не менее 10 млрд рублей 10 ч.
Платформа NVIDIA Open Agent Safety Platform обеспечит безопасное использование ИИ-агентов — от тестирования до развёртывания 10 ч.
На OpenAI подали в суд за взлом Hugging Face и игнорирование рисков автономного ИИ 10 ч.
OpenAI представила GPT‑6.1 Sol — почти как флагманская GPT‑6 Astra в сложных задачах, но в пять раз дешевле 11 ч.
AMD выпустила драйвер с поддержкой кампании Call of Duty: Modern Warfare 4, ремастера The Witcher 3: Wild Hunt, Gears of War: E-Day и других новых игр 13 ч.
OpenAI представила Dots — ИИ-агентов с собственными компьютерами, которые могут работать круглосуточно без пользователя 13 ч.
Вышел вычислительный модуль Walnut Pi CM2 — альтернатива Raspberry Pi CM5 на платформе Allwinner 45 мин.
Лондонцам завезут тепло от ЦОД — на баржах и по трубам 48 мин.
OpenAI вышла на годовой объём выручки $70 млрд и собирается привлечь ещё $30 млрд до IPO 2 ч.
Американские ИИ-гиганты в присутствии Трампа договорились о саморегулировании в области безопасности 3 ч.
Gigabyte выпустила Micro-ATX-плату B760M Aorus Ari WiFi6E в аниме-дизайне, с поддержкой графики PCIe 5.0 и DDR4 6 ч.
iFixit выявили первое реальное улучшение ремонтопригодности в наушниках Apple AirPods 5 7 ч.
Новая статья: Обзор материнской платы MSI Z890 GAMING PLUS WIFI6E: дешевле не значит хуже? 9 ч.
Оператор ЦОД Virtus привлёк рекордные £2,45 млрд на развитие ЦОД в Великобритании и материковой Европе 9 ч.
Дженсен Хуанг уверен в завтрашнем дне — NVIDIA увеличила сумму выкупа акций и планирует повысить дивиденды 10 ч.
Новая статья: Обзор UWQHD VA-монитора DIGMA Overdrive 34A712Q: для ценителей 11 ч.