Сегодня 04 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google сократила потребление памяти ИИ-моделями в шесть раз без потери точности — с алгоритмом TurboQuant

Исследовательский отдел Google Research опубликовал работу о технологии TurboQuant — алгоритме квантизации, который сокращает разрядность KV-кеша больших языковых моделей до 3 битов без потери точности в ответах и без потребности в дополнительном обучении. В тестах на ускорителях искусственного интеллекта Nvidia H100 4-битный алгоритм TurboQuant (с четвёртым битом на коррекцию ошибок) помог восьмикратно повысить производительность при вычислении логитов внимания в сравнении с неквантованными 32-битными ключами; при этом объём KV-кеша сократился в шесть раз.

 Источник изображения: and machines / unsplash.com

Источник изображения: and machines / unsplash.com

В KV-кеше хранятся ранее вычисленные данные механизма внимания, чтобы модели не приходилось пересчитывать их на каждом шаге генерации токенов. По мере роста контекстного окна этот кеш существенно разрастается; традиционные методы квантования помогают уменьшить размер кеша, но за это приходится «расплачиваться» несколькими дополнительными битами на значение из-за констант квантования, которые хранятся вместе со сжатыми данными — это своего рода аналог словаря из традиционных алгоритмов архивирования данных ZIP и RAR. При большом размере контекстного окна эти накладные расходы всё равно оказываются значительными.

TurboQuant помогает устранить эти накладные расходы в двухэтапном процессе, то есть обходится вообще без словаря. На первом этапе срабатывает метод PolarQuant — преобразование векторов данных из декартовых в полярные координаты. Каждому вектору присваивается значение радиуса (длины) и угла (направления). Угловые распределения предсказуемы и сконцентрированы, поэтому PolarQuant обходится без ресурсоёмкого этапа нормализации каждого блока, который неизбежен с традиционными квантизаторами. На выходе получается сжатие высокого качества без накладных расходов на хранение констант внимания — словарей.

 Источник изображения: Conny Schneider / unsplash.com

Источник изображения: Conny Schneider / unsplash.com

На втором этапе применяется 1-битный слой коррекции ошибок с использованием квантованного алгоритма Джонсона-Линденштрауса. Остаточная ошибка квантования проецируется в пространство меньшей размерности, каждое значение сводится к одному знаковому биту, устраняя тем самым систематическую погрешность в вычислениях оценки внимания с незначительными дополнительными издержками.

Google протестировала две составляющих алгоритма TurboQuant в отдельности и их совместную работу в бенчмарках с длинным контекстом LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval на открытых моделях Gemma и Mistral. TurboQuant показал идеальные результаты в задачах класса поиска «иголки в стоге сена» добившись сжатия KV-кеша минимум в шесть раз. В группе тестов LongBench, включающей ответы на вопросы, генерацию кода и создание сводок, TurboQuant оказался не хуже, а то и лучше базового алгоритма сжатия KIVI по всем задачам.

TurboQuant показал эффективность не только в работе с большими языковыми моделями, но и в векторном поиске — его протестировали в сравнении с известными алгоритмами сжатия Product Quantization и RabbiQ на наборе данных GloVe. Даже без обучения и оптимизации разработанный в Google алгоритм показал более качественные результаты, чем его соперники, настроенные специально для работы с этим набором данных. TurboQuant вообще не требует ни обучения, ни тонкой настройки, а его выполнение сопровождается незначительными накладными расходами — он готов для развёртывания даже в условиях повышенной нагрузки.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Мы не закончили»: глава Naughty Dog подтвердил работу над «парой проектов» по The Last of Us 2 ч.
«Пора всем остальным разработчикам равняться на Capcom»: первая за 20 лет новая Onimusha не разочаровала пользователей Steam 2 ч.
Люди бунтуют против ИИ и ЦОД — Альтман согласился, что отрасль сама в этом виновата 3 ч.
Anthropic помирилась с властями США, но не с Пентагоном — военные оставили создателя Claude в чёрном списке 3 ч.
Blizzard заинтриговала фанатов тизером новой StarCraft в разгар слухов о StarCraft 3 4 ч.
Nvidia официально выпустила DLSS 5 для GeForce RTX 50 — следующими поддержку получат RTX 40 4 ч.
Adobe сменила гендиректора впервые за 18 лет — чтобы справиться с наступлением ИИ 4 ч.
Государство и революция: следующее дополнение к Victoria 3 предложит возглавить Россию в эпоху самодержавия и перерождения 5 ч.
Разработчики Escape from Tarkov открыли издательский бизнес для хардкорных игр — Battlestate Games Publishing 6 ч.
OpenAI запустила Astra — свою самую мощную и противоречивую ИИ-модель 11 ч.
Ugreen представила хаб для безоблачного умного дома за $20 000 — внутри Nvidia Jetson Thor и 128 Гбайт памяти 7 мин.
Защищённый смартфон RugOne Xsnap 7 Pro со съёмной экшн-камерой поступит в продажу в октябре 19 мин.
Вышел одноплатный компьютер Orange Pi Zero 4 с поддержкой Wi-Fi 6 и дешевле $30 22 мин.
Складных iPhone на всех не хватит — Apple собирает лишь несколько сотен смартфонов в день, и больше не получается 25 мин.
Lenovo уместила Ryzen AI Max+ PRO 495 и 128 Гбайт памяти в 1,6-литровый ПК — четыре таких объединяются в ИИ-кластер 2 ч.
Дефицит памяти добрался до iPhone — новые модели подорожают на 10–20 %, а складной может стоить и $3000 3 ч.
Химический гигант BASF ополчился на Apple — компания требует запретить Face ID 3 ч.
Восемь лет в пути — и это только начало: BepiColombo наконец добрался до Меркурия 4 ч.
Саудовскую Аравию превращают в крупный ИИ-хаб 5 ч.
Представлены умные кольца Circular Ring 3 Pro и Slim с поддержкой NFC 6 ч.