Сегодня 24 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google сократила потребление памяти ИИ-моделями в шесть раз без потери точности — с алгоритмом TurboQuant

Исследовательский отдел Google Research опубликовал работу о технологии TurboQuant — алгоритме квантизации, который сокращает разрядность KV-кеша больших языковых моделей до 3 битов без потери точности в ответах и без потребности в дополнительном обучении. В тестах на ускорителях искусственного интеллекта Nvidia H100 4-битный алгоритм TurboQuant (с четвёртым битом на коррекцию ошибок) помог восьмикратно повысить производительность при вычислении логитов внимания в сравнении с неквантованными 32-битными ключами; при этом объём KV-кеша сократился в шесть раз.

 Источник изображения: and machines / unsplash.com

Источник изображения: and machines / unsplash.com

В KV-кеше хранятся ранее вычисленные данные механизма внимания, чтобы модели не приходилось пересчитывать их на каждом шаге генерации токенов. По мере роста контекстного окна этот кеш существенно разрастается; традиционные методы квантования помогают уменьшить размер кеша, но за это приходится «расплачиваться» несколькими дополнительными битами на значение из-за констант квантования, которые хранятся вместе со сжатыми данными — это своего рода аналог словаря из традиционных алгоритмов архивирования данных ZIP и RAR. При большом размере контекстного окна эти накладные расходы всё равно оказываются значительными.

TurboQuant помогает устранить эти накладные расходы в двухэтапном процессе, то есть обходится вообще без словаря. На первом этапе срабатывает метод PolarQuant — преобразование векторов данных из декартовых в полярные координаты. Каждому вектору присваивается значение радиуса (длины) и угла (направления). Угловые распределения предсказуемы и сконцентрированы, поэтому PolarQuant обходится без ресурсоёмкого этапа нормализации каждого блока, который неизбежен с традиционными квантизаторами. На выходе получается сжатие высокого качества без накладных расходов на хранение констант внимания — словарей.

 Источник изображения: Conny Schneider / unsplash.com

Источник изображения: Conny Schneider / unsplash.com

На втором этапе применяется 1-битный слой коррекции ошибок с использованием квантованного алгоритма Джонсона-Линденштрауса. Остаточная ошибка квантования проецируется в пространство меньшей размерности, каждое значение сводится к одному знаковому биту, устраняя тем самым систематическую погрешность в вычислениях оценки внимания с незначительными дополнительными издержками.

Google протестировала две составляющих алгоритма TurboQuant в отдельности и их совместную работу в бенчмарках с длинным контекстом LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval на открытых моделях Gemma и Mistral. TurboQuant показал идеальные результаты в задачах класса поиска «иголки в стоге сена» добившись сжатия KV-кеша минимум в шесть раз. В группе тестов LongBench, включающей ответы на вопросы, генерацию кода и создание сводок, TurboQuant оказался не хуже, а то и лучше базового алгоритма сжатия KIVI по всем задачам.

TurboQuant показал эффективность не только в работе с большими языковыми моделями, но и в векторном поиске — его протестировали в сравнении с известными алгоритмами сжатия Product Quantization и RabbiQ на наборе данных GloVe. Даже без обучения и оптимизации разработанный в Google алгоритм показал более качественные результаты, чем его соперники, настроенные специально для работы с этим набором данных. TurboQuant вообще не требует ни обучения, ни тонкой настройки, а его выполнение сопровождается незначительными накладными расходами — он готов для развёртывания даже в условиях повышенной нагрузки.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Control Resonant стартовала в Steam с «очень положительными» отзывами, а GamesVoice открыла сбор средств на русскую озвучку игры 8 мин.
Rockstar выпустит коллекционное издание GTA VI за $400 без GTA VI в комплекте 58 мин.
Бывший дизайнер Starfield объяснил, почему Starfield 2 никогда не выйдет 2 ч.
Owlcat отложила релиз и раскрыла новые детали аддона «Процессия Проклятых» для Warhammer 40,000: Rogue Trader 3 ч.
Анонсирован безумный экшен в духе Metal Gear Rising: Revengeance, но с танком в главной роли — трейлер и первые подробности Slam Tank 4 ч.
ИИ уже участвует в каждом шестом взломе в мире — и тенденция усиливается 5 ч.
«Яндекс» представил ИИ-ассистента «Алиса AI Про» для бизнеса 6 ч.
Yandex B2B Tech расширила экосистему сервисов для бизнеса 6 ч.
В Африке создали компактную LLM, которая обошла более крупные модели Google и Meta — Morena знает 12 местных языков 7 ч.
Bethesda не убьёт «творческую идентичность» Obsidian после присоединения — разработчики Fallout: New Vegas не станут командой поддержки 8 ч.
Роботакси Waymo намотали 436 млн км без водителей — аварий с пострадавшими оказалось на 82 % меньше, чем у людей 51 мин.
Logitech представила реинкарнацию легендарного микрофона Blue Yeti: с датчиком приближения, ИИ-шумоподавлением, АРУ и цветным дисплеем 2 ч.
Американской Micron могут запретить поставлять DDR5 в США — Netlist добилась расследования USITC 2 ч.
Xiaomi представила первые телевизоры с RGB-Mini LED — TV S Pro RGB-Mini LED 2027 по цене от $894 3 ч.
Представлена внешняя видеокарта WiCi One для запуска ИИ — с Wi-Fi 7 и SSD на 4 Тбайт 4 ч.
Финское неооблако Verda Cloud Oy привлекло $189 млн на строительство передовой ИИ-инфраструктуры 4 ч.
Дорогая память пока не помешала Raspberry Pi — выручка взлетела на 90 %, прибыль более чем удвоилась 5 ч.
Китайская видеокарта Lisuan LX 7G100 должна была стать конкурентом RTX 4060 — но в играх едва обошла девятилетнюю RX 580 5 ч.
Maibenben выпустила в России игровые ноутбуки X-Treme X17F Typhoon и Tornado с чипами AMD Zen 4 по цене от 122 тыс. рублей 5 ч.
Как в «Семейке Аддамс»: швейцарские инженеры разработали кисть руки, которая сама передвигается и нажимает кнопки 6 ч.