Сегодня 02 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Google сократила потребление памяти ИИ-моделями в шесть раз без потери точности — с алгоритмом TurboQuant

Исследовательский отдел Google Research опубликовал работу о технологии TurboQuant — алгоритме квантизации, который сокращает разрядность KV-кеша больших языковых моделей до 3 битов без потери точности в ответах и без потребности в дополнительном обучении. В тестах на ускорителях искусственного интеллекта Nvidia H100 4-битный алгоритм TurboQuant (с четвёртым битом на коррекцию ошибок) помог восьмикратно повысить производительность при вычислении логитов внимания в сравнении с неквантованными 32-битными ключами; при этом объём KV-кеша сократился в шесть раз.

 Источник изображения: and machines / unsplash.com

Источник изображения: and machines / unsplash.com

В KV-кеше хранятся ранее вычисленные данные механизма внимания, чтобы модели не приходилось пересчитывать их на каждом шаге генерации токенов. По мере роста контекстного окна этот кеш существенно разрастается; традиционные методы квантования помогают уменьшить размер кеша, но за это приходится «расплачиваться» несколькими дополнительными битами на значение из-за констант квантования, которые хранятся вместе со сжатыми данными — это своего рода аналог словаря из традиционных алгоритмов архивирования данных ZIP и RAR. При большом размере контекстного окна эти накладные расходы всё равно оказываются значительными.

TurboQuant помогает устранить эти накладные расходы в двухэтапном процессе, то есть обходится вообще без словаря. На первом этапе срабатывает метод PolarQuant — преобразование векторов данных из декартовых в полярные координаты. Каждому вектору присваивается значение радиуса (длины) и угла (направления). Угловые распределения предсказуемы и сконцентрированы, поэтому PolarQuant обходится без ресурсоёмкого этапа нормализации каждого блока, который неизбежен с традиционными квантизаторами. На выходе получается сжатие высокого качества без накладных расходов на хранение констант внимания — словарей.

 Источник изображения: Conny Schneider / unsplash.com

Источник изображения: Conny Schneider / unsplash.com

На втором этапе применяется 1-битный слой коррекции ошибок с использованием квантованного алгоритма Джонсона-Линденштрауса. Остаточная ошибка квантования проецируется в пространство меньшей размерности, каждое значение сводится к одному знаковому биту, устраняя тем самым систематическую погрешность в вычислениях оценки внимания с незначительными дополнительными издержками.

Google протестировала две составляющих алгоритма TurboQuant в отдельности и их совместную работу в бенчмарках с длинным контекстом LongBench, Needle In A Haystack, ZeroSCROLLS, RULER и L-Eval на открытых моделях Gemma и Mistral. TurboQuant показал идеальные результаты в задачах класса поиска «иголки в стоге сена» добившись сжатия KV-кеша минимум в шесть раз. В группе тестов LongBench, включающей ответы на вопросы, генерацию кода и создание сводок, TurboQuant оказался не хуже, а то и лучше базового алгоритма сжатия KIVI по всем задачам.

TurboQuant показал эффективность не только в работе с большими языковыми моделями, но и в векторном поиске — его протестировали в сравнении с известными алгоритмами сжатия Product Quantization и RabbiQ на наборе данных GloVe. Даже без обучения и оптимизации разработанный в Google алгоритм показал более качественные результаты, чем его соперники, настроенные специально для работы с этим набором данных. TurboQuant вообще не требует ни обучения, ни тонкой настройки, а его выполнение сопровождается незначительными накладными расходами — он готов для развёртывания даже в условиях повышенной нагрузки.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Минцифры РФ потребует особых привилегий для «Алисы AI» на мобильных устройствах 6 мин.
Rockstar представила первый официальный ролевой сервер для GTA Online — трейлер и анонс закрытой «беты» Nopixel V 38 мин.
Google представила Guided Vision — функцию визуального поиска вещей в режиме Gemini Live 2 ч.
Запущен Google Pics — графический ИИ-редактор, который бросает вызов Canva 10 ч.
Пошаговая ролевая игра Warrior Cats: Clans of the Forest по «Котам-Воителям» не заставит себя долго ждать — новый трейлер и дата выхода 12 ч.
«Вито в сделку не входил»: в масштабной утечке Valve нашли вырезанную концовку Mafia 2 13 ч.
Ролевой боевик No Rest for the Wicked от авторов Ori не выйдет из раннего доступа Steam в 2026 году 14 ч.
Свежий драйвер GeForce 616.56 заставил мерцать некоторые мониторы — Nvidia уже работает над исправлением 15 ч.
80 % разработчиков Star Wars Zero Company остались без зарплаты, и Electronic Arts тут ни при чём 15 ч.
Sonos попытается вернуть доверие пользователей с помощью ИИ-агентов — представлена ОС Sonos 27 для аудиосистем 15 ч.
К середине века затраты на ИИ-инфраструктуру достигнут $31,6 трлн 2 ч.
Новый генеральный директор Apple за следующий год заработает $58 млн, на $11 млн больше Тима Кука 5 ч.
Новая статья: Обзор видеокарты GIGABYTE AORUS GeForce RTX 5070 INFINITY 10 ч.
Учёные впервые засекли след тёмной материи, но это не точно — загадочная частица ударилась об атом ксенона 11 ч.
Xiaomi представила POCO X8 — смартфон среднего уровня со Snapdragon 6s Gen 4 и батареей на 8340 мА·ч 11 ч.
Razer представила Prio — складной геймпад для смартфонов, который помещается в карман 11 ч.
Sonos представила полностью переработанный саундбар Beam Ultra со звуком 7.1.2 и поддержкой Dolby Atmos 14 ч.
Sonos представила наушники Ace Ultra с эффективным шумоподавлением и повышенной автономностью за $450 15 ч.
Самая дешёвая GeForce RTX 5090 теперь стоить $5000 в США — в 2,5 раза дороже, чем на момент анонса 15 ч.
Учёные создали дрон с «кошачьими когтями» — он садится на айсберги и крутые ледяные скалы 15 ч.