Сегодня 25 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

DeepSeek научилась тренировать языковые ИИ-модели без оглядки на ограничения по скорости памяти

Как отмечалось недавно, пропускная способность памяти, используемой в инфраструктуре ИИ, становится одним из серьёзных ограничителей дальнейшего роста быстродействия языковых моделей. Представители DeepSeek утверждают, что разработали метод обучения ИИ-моделей, который позволяет обойти подобные ограничения со стороны памяти.

 Источник изображения: Unsplash, Solen Feyissa

Источник изображения: Unsplash, Solen Feyissa

Группа исследователей Пекинского университета в сотрудничестве с одним из основателей DeepSeek Лян Вэньфэном (Liang Wenfeng) опубликовала научную работу, в которой рассматривается новый подход к обучению языковых моделей, позволяющий «агрессивно увеличивать количество параметров» в обход ограничений, накладываемых подсистемой памяти используемых в ускорителях GPU.

От DeepSeek ожидают выхода новой версии большой языковой модели, но ритмичность их создания в случае с китайскими разработчиками сильно страдает от экспортных ограничений США и нехватки ресурсов в Китае. Текст нового исследования, соавтором которого является один из основателей DeepSeek, будет подробно изучаться специалистами в области искусственного интеллекта как в Китае, так и за его пределами.

Описываемая в документе методика «условного» использования памяти получила обозначение Engram, как отмечает South China Morning Post. Существующие подходы к вычислениям при обучении больших языковых моделей, по мнению китайских исследователей, вынуждают напрасно тратить ресурсы на тривиальные операции, которые можно было бы высвободить для высокоуровневых операций, связанных с рассуждениями.

Исследователи предложили в некотором смысле разделить вычисления и работу с памятью, обеспечивая поиск базовой информации более эффективными способами. Одновременно новая технология позволяет большим языковым моделям лучше обрабатывать длинные цепочки контекста, что приближает цель превращения ИИ-агентов в полноценных помощников человека.

В рамках эксперимента новый подход при обучении модели с 27 млрд параметров позволил поднять общий уровень быстродействия на несколько процентов. Кроме того, система получила больше доступных ресурсов для осуществления сложных операций с рассуждениями. По мнению авторов исследования, данный подход будет незаменим при обучении языковых моделей нового поколения в условиях ограниченности ресурсов. По данным The Information, китайская компания DeepSeek намеревается представить новую модель V4 с развитыми способностями в области написания программного кода к середине февраля этого года.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Календарь релизов 24–30 августа: Resonance: A Plague Tale Legacy и Star Wars Zero Company 5 ч.
NVIDIA выплатит Poolside за лицензию $6 млрд и получит более ста его специалистов, но поглощением эту сделку называть отказывается 8 ч.
Hugging Face отказалась от денег Nvidia и теперь рассматривает продажу за $13 млрд 9 ч.
The Witcher 4 выйдет в 2028 году — это «самая большая, смелая и амбициозная игра» в истории CD Projekt Red 10 ч.
«Это пустяки»: ветеран Rockstar сравнил утечки GTA VI с секс-скандалом вокруг GTA: San Andreas 11 ч.
После критики фанатов вампирская ролевая игра The Blood of Dawnwalker от ветеранов CD Projekt Red всё-таки получит поддержку 60 кадров/с на консолях 12 ч.
Alibaba выпустила Wan3.0 — новую версию генератора 30-секундных видео 12 ч.
Авторитетный инсайдер подтвердил продолжение Ori and the Will of the Wisps, а создатель серии назвал слухи об Ori 3 «полной чушью» 15 ч.
В Steam завирусился гибрид шутера и симулятора рыбалки на четверых How to Fish — миллион проданных копий за два дня 16 ч.
Зоркий фанат нашёл в Cyberpunk 2077 лужу из нового трейлера Cyberpunk: Edgerunners 2 и впечатлил даже CD Projekt Red 17 ч.
LG оценила 24,5-дюймовый игровой IPS-монитор UltraGear 25G590B с Full HD и 1000 Гц в $1000 4 ч.
Intel раскрыла устройство Crescent Island — ИИ-ускорителя с огромным объёмом дешёвой памяти 4 ч.
Новая статья: Обзор и тест процессорного кулера MSI MAG CoreFrozr AA13: просто, недорого, симпатично 5 ч.
В контрабанде ИИ-ускорителей в Китай оказался замешан топ-менеджер Nvidia — теперь ему грозит 5 лет тюрьмы 10 ч.
Xiaomi представила мини-ПК AI Cube на собственных CPU, GPU и NPU и с LPDDR6-памятью 10 ч.
Xiaomi начала повышать цены на смартфоны — некоторые модели подорожают на 25 % 10 ч.
Фото дня: доставка суперускорителя NVIDIA Vera Rubin NVL72 в дата-центр Microsoft 12 ч.
YMTC готовит IPO на $4,9 млрд — китайский производитель флеш-памяти хочет нарастить выпуск 3D NAND 15 ч.
Xiaomi бросила вызов Qualcomm и MediaTek: новый 3-нм чип Xring O3 первым получил поддержку LPDDR6 16 ч.
Alibaba Cloud намерена всё больше полагаться на ИИ-чипы собственной разработки 16 ч.