Сегодня 16 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

DeepSeek научилась тренировать языковые ИИ-модели без оглядки на ограничения по скорости памяти

Как отмечалось недавно, пропускная способность памяти, используемой в инфраструктуре ИИ, становится одним из серьёзных ограничителей дальнейшего роста быстродействия языковых моделей. Представители DeepSeek утверждают, что разработали метод обучения ИИ-моделей, который позволяет обойти подобные ограничения со стороны памяти.

 Источник изображения: Unsplash, Solen Feyissa

Источник изображения: Unsplash, Solen Feyissa

Группа исследователей Пекинского университета в сотрудничестве с одним из основателей DeepSeek Лян Вэньфэном (Liang Wenfeng) опубликовала научную работу, в которой рассматривается новый подход к обучению языковых моделей, позволяющий «агрессивно увеличивать количество параметров» в обход ограничений, накладываемых подсистемой памяти используемых в ускорителях GPU.

От DeepSeek ожидают выхода новой версии большой языковой модели, но ритмичность их создания в случае с китайскими разработчиками сильно страдает от экспортных ограничений США и нехватки ресурсов в Китае. Текст нового исследования, соавтором которого является один из основателей DeepSeek, будет подробно изучаться специалистами в области искусственного интеллекта как в Китае, так и за его пределами.

Описываемая в документе методика «условного» использования памяти получила обозначение Engram, как отмечает South China Morning Post. Существующие подходы к вычислениям при обучении больших языковых моделей, по мнению китайских исследователей, вынуждают напрасно тратить ресурсы на тривиальные операции, которые можно было бы высвободить для высокоуровневых операций, связанных с рассуждениями.

Исследователи предложили в некотором смысле разделить вычисления и работу с памятью, обеспечивая поиск базовой информации более эффективными способами. Одновременно новая технология позволяет большим языковым моделям лучше обрабатывать длинные цепочки контекста, что приближает цель превращения ИИ-агентов в полноценных помощников человека.

В рамках эксперимента новый подход при обучении модели с 27 млрд параметров позволил поднять общий уровень быстродействия на несколько процентов. Кроме того, система получила больше доступных ресурсов для осуществления сложных операций с рассуждениями. По мнению авторов исследования, данный подход будет незаменим при обучении языковых моделей нового поколения в условиях ограниченности ресурсов. По данным The Information, китайская компания DeepSeek намеревается представить новую модель V4 с развитыми способностями в области написания программного кода к середине февраля этого года.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Новая статья: Big Walk — друзья познаются на прогулке. Рецензия 2 ч.
Прицениваясь к Anthropic, инвесторы всерьёз прикидывают её выручку через два года 2 ч.
Microsoft предупредила о завершении поддержки Windows 10 Enterprise LTSB 2016 и других версий ОС 8 ч.
В интернете кончились тексты: разработчики ИИ начали скупать корпоративные чаты и письма 10 ч.
OpenAI переосмыслила подход к безопасности после инцидента со взломом Hugging Face 10 ч.
В модулях памяти Corsair, G.Skill и Adata нашли уязвимость, через которую можно обходить защиту Windows 12 ч.
Высший суд Франции отклонил закон о запрете соцсетей для детей до 15 лет — он нарушает свободу слова 13 ч.
Опасная ошибка в macOS позволяла удалённо управлять чужим Mac без пароля 14 ч.
Anthropic уже создала ИИ-модель мощнее Mythos, но решила никому её не показывать 16 ч.
Исход руководителей из OpenAI посеял в компании хаос перед выходом на биржу 16 ч.
На заре Вселенной впервые обнаружена «чёрная звездодыра» размером с Солнечную систему 6 ч.
Пузырь ИИ надувается: крупнейшие IT-компании всё больше зарабатывают на инвестициях друг в друга 8 ч.
В Пекине пройдут Всемирные игры человекоподобных роботов с участием 2026 роботов 8 ч.
Производители видеокарт предупреждают о надвигающемся дефиците — сильнее всего пострадают бюджетные модели 9 ч.
Власти США призвали Apple не закупать китайскую память 10 ч.
Tesla скоро представит новый Roadster, и он будет летать 10 ч.
D-Wave сообщила о прорыве в коррекции ошибок квантовых вычислений 10 ч.
196 Пбайт на стойку: хранилище Dell ObjectScale первым в мире получило поддержку 245-Тбайт SSD 11 ч.
Цены на серверные SSD за год взлетели в 6,5 раз: накопители на 30 Тбайт стоят уже $18–$22 тыс. 12 ч.
Google переформатировала стратегию Googlebook — сначала флагманы, потом массовый рынок 13 ч.