Сегодня 26 сентября 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

DeepSeek научилась тренировать языковые ИИ-модели без оглядки на ограничения по скорости памяти

Как отмечалось недавно, пропускная способность памяти, используемой в инфраструктуре ИИ, становится одним из серьёзных ограничителей дальнейшего роста быстродействия языковых моделей. Представители DeepSeek утверждают, что разработали метод обучения ИИ-моделей, который позволяет обойти подобные ограничения со стороны памяти.

 Источник изображения: Unsplash, Solen Feyissa

Источник изображения: Unsplash, Solen Feyissa

Группа исследователей Пекинского университета в сотрудничестве с одним из основателей DeepSeek Лян Вэньфэном (Liang Wenfeng) опубликовала научную работу, в которой рассматривается новый подход к обучению языковых моделей, позволяющий «агрессивно увеличивать количество параметров» в обход ограничений, накладываемых подсистемой памяти используемых в ускорителях GPU.

От DeepSeek ожидают выхода новой версии большой языковой модели, но ритмичность их создания в случае с китайскими разработчиками сильно страдает от экспортных ограничений США и нехватки ресурсов в Китае. Текст нового исследования, соавтором которого является один из основателей DeepSeek, будет подробно изучаться специалистами в области искусственного интеллекта как в Китае, так и за его пределами.

Описываемая в документе методика «условного» использования памяти получила обозначение Engram, как отмечает South China Morning Post. Существующие подходы к вычислениям при обучении больших языковых моделей, по мнению китайских исследователей, вынуждают напрасно тратить ресурсы на тривиальные операции, которые можно было бы высвободить для высокоуровневых операций, связанных с рассуждениями.

Исследователи предложили в некотором смысле разделить вычисления и работу с памятью, обеспечивая поиск базовой информации более эффективными способами. Одновременно новая технология позволяет большим языковым моделям лучше обрабатывать длинные цепочки контекста, что приближает цель превращения ИИ-агентов в полноценных помощников человека.

В рамках эксперимента новый подход при обучении модели с 27 млрд параметров позволил поднять общий уровень быстродействия на несколько процентов. Кроме того, система получила больше доступных ресурсов для осуществления сложных операций с рассуждениями. По мнению авторов исследования, данный подход будет незаменим при обучении языковых моделей нового поколения в условиях ограниченности ресурсов. По данным The Information, китайская компания DeepSeek намеревается представить новую модель V4 с развитыми способностями в области написания программного кода к середине февраля этого года.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
RuStore могут сделать обязательный для предустановки на все смарт-ТВ в России 2 ч.
Новая статья: SPRAWL zero — в свинцовом потоке. Рецензия 2 ч.
«Плод того же отравленного дерева»: Sony и Universal снова подали в суд на ИИ-генератор Suno за кражу музыки 4 ч.
Мне бы в небо: критики вынесли вердикт Ace Combat 8: Wings of Theve 5 ч.
Amazon запретила ИИ-агенту Meta Muse совершать покупки и сделает то же с аналогами от Google и OpenAI 6 ч.
Meta нашла слабое место OpenAI — ИИ-агент Muse стремительно набирает популярность 6 ч.
Remedy рассказала, как будет улучшать Control Resonant после релиза — «Новая игра ++», фоторежим и не только 6 ч.
Легендарная Gothic вышла на iPhone и iPad — с адаптированным управлением и двумя режимами графики 7 ч.
Слава ветерана GTA не помогла: студия Build a Rocket Boy в ответе за провальный боевик MindsEye стала банкротом 8 ч.
Microsoft перезапустила Copilot как суперприложение с чатом, агентами и вайб-кодингом — ИИ должен повторить успех Office 8 ч.
Слухи: Apple до конца года выпустит iPad mini с OLED-экраном, колонки HomePod mini 2 и приставки Apple TV 4K 2 ч.
Google отправит ИИ-чипы TPU в космос уже на следующей неделе 6 ч.
Ангстремный техпроцесс Intel 14A заинтересовал Amazon, Apple, AMD, Google, Tesla, Microsoft, Nvidia и Qualcomm 8 ч.
Память DDR5 для ноутбуков подорожала в шесть раз за год — и пока не думает останавливаться 8 ч.
Быстрая доставка с неба оказалась слишком шумной: жители Техаса жалуются на дроны Amazon 9 ч.
Oracle может начать платить за ЦОД, которого ещё нет — Project Jupiter в Нью-Мексико задерживается 9 ч.
Intel догнала TSMC в гонке нанометров — Intel 14A будет отличаться от TSMC A14 не более чем на 5 % 9 ч.
ABB готовит ЦОДы к мегаваттным ИИ-стойкам — компания представила систему питания Infinitus стандарта 800 В DC 10 ч.
TSMC забита заказами до 2030 года — с января компания поднимет цены на производство чипов на 3–6 % 10 ч.
Австралиийский штат Виктория предложил обязать ЦОД самостоятельно обеспечить себя возобновляемой энергией 11 ч.