Сегодня 05 апреля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

DeepSeek научилась тренировать языковые ИИ-модели без оглядки на ограничения по скорости памяти

Как отмечалось недавно, пропускная способность памяти, используемой в инфраструктуре ИИ, становится одним из серьёзных ограничителей дальнейшего роста быстродействия языковых моделей. Представители DeepSeek утверждают, что разработали метод обучения ИИ-моделей, который позволяет обойти подобные ограничения со стороны памяти.

 Источник изображения: Unsplash, Solen Feyissa

Источник изображения: Unsplash, Solen Feyissa

Группа исследователей Пекинского университета в сотрудничестве с одним из основателей DeepSeek Лян Вэньфэном (Liang Wenfeng) опубликовала научную работу, в которой рассматривается новый подход к обучению языковых моделей, позволяющий «агрессивно увеличивать количество параметров» в обход ограничений, накладываемых подсистемой памяти используемых в ускорителях GPU.

От DeepSeek ожидают выхода новой версии большой языковой модели, но ритмичность их создания в случае с китайскими разработчиками сильно страдает от экспортных ограничений США и нехватки ресурсов в Китае. Текст нового исследования, соавтором которого является один из основателей DeepSeek, будет подробно изучаться специалистами в области искусственного интеллекта как в Китае, так и за его пределами.

Описываемая в документе методика «условного» использования памяти получила обозначение Engram, как отмечает South China Morning Post. Существующие подходы к вычислениям при обучении больших языковых моделей, по мнению китайских исследователей, вынуждают напрасно тратить ресурсы на тривиальные операции, которые можно было бы высвободить для высокоуровневых операций, связанных с рассуждениями.

Исследователи предложили в некотором смысле разделить вычисления и работу с памятью, обеспечивая поиск базовой информации более эффективными способами. Одновременно новая технология позволяет большим языковым моделям лучше обрабатывать длинные цепочки контекста, что приближает цель превращения ИИ-агентов в полноценных помощников человека.

В рамках эксперимента новый подход при обучении модели с 27 млрд параметров позволил поднять общий уровень быстродействия на несколько процентов. Кроме того, система получила больше доступных ресурсов для осуществления сложных операций с рассуждениями. По мнению авторов исследования, данный подход будет незаменим при обучении языковых моделей нового поколения в условиях ограниченности ресурсов. По данным The Information, китайская компания DeepSeek намеревается представить новую модель V4 с развитыми способностями в области написания программного кода к середине февраля этого года.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft инвестирует в развитие ИИ-инфраструктуры Японии $10 млрд 2 ч.
LinkedIn скрытно собирает данные о ПО, установленном на компьютерах пользователей соцсети 3 ч.
В Google Chrome появится функция, которая ускорит загрузку сайтов и сэкономит сетевой трафик 5 ч.
Новая статья: Grime 2 — истязание на любителя. Рецензия 15 ч.
Новая статья: Gamesblender № 770: релиз DLSS 4.5, Синдзи Миками и авторы Stellar Blade, почти конец Eidos Montreal 16 ч.
Энтузиаст установил Windows 3.1x на компьютер 2025 года — и она заработала c Ryzen 9 9900X и RTX 5060 Ti 20 ч.
Microsoft принудительно обновит до Windows 11 25H2 компьютеры с более старыми версиями ОС 24 ч.
В руководстве OpenAI провели очередные кадровые перестановки — частично вынужденные 04-04 14:05
Nvidia показала нейронное сжатие текстур: потребление видеопамяти упало почти в 7 раз 04-04 14:04
Суд обязал Netflix вернуть деньги за необоснованное повышение стоимости подписок, но только в одной стране 04-04 11:46
Fujitsu планирует выпуск 1,4-нм NPU для ИИ-систем 2 ч.
Американские ИИ-компании не смогут запустить в этом году более 30 % дата-центров из-за дефицита электроэнергии 7 ч.
В условиях дефицита памяти портативная игровая консоль Lenovo Legion Go 2 подорожала до полутора раз 8 ч.
В Китае введут строгий стандарт безопасности для пауэрбанков 8 ч.
NASA впервые разрешило астронавтам взять на борт iPhone в рамках лунной миссии Artemis II 9 ч.
Сразу после старта лунной миссии Трамп предложил сократить бюджет NASA на 23 % 9 ч.
Обновлённый RedMagic 11 Pro показал достойный FPS в играх для ПК класса AAA 22 ч.
ИИ на селе: NetApp и NTT протестировали геораспределённое обучение LLM 24 ч.
Стартап CavilinQ получил $8,8 млн на разработку квантового интерконнекта для объединения квантовых компьютеров 04-04 14:33
Специалисты iFixit разобрали наушники Apple AirPods Max 2 — внутренняя компоновка не изменилась 04-04 13:56