Сегодня 05 марта 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Олдскульная стратегия Crown of Greed в духе Majesty позволит почувствовать себя королём — новый трейлер и дата выхода в Steam 2 ч.
Anthropic возобновила переговоры с Пентагоном в надежде исправить ситуацию 3 ч.
Nvidia выпустила Hotfix-драйвер для решения проблем с настройками напряжения у GeForce RTX 5000 10 ч.
Android и Chrome OS сольются в одну платформу в 2026 году — Google подтвердила планы по Aluminium OS 11 ч.
Слухи о релизе Windows 12 в этом году оказались фейком, но интернет поверил 11 ч.
Ubisoft наконец подтвердила Assassin’s Creed Black Flag Resynced и приоткрыла завесу тайны над будущим франшизы 14 ч.
«Это просто нереально!»: Mundfish взбудоражила фанатов Atomic Heart трейлером с датой выхода сюжетного дополнения «Кровь на Хрустале» 15 ч.
Московский суд оштрафовал разработчика Escape from Tarkov на два миллиона рублей 17 ч.
Ghost of Yotei и Saros не выйдут на ПК — Sony больше не будет портировать эксклюзивы PS5, но есть исключения 17 ч.
«Яндекс» научил «Алису» управлять смартфоном по командам пользователя — ИИ-агент уже тестируется 18 ч.
Новая статья: Обзор TWS-наушников HUAWEI FreeBuds Pro 5: в консерватории все в порядке 29 мин.
В России стартовали продажи наушников Huawei FreeBuds Pro 5 с настройкой от экспертов Московской консерватории им. П. И. Чайковского 36 мин.
Nvidia остановила выпуск H200 для Китая — США разрешили поставки, но не выдали лицензии 39 мин.
National Grid и Emerald AI успешно умерили энергетические аппетиты британского ИИ ЦОД Nebius 60 мин.
5G-виртуализация с ИИ-монетизацией: Broadcom представила VMware Telco Cloud Platform 9 с фокусом суверенные облака 2 ч.
Хуанг подтвердил, что Nvidia передумала вливать $100 млрд в OpenAI — новых вложений в Anthropic тоже не предвидится 2 ч.
Broadcom в следующем году рассчитывает выручить на ИИ-чипах более $100 млрд 3 ч.
Meta будет разрабатывать собственные ИИ-ускорители 4 ч.
Нешуточное дело: NASA наметило запуск лунной миссии Artemis II на первое апреля 6 ч.
Aikido объединила морские ветряки с модульными ИИ ЦОД 12 ч.