Сегодня 18 ноября 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Electronic Arts и Codemasters анонсировали переосмысление симуляторов «Формулы-1» — F1 26 не будет 3 мин.
AMD представит технологию FSR Redstone с реконструкцией лучей и не только 10 декабря 26 мин.
Google представила Gemini 3 — ИИ-модель, которая превзошла всех конкурентов и уже доступна бесплатно 35 мин.
Спасение галактики, истребление пауков и многое другое: Microsoft раскрыла, какие игры пополнят Game Pass в конце ноября и начале декабря 2 ч.
Спустя 7 лет после запуска и через 18 лет после Steam в Epic Games Store появилась возможность дарить игры друзьям 3 ч.
Генпрокуратура признала нежелательной деятельность разработчиков S.T.A.L.K.E.R. 2: Heart of Chornobyl на территории России 4 ч.
Alibaba выпустила ИИ-бота Qwen — будущего конкурента ChatGPT 4 ч.
Евросоюз рассматривает необходимость ограничения возможностей американских облачных гигантов 5 ч.
Roblox скоро начнёт разделять пользователей по возрасту — грядёт обязательная верификация 5 ч.
ИИ-агент в Windows 11 сможет загружать вирусы, предупредила Microsoft 6 ч.
Электролёт Joby Aviation впервые взлетел в небо Дубая — пассажиров начнут возить в 2026 году по тарифу Uber Black 19 мин.
Роботакси Zoox без руля и педалей начнут перевозить обычных пассажиров в Сан-Франциско 2 ч.
Американский стартап стал ближе к запуску «бюджетных» термоядерных реакторов, заинтересовавших даже Билла Гейтса 3 ч.
Представлен стандарт связи Zigbee 4.0 для умного дома — расширенное покрытие, пакетная настройка и работа без концентратора 3 ч.
В России представили титановую клавиатуру для геймеров за 500 000 рублей 4 ч.
Илон Маск хочет на порядок больше ИИ-чипов, чем выпускает вся полупроводниковая индустрия мира 4 ч.
Apple N1 сравнили с сетевыми чипами Android-флагманов: чуть медленнее, но намного стабильнее 4 ч.
InWin выпустила корпус Dlite с премиальным дизайном и четвёркой ARGB-вентиляторов в комплекте 4 ч.
Oracle подешевела на $374 млрд после заключения сделки с OpenAI на $300 млрд 4 ч.
Бывший гендир Intel Пэт Гелсингер рассказал, как его инициалы появились на каждом процессоре i386 5 ч.