Сегодня 07 октября 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
В ранний доступ Steam ворвалась олдскульная стратегия Dying Breed, которая выглядит как потерянная Command & Conquer 13 мин.
Steam сломался второй раз за день — проблемы наблюдаются по всему миру 2 ч.
«Вы передо мной в долгу», — Трамп вернулся в TikTok и сразу же обратился к молодёжи 4 ч.
Хакеры заявили о взломе Huawei и получении доступа к средствам разработки и исходному коду 4 ч.
Геймплейный трейлер подтвердил дату выхода PowerWash Simulator 2 — владельцев оригинальной игры в Steam ждёт приятный сюрприз 4 ч.
Илон Маск пообещал, что в 2026 году xAI выпустит «отличную игру, сгенерированную ИИ» 5 ч.
Аудитория скейтерского симулятора Skate превысила 15 млн игроков спустя три недели после выхода в раннем доступе 5 ч.
Браузер Microsoft Edge существенно «поумнеет» за счёт ИИ Copilot 6 ч.
Всё, к чему прикасается OpenAI, начинает расти — раньше такой сверхспособностью обладала только Nvidia 8 ч.
Олдскульное приключение Mina the Hollower не выйдет 31 октября — смесь Bloodborne, «Зельды» и Castlevania от авторов Shovel Knight задерживается 9 ч.
Представлен одноплатный компьютер Arduino UNO Q за $44 с процессором Qualcomm, поддержкой Linux и ИИ 19 мин.
Samsung представила уменьшенный 200-Мп сенсор ISOCELL HP5 и хвастается его главным недостатком 2 ч.
MSI выпустила GeForce RTX 5070 Ti Ventus 3X PZ со скрытым разъёмом питания 3 ч.
Samsung представила 27-дюймовый монитор Odyssey G60F с IPS-панелью и частотой до 350 Гц 3 ч.
Qualcomm приобрела Arduino — икону мира DIY-электроники 4 ч.
HMD выпустила телефон-звонилку Touch 4G с сенсорным экраном и расширенной функциональностью 4 ч.
«Билайн» и «Инфомаксимум» реализовали проект по оптимизации бизнес-процессов с Proceset 4 ч.
Проблемы Nvidia в Китае стали подарком местным разработчикам GPU — Moore Threads, MetaX и Cambricon 4 ч.
Jaguar Land Rover оправилась после августовской хакерской атаки и наконец-то возобновляет работу 5 ч.
Sony выкинула из комплекта поставки Xperia 10 VII кабель USB-C, и это может стать новым трендом 5 ч.