Сегодня 07 мая 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Google обновит поисковую выдачу, добавив в ИИ-обзоры цитаты с форумов 4 ч.
Anthropic наделила управляемых ИИ-агентов Claude «сновидениями» — в некотором роде 7 ч.
Лаконичный трейлер раскрыл дату выхода и цену олдскульного приключения Mina the Hollower от создателей Shovel Knight 10 ч.
AMD выпустила драйвер с поддержкой Pragmata и других новых игр 12 ч.
Славянская Devil May Cry: разработчики балетного слешера «Царевна: Эпоха сказок» показали пять минут чистого геймплея 12 ч.
Meta готовит персонального ИИ-помощника для миллиардов пользователей — проект на $145 млрд пугает инвесторов 13 ч.
Второй трейлер GTA VI вышел ровно год назад, а фанаты вычислили дату следующего показа по расположению планет 14 ч.
Серверы Ubuntu снова заработали после пятидневной DDoS-атаки 15 ч.
Соавтор Mortal Kombat подтвердил работу над новой Mortal Kombat «и не только» 15 ч.
Google проведёт 12 мая мероприятие Android Show I/O Edition — там расскажут об Android 17 и, вероятно, об Aluminium OS 15 ч.
Apple нарастила долю расходов на исследования по отношению к выручке до максимальных за тридцать лет 10,3 % 39 мин.
Anthropic заключила сделку со SpaceX по использованию мощностей дата-центра Colossus 1 2 ч.
После IPO компании SpaceX возглавляющий её Илон Маск должен получить почти неограниченные полномочия 2 ч.
1 Тбайт/с на x16: PCI-SIG раньше срока предоставила спецификации PCI Express 8.0 версии 0.5 7 ч.
Новая статья: Обзор и тестирование корпуса Xastra A700 ARGB «башня» для всего 8 ч.
Инвесторы требуют от Nintendo поднять цену Switch 2 — сейчас консоль убыточна 9 ч.
Corning построит в США три завода по выпуску оптоволокна для ИИ ЦОД с чипами NVIDIA 10 ч.
Смарт-кольцо Samsung Galaxy Ring 2 выйдет не раньше 2027 года — с упором на автономность и мониторинг здоровья 11 ч.
Мировой рынок чипов идёт к $1 трлн — первый квартал принёс почти $300 млрд 11 ч.
Energizer представила безопасные для детей и питомцев батарейки-таблетки — они не вызывают ожогов при проглатывании 11 ч.