Сегодня 15 апреля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Apple будет анализировать переписки пользователей на iPhone, iPad и Mac для улучшения своего ИИ 19 мин.
Правительство РФ определилось, как будет изымать криптовалюту при уголовных делах 2 ч.
Контур.Толк представил новый ИИ-инструмент — резюме встречи 2 ч.
Broadcom вернула бесплатную версию VMware ESXi 8, но никому об этом не сказала 12 ч.
Meta начнёт обучать нейросети на данных пользователей из ЕС 12 ч.
Эпическое создание, новые квесты и механики: бесплатный аддон Stargazer для боевика Eternal Strands от студии экс-режиссёра Dragon Age готов к выходу 13 ч.
Electronic Arts анонсировала Star Wars Zero Company — тактическую стратегию по «Звёздным войнам» от бывших разработчиков XCOM 14 ч.
Лучше GPT-4o «почти по всем параметрам»: OpenAI представила флагманскую ИИ-модель GPT-4.1 14 ч.
Календарь релизов — 14–20 апреля: Mandragora: Whispers of the Witch Tree и Stygian: Outer Gods 15 ч.
Новый геймплейный трейлер подтвердил дату выхода взрывного платформера Shotgun Cop Man от создателя My Friend Pedro 15 ч.
Власти США начали расследование цепочек импорта чипов — это грозит новыми пошлинами 12 мин.
Ученые создали растягивающуюся литиевую батарею — её безопасно сгибать, резать и прокалывать 22 мин.
Google Maps со встроенным ИИ для электросетей: Google и PJM ускорят развитие энергетики в США 2 ч.
Южная Корея усилила меры по поддержке национальной полупроводниковой отрасли 3 ч.
Несчастье помогло: в прошлом квартале Apple стала лидером по росту поставок смартфонов 4 ч.
Новая статья: Почему DDR5 CUDIMM — это шаг вперёд: подробности и тесты 10 ч.
Новая статья: Обзор ИБП Ippon Innova TB 2000: с чистой синусоидой 11 ч.
Новая российская система RockITNet поможет компаниям повысить эффективность управления сетью 14 ч.
E Ink представила огромный 75-дюймовый дисплей на цветных электронных чернилах 14 ч.
Глава Alphabet подтвердил намерение компании потратить $75 млрд на ИИ ЦОД 15 ч.