Сегодня 08 июня 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
В Spotify появятся онлайн-трансляции с концертов и возможность покупки билетов 2 ч.
Дата выхода, демо в Steam и Венсан Кассель в роли Наполеона: авторы ролевого боевика Valor Mortis в духе Dark Souls и BioShock разразились новостями 4 ч.
«Новая BioShock выглядит отлично»: анонсирован сюжетный шутер Magicians: The Devil’s Deal, в котором сценическая магия стала реальной 5 ч.
ИИ-техподдержка Meta повелась на манипуляции хакеров и помогла украсть более 20 тыс. аккаунтов Instagram 5 ч.
Легендарный стелс-экшен Thief спустя 28 лет после релиза получит ремастер от Nightdive — первый трейлер и детали Thief: The Dark Project Remastered 5 ч.
В Yandex Cloud произошёл сбой в расчёте начислений 7 ч.
Сюжетная ролевая игра Vampire: The Masquerade — Eternal Whispers в духе Disco Elysium отправит раскрывать жуткие заговоры и тайны прошлого 7 ч.
Следующая часть Hellblade получила короткое название Senua — это полноценный приключенческий экшен 18 ч.
Владельцы PS5 останутся без Clockwork Revolution — стимпанковая RPG от создателей Wasteland оказалась новым эксклюзивом Xbox 19 ч.
Постапокалиптический шутер Metro 2039 выйдет в феврале 2027 года — новый геймплейный трейлер 20 ч.
Россиян не будут заставлять регистрировать аккаунты через отечественные e-mail — «Антифрод 2.0» доработали 56 мин.
Эстонская Skeleton Technologies представила суперконденсаторные ИБП GrapheneUPS для ИИ ЦОД 2 ч.
Российский рынок радиоэлектроники достиг 4 трлн рублей, но зависимость от импорта остаётся высокой 2 ч.
Стартап Windrose Electric, разрабатывающий электрические грузовики, представил концепцию ЦОД на колёсах 2 ч.
Репортаж со стенда Patriot на Computex 2026: память DDR5-9600, быстрые SSD и решения для эпохи ИИ 2 ч.
Репортаж со стенда PCCooler на Computex 2026: кулеры для самых мощных процессоров, модульный ПК и шаг к серверному охлаждению 4 ч.
Alphacool показала жидкостный кулер для Xbox и другие новинки на выставке Computex 2026 4 ч.
Репортаж со стенда Ocypus на Computex 2026: корпусные дисплеи, СЖО с обдувом VRM, кулеры с дисплеями и новые корпуса 4 ч.
Nvidia признали самой подготовленной к будущему компанией — Microsoft и Alphabet остались позади 4 ч.
Новая статья: Обзор HUAWEI MatePad SE 11" (2026): тонкий металлический планшет с раритетной начинкой 5 ч.