Сегодня 25 февраля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Twitch отказался от блокировок «всё или ничего» и разделил наказания 8 ч.
Discord отложил глобальное внедрение проверки возраста, но ненадолго 8 ч.
Anthropic научила ИИ-платформу Claude Cowork справляться с большим числом офисных задач 9 ч.
Google предложит музыкантам ИИ-продюсера вместо генератора случайных мелодий — компания поглотила ProducerAI 11 ч.
Marvel’s Wolverine выйдет до GTA VI — Sony подтвердила дату релиза жестокого боевика от создателей «Человека-паука» 12 ч.
Blizzard анонсировала новую Overwatch, но это мобильная игра — первый геймплей и подробности Overwatch Rush 13 ч.
Death Stranding 2: On the Beach оптимизируют даже для бюджетных ПК — объявлены системные требования 14 ч.
Противоречивого бота xAI Grok допустят к секретным военным системам США 14 ч.
Amazon закроет кооперативный платформер King of Meat спустя полгода после релиза — рассчитывали на 100 тысяч игроков, а получили 320 (не тысяч) 15 ч.
«Притворяться было бы ужасной идеей»: глава Microsoft Gaming ответила на подозрения игроков 15 ч.
Китайские производители намереваются в пять раз увеличить объёмы выпуска передовых чипов 33 мин.
Министерство торговли США призналось, что в Китай пока не попало ни одного ускорителя Nvidia H200 4 ч.
Новая статья: Обзор складного смартфона Google Pixel 10 Pro Fold, который не боится пыли 7 ч.
OpenAI признала, что ИИ до сих пор не проник в бизнес по-настоящему — и объяснила, почему 8 ч.
Новая статья: Компьютер месяца, спецвыпуск: эпоха отката, или Как дефицит чипов памяти влияет на выбор железа для игрового ПК 8 ч.
SambaNova представила ИИ-ускоритель SN50 и объявила о расширении партнёрства с Intel 10 ч.
DJI подала в суд на FCC за превышение полномочий при блокировке импорта дронов в США 10 ч.
Новая керамическая электроника откроет путь к возвращению на Венеру — не на часы, а на дни и недели 11 ч.
SanDisk представила портативные SSD со скоростью до 4000 Мбайт/с и объёмом до 8 Тбайт 12 ч.
В США нашли замену полупроводниковым лазерам — это особые microLED толщиной с волос 13 ч.