Сегодня 27 апреля 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Игра, сделанная специально для меня»: второй трейлер киберпанкового экшена .45 Parabellum Bloodhound впечатлил фанатов Parasite Eve 10 мин.
DeepSeek снизила на 75 % цены за доступ к ИИ-модели DeepSeek-V4-Pro 49 мин.
Российские власти разрешили разработчикам обучать ИИ на любых данных 50 мин.
Руководитель разработки Gothic Remake рассказал об отличиях ремейка от оригинальной «Готики» 2 ч.
Инновационный геймплей, верность традициям и Unreal Engine 5: вакансии Creative Assembly раскрыли подробности Alien: Isolation 2 3 ч.
Глава разработки Assassin’s Creed Codename Hexe покинул проект вслед за творческим руководителем 4 ч.
Илон Маск должен предложить фирменный финансовый сервис X Money в этом месяце 9 ч.
«Игра, которую я куплю в первый же день»: вышел первый тизер хоррора Alien: Isolation 2 17 ч.
Акции IBM упали из-за нежелания компании увеличить прогноз выручки 24 ч.
OpenAI и Anthropic начали активно привлекать маркетинговые кадры из других компаний 26-04 07:10
«Гравитон» представил российские серверы на базе Intel Xeon для облаков, виртуализации и ИИ 2 мин.
Hyundai поставит газовые генераторы мощностью 684 МВт для ЦОД в США 28 мин.
В Китае возродят внедорожники Freelander — с помощью Huawei, Chery, CATL и Qualcomm 41 мин.
Одноплатный компьютер Banana Pi BPI-SM10 получил чип RISC-V с ИИ-производительностью 60 TOPS 43 мин.
Tokyo Electron уволила руководителя из-за слишком тесных связей с китайскими конкурентами 45 мин.
Xiaomi переманила специалистов BMW, Mercedes-Benz, Porsche и Rolls-Royce в новый дизайн-центр в Европе 47 мин.
OpenAI замахнулась на рынок смартфонов — процессор спроектируют MediaTek и Qualcomm, а устройство соберёт китайская Luxshare 48 мин.
Необычная СЖО Airsys LiquidRack «опрыскивает» серверы 4 ч.
Три M.2-слота, два COM-порта и один VGA-выход: встраиваемая система AAEON Boxer-6407-TWL на базе Intel Twin Lake поможет модернизировать промышленные платформы 5 ч.
Забастовка рабочих Samsung сократит мировой выпуск памяти — в условиях дефицита цены тут же подскочат 5 ч.