Сегодня 28 июля 2025
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Software

Сфера ИИ заинтересовалась малыми языковыми моделями — они дешевле и эффективнее больших в конкретных задачах

На рынке ИИ сейчас наблюдается тренд на использование малых языковых моделей (SLM), которые имеют меньше параметров, чем большие языковые модели (LLM), и лучше подходят для более узкого круга задач, пишет журнал Wired.

 Источник изображения: Luke Jones/unsplash.com

Источник изображения: Luke Jones/unsplash.com

Новейшие версии LLM компаний OpenAI, Meta и DeepSeek имеют сотни миллиардов параметров, благодаря чему могут лучше определять закономерности и связи, что делает их более мощными и точными. Однако их обучение и использование требуют огромных вычислительных и финансовых ресурсов. Например, обучение модели Gemini 1.0 Ultra обошлось Google в 191 миллион долларов. По данным Института исследований электроэнергетики, выполнение одного запроса в ChatGPT требует примерно в 10 раз больше энергии, чем один поиск в Google.

IBM, Google, Microsoft и OpenAI недавно выпустили SLM, имеющие всего несколько миллиардов параметров. Их нельзя использовать в качестве универсальных инструментов, как LLM, но они отлично справляются с более узко определёнными задачами, такими как подведение итогов разговоров, ответы на вопросы пациентов в качестве чат-бота по вопросам здравоохранения и сбор данных на интеллектуальных устройствах. «Они также могут работать на ноутбуке или мобильном телефоне, а не в огромном ЦОД», — отметил Зико Колтер (Zico Kolter), учёный-компьютерщик из Университета Карнеги — Меллона.

Для обучения малых моделей исследователи используют несколько методов, например дистилляцию знаний, при которой LLM генерирует высококачественный набор данных, передавая знания SLM, как учитель даёт уроки ученику. Также малые модели создаются из больших путём «обрезки» — удаления ненужных или неэффективных частей нейронной сети.

Поскольку у SLM меньше параметров, чем у больших моделей, их рассуждения могут быть более прозрачными. Небольшая целевая модель будет работать так же хорошо, как большая, при выполнении конкретных задач, но её будет проще разрабатывать и обучать. «Эти эффективные модели могут сэкономить деньги, время и вычислительные ресурсы», — сообщил Лешем Чошен (Leshem Choshen), научный сотрудник лаборатории искусственного интеллекта MIT-IBM Watson.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft превратила Edge в ИИ-браузер, начав тестирование режима Copilot Mode — пока бесплатно 2 ч.
«Лихо одноглазое» пробудилось в Steam и VK Play — это мрачный фольклорный хоррор от создателей «Чёрной книги» 2 ч.
Это шанс для VR: Tencent выпустила открытую ИИ-модель Hunyuan 3D World Model 1.0, которая генерирует интерактивные 3D-миры 5 ч.
Hollow Knight: Silksong скоро выйдет из тени — Microsoft привезёт игру на Gamescom 2025 6 ч.
У Techland большие планы на Dying Light, поэтому в Dying Light: The Beast не будет выбора концовки 7 ч.
В отключениях интернета в России появятся исключения — предлагается сохранять доступ к «Госуслугам» и банкам 9 ч.
Завирусившийся симулятор Quarantine Zone: The Last Check от российских разработчиков достиг «грандиозного рубежа» и нашёл издателя 10 ч.
Хакеры взломали системы «Аэрофлота» — отменены десятки рейсов 11 ч.
Самая уродливая надежда Земли на спасение: радиоактивный боевик Toxic Crusaders получил новый трейлер и дату выхода 11 ч.
«Выглядит как Sekiro на стероидах»: игроков впечатлили 22 минуты геймплея амбициозного китайского боевика Phantom Blade Zero 12 ч.
Sony показала FlexStrike — аркадный геймпад для хардкорных фанатов файтингов 24 мин.
Meta возобновила разработку умных часов, но это не точно — выпускать их будут в Китае 3 ч.
MSI догонит Gigabyte: компания впервые поставит 10 млн материнских плат за год 3 ч.
Китай изо всех сил стремится создать аналог Starlink, но пока драматически отстаёт от SpaceX 4 ч.
Huawei вернула лидерство на китайском рынке смартфонов — Apple только на пятом месте 5 ч.
Xiaomi анонсировала смартфон Redmi Note 14 SE с разъёмом для наушников и ценой $173 6 ч.
«Мы не можем полагаться на человека»: учёные создали робота-каннибала, который ремонтируется за счёт других машин 6 ч.
Sapphire представила профессиональную видеокарту Radeon AI Pro R9700 с турбиной и 12V-2×6 6 ч.
Первый лунный радиотелескоп будет установлен на обратной стороне Луны в следующем году 7 ч.
Inno3D представила однослотовые GeForce RTX 5090 и RTX 5080 Frostbite Pro для ПК с кастомными СЖО 7 ч.