«Интеллектуальных гаджетов», тем или иным образом реализующих ИИ-функциональность, год от года анонсируют всё больше: тут и смарт-очки, и оснащённые множеством датчиков умные бейджи, и даже носимые кнопки неясного предназначения. Однако в основной массе всё это, по справедливому замечанию острословов с платформы Reddit, не более чем неоправданно дорогие аппаратные смартфонные приложения: производительности интегрированного в их компактные корпуса «железа» откровенно недостаёт для запуска даже ограниченно полезной малой языковой модели (МЯМ), не говоря уже о полнофункциональной большой (БЯМ). Так что в лучшем случае «интеллектуальные гаджеты» по беспроводному каналу взаимодействуют с исполняемой на пользовательском смартфоне или персональном компьютере МЯМ, а в худшем — посредством всё того же смартфона — напрямую с облачными генеративными монстрами вроде Claude, Gemini или GPT.
Так что же, подлинно интеллектуальных гаджетов, способных действовать офлайн, попросту не существует? А, может, они и вовсе не нужны, ведь большая языковая модель в любом случае произведёт инференс быстрее, выдав ответ точнее и полнее локальной?
Codex Micro, первый коммерческий аппаратный продукт OpenAI, обойдётся покупателю в США в 230 долларов без учёта налогов. Устройство призвано упростить работу с решающим программистские задачи ИИ-агентом Codex и по сути является физическим интерфейсом для запускаемого на ПК приложения ChatGPT. То бишь «умной клавиатурой» безо всякого зазрения совести называют прокладку второго порядка (аппаратный плагин к программному интерфейсу для связи с облачной БЯМ) с шестью подсвечиваемыми клавишами, которые разными цветами отображают в реальном времени состояние активных потоков ИИ: «простой», «обработка», «завершено» или «ошибка». Достойный выбор для тех, кому лень регулярно нажимать Alt+TAB! (Источник: OpenAI)
Большие модели привлекательны своей универсальностью. Вот как раз стремление обеспечить владельцу гаджета (умных очков, бейджа и т. п.) привычную по имеющемуся уже у него опыту взаимодействия с БЯМ универсальность и заставляет разработчиков превращать подобные устройства в более или менее комфортабельные для регулярного использования прокладки. Но это вовсе не значит, будто единственно пригодными для эмуляции полезных в прикладном плане нейросетей остаются одни лишь набитые ИИ-ускорителями облачные серверы. Отнюдь; уже достаточно давно в мире успешно развивается такое направление, как периферийный ИИ (edge AI), подразумевающее исполнение довольно изощрённых моделей непосредственно на устройствах за пределами облаков — вплоть до видеокамер, элементов интернета вещей или различного рода датчиков. Да, круг решаемых такими гаджетами задач чаще всего ограничен, — но ведь и универсальность облачной БЯМ необходима на практике далеко не всегда.
Устройства периферийного (необлачного) ИИ эмулируют нейросети с опорой на собственное «железо»: на графические процессоры, нейронные сопроцессоры (neural processing unit — NPU), специализированные ASIC или FPGA. Исполняются же на этой аппаратной основе не только универсальные малые языковые модели (главное их отличие от больших — именно количественное: архитектура в целом та же, но параметров не сотни миллиардов с гаком, а на 3−4 десятичных порядка меньше), но и более специализированные: импульсные, рекуррентные, свёрточные и иные более компактные нейросети. Зачем разработчикам напрягаться, создавая в полном смысле слова умные (способные самостоятельно раскинуть моделируемыми на собственном «железе» перцептронами, пусть тех и существенно меньше, чем у облачной БЯМ) гаджеты, понятно. Главных причин тут три: время, энергия и автономность как таковая.
Важный поворотный момент в эволюции языковых моделей наступил с появлением в 2017 г. архитектуры трансформеров, принципиально отличной от господствовавших до той поры рекуррентных нейросетей, RNN: типичное число параметров с тех пор росло экспоненциально (источник: ACM)
Время — точнее, задержка от получения входных данных до выдачи нейросетью ответа-реакции — существенно важно для таких приложений периферийного ИИ, как промышленные роботы и иные средства автоматизации, системы безопасности, беспилотный транспорт. Насколько бы серверный ИИ-ускоритель ни был мощнее локального NPU, если латентность канала связи и управления (в обе стороны; от устройства в облако — плюс время на обработку запроса — плюс обратно) исчисляется даже несколькими десятыми долями секунды, это уже во множестве прикладных ситуаций попросту недопустимо. С энергий тоже всё ясно: специализированная малая нейросеть, в особенности воплощённая «в металле» — точнее, в кремнии с добавлением металла, если говорить о полупроводниковых ASIC/FPGA, — куда экономичнее всезнайки-БЯМ, расходующей примерно 0,3 Вт·ч (около 3 джоулей) на обработку одного-единственного токена.
Экономичность особенно существенна для компактных гаджетов вроде разнообразных интеллектуальных датчиков, элементов умного дома, да даже для носимой электроники, которую хочется пореже подзаряжать. Ну, и автономность тоже имеет принципиальное значение: не везде и не всегда облачные БЯМ доступны; более того, некоторые чувствительные задачи вовсе не хочется доверять оперирующей где-то вдали модели, условия обращения к которой изначально подразумевают решительный отказ пользователя от конфиденциальности коммуникаций с нею. Как раз по этой, кстати, причине всё больше коммерческих заказчиков склоняются к размещению ИИ для обработки своих конфиденциальных данных в закрытом периметре, физически отделённом от публичного облака, — как бы чего не вышло.
Универсальные интеллектуальные шлюзы реализуют сбор данных, маршрутизацию информационных потоков и периферийные нейровычисления на единой аппаратной платформе — притом в экстремальных (в плане температуры, вибрационного режима, влажности и проч.) условиях промышленного производства (источник: Advantech)
В итоге, если рассмотреть все категории устройств, на которых сегодня в принципе могут исполняться (и исполняются!) нейросетевые модели самого разного рода, насчитать выйдет не менее четырёх. А именно:
Промышленные периферийные шлюзы, industrial edge gateways. Конструктивно они напоминают сетевые маршрутизаторы с усиленной вычислительной частью, разве что в более стойком ко всевозможным неблагоприятным факторам исполнении (особо прочные корпуса, антивибрационные крепления, сверхэффективные системы теплоотвода и т. д.); развёртываются они на периферии информационной сети предприятия. Такие устройства соединяют вычислительную инфраструктуру промышленного объекта с операционной (в которой реализуется, собственно, производство) — связывая таким образом information technology (IT) с operational technology (OT). Помимо коммутации потоков данных, эти маршрутизаторы на стероидах производят обработку информации на лету —в частности, при помощи бортовых моделей машинного обучения, исполняемых на локальных нейронных либо тензорных процессорах (NPU/TPU), для локального выполнения облегченных, оптимизированных моделей машинного обучения. Интеллектуальные задачи, которые решаются на периферии ИT-сети предприятия, да ещё и с минимальными задержками на уровне OT, — это машинное зрение в реальном времени, контроль качества на производственных линиях, предиктивный анализ аномалий оборудования для опережающего грядущую неполадку технического обслуживания и многое другое.
Автономный транспорт, всевозможные дроны и роботы. Здесь тоже никаких вопросов на тему обоснованности применения именно локального ИИ не возникает: физический мир не будет ждать, пока плотный информационный поток (данные с оптических камер и лидаров, текущие показатели скорости и момента импульса ключевых узлов машины, сведения о коэффициенте трения подстилающей поверхности, о ветровом давлении и ещё много о чём) получится транслировать на облачный сервер, там успешно обработать — а затем переправить обратно на дрон, автомобиль, робопогрузчик или иную самодвижущуюся (вот теперь в полном смысле слова) машину преобразованный в команды управления ответ. В зависимости от того, какой уровень автономности данное устройство реализует, его аппаратная ИИ-платформа должна выдавать от 30 до 1000 TOPS (tera operations per second — 1012 операций в секунду), и это уже прямо сейчас: баснословный пока пятый уровень полной автономности, на котором присутствие человека не требуется даже в роли стороннего наблюдателя/диспетчера, потребует многократно больше. В этом сегменте прикладного ИИ-рынка активно конкурирует множество решений: платформы Nvidia Drive (уже используемые целым рядом автопроизводителей системы-на-кристалле Orin обеспечивают 254 TOPS, а Thor — целых 2000 TOPS), Qualcomm Snapdragon Ride, Mobileye EyeQ, собственный компьютер FSD (что так и расшифровывается — full self-driving computer) разработки Tesla, китайская Horizon Journey и т. д.
Умный дом прекрасно может контролироваться и облачной моделью — но зачем, если задачи решаемого его элементами круга вполне по плечу локально исполняемой МЯМ? (Источник: ИИ-генерация на основе модели Grok Imagine)
Элементы умного дома и бытовая техника. Кому могут понадобиться микроволновка, гаражные ворота или датчик утечки воды с искусственным интеллектом? Ясное дело, самим их вендорам, чтобы продать свою продукцию подороже Однозначный ответ тут дать трудно, но в целом, наверное, ИИ буквально в каждом домашнем гаджете действительно избыточен. Вот в хабе умного дома — дело другое: даже интерпретировать голосовые команды владельца без обращения к облаку уже значит повысить информационную безопасность умного жилища. Точно так же разумным будет локально производить распознавание образов — на интегрированном прямо в видеокамеру нейропроцессоре. Умный холодильник (сам по себе либо, опять-таки, при помощи ИИ-хаба) будет своевременно напоминать о том, что какие-то продукты подходят к концу; интеллектуальный робот-пылесос проинформирует хозяина, что некий участок пола по какой-то причине не поддаётся уборке; термостат со способностью к обучению самостоятельно затвердит, к какому времени в какой день недели обеспечивать в той или иной комнате предпочитаемый обитателями дома температурный режим. Одно из рекламируемых достоинств умного дома — повышение эффективности использования энергии в нём (как раз за счёт исключения потерь вследствие людской забывчивости и невнимательности — не выключенного вовремя света, работающего впустую кондиционера и т. п.), но выгода тут не умопомрачительная. По оценке Министерства энергетики США, применение умного термостата экономит домовладельцу менее 200 долл. ежегодно — что не полная ерунда, конечно, но вряд ли окупит затраты на развёртывание интеллектуальной домашней системы. Особенно если принять в расчёт сравнительно свежую тенденцию предоставлять услуги умного дома по подписке, причём плата за услугу нередко индексируется на 5−15% в год, а суммарные подписные выплаты начинают превосходить выложенную за сам комплект интеллектуального «железа» сумму уже через 2−3 года.
Носимые устройства. Умные часы, фитнес-браслеты, различные медицинские носимые гаджеты — их частенько тоже оснащают нейропроцессорами для локальной обработки фиксируемых их датчиками показателей. Благо, информационные потоки здесь сравнительно узкие (если сопоставлять с теми, что приходится обрабатывать TPU машинного зрения, встраиваемым в камеры высокого разрешения, скажем), так что достаточно оказывается довольно компактных нейросетей — которые, в свою очередь, довольствуются энергоэффективными микросхемами, подходящими для встраивания в компактные корпуса носимых устройств. Предпочтение исполняемым локально моделям перед теми, что могут быть развёрнуты на сопряжённом с таким гаджетом по Bluetooth смартфоне, например, отдают сразу по нескольким причинам. Это прежде всего экономия энергии (поддержание активного радиоканала часами, если не сутками, заметно сокращает время автономной работы компактного устройства), повышение надёжности мониторинга жизненно важных показателей (чем больше в системе звеньев — к локальному NPU/TPU добавляются Bluetooth-адаптер, антенна, плюс сам подверженный помехам радиоканал связи, плюс приёмный радиоблок на стороне смартфона, а ещё нельзя списывать со счетов возможность прекращения работы ИИ-модели на внешнем устройстве по причине сбоя или обновления ПО, — тем выше вероятность сбоя), а также забота о конфиденциальности биометрических данных. Нейрочипы для носимых гаджетов вроде Qualcomm Hexagon или Cortex-M начали появляться в серийных устройствах ещё до оглушительного дебюта ChatGPT в конце 2022 года, и с тех пор продолжают совершенствоваться.
На самом обычном iPhone, не говоря уже об iPad или Mac, уже доступны приложения, позволяющие локально запускать немало ИИ-моделей. Справляться же с этой задачей процессорам Apple Silicon помогает фирменная рабочая среда (фреймворк) MLX (источник: скриншот сайта locallyai.app)
Приведённый список категорий «автономно умных» устройств логично дополнить ещё двумя — правда, куда более универсальными: это смартфоны (плюс планшеты) и персональные компьютеры. С последними всё как раз наиболее ясно: в зависимости от особенностей платформы, на таких мощных гаджетах способны исполняться модели с числом параметров примерно до 100 млрд. Занятно, кстати, что для x86-систем формальная планка пониже, чем для макбуков на ARM-чипах — из-за особенностей архитектуры вторых, позволяющих предоставить нейросети для операций всю доступную на компьютере оперативную память одним логически цельным куском, тогда как первые вынуждены ютить ИИ-модели в тесных клетках видеопамяти установленных в системе графических адаптеров (которых, справедливости ради отметим, может быть и больше одного, — если ИИ-энтузиаст готов себе эту роскошь позволить). В результате на x86-ПК с видеокартой RTX PRO 6000 (96 Гбайт видеопамяти) или с несколькими графическими адаптерами в связке удаётся запускать «однопоточные» модели с более чем 70 млрд параметров при высокой квантизации, а также многие формально более крупные, работающие по принципу mixture of experts (MoE). В то же время простой незамысловатый Mac Studio с процессором Apple M4 Ultra и суммарным объёмом ОЗУ в пределах 192–512 Гбайт потянет модели и более чем со 100 млрд параметров — вплоть до DeepSeek V4-Flash (1,6 трлн параметров всего, 49 млрд активных для каждой задачи) или GLM-5.2 (753 млрд параметров всего, 40 млрд активных).
Смартфоны различных брендов в этом отношении более унифицированы благодаря идеологически единой платформе ARM. Устройств на базе x86 (да, Intel Atom, олдскулы помнят о тебе!) среди них в настоящее время не наблюдается; да даже если бы они и были — выделенной видеопамяти смартфонная архитектура не предусматривает. Здесь всё определяет общий предустановленный объём ОЗУ: на флагманских моделях с 8−12 Гбайт удастся запустить такие заслуживающие внимания современные модели с возможностями «рассуждений» и мультимодальности, как Gemma 4 E4B (приблизительно 4,5 млрд активных параметров из общего числа 8 млрд) или Qwen 3 4B (4 млрд параметров). В среднем ценовом сегменте (6–8 Гбайт ОЗУ) придётся довольствоваться Qwen 3 1.7B или SmolLM 2 1.7B, а обладателям смартфонов с 4–6 Гбайт памяти доступны Gemma 3 1B или Llama 3.2 1B менее чем с 1 млрд параметров каждая.
Эксперты отмечают, что количественная «мера безопасности» (safety metrics) ИИ-модели, определяющая частоту появления галлюцинаций, «вредных советов» и прочих нежелательных либо напрямую опасных комментариев, напрямую зависит от размера: у МЯМ safety metrics системно ниже, чем даже у тех БЯМ, дистилляцией из которых они получаются (источник: ACM)
Здесь кстати придётся напоминание о том, что граница между БЯМ и МЯМ (условная, разумеется, — архитектурно-то они практически идентичны) довольно-таки размыта — и определяется весьма вольно, от 1 до 15 млрд параметров. Как правило, в наши дни МЯМ для персональных систем не разрабатываются с нуля, а представляют собой дистиллированные версии родственных БЯМ, оптимизированные вдобавок в плане квантизации: вместо того, чтобы хранить значения весов в виде дробных чисел с плавающей запятой и 16 либо 8 значащими цифрами (форматы FP16, FP8 соответственно), они полагаются на целочисленное представление — INT4 или INT8, что ещё более сокращает занимаемое ими в оперативной памяти место.
Смысл МЯМ — именно в их универсальности: пусть и выполняющие свои задачи не так хорошо, как старшие сестрички, они незаменимы там, где ключевым для гаджета выступает текстовое или голосовое взаимодействие с его владельцем в ходе решения неограниченного круга задач. Здесь, опять-таки, на первое место выступает низкая латентность: в случае локальной МЯМ от получения подсказки (голосовой либо текстовой) до выдачи ответа проходит 25-100 мс, тогда как облачная модель — бесспорно более мощная и сведущая! — изложит своё весомое мнение не ранее чем через 300-800 мс. Это важно для таких повседневных приложений, как перевод на иностранный язык (либо с него) в реальном времени, автокоррекция клавиатурного ввода, быстрое реагирование на голосовые команды, отдаваемые встроенной в смартфон умной камере («Два и восемь! Диафрагма два точка восемь, таблетка ты стоеросовая!») и т. п. Казалось бы, ерунда; ну что такое секундная задержка, если за этот интервал из облака может прийти куда более полный и внятный ответ? Но исследования показывают, что такого рода регулярные запинки разрушают у пользователя иллюзию коммуникации с подлинно интеллектуальным собеседником, насколько бы правдоподобно ни синтезировалась машинная речь.
Новый заход на тему Windows-on-ARM грозит состояться уже осенью 2026-го, когда сразу несколько вендоров обещают вывести на мировой рынок персональные компьютеры на основе Nvidia RTX Spark — ARM-чипа, специально созданного для запуска локальных ИИ-агентов. 20 ядер Grace, графический процессор Blackwell RTX (6144 ядер CUDA), до 128 Гбайт унифицированной памяти LPDDR5X должны обеспечить производительность ИИ-моделей в квантизации FP4 AI до 1 ПФЛОПС (источник: Nvidia)
Бесспорно, тут играют и прочие приводившиеся уже аргументы в пользу локализации ИИ: повышенная конфиденциальность доверяемых модели чувствительных данных, независимость от качества канала связи в текущий момент, а также банальная экономия (модель с открытыми весами на смартфоне или ПК производит инференс бесплатно). На практике разумным представляется гибридный, комбинированный подход: МЯМ на смартфонах или ПК (Microsoft Copilot тут только первая ласточка; дальше локальных ИИ-помощников будет появляться всё больше) станут использовать для требующих стремительной реакции, конфиденциальных и несложных, но утомительных для ручного исполнения работ. В то же время к облачным БЯМ примутся обращаться за решением ресурсоёмких (включая мультиагентные), сложных и редко встречающихся задач — с эмуляцией глубоких логических умозаключений, с крупными контекстными окнами и т. п.
Если МЯМ занимают промежуточное положение между большими моделями и совсем крохотными (термин TinyML вполне адекватно описывает последние, — число параметров в них может не доходить и до миллиона), то эти-то малютки для чего могут понадобиться? Да вот как раз для тех самых промышленных интеллектуальных хабов, элементов умного дома, самостоятельно анализирующих события в поле своего зрения камер и т. д.; в общем, для всех специализированных устройств, которым регулярно приходится решать довольно узкий круг задач. Модели TinyML запускают на микроконтроллерах с крайне ограниченными ресурсами и малым энергопотреблением, часто вовсе без операционной системы, располагающих ничтожными объёмами ОЗУ — 256 Кбайт для ARM Cortex-M, ESP32 или Arduino Nano не редкость. Понятно, что архитектура таких моделей тоже весьма специфична: часто они представляют собой миниатюрные одномерные свёрточные нейронные сети (CNN), рекуррентные нейронные сети (RNN) или квантованные деревья решений. Корректнее даже было бы называть многие из них не языковыми моделями, а специализированными классификаторами — своего рода «ничейной землёй» между явно задаваемыми и нейросетевыми, существенно стохастическими алгоритмами. Грубо говоря, малая нейросеть, определяющая, какую именно цифру от 0 до 9 ей демонстрируют в виде картинки, и есть пример такого классификатора: в пределах своей компетенции она может быть весьма точной, но если вместо «3» ей подсунут букву «З», или же «о» вместо «0», она добросовестно отнесёт неведомый символ к одной из известных ей категорий. Тут речь уже не о «галлюцинациях», а об исходной ограниченности тренировочной базы, — так что живому оператору самому придётся тщательно следить за тем, чтобы TinyML применялись строго по назначению.
Но ведь если весьма обширная палитра автономных ИИ-устройств решает исключительно вполне определённого типа задачи, не разумнее ли будет применять для запуска соответствующих моделей не универсальные микроконтроллеры — тем более, что доступное на них количество транзисторов не даёт возможности проектировщикам хорошенько развернуться, — а узкоспецифические? Всё верно; специализированные интегральные схемы (application-specific integrated circuit, ASIC) для самостоятельно оперирующих интеллектуальных гаджетов активно используют, особенно на производстве. Их, конечно, нельзя перепрограммировать; все особенности реализуемой на таком «железе» нейросети намертво прошиты на аппаратном уровне. Зато энергоэффективность таких чипов оказывается на высоте, что особенно важно для решаемых ими задач: обработка изображений непосредственно на фиксирующем их устройстве, распознавание ключевых слов (команд оператора), шумоподавление в активных наушниках (да-да, тут теперь тоже не обходится без ИИ!) и т. п. В пример можно привести Google Edge TPU, Hailo-8, Syntiant NDP, Sony IMX500 и многие другие ASIC, на которых исполняются специфические модели высокой степени квантизации — вроде MobileNet V2 — при энергопотреблении менее 1 Вт на микросхему. Разумеется, и многие применяемые в умных авто ИИ-контроллеры также относятся к категории ASIC — как упоминавшийся уже Tesla FSD, обеспечивающий инференс патентованных нейронных сетей Tesla для автономного вождения.
Чуть больше свободы разработчикам обещает применение программируемых логических интегральных схем (ПЛИС; они же field-programmable gate arrays — FPGA). Такие чипы (AMD Xilinx Kria K26, Altera Agilex, Efinix Titanium Edge и многие другие) со способностью командным методом реконфигурировать аппаратную логику особенно ценны для промышленных и робототехнических приложений. Дело в том, что физическая реальность слишком непредсказуема, так что полагаться на раз и навсегда обученную ИИ-модель (тем более с ничтожным числом параметров) для адекватного взаимодействия с ним автономному устройству попросту опасно. И ПЛИС здесь попросту незаменимы как раз потому, что допускают перезапись однажды прошитой на аппаратном уровне модели. Кроме того, ИИ-гаджет на базе FPGA выходит более универсальным, чем на ASIC: одну и ту же камеру с небольшой ПЛИС можно сегодня эффективно использовать для распознавания лиц на проходной предприятия (сличения их с неким загруженным в систему каталогом), а завтра — для чтения номерных знаков проезжающих мимо той же проходной машин. Ещё два обширных поля для применения ИИ на ПЛИС — военные и космические задачи: одна-единственная энергоэффективная микросхема на некоем аппарате, физический доступ к которому после запуска исключён, способная в одной конфигурации распознавать образы, а в другой — реализовывать постквантовую криптографию, чтобы эти образы без опаски передавать в эфире куда следует, дорогого (в буквальном смысле слова) стоит.
Наушники Bose QuietComfort Ultra — как раз из тех, что подавляют внешние шумы благодаря автономно работающей на встроенном «железе» ИИ-модели (источник: Bose)
Как видим, областей применения у малых и совсем крохотных моделей машинного обучения предостаточно — и дальнейшее развитие монструозных облачных нейросетей их ни в коем случае на свалку истории не отправит. Не зря, кстати, сама же Microsoft недавно сетовала на то, что её инженеры «чрезмерно» используют облачную БЯМ OpenAI GPT-5.6 и в хвост, и в гриву, сжигая дорогостоящие токены без особой отдачи, — тогда как могли бы полагаться на доморощенный Copilot, который, между прочим, сами же и разрабатывают; озорники такие. Гибридный взвешенный подход с балансировкой между локальными и доступными через облако ИИ (в соотношении, по экспертным подсчётам, вплоть до 9:1 для подавляющего большинства обыденных повседневных заданий) явно придётся по душе нервно подсчитывающим затраты на эту модную технологию владельцам самых разнообразных предприятий. Всему своё время и место — и локальным ИИ-вычислениям в том числе!