Сегодня 15 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

ИИ-модели могут работать на чём угодно: энтузиаст запустил LLM на микроконтроллере за $10

В 2026 году большие языковые модели можно локально запускать на ноутбуках и даже смартфонах. Энтузиаст под псевдонимом SlvDev запустил небольшую языковую модель локально на микроконтроллере ESP32-S3 за $10 и добился скорости работы без малого 10 токенов в секунду.

 Источник изображения: Igor Omilaev / unsplash.com

Источник изображения: Igor Omilaev / unsplash.com

Микроконтроллер ESP32-S3 располагает 520 кбайт SRAM и 8 Мбайт псевдо-SRAM (PSRAM). Он предназначен для управления удалёнными датчиками устройствами интернета вещей и другим оборудованием — модель класса DeepSeek V4 Flash на нём запустить не получится. Вместо неё энтузиаст выбрал систему в 10 000 раз компактнее — разработанную Microsoft Research модель TinyStories с 28,9 млн параметров.

В исходном виде и она оказалась слишком объёмной для ESP32-S3: при 16-битной точности ей требуются около 60 Мбайт пространства, которого на микроконтроллере просто нет. Поэтому на начальном этапе автор проекта провёл квантование — сжал веса модели с 16 до 8, а затем и до 4 битов. В результате модель стала занимать 14,9 Мбайт, и для её установки пришлось приобрести вариант микроконтроллера с флеш-памятью на 16 Мбайт.

Далее энтузиаст провёл ещё одну операцию — реализовал механизм послойного встраивания (Per-layer embedding — PLE), который используется в архитектуре открытых моделей Google Gemma. В результате значительную часть весов модели или 25 млн параметров размером 12 Мбайт он перенёс во флеш-память, обращения к которой будут производиться относительно нечасто, а в оперативную память контроллера поместил лишь 2 Мбайт данных. В результате входные заголовки и кеш ключ-значение (KV) оказались в PSRAM, а для активации хватило 520 кбайт на SRAM. Благодаря этим мерам удалось получить генерацию со скоростью 9,88 токенов в секунду — быстрее, чем может читать среднестатистический человек.

Модель Tiny Stories стала отличным примером для демонстрации концепции, но она только генерирует короткие истории, и этого недостаточно даже для запуска чат-бота. Есть ещё имеющая схожие размеры модель Barista, и она уже умеет отвечать на вопросы, причём генерирует токены вдвое быстрее, но только на темы, связанные с эспрессо. Обе модели слишком маленькие, чтобы делать что-то ещё, но сам факт их работы на ESP32 уже впечатляет.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Открытые ИИ-модели Alibaba Qwen стали самыми востребованными в мире, опередив альтернативы Google и Meta 3 ч.
Microsoft предупредила о завершении поддержки Windows 10 Enterprise LTSB 2016 и других версий ОС 5 ч.
OpenAI переосмыслила подход к безопасности после инцидента со взломом Hugging Face 7 ч.
В модулях памяти Corsair, G.Skill и Adata нашли уязвимость, через которую можно обходить защиту Windows 9 ч.
Высший суд Франции отклонил закон о запрете соцсетей для детей до 15 лет — он нарушает свободу слова 9 ч.
Опасная ошибка в macOS позволяла удалённо управлять чужим Mac без пароля 10 ч.
Исход руководителей из OpenAI посеял в компании хаос перед выходом на биржу 12 ч.
Google удалила из «Play Маркета» приложения Ozon 15 ч.
Новая статья: Grim Dawn: Fangs of Asterkarn — мрачный юбилей. Рецензия 23 ч.
Корпоративный боевик Stick It to the Stickman от создателей Broforce и Anger Foot уйдёт с биржи раннего доступа Steam — новый трейлер и дата выхода 1.0 24 ч.
На заре Вселенной впервые обнаружена «чёрная звездодыра» размером с Солнечную систему 2 ч.
Intel предрекает разделение рынка ПК: новые сокеты — для энтузиастов, старые — для масс 2 ч.
Microsoft отступает из Китая: производство, магазины и сотрудники уходят — Azure остаётся 3 ч.
Пузырь ИИ надувается: крупнейшие IT-компании всё больше зарабатывают на инвестициях друг в друга 4 ч.
В Пекине пройдут Всемирные игры человекоподобных роботов с участием 2026 роботов 5 ч.
Tesla скоро представит новый Roadster, и он будет летать 7 ч.
D-Wave сообщила о прорыве в коррекции ошибок квантовых вычислений 7 ч.
196 Пбайт на стойку: хранилище Dell ObjectScale первым в мире получило поддержку 245-Тбайт SSD 8 ч.
Цены на серверные SSD за год взлетели в 6,5 раз: накопители на 30 Тбайт стоят уже $18–$22 тыс. 8 ч.
Google переформатировала стратегию Googlebook — сначала флагманы, потом массовый рынок 10 ч.