Сегодня 16 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

ИИ-модели могут работать на чём угодно: энтузиаст запустил LLM на микроконтроллере за $10

В 2026 году большие языковые модели можно локально запускать на ноутбуках и даже смартфонах. Энтузиаст под псевдонимом SlvDev запустил небольшую языковую модель локально на микроконтроллере ESP32-S3 за $10 и добился скорости работы без малого 10 токенов в секунду.

 Источник изображения: Igor Omilaev / unsplash.com

Источник изображения: Igor Omilaev / unsplash.com

Микроконтроллер ESP32-S3 располагает 520 кбайт SRAM и 8 Мбайт псевдо-SRAM (PSRAM). Он предназначен для управления удалёнными датчиками устройствами интернета вещей и другим оборудованием — модель класса DeepSeek V4 Flash на нём запустить не получится. Вместо неё энтузиаст выбрал систему в 10 000 раз компактнее — разработанную Microsoft Research модель TinyStories с 28,9 млн параметров.

В исходном виде и она оказалась слишком объёмной для ESP32-S3: при 16-битной точности ей требуются около 60 Мбайт пространства, которого на микроконтроллере просто нет. Поэтому на начальном этапе автор проекта провёл квантование — сжал веса модели с 16 до 8, а затем и до 4 битов. В результате модель стала занимать 14,9 Мбайт, и для её установки пришлось приобрести вариант микроконтроллера с флеш-памятью на 16 Мбайт.

Далее энтузиаст провёл ещё одну операцию — реализовал механизм послойного встраивания (Per-layer embedding — PLE), который используется в архитектуре открытых моделей Google Gemma. В результате значительную часть весов модели или 25 млн параметров размером 12 Мбайт он перенёс во флеш-память, обращения к которой будут производиться относительно нечасто, а в оперативную память контроллера поместил лишь 2 Мбайт данных. В результате входные заголовки и кеш ключ-значение (KV) оказались в PSRAM, а для активации хватило 520 кбайт на SRAM. Благодаря этим мерам удалось получить генерацию со скоростью 9,88 токенов в секунду — быстрее, чем может читать среднестатистический человек.

Модель Tiny Stories стала отличным примером для демонстрации концепции, но она только генерирует короткие истории, и этого недостаточно даже для запуска чат-бота. Есть ещё имеющая схожие размеры модель Barista, и она уже умеет отвечать на вопросы, причём генерирует токены вдвое быстрее, но только на темы, связанные с эспрессо. Обе модели слишком маленькие, чтобы делать что-то ещё, но сам факт их работы на ESP32 уже впечатляет.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Databricks привлекла $5 млрд, хотя инвесторы были готовы дать $15 млрд 38 мин.
Новая статья: Big Walk — друзья познаются на прогулке. Рецензия 14 ч.
Прицениваясь к Anthropic, инвесторы всерьёз прикидывают её выручку через два года 14 ч.
Открытые ИИ-модели Alibaba Qwen стали самыми востребованными в мире, опередив альтернативы Google и Meta 18 ч.
Microsoft предупредила о завершении поддержки Windows 10 Enterprise LTSB 2016 и других версий ОС 20 ч.
В интернете кончились тексты: разработчики ИИ начали скупать корпоративные чаты и письма 22 ч.
OpenAI переосмыслила подход к безопасности после инцидента со взломом Hugging Face 22 ч.
В модулях памяти Corsair, G.Skill и Adata нашли уязвимость, через которую можно обходить защиту Windows 24 ч.
Высший суд Франции отклонил закон о запрете соцсетей для детей до 15 лет — он нарушает свободу слова 15-08 13:45
Опасная ошибка в macOS позволяла удалённо управлять чужим Mac без пароля 15-08 12:40
Amogy и 2G Energy испытали систему генерации энергии для ЦОД, работающую на аммиаке и природном газе 28 мин.
Власти США предостерегают союзников от сотрудничества с китайскими разработчиками ИИ 7 ч.
Sony рассказала, как новый апскейлер Enhanced PSSR улучшает качество графики на PS5 Pro 14 ч.
Intel предрекает разделение рынка ПК: новые сокеты — для энтузиастов, старые — для масс 18 ч.
Твердотельные аккумуляторы приблизились к промышленному производству 20 ч.
Пузырь ИИ надувается: крупнейшие IT-компании всё больше зарабатывают на инвестициях друг в друга 20 ч.
В Пекине пройдут Всемирные игры человекоподобных роботов с участием 2026 роботов 20 ч.
Производители видеокарт предупреждают о надвигающемся дефиците — сильнее всего пострадают бюджетные модели 21 ч.
Власти США призвали Apple не закупать китайскую память 22 ч.
Tesla скоро представит новый Roadster, и он будет летать 22 ч.