Сегодня 05 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

ИИ-модели могут работать на чём угодно: энтузиаст запустил LLM на микроконтроллере за $10

В 2026 году большие языковые модели можно локально запускать на ноутбуках и даже смартфонах. Энтузиаст под псевдонимом SlvDev запустил небольшую языковую модель локально на микроконтроллере ESP32-S3 за $10 и добился скорости работы без малого 10 токенов в секунду.

 Источник изображения: Igor Omilaev / unsplash.com

Источник изображения: Igor Omilaev / unsplash.com

Микроконтроллер ESP32-S3 располагает 520 кбайт SRAM и 8 Мбайт псевдо-SRAM (PSRAM). Он предназначен для управления удалёнными датчиками устройствами интернета вещей и другим оборудованием — модель класса DeepSeek V4 Flash на нём запустить не получится. Вместо неё энтузиаст выбрал систему в 10 000 раз компактнее — разработанную Microsoft Research модель TinyStories с 28,9 млн параметров.

В исходном виде и она оказалась слишком объёмной для ESP32-S3: при 16-битной точности ей требуются около 60 Мбайт пространства, которого на микроконтроллере просто нет. Поэтому на начальном этапе автор проекта провёл квантование — сжал веса модели с 16 до 8, а затем и до 4 битов. В результате модель стала занимать 14,9 Мбайт, и для её установки пришлось приобрести вариант микроконтроллера с флеш-памятью на 16 Мбайт.

Далее энтузиаст провёл ещё одну операцию — реализовал механизм послойного встраивания (Per-layer embedding — PLE), который используется в архитектуре открытых моделей Google Gemma. В результате значительную часть весов модели или 25 млн параметров размером 12 Мбайт он перенёс во флеш-память, обращения к которой будут производиться относительно нечасто, а в оперативную память контроллера поместил лишь 2 Мбайт данных. В результате входные заголовки и кеш ключ-значение (KV) оказались в PSRAM, а для активации хватило 520 кбайт на SRAM. Благодаря этим мерам удалось получить генерацию со скоростью 9,88 токенов в секунду — быстрее, чем может читать среднестатистический человек.

Модель Tiny Stories стала отличным примером для демонстрации концепции, но она только генерирует короткие истории, и этого недостаточно даже для запуска чат-бота. Есть ещё имеющая схожие размеры модель Barista, и она уже умеет отвечать на вопросы, причём генерирует токены вдвое быстрее, но только на темы, связанные с эспрессо. Обе модели слишком маленькие, чтобы делать что-то ещё, но сам факт их работы на ESP32 уже впечатляет.

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
Microsoft призвала инженеров не злоупотреблять использованием ИИ — это дорого 36 мин.
Российские энтузиасты перенесли GTA III в браузер, хотя это считалось невозможным 2 ч.
Исследователи уличили ИИ-агентов OpenAI и Anthropic в новых попытках взлома 3 ч.
Исследователи «спустили с поводка» ИИ-модели — те попытались добавить вредоносный код в открытое ПО 3 ч.
Белый дом не станет раскрывать свою схему тестирования ИИ-моделей на безопасность 3 ч.
Doom запустили прямо в Paint — и к этому причастен технический директор Microsoft Azure 4 ч.
Возвращение блудного сына: спустя шесть лет работы на EA в Ubisoft вернулся режиссёр Assassin’s Creed Valhalla 4 ч.
«Я был так близко»: шуточная игра This Game Costs 200 Dollars едва не сделала американского подростка миллионером 5 ч.
Рекламный бизнес соцсети X так и не восстановился до уровня Twitter 6 ч.
Только The Elder Scrolls VI: бывший дизайнер квестов Bethesda опроверг слухи о неанонсированной The Elder Scrolls 7 ч.