Сегодня 25 августа 2026
18+
MWC 2018 2018 Computex IFA 2018
реклама
Новости Hardware

ИИ-модели могут работать на чём угодно: энтузиаст запустил LLM на микроконтроллере за $10

В 2026 году большие языковые модели можно локально запускать на ноутбуках и даже смартфонах. Энтузиаст под псевдонимом SlvDev запустил небольшую языковую модель локально на микроконтроллере ESP32-S3 за $10 и добился скорости работы без малого 10 токенов в секунду.

 Источник изображения: Igor Omilaev / unsplash.com

Источник изображения: Igor Omilaev / unsplash.com

Микроконтроллер ESP32-S3 располагает 520 кбайт SRAM и 8 Мбайт псевдо-SRAM (PSRAM). Он предназначен для управления удалёнными датчиками устройствами интернета вещей и другим оборудованием — модель класса DeepSeek V4 Flash на нём запустить не получится. Вместо неё энтузиаст выбрал систему в 10 000 раз компактнее — разработанную Microsoft Research модель TinyStories с 28,9 млн параметров.

В исходном виде и она оказалась слишком объёмной для ESP32-S3: при 16-битной точности ей требуются около 60 Мбайт пространства, которого на микроконтроллере просто нет. Поэтому на начальном этапе автор проекта провёл квантование — сжал веса модели с 16 до 8, а затем и до 4 битов. В результате модель стала занимать 14,9 Мбайт, и для её установки пришлось приобрести вариант микроконтроллера с флеш-памятью на 16 Мбайт.

Далее энтузиаст провёл ещё одну операцию — реализовал механизм послойного встраивания (Per-layer embedding — PLE), который используется в архитектуре открытых моделей Google Gemma. В результате значительную часть весов модели или 25 млн параметров размером 12 Мбайт он перенёс во флеш-память, обращения к которой будут производиться относительно нечасто, а в оперативную память контроллера поместил лишь 2 Мбайт данных. В результате входные заголовки и кеш ключ-значение (KV) оказались в PSRAM, а для активации хватило 520 кбайт на SRAM. Благодаря этим мерам удалось получить генерацию со скоростью 9,88 токенов в секунду — быстрее, чем может читать среднестатистический человек.

Модель Tiny Stories стала отличным примером для демонстрации концепции, но она только генерирует короткие истории, и этого недостаточно даже для запуска чат-бота. Есть ещё имеющая схожие размеры модель Barista, и она уже умеет отвечать на вопросы, причём генерирует токены вдвое быстрее, но только на темы, связанные с эспрессо. Обе модели слишком маленькие, чтобы делать что-то ещё, но сам факт их работы на ESP32 уже впечатляет.

Было интересно? Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект

Источник:

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER.
Материалы по теме

window-new
Soft
Hard
Тренды 🔥
«Выглядит лучше Modern Warfare 4»: короткая демонстрация научно-фантастического шутера Fragmentary Order от Никиты Буянова понравилась игрокам 10 мин.
Журналисты рассекретили, когда выйдут первые обзоры жестокого боевика Marvel’s Wolverine от создателей Marvel’s Spider-Man 2 ч.
Авторитетный инсайдер раскрыл сентябрьскую подборку игр PS Plus — подписчики приготовились к разочарованию 3 ч.
Microsoft встроила в ИИ-картинки скрытый идентификатор — по нему можно установить, кто их создал 3 ч.
Из австралийских чартов изгнали ИИ-музыку — трек должен быть «в значительной степени создан человеком» 4 ч.
Амбициозное фанатское дополнение вернёт Мексику в Red Dead Redemption 2, причём очень скоро — новый трейлер Nuevo Paraiso: The Forgotten Frontier 4 ч.
«Зомби-иск» о коде Linux вот-вот окончательно закопают 4 ч.
Ролевой боевик Mortal Shell 2 привлёк свыше полумиллиона игроков за первую неделю после релиза 5 ч.
Утечка пляжного геймплея GTA VI впечатлила фанатов проработкой NPC, а автор «сливов» ответил на обвинения в жадности 5 ч.
Lenovo признала, что обновление BIOS «окирпичивает» Legion Go — пострадавшим советуют обращаться в поддержку 7 ч.