Модель распознавания речи на 13 млн параметров запустили на микроконтроллере за $10
Энтузиаст портировал квантованную версию Conformer ASR модели от NVIDIA на микроконтроллер ESP32-S3 стоимостью менее $10. После оптимизации модель с 13,1 млн параметров занимает 14 МБ флеш-памяти и транскрибирует 8 секунд аудио, хотя скорость остается медленной. Квантизация увеличила ошибку распознавания лишь на 3%.
Показывает путь к демократизации AI: если распознавание речи работает на чипе за 10 долларов, это открывает дорогу для тысяч DIY-проектов, офлайн-устройств и снижает зависимость от облачных сервисов. Альтернатива гонке гигантских моделей.
Нейросеть для распознавания речи на чипе за 700 рублей
Энтузиаст с ником wunschpunsch3D поделился успешной попыткой запустить 13-миллионную модель распознавания речи на микроконтроллере ESP32-S3 — железке размером с почтовую марку, которая стоит меньше $10.
От катастрофы к рабочему прототипу
Базой послужила модель Conformer от NVIDIA с Hugging Face — её дистиллировали и квантовали до 8-битного представления. В итоге модель уместилась в 14 МБ флеш-памяти и использует 256 КБ оперативки плюс 4 МБ дополнительной PSRAM для обработки 8 секунд аудио.
Первая попытка была провальной: транскрипция 5 секунд занимала 10 минут. После оптимизации скорость выросла на порядки, хотя автор признаёт — всё ещё «мучительно медленно». Для сравнения: Whisper Tiny на этом же железе обрабатывал 5 секунд за 50 минут, поэтому его дальше не оптимизировали.
Что под капотом
ESP32-S3 имеет аппаратное ускорение для 8-битных операций — это единственное, что делает машинное обучение на нём хоть как-то реальным. Квантизация и дистилляция увеличили Word Error Rate всего на ~3% по бенчмаркам Hugging Face — вполне приемлемая цена за возможность работы на микроконтроллере.
Почему это важно
Автор подчеркивает: индустрия помешалась на гонке параметров и топовых строчках бенчмарков, забывая об эффективности. Портирование моделей на доступное железо — это вопрос демократизации технологий и сохранения AI как хобби для широкой аудитории, а не привилегии владельцев серверных ферм.
Ключевые выводы
- Модель на 13 млн параметров можно запустить на микроконтроллере за $10 с помощью квантизации и дистилляции
- 8-битная квантизация увеличивает ошибку распознавания всего на 3% — приемлемый компромисс для edge-устройств
- ESP32-S3 с аппаратным ускорением для 8-bit математики делает edge AI реальным, хотя скорость остается узким местом
- Whisper Tiny оказался слишком тяжёлым даже для оптимизированного запуска на микроконтроллерах
- Индустрия фокусируется на гигантских моделях в ущерб эффективности и доступности для хоббистов
Автор: Ксения Лаврова · Источник: reddit.com
Это классный пример того, как можно идти против течения индустрии. Пока все мерятся размерами моделей и считают петафлопсы, кто-то упорно пихает речевую нейросеть в железку за цену обеда. Да, медленно. Да, с компромиссами. Но работает.
Важнее другое: это реальная альтернатива облачной зависимости. Если можешь распознавать речь локально на ESP32, то не нужен ни интернет, ни подписка на API, ни беспокойство о приватности. Для IoT, DIY-проектов и embedded-систем это золото. Жаль только, что подобных исследований — капля в море на фоне бесконечной гонки за SOTA на бенчмарках.
Комментарии