модели 1 мин

Модель распознавания речи на 13 млн параметров запустили на микроконтроллере за $10

Энтузиаст портировал квантованную версию Conformer ASR модели от NVIDIA на микроконтроллер ESP32-S3 стоимостью менее $10. После оптимизации модель с 13,1 млн параметров занимает 14 МБ флеш-памяти и транскрибирует 8 секунд аудио, хотя скорость остается медленной. Квантизация увеличила ошибку распознавания лишь на 3%.

Показывает путь к демократизации AI: если распознавание речи работает на чипе за 10 долларов, это открывает дорогу для тысяч DIY-проектов, офлайн-устройств и снижает зависимость от облачных сервисов. Альтернатива гонке гигантских моделей.

Нейросеть для распознавания речи на чипе за 700 рублей

Энтузиаст с ником wunschpunsch3D поделился успешной попыткой запустить 13-миллионную модель распознавания речи на микроконтроллере ESP32-S3 — железке размером с почтовую марку, которая стоит меньше $10.

От катастрофы к рабочему прототипу

Базой послужила модель Conformer от NVIDIA с Hugging Face — её дистиллировали и квантовали до 8-битного представления. В итоге модель уместилась в 14 МБ флеш-памяти и использует 256 КБ оперативки плюс 4 МБ дополнительной PSRAM для обработки 8 секунд аудио.

Первая попытка была провальной: транскрипция 5 секунд занимала 10 минут. После оптимизации скорость выросла на порядки, хотя автор признаёт — всё ещё «мучительно медленно». Для сравнения: Whisper Tiny на этом же железе обрабатывал 5 секунд за 50 минут, поэтому его дальше не оптимизировали.

Что под капотом

ESP32-S3 имеет аппаратное ускорение для 8-битных операций — это единственное, что делает машинное обучение на нём хоть как-то реальным. Квантизация и дистилляция увеличили Word Error Rate всего на ~3% по бенчмаркам Hugging Face — вполне приемлемая цена за возможность работы на микроконтроллере.

Почему это важно

Автор подчеркивает: индустрия помешалась на гонке параметров и топовых строчках бенчмарков, забывая об эффективности. Портирование моделей на доступное железо — это вопрос демократизации технологий и сохранения AI как хобби для широкой аудитории, а не привилегии владельцев серверных ферм.

Ключевые выводы

  • Модель на 13 млн параметров можно запустить на микроконтроллере за $10 с помощью квантизации и дистилляции
  • 8-битная квантизация увеличивает ошибку распознавания всего на 3% — приемлемый компромисс для edge-устройств
  • ESP32-S3 с аппаратным ускорением для 8-bit математики делает edge AI реальным, хотя скорость остается узким местом
  • Whisper Tiny оказался слишком тяжёлым даже для оптимизированного запуска на микроконтроллерах
  • Индустрия фокусируется на гигантских моделях в ущерб эффективности и доступности для хоббистов
квантизацияedge AIASRмикроконтроллерыоптимизация

Автор: Ксения Лаврова · Источник: reddit.com

Мнение редакции

Это классный пример того, как можно идти против течения индустрии. Пока все мерятся размерами моделей и считают петафлопсы, кто-то упорно пихает речевую нейросеть в железку за цену обеда. Да, медленно. Да, с компромиссами. Но работает.

Важнее другое: это реальная альтернатива облачной зависимости. Если можешь распознавать речь локально на ESP32, то не нужен ни интернет, ни подписка на API, ни беспокойство о приватности. Для IoT, DIY-проектов и embedded-систем это золото. Жаль только, что подобных исследований — капля в море на фоне бесконечной гонки за SOTA на бенчмарках.

Ещё по теме

Комментарии