MoE-модель Qwen 35B-A3B в 4 раза быстрее dense-модели 27B при почти равном качестве кода
Разработчик сравнил MoE-архитектуру Qwen 35B-A3B с плотной моделью 27B на локальных задачах по кодингу. MoE оказалась в ~4 раза быстрее (116 vs 30 токенов/сек), но разница в качестве кода — минимальная на стандартных задачах. Dense-модель выигрывала только на сложных edge-кейсах с неявными зависимостями.
Если ты строишь AI-инструмент для кода или работаешь с локальными моделями — это доказательство, что MoE уже не компромисс, а рабочая альтернатива. Можно экономить на железе и API, не жертвуя качеством на большинстве задач.
Что произошло
Энтузиаст провёл локальное тестирование двух моделей Qwen на задачах рефакторинга и починки кода: MoE-архитектуру 35B-A3B (активирует ~3 млрд параметров) против dense-модели 27B. Железо — Radeon R9700 + Ryzen 9 5950X, llama.cpp с полной выгрузкой на GPU.
Скорость: MoE выдавала ~116 токенов/сек, dense — ~30 (в ~3,9 раза медленнее).
Качество: На обычных багфиксах, мультифайловых изменениях и парсинге обе модели справлялись примерно одинаково (7/10). Dense начинала выигрывать только на тяжёлых кейсах: неявные инварианты, сложные edge-кейсы, каскадные изменения при переименовании ID.
Квантизация разная (Q5_K_M vs Q4_K_XL), так что это не академическое сравнение архитектур, но тест показывает: количество активных параметров — плохой предсказатель реальной производительности. На практике разница в качестве оказалась куда меньше, чем разрыв в скорости.
Автор: Ксения Лаврова · Источник: reddit.com
Разработчикам. MoE-модели дают вполне рабочее качество кода при кратном ускорении — смысл присмотреться для локальных ассистентов и CI/CD-пайплайнов. Dense нужна, только если постоянно работаешь с рефакторингом сложных зависимостей и edge-кейсами.
Бизнесу. Для продуктов с кодогенерацией MoE может снизить затраты на железо и инференс в разы, почти не жертвуя качеством на типовых задачах. Bottleneck — только в редких сложных сценариях, где нужна глубокая семантика.
Инвесторам. MoE-архитектуры начинают закрывать качественный разрыв с dense на прикладных задачах. Это снижает entry barrier для локальных AI-инструментов и открывает рынок edge-инференса без облака. Потенциал роста в DevTools и on-premise решениях.
- Локальный AI-ассистент для кода на базе MoE: быстрый, работает офлайн, не требует топовой видеокарты — можно паковать в IDE-плагин для команд
- CI/CD-инструменты с автоматическим рефакторингом и code review на MoE-моделях: дёшево, быстро, privacy-first
- Консалтинг и интеграция MoE-моделей для enterprise: миграция с облачных API на локальные инстансы — экономия + безопасность
- Сервис тестирования кода с MoE: валидация PR, автоматические фиксы багов — конкурируем скоростью и ценой с GitHub Copilot
- Edge-платформы для embedded AI-кодинга: embedded-девайсы, роботы, IoT — где нужна скорость, но облако недоступно
- Тест локальный, на одной конфигурации железа и с разной квантизацией — результаты могут не масштабироваться на другие задачи и модели
- Dense-модели всё ещё выигрывают на сложных архитектурных изменениях — если продукт ориентирован на highend-разработчиков, MoE может разочаровать
- Экосистема MoE-моделей пока незрелая: мало готовых fine-tune, хуже документация, меньше комьюнити-поддержки, чем у плотных моделей
- Количество активных параметров — не единственный фактор: качество обучающих данных, alignment, квантизация — всё это влияет сильнее архитектуры
Этот тест — не академическая выжимка, а реальный опыт разработчика, который просто взял две модели и прогнал их через свой код. И вот что интересно: MoE оказалась не «быстрой, но глупой», а «быстрой и вполне умной на обычных задачах». Плотная модель выигрывала только там, где нужно было держать в голове сложные зависимости и неявные инварианты — то есть на задачах, которые большинство разработчиков решают раз в неделю, а не каждый день.
Для меня главный вывод не в цифрах скорости, а в том, что количество активных параметров — это хреновая метрика для оценки модели. Все смотрят на параметры, как на IQ, но в реальности важнее, как модель обучена и на чём квантизирована. Если ты делаешь продукт для массового рынка — MoE уже можно брать всерьёз. Если работаешь с энтерпрайзом и сложными архитектурными изменениями — dense пока рулит. Но окно для локальных AI-инструментов без облака открыто.
Комментарии