DSpark: спекулятивное декодирование с управлением по уверенности
DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.
Исследователям и инженерам, работающим с оптимизацией inference LLM в production-системах с высокой конкурентностью пользователей. Показывает практический путь балансировки между параллельной скоростью генерации и качеством предложенных токенов с учётом реальных ограничений на вычислительные ресурсы.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- DSpark сочетает параллельную архитектуру DFlash с лёгкой последовательной головой (Markov head), которая корректирует предсказания на основе предыдущего токена через низкоранговую факторизацию вместо полной матрицы переходов
- Система динамически выбирает длину префикса для верификации на основе калиброванных оценок уверенности, учитывая текущую загрузку GPU в high-concurrency окружении
- В production-развёртывании DeepSeek-V4 DSpark показывает ускорение генерации на 60-85% для V4-Flash и 57-78% для V4-Pro при сохранении throughput
- Метод решает проблему 'suffix decay' в блочных диффузионных драфтерах, когда поздние токены в блоке становятся менее связными из-за отсутствия информации о реально выбранных ранних токенах
Комментарии