Tencent открыл AngelSpec — фреймворк для обучения драфтеров спекулятивной декодировки под разные типы задач
Tencent выложил AngelSpec — torch-фреймворк для обучения черновых моделей в спекулятивной декодировке. Вместо одной универсальной модели обучает две: MTP для диалогов, DFly для кода и математики. На Qwen3-8B и Hy3-A21B прирост acceptance length до 60%, особенно на код и формальные рассуждения.
Inference — самая затратная часть production LLM-систем. AngelSpec показывает, как снизить расходы на 30-60% без потери качества, если правильно разделить нагрузку.
Что произошло
Tencent выпустил AngelSpec — open-source фреймворк на PyTorch для обучения драфтеров в спекулятивной декодировке. Идея простая: лёгкая модель предлагает несколько следующих токенов, тяжёлая целевая модель проверяет их за один проход. Если подходит — принимаем, нет — отбрасываем и генерируем заново. Ускорение зависит от двух вещей: сколько токенов приняли и сколько времени заняла связка генерация-проверка.
Проблема: обычно обучают одну универсальную драфтер-модель на усреднённой смеси данных. Реальная нагрузка разнородная: в диалогах высокая энтропия, много вариантов продолжения — длинные предложения не проходят проверку, лучше короткие. В коде и математике наоборот: синтаксис, повторяющиеся переменные, формальные выражения создают длинные предсказуемые последовательности — выгодно предлагать блоками.
AngelSpec поставляет две модели: MTP (multi-token prediction) для диалогов и DFly (block-diffusion) для кода и математики. MTP обучается на разнообразных диалоговых данных, DFly усилен 700К примеров кода и математики из OpenCodeInstruct, OpenCodeReasoning и других источников.
Ключевые улучшения MTP: авторегрессивный анролл на нескольких глубинах с переиспользованием одного физического блока, заморозка целевой модели и обучение на роллаутах целевой модели вместо исходного корпуса. Результат: средний acceptance вырос с 52,8% до 66,4%, принятая длина с 2,58 до 2,99 токена. На третьей позиции acceptance подскочил с 29% до 70,6% на GSM8K.
DFly: гибридный бэкбон с FC-веткой и per-layer fusion, плюс небольшая авторегрессивная голова после параллельного бэкбона (предшественник-условная AR голова). На Qwen3-8B средняя accepted length 5,41 против 5,32 у DSpark и 3,24 у MTP. На Hy3-A21B: 4,79 против 3,69 у DFlash — относительный прирост 30-60%.
Автор: Юлия Тарасова · Источник: marktechpost.com
Разработчикам. Torch-native фреймворк, легко интегрируется в существующие пайплайны. Две готовые архитектуры под разные режимы нагрузки: MTP для диалогов, DFly для кода/математики. Можно обучить свою драфтер-модель под специфику продакшна, freezing целевой модели упрощает деплой.
Бизнесу. Ускорение inference на 30-60% снижает затраты на GPU и латентность. Особенно критично для SaaS с кодогенерацией, матрешками запросов и техподдержкой: каждый тип задачи получает свой драфтер. Реальный ROI в production, где нагрузка не равномерна.
Инвесторам. Tencent активно двигает эффективность inference — один из ключевых барьеров масштабирования LLM-сервисов. Открытость AngelSpec ускорит появление конкурентов в inference-оптимизации, снизит барьер входа для стартапов. Рост сегмента специализированных драфтеров и inference-провайдеров.
- Сделать SaaS для автоматического подбора и обучения драфтеров под профиль нагрузки клиента: анализ логов, датасет-синтез, fine-tuning.
- Предложить managed-сервис спекулятивной декодировки для inference-провайдеров: drop-in решение для снижения затрат на API.
- Разработать специализированные драфтеры для узких вертикалей: юриспруденция, финансы, медицина — где стандартные MTP/DFly не оптимальны.
- Построить маркетплейс предобученных драфтеров под разные модели и задачи, монетизация через подписку и лицензии.
- Интегрировать AngelSpec в платформы для MLOps (Weights & Biases, MLflow): автоматизированные эксперименты по ускорению inference.
- Прирост зависит от того, насколько реальная нагрузка соответствует предположениям: если разнообразие задач выше, чем две категории, нужно обучать больше моделей — растут затраты.
- Спекулятивная декодировка усложняет инфраструктуру: нужны две модели в памяти, синхронизация, управление версиями. Не все команды готовы к этой сложности.
- На низких температурах (T=0) эффект максимальный, на высоких (креативная генерация) acceptance падает — выгода локализована на детерминированных задачах.
- Открытый код снижает конкурентное преимущество Tencent, но увеличивает давление на других вендоров — ценовая война на inference-услугах.
Спекулятивная декодировка — не новость, но AngelSpec наконец признаёт очевидное: нагрузка в production неоднородна, и один драфтер на всё — это как средняя температура по больнице. Два специализированных драфтера (диалоги + код) дают реальный прирост там, где это критично. Особенно впечатляет acceptance на глубоких позициях после обучения на роллаутах целевой модели — с 29% до 70% на третьей позиции в GSM8K.
Но давайте без розовых очков: это не серебряная пуля. Вам нужно чётко понимать профиль нагрузки, иметь инфраструктуру для двух моделей в памяти и готовность к усложнению пайплайна. Плюс прирост концентрируется на низких температурах — если у вас креативная генерация с высокой энтропией, эффект скромнее. Зато если у вас SaaS с кодогенерацией или формальными рассуждениями — это прямая экономия денег на GPU.
Комментарии