#спекулятивная декодировка

И инструменты ·30 июл 2026

Tencent открыл AngelSpec — фреймворк для обучения драфтеров спекулятивной декодировки под разные типы задач

Tencent выложил AngelSpec — torch-фреймворк для обучения черновых моделей в спекулятивной декодировке. Вместо одной универсальной модели обучает две: MTP для диалогов, DFly для кода и математики. На Qwen3-8B и Hy3-A21B прирост acceptance length до 60%, особенно на код и формальные рассуждения.

0 81
И инструменты ·29 июл 2026

llama.cpp теперь загружает MTP-тензоры по умолчанию — лишний гигабайт VRAM для всех

Свежие сборки llama.cpp автоматически загружают MTP/NextN-тензоры из GGUF-моделей (GLM-5.2, Qwen3.5-MoE и др.), даже если спекулятивная декодировка отключена. Раньше эти блоки грузились только при явном --spec-type draft-mtp. Теперь каждый запуск жрёт на ~1 дополнительный MoE-слой памяти, даже если MTP не используется.

0 61