#спекулятивное декодирование

И инструменты ·20 авг 2026

Liquid AI выпустила DSpark-драфтеры для LFM2.5: ускорение декодинга до 3,18x без потери качества

Liquid AI представила драфт-модели для LFM2.5 (1.2B, 2.6B, 8B), которые ускоряют генерацию текста до 3,18x на H100 и до 2,87x на M4 Max через спекулятивное декодирование. Драфтер (~300M параметров) предлагает 9 токенов за раз, целевая модель проверяет все разом. Выход идентичен оригиналу при жадном декодинге, точность не меняется. Работает в llama.cpp и SGLang, но требует самостоятельного хостинга.

0 50
М модели ·25 июл 2026

DSpark: спекулятивное декодирование с управлением по уверенности

DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.

0 108