Liquid AI выпустила DSpark-драфтеры для LFM2.5: ускорение декодинга до 3,18x без потери качества
Liquid AI представила драфт-модели для LFM2.5 (1.2B, 2.6B, 8B), которые ускоряют генерацию текста до 3,18x на H100 и до 2,87x на M4 Max через спекулятивное декодирование. Драфтер (~300M параметров) предлагает 9 токенов за раз, целевая модель проверяет все разом. Выход идентичен оригиналу при жадном декодинге, точность не меняется. Работает в llama.cpp и SGLang, но требует самостоятельного хостинга.