#оптимизация inference

М модели ·25 июл 2026

DSpark: спекулятивное декодирование с управлением по уверенности

DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.

0 108
И инструменты ·23 июл 2026

Как заставить 3B-модель работать как 30B: метод «структурной упряжки» вместо слепого промпт-инжиниринга

Разработчик поделился методом, как выжать максимум из малых локальных LLM (3B–8B параметров). Вместо огромных системных промптов он использует жёсткие markdown-шаблоны — «скелеты» с чёткими слотами для переменных. Модель не придумывает структуру, а только заполняет пробелы по строгим правилам, что резко повышает качество и стабильность генерации.

0 90