Алгоритмы спекулятивной генерации: DSpark, DFlash и Multi-Token Prediction
Автогрессивная генерация текста в LLM медленна, потому что каждый токен требует отдельного прохода через модель. Спекулятивная декодировка решает эту проблему: быстрый механизм предлагает несколько токенов-кандидатов, которые основная модель проверяет параллельно за один проход. Статья разбирает три современных подхода к спекулятивной генерации.
0
41