#архитектура моделей

М модели ·25 июл 2026

DSpark: спекулятивное декодирование с управлением по уверенности

DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.

0 108
И исследования ·15 июл 2026

Новая архитектура внимания на FFT: 128K контекста на CPU ноутбука вместо GPU

Независимый исследователь разработал альтернативу стандартному механизму внимания в LLM — Wave Field, основанную на FFT-свёртке. Утверждает O(N log N) при обучении и O(1) при инференсе, что даёт 80+ токенов/сек на CPU ноутбука при контексте 128K токенов, где обычное внимание падает от нехватки памяти. Модель 130M параметров показывает ~47% в zero-shot бенчмарках против 26,5% у GPT-2 124M. Код открыт, автор просит независимое тестирование.

0 219