#LLM inference

М модели ·28 июл 2026

Алгоритмы спекулятивной генерации: DSpark, DFlash и Multi-Token Prediction

Автогрессивная генерация текста в LLM медленна, потому что каждый токен требует отдельного прохода через модель. Спекулятивная декодировка решает эту проблему: быстрый механизм предлагает несколько токенов-кандидатов, которые основная модель проверяет параллельно за один проход. Статья разбирает три современных подхода к спекулятивной генерации.

0 41
И инструменты ·24 июл 2026

Core ML vs. Core AI: Кто управляет циклом генерации?

Apple выпустила Core AI (iOS/macOS 27+) — преемника Core ML для запуска LLM на устройствах. Главное отличие не в возможностях моделей, а в том, кто управляет циклом генерации токенов: приложение (CPU) или системная среда выполнения (runtime). Это даёт измеримое ускорение в 3,5 раза на идентичной модели.

0 19