#CPU inference

И инструменты ·23 июл 2026

Сжатие KV-кеша LLM в 8 раз на CPU: инженерия за AdapTQ

Автор создал AdapTQ — открытую C++ библиотеку, которая сжимает KV-кеш больших языковых моделей в 8 раз при работе на обычных CPU (MacBook, Raspberry Pi). Это решает проблему нехватки оперативной памяти при длинных контекстах и ускоряет генерацию токенов благодаря снижению потребности в пропускной способности памяти.

0 122
И инструменты ·23 июл 2026

Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100

Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.

0 108
И исследования ·15 июл 2026

Новая архитектура внимания на FFT: 128K контекста на CPU ноутбука вместо GPU

Независимый исследователь разработал альтернативу стандартному механизму внимания в LLM — Wave Field, основанную на FFT-свёртке. Утверждает O(N log N) при обучении и O(1) при инференсе, что даёт 80+ токенов/сек на CPU ноутбука при контексте 128K токенов, где обычное внимание падает от нехватки памяти. Модель 130M параметров показывает ~47% в zero-shot бенчмарках против 26,5% у GPT-2 124M. Код открыт, автор просит независимое тестирование.

0 219