#CPU inference

И инструменты ·2 авг 2026

Kimi K3 (0.5 петабайта) запустили на одном CPU с 8 ГБ оперативки — голый C99, без GPU

Энтузиаст запустил гигантскую модель Kimi K3 (1.56 ТБ checkpoint) на обычном CPU с 8 ГБ RAM, написав inference-движок на чистом C99. Стриминг экспертов с NVMe, 4-битная квантизация без распаковки, 33 секунды на токен. Никаких фреймворков, GPU или BLAS — только OpenMP и 176 КБ бинарник.

0 116
И инструменты ·7 авг 2026

llama.cpp: новый PR разогнал Q2_0 квантизацию в 3 раза на обычных CPU — 8B модель с 2.4 до 8.2 tok/s

Открытый PR в llama.cpp добавляет VNNI-оптимизацию для Q2_0 квантизации, показывая 3–3.6x рост скорости на x86 CPU. На AMD EPYC 9645 8B модель в декоде разогналась с 2.39 до 8.20 tok/s, на Intel i5-13400 — с 2.17 до 6.92 tok/s. Работает на обычных десктопных процах (12–14 поколение Intel, Zen 4/5), где AVX-512 выключен, а AVX-VNNI есть.

0 57
И инструменты ·23 июл 2026

Сжатие KV-кеша LLM в 8 раз на CPU: инженерия за AdapTQ

Автор создал AdapTQ — открытую C++ библиотеку, которая сжимает KV-кеш больших языковых моделей в 8 раз при работе на обычных CPU (MacBook, Raspberry Pi). Это решает проблему нехватки оперативной памяти при длинных контекстах и ускоряет генерацию токенов благодаря снижению потребности в пропускной способности памяти.

0 123
И инструменты ·23 июл 2026

Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100

Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.

0 109
И инструменты ·29 июл 2026

Liquid AI выпустила энкодеры LFM2.5 на 230М и 350М параметров: работают на CPU с контекстом 8К токенов

Liquid AI открыла две модели-энкодера (230М и 350М параметров) с контекстом 8192 токена, которые работают быстро на обычном процессоре. Переделали декодеры LFM2.5 в двунаправленные энкодеры для задач классификации, фильтрации и детекции PII — там, где GPU нет или дорого.

0 66
И инструменты ·24 июл 2026

Разработчик ускорил ядро в 29 раз — и получил всего 6% прироста в реальности

Разработчик inference-движка на C99 для тернарных моделей BitNet две недели писал новое матричное ядро с AVX-512, разогнал его в 29 раз по бенчмаркам, но в реальном конвейере прирост оказался всего 6–10%. Причина: модель упирается в пропускную способность RAM (95% загрузки), а не в вычисления — быстрее считать нечего, если данные не успевают подгружаться.

0 74