#llama.cpp

И инструменты ·17 авг 2026

Адаптивный MTP в llama.cpp: автоматическая оптимизация скорости генерации

В llama.cpp появился PR с адаптивным режимом MTP (Multi-Token Prediction), который динамически подбирает глубину предсказания токенов. При генерации кода скорость растёт на 10-15%, а при воспоминании кода из контекста — до 50-100% быстрее против статического MTP=3. Для прозы прирост скромнее: 3% хуже на плотных текстах, +20-30% при воспоминании.

0 126
И инструменты ·17 авг 2026

Qwen 3.8 27B на RTX 5060 Ti 16GB: 73k контекст и автономная разработка на 3 промптах

Энтузиаст прогнал 1M+ токенов через Qwen 3.8 27B на RTX 5060 Ti 16GB, добился 73k контекста в 16GB VRAM через квантизацию KV-кэша (q4_1) и нативный MTP. Построил полноценный REST API + MCP-сервер всего 3 промптами — модель работала автономно 2 часа, писала код, тесты, линтинг. Поделился точной конфигурацией llama.cpp для бюджетного железа.

0 115
И инструменты ·18 авг 2026

DeepSeek V4 Flash на четырёх RTX 3060: 100 tok/s на 144 ГБ модели с контекстом 360k

Энтузиаст запустил 144 ГБ модель DeepSeek V4 Flash на четырёх потребительских RTX 3060 12GB, добившись скорости обработки промпта ~100 tok/s и контекста 368k токенов. Ключ — экстремальное распределение экспертов MoE по GPU через llama.cpp и агрессивная настройка микробатчей. Показывает, что большие MoE-модели можно разгонять на доступном железе.

0 22
И инструменты ·13 авг 2026

Исправленный Jinja-шаблон для Qwen 3.5–3.8: теперь thinking можно выключить, а tool calling не крашится

Энтузиаст выпустил фикс для официального чат-шаблона Qwen 3.5–3.8, который ломает мультитёрн-диалоги, tool calling и управление reasoning. Новый шаблон добавляет переключение thinking on/off, поддержку llama.cpp и vLLM, не портит KV-кеш и работает с OpenAI API-форматом инструментов.

0 84
И инструменты ·11 авг 2026

DeepSeek V4 0731: квантизация до 104 ГБ с 83.6% точностью на RTX 5090

Команда AtomicChat квантизовала DeepSeek V4 0731, выявив критические баги в llama.cpp (NaN-значения и потерю точности при конвертации FP8). Создали 13 квантов с imatrix на 1.87M токенах, оптимизированных под RTX 5090. Лучший результат: 104 ГБ (AD-IQ2_M) с 83.6% точностью top-1, что обходит публичные кванты по PPL при одинаковом размере.

0 70
И инструменты ·9 авг 2026

Локальный AI за 900 евро: интегрированная графика AMD Radeon 780M тянет модели на 30+ миллиардов параметров

Энтузиаст показал, как запускать LLM на 30+ миллиардов параметров на мини-ПК с интегрированной графикой AMD Radeon 780M и 64 ГБ оперативки за ~900 евро. Qwen 3.6 35B выдаёт 21 токен/сек, Gemma 4 31B — 5-6 токенов/сек. Не быстро, но работает для личных задач без облака.

0 83
И инструменты ·6 авг 2026

Как ускорить Qwen 35B в 2.4 раза на RTX 3090 без потери скорости генерации

Исследователь показал, как сбросив 8 экспертных слоёв MoE-модели Qwen3.6-35B на CPU, можно увеличить batch-размеры и разогнать prompt processing с 564 до 1330 токенов/сек (2.36×) на RTX 3090, сохранив скорость генерации. Ключ — освобождение VRAM для увеличения батча, а не сам CPU-оффлоад.

0 124
И инструменты ·5 авг 2026

Qwen3-TTS в llama.cpp: клонирование голоса теперь работает локально из коробки

В llama.cpp добавили полноценную поддержку Qwen3-TTS — модели клонирования голоса из 3 секунд референса. Теперь можно синтезировать речь на 10 языках локально, через тот же движок, на котором крутятся LLM. Это упрощает интеграцию TTS в существующие проекты на llama.cpp, но есть нюансы.

0 105
И инструменты ·2 авг 2026

Хакерская оптимизация DeepSeek-V4: как сэкономить 30 ГБ RAM без потери качества

Энтузиаст TacoTakumi перепаковал DeepSeek-V4-Flash в 3-битный формат, квантизировав только экспертные слои. Результат: 111 ГБ вместо 140+, на 40% быстрее оригинала при частичной загрузке в RAM, качество лучше чем у полной IQ3_S-квантизации. Для тех, кто гоняет большие MoE-модели на разношёрстных GPU и не хочет скатываться до 2-битных квантов.

0 128
И инструменты ·30 июл 2026

MindControl для Llama.cpp: как сократить токены вдвое без потери точности в рассуждениях LLM

Разработчик протестировал MindControl — метод контроля «бюджета рассуждений» для llama.cpp через самоинструкции модели вместо жёсткой обрезки. Результат: снижение потребления токенов на 50% без потери точности на HumanEval+ и LiveCodeBench. Лучший результат (95.7%) получен при максимальных ограничениях — модель не зацикливается на простых задачах.

0 136
И инструменты ·7 авг 2026

llama.cpp: новый PR разогнал Q2_0 квантизацию в 3 раза на обычных CPU — 8B модель с 2.4 до 8.2 tok/s

Открытый PR в llama.cpp добавляет VNNI-оптимизацию для Q2_0 квантизации, показывая 3–3.6x рост скорости на x86 CPU. На AMD EPYC 9645 8B модель в декоде разогналась с 2.39 до 8.20 tok/s, на Intel i5-13400 — с 2.17 до 6.92 tok/s. Работает на обычных десктопных процах (12–14 поколение Intel, Zen 4/5), где AVX-512 выключен, а AVX-VNNI есть.

0 57
И инструменты ·29 июл 2026

Как заставить 8B-модель вызывать функции без косяков: компилятор грамматик GBNF

Разработчик собрал AI-агента на Rust + llama.cpp с 50+ инструментами и решил проблему невалидного JSON от маленьких моделей через компиляцию JSON Schema в GBNF-грамматики. Модель физически не может сгенерировать неправильный формат — сэмплер ограничивает токены на лету. Плюс семантический роутер сужает выбор с 50 до 3 инструментов за раз.

0 104
И инструменты ·27 июл 2026

Speculative decoding на Qwen3.6-27B: чем тяжелее квантизация, тем выше прирост скорости

Бенчмарк speculative decoding на Qwen3.6-27B показал парадоксальный результат: чем меньше сжата модель (Q8 против Q4), тем больший прирост даёт спекулятивная генерация. DFlash — самый быстрый алгоритм в общем случае, MTP — стабильная альтернатива, EAGLE3 и ngram проигрывают. Результаты справедливы для узкого сценария (короткие выходы, один поток), под нагрузкой выигрыш сожмётся.

0 117
И инструменты ·27 июл 2026

Ling-3.0-flash: обещания поддержки vs реальность — вес-файлы задерживаются, llama.cpp даже не планирует

Ant Group анонсировала Ling-3.0-flash, но вес-файлы ещё не открыты. SGLang обещает поддержку «в день релиза», vLLM ждёт публикации весов, а llama.cpp закрыл запрос на поддержку предыдущей версии (Ling-2.6) как «не планируется». Судя по паттерну предыдущих релизов, веса появятся после окончания бесплатного доступа к API — примерно 3 августа.

0 98
И инструменты ·3 авг 2026

ARPL: автоопределение железа для llama.cpp на ARM — никакой ручной настройки под чип

Разработчик выложил ARPL — библиотеку для llama.cpp, которая на лету определяет возможности ARM-процессора (ISA-расширения, топологию ядер) и автоматически настраивает модель. Больше не нужно собирать отдельные сборки под каждый телефон — всё работает из коробки на Snapdragon 8 Elite, старых чипах, любых ARM-устройствах.

0 36
И инструменты ·29 июл 2026

llama.cpp теперь загружает MTP-тензоры по умолчанию — лишний гигабайт VRAM для всех

Свежие сборки llama.cpp автоматически загружают MTP/NextN-тензоры из GGUF-моделей (GLM-5.2, Qwen3.5-MoE и др.), даже если спекулятивная декодировка отключена. Раньше эти блоки грузились только при явном --spec-type draft-mtp. Теперь каждый запуск жрёт на ~1 дополнительный MoE-слой памяти, даже если MTP не используется.

0 61
И инструменты ·25 июл 2026

MTP в llama.cpp: в 2 раза быстрее на обычных моделях, провал на MoE

В llama.cpp появилась нативная поддержка MTP (Multi Token Prediction) — технологии, где модель предсказывает несколько токенов за раз. На обычных dense-моделях (Qwen, DeepSeek, GLM) это даёт ускорение в 1.4-2.2 раза. На MoE-моделях прирост минимальный или его вообще нет — архитектура MoE уже оптимизирована по затратам на декодинг. Старые методы спекулятивной декодинга с отдельными draft-моделями показали себя ненадёжно.

0 71
И инструменты ·23 июл 2026

DFlash превратил 118B-модель на двух RTX 5090 в тормоз: как вернуть скорость или забить на спекуляцию

Энтузиаст запустил огромную MoE-модель Laguna S 2.1 (118B параметров, 71 ГБ) на двух RTX 5090 с технологией DFlash speculative decoding — и она замедлила генерацию в 2,5 раза вместо ускорения. Причина: дефолтные настройки llama.cpp заставляли драфтер генерировать слишком много токенов без уверенности, а верификация каждого токена обходилась дорого из-за оффлоада экспертов в CPU RAM. После тюнинга (ограничение длины драфта, порог уверенности 0.6, квантизация драфтера в Q8) скорость выросла с 23 до 64 tok/s — но это всё равно примерно как без драфта (62 tok/s), так что вывод: на такой конфигурации спекулятивная генерация бесполезна.

0 85
И инструменты ·4 авг 2026

Llama.cpp ускорили на 4-8% за счёт переноса сэмплинга на GPU

В llama.cpp добавили опцию переноса сэмплирования токенов с CPU на GPU при использовании MTP (multi-token prediction). На RTX 5090 прирост скорости достигает 8%, на старой Tesla P40 — 4%. Это самое заметное улучшение производительности локального инференса за последнее время.

0 18
И инструменты ·22 июл 2026

Как выжать 340 токенов в секунду из 204GB MoE-модели на одной видеокарте

Энтузиаст разработал метод запуска огромных MoE-моделей (Kimi 2.7, 204GB) на одной системе через хитрую комбинацию unified memory, кэширования VRAM и выборочной выгрузки экспертов. На DGX Spark достиг 340 токенов/сек на промпте и 9.6 на генерации — в разы быстрее CPU. На обычных 3090 тоже работает, но медленнее из-за узкого PCIe.

0 74
И инструменты ·25 июл 2026

Энтузиаст запустил 27-миллиардную языковую модель на одноплатнике с 16 ГБ памяти

Разработчик смог запустить полноценную 27-миллиардную языковую модель Bonsai на одноплатном компьютере Jetson Orin NX 16GB, используя экстремальное 1-битное сжатие. Модель работает полностью офлайн, потребляет около 25 Вт и выдаёт ~7 токенов в секунду — медленно, но для одного пользователя вполне пригодно.

0 55
И инструменты ·23 июл 2026

Бесконечное «думание» Laguna-S-2.1 оказалось проблемой квантизации

Пользователь llama.cpp обнаружил, что зацикливание модели Laguna-S-2.1 (когда она бесконечно «думает» и не закрывает теги </think>) связано не с настройками, а с некачественной квантизацией. Переход на APEX-квантизацию с разной точностью для разных слоёв устранил 90% проблемы.

0 59
И инструменты ·29 июл 2026

Как заставить локальные LLM не ломать JSON: грамматический подход через llama.cpp

Разработчик решил проблему невалидного JSON от локальных моделей через GBNF-грамматики в llama.cpp. Система компилирует схемы инструментов в правила грамматики, которые запрещают модели генерировать невалидный вывод на уровне токенов. Применил в проекте Eris — локальном AI-агенте на Rust с памятью в Markdown.

0 27