#квантизация

И инструменты ·21 авг 2026

Sparse Attention для Minimax H3: до 70% экономии памяти и 2x ускорение генерации видео

Разработчик Zironic представил оптимизированную реализацию Sparse Attention для Minimax H3 с гибким контролем плотности внимания (10-50%), INT8/FP8 квантизацией и снижением пикового потребления памяти до 70%. В отличие от других патчей, работает только с видеотокенами и интегрируется с Comfy Kitchen напрямую.

0 85
И инструменты ·18 авг 2026

Qwen 3.8 27B локально vs API: как разработчик сэкономил $650+ за один вечер на длинных задачах

Разработчик прогнал 8-часовую задачу на локальной Qwen 3.8 27B (27 млрд параметров) с 262K контекстом: 966 вызовов модели, 131M входных и 853K выходных токенов, 105 tok/s. Та же работа через API обошлась бы в $18-677 в зависимости от провайдера. Локальный инференс на RTX PRO 6000 с квантизацией Q4/Q5/Q6 показал нулевую стоимость и отличную скорость для multi-agent задач с огромным контекстом.

0 92
И исследования ·18 авг 2026

Diffusion-модель на 264 КБ оперативки: как запустить генерацию картинок на микроконтроллере

Энтузиаст обучил diffusion-модель, которая генерирует изображения 32×32 пикселя на микроконтроллере Shrike Lite с 264 КБ RAM. Использовал встроенную FPGA для ускорения, но упёрся в память — параллельные вычисления оказались медленнее простого MCU (220 vs 70 секунд на картинку). Результаты шумные из-за жёсткой квантизации, но проект показывает границы экстремальной оптимизации.

0 53
И инструменты ·11 авг 2026

DeepSeek V4 0731: квантизация до 104 ГБ с 83.6% точностью на RTX 5090

Команда AtomicChat квантизовала DeepSeek V4 0731, выявив критические баги в llama.cpp (NaN-значения и потерю точности при конвертации FP8). Создали 13 квантов с imatrix на 1.87M токенах, оптимизированных под RTX 5090. Лучший результат: 104 ГБ (AD-IQ2_M) с 83.6% точностью top-1, что обходит публичные кванты по PPL при одинаковом размере.

0 70
И инструменты ·9 авг 2026

KLQ: квантизация LLM без обучения через измерение геометрии пространства — бьёт SpinQuant на 4 битах

Новый метод квантизации KLQ измеряет важность направлений в пространстве эмбеддингов LLM и распределяет биты неравномерно — даёт больше битов важным направлениям, меньше — второстепенным. На Llama 3.2 1B в режиме W4A4KV4 обходит SpinQuant и почти догоняет ReSpinQuant, при этом не требует дообучения (только проходы по модели для измерений).

0 85
М модели ·1 авг 2026

Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение

Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.

0 127
И инструменты ·2 авг 2026

Хакерская оптимизация DeepSeek-V4: как сэкономить 30 ГБ RAM без потери качества

Энтузиаст TacoTakumi перепаковал DeepSeek-V4-Flash в 3-битный формат, квантизировав только экспертные слои. Результат: 111 ГБ вместо 140+, на 40% быстрее оригинала при частичной загрузке в RAM, качество лучше чем у полной IQ3_S-квантизации. Для тех, кто гоняет большие MoE-модели на разношёрстных GPU и не хочет скатываться до 2-битных квантов.

0 128
И инструменты ·2 авг 2026

Kimi K3 (0.5 петабайта) запустили на одном CPU с 8 ГБ оперативки — голый C99, без GPU

Энтузиаст запустил гигантскую модель Kimi K3 (1.56 ТБ checkpoint) на обычном CPU с 8 ГБ RAM, написав inference-движок на чистом C99. Стриминг экспертов с NVMe, 4-битная квантизация без распаковки, 33 секунды на токен. Никаких фреймворков, GPU или BLAS — только OpenMP и 176 КБ бинарник.

0 116
И инструменты ·31 июл 2026

Трансформер для апскейла сжали до 668 КБ с помощью тернарной квантизации BitNet

Исследователи применили 1.58-битную квантизацию BitNet к vision-трансформеру Swin2SR для увеличения изображений. Модель весит всего 668 КБ в сжатом виде, работает в браузере и даёт +2.66 dB прироста качества над бикубической интерполяцией при увеличении в 2 раза.

0 130
И инструменты ·7 авг 2026

llama.cpp: новый PR разогнал Q2_0 квантизацию в 3 раза на обычных CPU — 8B модель с 2.4 до 8.2 tok/s

Открытый PR в llama.cpp добавляет VNNI-оптимизацию для Q2_0 квантизации, показывая 3–3.6x рост скорости на x86 CPU. На AMD EPYC 9645 8B модель в декоде разогналась с 2.39 до 8.20 tok/s, на Intel i5-13400 — с 2.17 до 6.92 tok/s. Работает на обычных десктопных процах (12–14 поколение Intel, Zen 4/5), где AVX-512 выключен, а AVX-VNNI есть.

0 57
И инструменты ·4 авг 2026

DeepSeek V4 Flash в 2-битной квантизации первым справился с SQL-тестами на локальной машине

Энтузиаст запустил DeepSeek V4 Flash в агрессивной 2-битной квантизации на двух RTX 3080 и получил 100% на SQL-бенчмарке — то, что раньше удавалось только Claude Opus 4.7 и GPT-5.5 в облаке. Кастомная сборка GGUF с допиленным движком antirez выдала 300 токенов/сек промпта и 11-12 токенов/сек генерации.

0 80
М модели ·31 июл 2026

Квантизация Qwen3.6-27B до 3.33 BPW без потери качества: проверено на реальной модели, а не на бумаге

Разработчик сжал файнтюн Qwen3.6-27B до 10.4 ГБ (3.33 бита на вес) методом покомпонентной квантизации с KLD-контролем. Главное: на этот раз проверил не отдельные слои, а собранную модель целиком — и нашёл реальную деградацию, которую пришлось чинить вручную. Модуль внимания сжимается почти даром, основная цена качества — в FFN.

0 116
И инструменты ·28 июл 2026

Квантизация по данным, а не по вибрациям: тестирование каждого слоя весов перед сжатием

Разработчик создал инструмент для точного тестирования устойчивости каждой группы весов в нейросети к квантизации, вместо традиционного подхода «применить один битрейт ко всем слоям и надеяться на лучшее». Измеряя KL-дивергенцию для каждой группы отдельно, он выявил, что размер слоя не предсказывает его сжимаемость, нашёл узкий порог в 3.5-3.9 бит/вес, после которого начинается деградация, и обнаружил, что вызовы инструментов (tool calling) ломаются первыми. На основе данных собрал три варианта квантизации Qwen3.6-27B с разным балансом размера и качества.

0 121
И инструменты ·2 авг 2026

DeepSeek-V4-Flash на 284 млрд параметров запустили на 5,3 ГБ памяти — как это вообще возможно

Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.

0 75
И исследования ·2 авг 2026

EdgeRazor: сжатие LLM до 1.88 бита на параметр без потери качества

Исследователи из Нанкинского университета предложили метод EdgeRazor, который сжимает большие языковые модели до экстремально низкой точности (1.88 бита на параметр) через дистилляцию с управлением энтропией. Работает с обычными форматами инференса, но требует вычислительных мощностей для создания студенческой модели. Открыт код и несколько примеров моделей.

0 75
И инструменты ·27 июл 2026

Speculative decoding на Qwen3.6-27B: чем тяжелее квантизация, тем выше прирост скорости

Бенчмарк speculative decoding на Qwen3.6-27B показал парадоксальный результат: чем меньше сжата модель (Q8 против Q4), тем больший прирост даёт спекулятивная генерация. DFlash — самый быстрый алгоритм в общем случае, MTP — стабильная альтернатива, EAGLE3 и ngram проигрывают. Результаты справедливы для узкого сценария (короткие выходы, один поток), под нагрузкой выигрыш сожмётся.

0 117
М модели ·30 июл 2026

Как Google запустила генеративную AI на смарт-часах

Google встроила локальную языковую модель в Pixel Watch, хотя часы имеют в сотни раз меньше памяти, чем телефон, и физически не могут долго работать на полной мощности из-за перегрева. Статья объясняет, какие три технических компромисса позволили уместить AI в столь ограниченное устройство.

0 73
И инструменты ·2 авг 2026

WinterMix: новый метод квантизации MLX побил 6-битные сборки при меньшем весе — 82 ГБ против 95 ГБ

Разработчик создал новый метод квантизации для MLX-моделей на Apple Silicon, который даёт лучший результат для Qwen3.5-122B: сборка на 82 ГБ обгоняет 6-битные на 94-95 ГБ, а версия на 68 ГБ позволяет держать 5-8 агентов с контекстом 100К токенов одновременно на Mac с 128 ГБ RAM. Перплексия всего на 0.3-0.7% хуже исходного GGUF, при этом MLX даёт 9x быстрее prefill и на 20% быстрее генерацию токенов на M5 Max.

0 47
М модели ·24 июл 2026

Laguna S2.1 в деле: медленная, но решает баги, с которыми не справляются Qwen и Claude

Практический тест Laguna S2.1 показал, что модель не подходит для планирования задач из-за слишком глубокого рассуждения, но оказалась эффективна для сложной отладки кода. В отличие от Qwen, DeepSeek и Claude, которые часто фиксят первую попавшуюся проблему и останавливаются, Laguna тратит сотни тысяч токенов на анализ, но находит ВСЕ корневые причины багов. Модель заняла нишу «тяжёлой артиллерии» для задач, с которыми не справляются универсальные LLM.

0 94
И инструменты ·29 июл 2026

Запустил модель на 1.56 ТБ на игровом ноуте с 6 ГБ видеопамяти — вот что вышло

Энтузиаст запустил гигантскую MoE-модель (1.56 ТБ, 896 экспертов на слой) на бюджетном ноутбуке HP Victus с RTX 4050 (6 ГБ VRAM). Первая попытка — краш до первого токена. После патча движка и стриминга весов с SSD получилось 0.1 токена в секунду — медленно, но работает. Бутылочное горлышко — 33 ГБ чтения с диска на каждый токен.

0 80
М модели ·27 июл 2026

Gemma 4 и Qwen 3.6 MoE на встроенной графике AMD: тесты показали, почему MoE — это будущее локальных LLM

Энтузиаст протестировал новые модели Gemma 4 и Qwen 3.6 MoE на мини-ПК с APU AMD 6800H (встроенная графика Radeon 680M). Главный вывод: Mixture of Experts (MoE) модели дают скорость маленькой модели при интеллекте большой — Qwen 3.6 35B в 6,5 раз быстрее обычной 31B модели. Квантизация Q4 оптимальна для APU, Q8 убивает производительность, а новые форматы FP4 пока работают хуже обычных.

0 66
И инструменты ·26 июл 2026

Самодельный Triton-бэкенд разогнал 10B-модель до 97 tok/s на RTX 5070

Энтузиаст написал специализированный GPU-бэкенд для запуска 1.58-битной Falcon3-10B, добившись 97.5 токенов/сек на RTX 5070 — почти в 10 раз быстрее стандартного Transformers. Использует упакованные тернарные веса, Triton-ядра и CUDA Graph. Код опубликован, автор ищет независимые проверки на других GPU.

0 74
М модели ·26 июл 2026

Как модель на 1,6 триллиона параметров работает на ноутбуке: C-код, который вы можете запустить

Автор показывает, как запустить гигантские MoE-модели вроде DeepSeek V4 на обычном ноутбуке. Ключ — в том, что Mixture-of-Experts активирует только ~3% параметров за раз, остальные 97% можно держать на диске и подгружать по требованию. Статья объясняет математику разреженности и предлагает полный рабочий стриминговый движок на C.

0 64
М модели ·27 июл 2026

Kimi K3 выходит сегодня: 1,4 ТБ весов и суровая математика GPU

Moonshot AI публикует веса модели Kimi K3 (2,8 трлн параметров, 896 экспертов MoE). Команда Qubrid разбирает требования к памяти: на A100 нужно 3 узла, на H200 — два, только B300 с нативной FP4 подходит для одного узла. Обещают тесты производительности на всех трёх конфигурациях к концу недели.

0 53
И инструменты ·28 июл 2026

Доводы в пользу локального и суверенного ИИ

Автор утверждает, что использование облачного ИИ незаметно превратилось в постоянную зависимость от чужих серверов и условий. Альтернатива — локальные модели на собственном оборудовании — стала технически осуществимой благодаря открытым весам, квантизации и развитию потребительского железа.

0 60
И инструменты ·2 авг 2026

DeepSeek V4 Flash ломается при квантизации KV Cache — тесты показали 10% деградацию точности

Пользователь провёл тесты квантизации KV Cache для DeepSeek V4 Flash (BF16 → Q8) и получил значительное падение качества: средний KL divergence вырос до 0.146 (против 0.0036 у Qwen 397B), точность топ-токенов упала до 87% (против 98% у Qwen). Вывод: для DS4F квантизация KV Cache — плохая идея.

0 26
И инструменты ·3 авг 2026

MiniMax H3 на локальной карте: видео с аудио за 3 минуты на RTX 4090 Laptop

Первый успешный локальный запуск MiniMax H3 в ComfyUI на ноутбучной RTX 4090 16GB: 5 секунд видео 960×540 сгенерировалось за 182 секунды (3 минуты), включая нативный звук. Использовались облегченные INT8-версии модели (~21GB) и AWQ-энкодера (~15.7GB). Результат показывает, что генерация видео+аудио на потребительском железе становится реальностью.

0 30
И инструменты ·26 июл 2026

BeeLlama.cpp v0.4.1: новые способы сжатия KV-кэша для LLM без потери точности

Вышла версия форка llama.cpp с улучшенными алгоритмами квантизации KV-кэша: KVarN (нормализация по дисперсии), precision tail (хранение последних токенов в высоком качестве) и дополнительные типы сжатия q2_0-q6_1. Бенчмарки показывают, что хранение последних 1024 токенов в полной точности позволяет kvarn5 и q6_0 достичь качества q8_0 при меньшем расходе видеопамяти.

0 56
И инструменты ·25 июл 2026

SVDQuant ускоряет Krea 2 вдвое даже на старых NVIDIA GPU — INT8/W4A4 вместо бесполезного FP8

Выпущена квантизованная версия Krea 2 Turbo для ComfyUI, использующая INT8 и W4A4 вместо популярного FP8. Скорость удваивается даже на GPU серий RTX 20/30 (Turing/Ampere), размер модели уменьшается втрое, качество сохраняется. FP8 работает быстро только на новейших Ada/Hopper GPU, на старых картах он фактически откатывается к BF16 и тормозит. Автор замерил это экспериментально и выбрал форматы, поддерживаемые тензорными ядрами начиная с Turing.

0 59
И инструменты ·23 июл 2026

Бесконечное «думание» Laguna-S-2.1 оказалось проблемой квантизации

Пользователь llama.cpp обнаружил, что зацикливание модели Laguna-S-2.1 (когда она бесконечно «думает» и не закрывает теги </think>) связано не с настройками, а с некачественной квантизацией. Переход на APEX-квантизацию с разной точностью для разных слоёв устранил 90% проблемы.

0 59
Б безопасность ·23 июл 2026

Вам подсунули не ту AI-модель, за которую вы заплатили

API-провайдеры всё чаще незаметно подменяют модели: запрашиваете Claude Opus — получаете другую версию, ставите галочку на квантизацию — получаете худшую точность по умолчанию. Anthropic хотя бы сообщает о подмене в ответе, Cursor публикует правила роутинга без деталей, OpenRouter прячет квантизацию в документации. Юридически непонятно, что вы вообще купили: название модели, её возможности или просто «удовлетворённость пользователя».

0 42
И инструменты ·28 июл 2026

DeepSeek V4 Flash на AMD Ryzen AI MAX+ 395: 32 токена/сек на одном чипе с 128 ГБ памяти

Команда Lucebox запустила 284-миллиардный DeepSeek V4 Flash на единственном AMD Ryzen AI MAX+ 395 с 128 ГБ unified memory, достигнув 32 tok/s при декодировании и ~250 tok/s при префилле — это на 68.5% быстрее предыдущего лидера. Ключ к успеху — ROCmFPX (семейство 2–4-битных форматов квантизации под ROCm/HIP) и DSpark draft-модель для спекулятивного декодинга. Код открыт, результат подан на LocalMaxxing.

0 23
И инструменты ·27 июл 2026

TRELLIS.2 INT8 теперь работает нативно на AMD-картах через ComfyUI

Энтузиаст выпустил патч для запуска 3D-модели TRELLIS.2 в INT8-квантизации напрямую на видеокартах AMD (ROCm) через ComfyUI. Используя оптимизированные Triton-ядра вместо GGUF-весов, он добился ускорения в 2.7–3× на холодном старте и 1.27× общего прироста по времени генерации на RX 7900 XTX. Доступен готовый workflow для создания 3D-моделей разрешением до 1024.

0 34
И инструменты ·23 июл 2026

NanoQuant v3: C++ фундамент для локального сжатия LLM

Автор пересобрал свой проект сжатия весов моделей на C++ с акцентом на низкоуровневые детали: int4-квантизацию, однобитное сжатие, упаковку в памяти, работу с GGUF без полной загрузки модели. Проект не требует CUDA, PyTorch или Docker — только CMake и компилятор C++20.

0 44
И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 27