#локальный запуск

М модели ·10 авг 2026

Muse Glimmer 30B влезает в RTX 3090 с полным контекстом — тест на реальном железе

Новая модель Muse Glimmer 30B реально работает на одной RTX 3090 (24GB VRAM) с контекстом до 256k токенов, занимая ~22-23GB. Для сравнения: Qwen3.6-27B и Gemma-4-31B на том же железе дают только 70-125k токенов. Скорость 64-124 tok/s с DFlash, тест на 150k токенов прошёл без проблем.

0 26
И инструменты ·28 июл 2026

Квантизация по данным, а не по вибрациям: тестирование каждого слоя весов перед сжатием

Разработчик создал инструмент для точного тестирования устойчивости каждой группы весов в нейросети к квантизации, вместо традиционного подхода «применить один битрейт ко всем слоям и надеяться на лучшее». Измеряя KL-дивергенцию для каждой группы отдельно, он выявил, что размер слоя не предсказывает его сжимаемость, нашёл узкий порог в 3.5-3.9 бит/вес, после которого начинается деградация, и обнаружил, что вызовы инструментов (tool calling) ломаются первыми. На основе данных собрал три варианта квантизации Qwen3.6-27B с разным балансом размера и качества.

0 121
И инструменты ·22 июл 2026

Как выжать 340 токенов в секунду из 204GB MoE-модели на одной видеокарте

Энтузиаст разработал метод запуска огромных MoE-моделей (Kimi 2.7, 204GB) на одной системе через хитрую комбинацию unified memory, кэширования VRAM и выборочной выгрузки экспертов. На DGX Spark достиг 340 токенов/сек на промпте и 9.6 на генерации — в разы быстрее CPU. На обычных 3090 тоже работает, но медленнее из-за узкого PCIe.

0 74
И инструменты ·23 июл 2026

Бесконечное «думание» Laguna-S-2.1 оказалось проблемой квантизации

Пользователь llama.cpp обнаружил, что зацикливание модели Laguna-S-2.1 (когда она бесконечно «думает» и не закрывает теги </think>) связано не с настройками, а с некачественной квантизацией. Переход на APEX-квантизацию с разной точностью для разных слоёв устранил 90% проблемы.

0 59