#локальный инференс

И инструменты ·18 авг 2026

Qwen 3.8 27B локально vs API: как разработчик сэкономил $650+ за один вечер на длинных задачах

Разработчик прогнал 8-часовую задачу на локальной Qwen 3.8 27B (27 млрд параметров) с 262K контекстом: 966 вызовов модели, 131M входных и 853K выходных токенов, 105 tok/s. Та же работа через API обошлась бы в $18-677 в зависимости от провайдера. Локальный инференс на RTX PRO 6000 с квантизацией Q4/Q5/Q6 показал нулевую стоимость и отличную скорость для multi-agent задач с огромным контекстом.

0 92
И инструменты ·6 авг 2026

Как ускорить Qwen 35B в 2.4 раза на RTX 3090 без потери скорости генерации

Исследователь показал, как сбросив 8 экспертных слоёв MoE-модели Qwen3.6-35B на CPU, можно увеличить batch-размеры и разогнать prompt processing с 564 до 1330 токенов/сек (2.36×) на RTX 3090, сохранив скорость генерации. Ключ — освобождение VRAM для увеличения батча, а не сам CPU-оффлоад.

0 124
М модели ·1 авг 2026

Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение

Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.

0 127
М модели ·25 июл 2026

Школьник выпустил полноценную TTS-модель всего на 4 миллиона параметров

Разработчик-старшеклассник представил Inflect v2 — две сверхкомпактные модели для синтеза речи (4M и 10M параметров), которые работают полностью локально без внешних компонентов. Модели в 21-1000 раз меньше аналогов, но при этом производят вполне годную речь с качеством ~4.4 UTMOS и скоростью 6-10× реального времени на CPU.

0 106
И инструменты ·23 июл 2026

Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100

Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.

0 109
И инструменты ·25 июл 2026

Как запустить 480-миллиардную модель на MacBook с 36 ГБ памяти — стриминг экспертов MoE с SSD

Разработчик форкнул llama.cpp, чтобы запускать огромные MoE-модели (до 480B параметров) на обычном MacBook, подгружая веса экспертов с SSD по требованию вместо загрузки всей модели в RAM. Qwen 35B выдаёт ~13-19 tok/s, даже 118B-модель работает на устройстве с 36 ГБ памяти. Приложение доступно как готовый .dmg для macOS, код открыт (MIT), все бенчмарки — включая провалившиеся эксперименты — опубликованы.

0 20