#бюджетное железо

И инструменты ·17 авг 2026

Qwen 3.8 27B на RTX 5060 Ti 16GB: 73k контекст и автономная разработка на 3 промптах

Энтузиаст прогнал 1M+ токенов через Qwen 3.8 27B на RTX 5060 Ti 16GB, добился 73k контекста в 16GB VRAM через квантизацию KV-кэша (q4_1) и нативный MTP. Построил полноценный REST API + MCP-сервер всего 3 промптами — модель работала автономно 2 часа, писала код, тесты, линтинг. Поделился точной конфигурацией llama.cpp для бюджетного железа.

0 115
И инструменты ·9 авг 2026

Локальный AI за 900 евро: интегрированная графика AMD Radeon 780M тянет модели на 30+ миллиардов параметров

Энтузиаст показал, как запускать LLM на 30+ миллиардов параметров на мини-ПК с интегрированной графикой AMD Radeon 780M и 64 ГБ оперативки за ~900 евро. Qwen 3.6 35B выдаёт 21 токен/сек, Gemma 4 31B — 5-6 токенов/сек. Не быстро, но работает для личных задач без облака.

0 83
И инструменты ·23 июл 2026

Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100

Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.

0 109
И инструменты ·29 июл 2026

Запустил модель на 1.56 ТБ на игровом ноуте с 6 ГБ видеопамяти — вот что вышло

Энтузиаст запустил гигантскую MoE-модель (1.56 ТБ, 896 экспертов на слой) на бюджетном ноутбуке HP Victus с RTX 4050 (6 ГБ VRAM). Первая попытка — краш до первого токена. После патча движка и стриминга весов с SSD получилось 0.1 токена в секунду — медленно, но работает. Бутылочное горлышко — 33 ГБ чтения с диска на каждый токен.

0 80