Qwen 3.8 27B на RTX 5060 Ti 16GB: 73k контекст и автономная разработка на 3 промптах
Энтузиаст прогнал 1M+ токенов через Qwen 3.8 27B на RTX 5060 Ti 16GB, добился 73k контекста в 16GB VRAM через квантизацию KV-кэша (q4_1) и нативный MTP. Построил полноценный REST API + MCP-сервер всего 3 промптами — модель работала автономно 2 часа, писала код, тесты, линтинг. Поделился точной конфигурацией llama.cpp для бюджетного железа.