Qwen 3.8 27B локально vs API: как разработчик сэкономил $650+ за один вечер на длинных задачах
Разработчик прогнал 8-часовую задачу на локальной Qwen 3.8 27B (27 млрд параметров) с 262K контекстом: 966 вызовов модели, 131M входных и 853K выходных токенов, 105 tok/s. Та же работа через API обошлась бы в $18-677 в зависимости от провайдера. Локальный инференс на RTX PRO 6000 с квантизацией Q4/Q5/Q6 показал нулевую стоимость и отличную скорость для multi-agent задач с огромным контекстом.