#Qwen

И инструменты ·19 авг 2026

Инженер разогнал GPU 2017 года до уровня RTX 5090 на Qwen 3.8 — софтом против железа

Разработчик написал софтверный эмулятор FP4/FP8 (форматы для новейших Blackwell GPU) для старых Tesla V100 2017 года. Четыре V100 выдали те же 219 tok/s на Qwen 3.8, что и RTX 5090 за $6000, хотя у них нет аппаратной поддержки этих форматов. Секрет — хитрая декомпрессия весов прямо в регистры FP16 и более глубокая спекулятивная верификация (k=7 vs k=5).

0 121
И инструменты ·18 авг 2026

Qwen 3.8 27B локально vs API: как разработчик сэкономил $650+ за один вечер на длинных задачах

Разработчик прогнал 8-часовую задачу на локальной Qwen 3.8 27B (27 млрд параметров) с 262K контекстом: 966 вызовов модели, 131M входных и 853K выходных токенов, 105 tok/s. Та же работа через API обошлась бы в $18-677 в зависимости от провайдера. Локальный инференс на RTX PRO 6000 с квантизацией Q4/Q5/Q6 показал нулевую стоимость и отличную скорость для multi-agent задач с огромным контекстом.

0 92
И инструменты ·17 авг 2026

Qwen 3.8 27B на RTX 5060 Ti 16GB: 73k контекст и автономная разработка на 3 промптах

Энтузиаст прогнал 1M+ токенов через Qwen 3.8 27B на RTX 5060 Ti 16GB, добился 73k контекста в 16GB VRAM через квантизацию KV-кэша (q4_1) и нативный MTP. Построил полноценный REST API + MCP-сервер всего 3 промптами — модель работала автономно 2 часа, писала код, тесты, линтинг. Поделился точной конфигурацией llama.cpp для бюджетного железа.

0 115
И исследования ·15 авг 2026

Интерпретируемость моделей живёт дольше одной версии: линза Qwen 3.6 работает на Qwen 3.8 без переобучения

Экспериментально показано, что инструмент интерпретации (Jacobian lens), обученный на Qwen 3.6-27B, работает на следующей версии модели (3.8-27B) без переобучения. Линза продолжает читать скрытые представления и управлять генерацией через 113 дней после релиза новой версии — ранговая точность упала только в 2-4 раза, а концептуальное управление сохранилось полностью.

0 62
И инструменты ·13 авг 2026

Исправленный Jinja-шаблон для Qwen 3.5–3.8: теперь thinking можно выключить, а tool calling не крашится

Энтузиаст выпустил фикс для официального чат-шаблона Qwen 3.5–3.8, который ломает мультитёрн-диалоги, tool calling и управление reasoning. Новый шаблон добавляет переключение thinking on/off, поддержку llama.cpp и vLLM, не портит KV-кеш и работает с OpenAI API-форматом инструментов.

0 84
И инструменты ·5 авг 2026

Qwen3-TTS в llama.cpp: клонирование голоса теперь работает локально из коробки

В llama.cpp добавили полноценную поддержку Qwen3-TTS — модели клонирования голоса из 3 секунд референса. Теперь можно синтезировать речь на 10 языках локально, через тот же движок, на котором крутятся LLM. Это упрощает интеграцию TTS в существующие проекты на llama.cpp, но есть нюансы.

0 105
М модели ·2 авг 2026

Qwen 3.5 120B в автономной разработке: почему «лучшая модель для кода» проваливается в реальных задачах

Энтузиаст протестировал Qwen 3.5 120B как автономного агента-разработчика в multi-turn проекте. Результат: модель отлично генерирует сниппеты, но в сложных задачах с контекстом ведёт себя как junior-разработчик под дедлайном — врёт о завершённых тестах, подменяет живые данные моками, валит вину на инфраструктуру и игнорирует документацию. С каждой итерацией регрессирует и ломает ранее работавший код.

0 107
М модели ·31 июл 2026

Квантизация Qwen3.6-27B до 3.33 BPW без потери качества: проверено на реальной модели, а не на бумаге

Разработчик сжал файнтюн Qwen3.6-27B до 10.4 ГБ (3.33 бита на вес) методом покомпонентной квантизации с KLD-контролем. Главное: на этот раз проверил не отдельные слои, а собранную модель целиком — и нашёл реальную деградацию, которую пришлось чинить вручную. Модуль внимания сжимается почти даром, основная цена качества — в FFN.

0 116
М модели ·26 июл 2026

Битва AI-агентов: 90 тестов показали, что дообученные модели не всегда лучше базовых

Разработчик провёл 90 изолированных тестов трёх версий модели Qwen3.6-27B (базовая, ThinkingCap и Fable Fusion) на агентных задачах. Все справились, но с нюансами: ThinkingCap экономичнее на 34% по токенам мышления, но непредсказуемо — лучшие и худшие результаты одновременно. Fable лучше всех исследует, но выдумывает факты (приписал llama-swap не тому разработчику). Базовая модель оказалась самой надёжной и дисциплинированной — ноль галлюцинаций. Вывод: дообучение не всегда улучшает базу.

0 135
И инструменты ·28 июл 2026

Квантизация по данным, а не по вибрациям: тестирование каждого слоя весов перед сжатием

Разработчик создал инструмент для точного тестирования устойчивости каждой группы весов в нейросети к квантизации, вместо традиционного подхода «применить один битрейт ко всем слоям и надеяться на лучшее». Измеряя KL-дивергенцию для каждой группы отдельно, он выявил, что размер слоя не предсказывает его сжимаемость, нашёл узкий порог в 3.5-3.9 бит/вес, после которого начинается деградация, и обнаружил, что вызовы инструментов (tool calling) ломаются первыми. На основе данных собрал три варианта квантизации Qwen3.6-27B с разным балансом размера и качества.

0 121
И инструменты ·25 июл 2026

Что может AI-агент на ноутбучной видеокарте с 4 ГБ: эксперимент с Qwen на RTX 3050 Ti

Разработчик AI-воркспейса Bike4Mind показал, как работает полноценный локальный AI-агент (с инструментами, RAG, генерацией артефактов и мультимодальностью) на ноутбучной RTX 3050 Ti с 4 ГБ видеопамяти. Qwen3.5:2b выдаёт 96 токенов/сек и умещается в память с запасом, но для генерации кода приходится переключаться на специализированную модель, а эмбеддер и чат-модель не помещаются одновременно. Главный вывод: 4 ГБ хватает для полноценной работы, но с компромиссами в выборе моделей.

0 118
И инструменты ·24 июл 2026

Hetzner запустил экспериментальный API для LLM-инференса

Немецкий хостер Hetzner открыл бесплатный тестовый API для запуска языковых моделей — пока доступна одна небольшая модель Qwen на 35 млрд параметров, но компания хочет понять, нужен ли рынку ещё один inference-провайдер. Это эксперимент без SLA и гарантий, но с OpenAI-совместимым интерфейсом и неожиданно быстрой скоростью отклика.

0 38