Исправленный Jinja-шаблон для Qwen 3.5–3.8: теперь thinking можно выключить, а tool calling не крашится
Энтузиаст выпустил фикс для официального чат-шаблона Qwen 3.5–3.8, который ломает мультитёрн-диалоги, tool calling и управление reasoning. Новый шаблон добавляет переключение thinking on/off, поддержку llama.cpp и vLLM, не портит KV-кеш и работает с OpenAI API-форматом инструментов.
Если работаешь с Qwen-агентами или чат-ботами, официальный шаблон сломан — это патч экономит дни дебага. Показывает, как быстро вендоры выкатывают новые модели без проверки базового инструментария.
Qwen выпустил модель 3.8 с управляемой глубиной рассуждений (reasoning effort) — можно задавать xhigh, medium или low. Но официальный Jinja-шаблон для чатов сломан:
- Нельзя отключить thinking — enable_thinking=false приводит к краше
- История портится — в мультитёрне вставляются пустые
<think></think>теги перед реальными мыслями - Tool calling падает — если клиент передаёт аргументы JSON-строкой (стандарт OpenAI API), шаблон крашится
- Агенты зависают — теряются системные сообщения в середине диалога, ломаются multi-step tool loops
Энтузиаст froggeric выпустил единый фикс для всех версий Qwen 3.5–3.8:
- Полная поддержка reasoning effort и возможность выключить thinking через kwargs или
<|think_off|>в промпте - KV-кеш не ломается — прошлые мысли сохраняются, prefix cache остаётся горячим
- Работает с llama.cpp (флаг
--reasoning-preserve), vLLM, LM Studio, MLX - Парсит инструменты в обоих форматах — и Python-словари, и JSON-строки
Шаблон прошёл 28 автотестов, но автор просит обратной связи от тех, кто запускает 3.8 (2.4 трлн параметров).
Автор: Юлия Тарасова · Источник: reddit.com
Разработчикам. Готовый drop-in Jinja-шаблон для Qwen 3.5–3.8: чинит tool calling, мультитёрн, добавляет toggle thinking и работает с vLLM/llama.cpp из коробки. Сохраняет KV-кеш, не ломает prefix cache.
Бизнесу. Если строите агентов или чат-боты на Qwen, официальный шаблон ломает диалоги и инструменты. Фикс экономит время на дебаг и позволяет управлять глубиной рассуждений модели — быстрые ответы или детальный анализ.
Инвесторам. Qwen 3.8 (2.4 трлн параметров) вышел с управляемым reasoning — интересно для enterprise-агентов. Но выкатили с багами в базовом инструментарии — показатель незрелости инфраструктуры.
- Упаковать фикс в SaaS-обёртку для Qwen: plug-and-play шаблоны для vLLM/llama.cpp с GUI для настройки reasoning effort — продать enterprise-клиентам
- Сделать микро-консалтинг для команд, внедряющих Qwen-агентов: аудит шаблонов, настройка tool calling, оптимизация KV-кеша
- Запустить инструмент для A/B-тестирования reasoning effort: автоматически подбирать low/medium/xhigh под задачу, экономить токены
- Собрать репозиторий community-fixes для популярных LLM — монетизировать через спонсорство от хостингов (Together, Replicate)
- Предложить Qwen платный аудит официальных шаблонов — они явно не тестируют edge cases
- Автор сам не тестил на 3.8 (нет железа) — может быть недостаточная валидация, community-фидбек отсутствует
- Qwen может выпустить официальный фикс в течение недели — тогда этот патч устареет
- Зависимость от сторонних шаблонов в проде — риск, если автор перестанет поддерживать или уйдёт
- Reasoning effort в 3.8 — новая фича, её реальная польза не доказана в production, может быть просто маркетинг
Классическая история: вендор запускает шумиху вокруг новой фичи (reasoning effort), а базовые вещи типа tool calling и мультитёрна ломаются. froggeric сделал то, что должна была сделать команда Qwen — и теперь community зависит от одного энтузиаста.
Если работаешь с Qwen — патч реально полезный, особенно для агентов. Но reasoning effort пока просто новый гиперпараметр без доказанной пользы в production. И да, зависимость от сторонних шаблонов в проде — это риск. Qwen может выпустить официальный фикс завтра, и этот патч устареет. Но факт остаётся: они выкатили сырой продукт.
Инструменты из статьи
Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.
Доступ из РФ →
Комментарии