инструменты 1 мин

Исправленный Jinja-шаблон для Qwen 3.5–3.8: теперь thinking можно выключить, а tool calling не крашится

Энтузиаст выпустил фикс для официального чат-шаблона Qwen 3.5–3.8, который ломает мультитёрн-диалоги, tool calling и управление reasoning. Новый шаблон добавляет переключение thinking on/off, поддержку llama.cpp и vLLM, не портит KV-кеш и работает с OpenAI API-форматом инструментов.

Если работаешь с Qwen-агентами или чат-ботами, официальный шаблон сломан — это патч экономит дни дебага. Показывает, как быстро вендоры выкатывают новые модели без проверки базового инструментария.

Qwen выпустил модель 3.8 с управляемой глубиной рассуждений (reasoning effort) — можно задавать xhigh, medium или low. Но официальный Jinja-шаблон для чатов сломан:

  • Нельзя отключить thinking — enable_thinking=false приводит к краше
  • История портится — в мультитёрне вставляются пустые <think></think> теги перед реальными мыслями
  • Tool calling падает — если клиент передаёт аргументы JSON-строкой (стандарт OpenAI API), шаблон крашится
  • Агенты зависают — теряются системные сообщения в середине диалога, ломаются multi-step tool loops

Энтузиаст froggeric выпустил единый фикс для всех версий Qwen 3.5–3.8:

  • Полная поддержка reasoning effort и возможность выключить thinking через kwargs или <|think_off|> в промпте
  • KV-кеш не ломается — прошлые мысли сохраняются, prefix cache остаётся горячим
  • Работает с llama.cpp (флаг --reasoning-preserve), vLLM, LM Studio, MLX
  • Парсит инструменты в обоих форматах — и Python-словари, и JSON-строки

Шаблон прошёл 28 автотестов, но автор просит обратной связи от тех, кто запускает 3.8 (2.4 трлн параметров).

Автор: Юлия Тарасова · Источник: reddit.com

Разработчикам. Готовый drop-in Jinja-шаблон для Qwen 3.5–3.8: чинит tool calling, мультитёрн, добавляет toggle thinking и работает с vLLM/llama.cpp из коробки. Сохраняет KV-кеш, не ломает prefix cache.

Бизнесу. Если строите агентов или чат-боты на Qwen, официальный шаблон ломает диалоги и инструменты. Фикс экономит время на дебаг и позволяет управлять глубиной рассуждений модели — быстрые ответы или детальный анализ.

Инвесторам. Qwen 3.8 (2.4 трлн параметров) вышел с управляемым reasoning — интересно для enterprise-агентов. Но выкатили с багами в базовом инструментарии — показатель незрелости инфраструктуры.

Хайп35
Реальная польза45
Заработать30
  • Упаковать фикс в SaaS-обёртку для Qwen: plug-and-play шаблоны для vLLM/llama.cpp с GUI для настройки reasoning effort — продать enterprise-клиентам
  • Сделать микро-консалтинг для команд, внедряющих Qwen-агентов: аудит шаблонов, настройка tool calling, оптимизация KV-кеша
  • Запустить инструмент для A/B-тестирования reasoning effort: автоматически подбирать low/medium/xhigh под задачу, экономить токены
  • Собрать репозиторий community-fixes для популярных LLM — монетизировать через спонсорство от хостингов (Together, Replicate)
  • Предложить Qwen платный аудит официальных шаблонов — они явно не тестируют edge cases
  • Автор сам не тестил на 3.8 (нет железа) — может быть недостаточная валидация, community-фидбек отсутствует
  • Qwen может выпустить официальный фикс в течение недели — тогда этот патч устареет
  • Зависимость от сторонних шаблонов в проде — риск, если автор перестанет поддерживать или уйдёт
  • Reasoning effort в 3.8 — новая фича, её реальная польза не доказана в production, может быть просто маркетинг

Классическая история: вендор запускает шумиху вокруг новой фичи (reasoning effort), а базовые вещи типа tool calling и мультитёрна ломаются. froggeric сделал то, что должна была сделать команда Qwen — и теперь community зависит от одного энтузиаста.

Если работаешь с Qwen — патч реально полезный, особенно для агентов. Но reasoning effort пока просто новый гиперпараметр без доказанной пользы в production. И да, зависимость от сторонних шаблонов в проде — это риск. Qwen может выпустить официальный фикс завтра, и этот патч устареет. Но факт остаётся: они выкатили сырой продукт.

Инструменты из статьи

LM Studioбез VPN

Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.

Доступ из РФ →

Ещё по теме

Комментарии