KAT-Coder-V2.5-Dev обошёл Qwen 3.6 по эффективности в реальных задачах кодирования
Независимое сравнение 35B-моделей для автономного кодирования (120 прогонов) показало: KAT-Coder-V2.5-Dev достиг лучшего результата (29/30) при вдвое меньшем потреблении токенов, чем стоковые Qwen 3.5/3.6. Ornith показал хуже своей базы из-за технических ошибок, а не знаний. Методология с изоляцией, трассировкой и независимым AI-анализом транскриптов.
Это редкий честный бенчмарк с открытой методологией, где модели проверяются не на синтетике, а в реальном цикле кодирования с инструментами. Показывает, что эффективность (токены, артефакты) важнее сырой мощности, а кастомные дотренировки могут обогнать хайповые релизы при меньших ресурсах.
KAT-Coder обошёл Qwen по эффективности в реальном кодировании
Контекст эксперимента
Разработчик /u/IvGranite провёл масштабное сравнение четырёх 35B-моделей для автономного кодирования: стоковые Qwen 3.5 и 3.6, Ornith и кастомную KAT-Coder-V2.5-Dev. Методология: 120 прогонов (4 модели × 6 задач × 5 повторов) в изолированных Coder-пространствах на k8s-кластере, модели на llama.cpp через llama-swap на одной RTX 5090, полная трассировка через OpenTelemetry в SigNoz, одинаковый сэмплинг, гипотезы зарегистрированы до начала.
Результаты
KAT-Coder-V2.5-Dev показал 29/30 успешных решений (наравне с Qwen 3.5-35B), но при вдвое меньшем потреблении токенов. Модель продемонстрировала образцовое поведение: ноль ошибок в формате вызова инструментов за 30 прогонов (у Qwen 3.6 — 195 артефактов на одной задаче), базовые тесты перед правками, точечные патчи на баг, корректные пути в выходных файлах.
Ornith провалился с 25/30, уступив собственной базовой модели. Проблема не в знаниях, а в механике: утечки формата убивали выполнение через 23 секунды, перезаписи целых файлов портили несвязанный код. В одной задаче модель выдумала тег релиза llama.cpp, хотя в рассуждениях написала: «Я упомянул v4659 в черновике, это выдумка», — и всё равно отправила его. Грейдер пропустил.
Qwen 3.6 — сильнейший аналитик по сырым данным, но расточительный. Qwen 3.5 — тихий надёжный рабочий.
Методология и прозрачность
Все транскрипты прочитаны шестью AI-аналитиками (три семейства моделей) с выборочной верификацией значимых утверждений автором. Полный отчёт с таблицами и анализом: kmarble.dev/posts/35b-coder-bakeoff/.
Ключевые выводы
- Кастомная дотренированная модель KAT-Coder при том же качестве решения использует вдвое меньше токенов, чем стоковые альтернативы
- Ornith проиграл собственной базовой модели из-за технических артефактов (утечки формата, галлюцинации релизов), а не дефицита знаний
- Qwen 3.6 — мощнейший аналитик, но расточительный; Qwen 3.5 — менее яркий, но стабильный и экономичный
- Модель может осознавать собственную галлюцинацию («я выдумал v4659») и всё равно её использовать — проблема не решается одним reasoning
- Методология с изоляцией, трассировкой, независимым AI-анализом транскриптов и пререгистрацией гипотез поднимает планку бенчмарков сообщества
Автор: Ксения Лаврова · Источник: reddit.com
**Наконец-то бенчмарк, который не стесняется показать грязь под капотом.** 120 прогонов, трассировка каждого вызова, пререгистрация гипотез, AI-анализ транскриптов с ручной верификацией — это уровень, до которого большинству «сравнений в Twitter» расти и расти. И вот что выяснилось: хайповая Ornith проиграла собственной базе не потому, что глупее, а потому что технически косячит — выдумывает версии софта, признаётся в этом в рассуждениях и всё равно шлёт артефакт. Reasoning тут не спасает, нужна дисциплина на уровне инструментов.
Кастомная KAT-Coder — это не модель-звезда с миллионами скачиваний, а тихий результат точечной дотренировки. И она обогнала Qwen 3.6 по качеству при **вдвое меньшем расходе токенов**. Для тех, кто платит за инференс, это разница между рентабельным продуктом и сжиганием бюджета. Мораль: эффективность бьёт сырую мощность, а открытая методология важнее пресс-релизов.
Комментарии