Битва AI-агентов: 90 тестов показали, что дообученные модели не всегда лучше базовых
Разработчик провёл 90 изолированных тестов трёх версий модели Qwen3.6-27B (базовая, ThinkingCap и Fable Fusion) на агентных задачах. Все справились, но с нюансами: ThinkingCap экономичнее на 34% по токенам мышления, но непредсказуемо — лучшие и худшие результаты одновременно. Fable лучше всех исследует, но выдумывает факты (приписал llama-swap не тому разработчику). Базовая модель оказалась самой надёжной и дисциплинированной — ноль галлюцинаций. Вывод: дообучение не всегда улучшает базу.
Это редкий честный бенчмарк AI-агентов с прозрачной методологией и неожиданным результатом: модные файнтюны часто уступают базовым моделям в реальных задачах. Важно для всех, кто выбирает модель для продакшена — не всегда стоит гнаться за последними «улучшенными» версиями.
Эксперимент: три модели, 90 прогонов, один вывод
Разработчик под ником IvGranite решил проверить популярное мнение, что файнтюны ThinkingCap и Fable Fusion превосходят базовую Qwen3.6-27B в агентной работе. Методология впечатляет: 6 самооцениваемых задач, по 5 повторений на каждую модель — итого 90 изолированных запусков в идентичных условиях на k8s-кластере с одной GeForce RTX 5090.
Результаты: эффективность ≠ надёжность
ThinkingCap показал противоречивые результаты. С одной стороны — экономия в 34% токенов мышления и самые быстрые прогоны на 5 из 6 задач. С другой — крайняя нестабильность: лучшие по затратам и худшие прогоны принадлежат именно ему. В одном случае модель потратила ~10 вызовов инструментов, гоняясь за несуществующим тегом релиза llama.cpp, с которым базовая версия справилась одним API-запросом.
Fable Fusion оказался лучшим детективом и худшим рассказчиком. Только он проверил, что сломанный конфиг действительно активен, и достал лучшие исследовательские данные (распарсил встроенный JSON ритейлера для цен на варианты, нашёл мейнтейнера через GitHub API). Но та же модель приписала llama-swap авторство «Мэттью Гарретту, бывшему инженеру Red Hat» — реальному человеку (mjg59), который к проекту не имеет отношения. Настоящий автор — Бенсон Вонг (mostlygeek). Модель слила две реальные личности, процитировала правильный репо и... прошла грейдер. В другом запуске Fable потратил 94 вызова инструментов на один вопрос о цене.
Базовая Qwen3.6-27B оказалась самой скучной и дисциплинированной: однородные патчи, перечитывание собственного вывода, ноль выдуманных фактов, победа по манере выполнения в большинстве задач.
Вывод автора
Базовая модель остаётся дефолтом. За 90 прогонов файнтюны не доказали своё превосходство. ThinkingCap имеет смысл только если латентность токенов мышления — ваше узкое горло. Полный отчёт с конфигурациями, дизайном эксперимента и анализом транскриптов опубликован по ссылке.
Ключевые выводы
- Дообученные модели не гарантируют улучшение над базовой версией — часто это латеральный сдвиг с trade-off'ами
- ThinkingCap экономит 34% токенов мышления, но демонстрирует непредсказуемую бимодальность результатов
- Fable Fusion лучше всех исследует контекст, но склонна к галлюцинациям с фактами — смешивает реальные личности
- Базовая Qwen3.6-27B показала нулевой процент галлюцинаций и самую стабильную работу
- В агентных задачах надёжность и дисциплинированность важнее агрессивной оптимизации эффективности
Автор: Артём Ковалёв · Источник: reddit.com
Это один из тех материалов, где методология важнее выводов. Парень не просто прогнал бенчмарк — он сделал это правильно: изоляция, идентичные условия, предрегистрация гипотез, полные транскрипты, ручная верификация. И выводы неудобные для хайпа: файнтюны не обязательно лучше базы, а часто — просто другие.
Особенно показателен кейс с Fable: модель слила два реальных профиля GitHub в одного несуществующего человека и прошла грейдер. Это не баг, а фича современных LLM — галлюцинации звучат убедительно. Для продакшен-агентов это критично: лучше скучная модель без выдумок, чем креативная, которая 10% времени несёт чушь. Базовая Qwen тут честный победитель — ноль галлюцинаций за 90 прогонов.
Комментарии