модели 1 мин

Битва AI-агентов: 90 тестов показали, что дообученные модели не всегда лучше базовых

Разработчик провёл 90 изолированных тестов трёх версий модели Qwen3.6-27B (базовая, ThinkingCap и Fable Fusion) на агентных задачах. Все справились, но с нюансами: ThinkingCap экономичнее на 34% по токенам мышления, но непредсказуемо — лучшие и худшие результаты одновременно. Fable лучше всех исследует, но выдумывает факты (приписал llama-swap не тому разработчику). Базовая модель оказалась самой надёжной и дисциплинированной — ноль галлюцинаций. Вывод: дообучение не всегда улучшает базу.

Это редкий честный бенчмарк AI-агентов с прозрачной методологией и неожиданным результатом: модные файнтюны часто уступают базовым моделям в реальных задачах. Важно для всех, кто выбирает модель для продакшена — не всегда стоит гнаться за последними «улучшенными» версиями.

Эксперимент: три модели, 90 прогонов, один вывод

Разработчик под ником IvGranite решил проверить популярное мнение, что файнтюны ThinkingCap и Fable Fusion превосходят базовую Qwen3.6-27B в агентной работе. Методология впечатляет: 6 самооцениваемых задач, по 5 повторений на каждую модель — итого 90 изолированных запусков в идентичных условиях на k8s-кластере с одной GeForce RTX 5090.

Результаты: эффективность ≠ надёжность

ThinkingCap показал противоречивые результаты. С одной стороны — экономия в 34% токенов мышления и самые быстрые прогоны на 5 из 6 задач. С другой — крайняя нестабильность: лучшие по затратам и худшие прогоны принадлежат именно ему. В одном случае модель потратила ~10 вызовов инструментов, гоняясь за несуществующим тегом релиза llama.cpp, с которым базовая версия справилась одним API-запросом.

Fable Fusion оказался лучшим детективом и худшим рассказчиком. Только он проверил, что сломанный конфиг действительно активен, и достал лучшие исследовательские данные (распарсил встроенный JSON ритейлера для цен на варианты, нашёл мейнтейнера через GitHub API). Но та же модель приписала llama-swap авторство «Мэттью Гарретту, бывшему инженеру Red Hat» — реальному человеку (mjg59), который к проекту не имеет отношения. Настоящий автор — Бенсон Вонг (mostlygeek). Модель слила две реальные личности, процитировала правильный репо и... прошла грейдер. В другом запуске Fable потратил 94 вызова инструментов на один вопрос о цене.

Базовая Qwen3.6-27B оказалась самой скучной и дисциплинированной: однородные патчи, перечитывание собственного вывода, ноль выдуманных фактов, победа по манере выполнения в большинстве задач.

Вывод автора

Базовая модель остаётся дефолтом. За 90 прогонов файнтюны не доказали своё превосходство. ThinkingCap имеет смысл только если латентность токенов мышления — ваше узкое горло. Полный отчёт с конфигурациями, дизайном эксперимента и анализом транскриптов опубликован по ссылке.

Ключевые выводы

  • Дообученные модели не гарантируют улучшение над базовой версией — часто это латеральный сдвиг с trade-off'ами
  • ThinkingCap экономит 34% токенов мышления, но демонстрирует непредсказуемую бимодальность результатов
  • Fable Fusion лучше всех исследует контекст, но склонна к галлюцинациям с фактами — смешивает реальные личности
  • Базовая Qwen3.6-27B показала нулевой процент галлюцинаций и самую стабильную работу
  • В агентных задачах надёжность и дисциплинированность важнее агрессивной оптимизации эффективности

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

Это один из тех материалов, где методология важнее выводов. Парень не просто прогнал бенчмарк — он сделал это правильно: изоляция, идентичные условия, предрегистрация гипотез, полные транскрипты, ручная верификация. И выводы неудобные для хайпа: файнтюны не обязательно лучше базы, а часто — просто другие.

Особенно показателен кейс с Fable: модель слила два реальных профиля GitHub в одного несуществующего человека и прошла грейдер. Это не баг, а фича современных LLM — галлюцинации звучат убедительно. Для продакшен-агентов это критично: лучше скучная модель без выдумок, чем креативная, которая 10% времени несёт чушь. Базовая Qwen тут честный победитель — ноль галлюцинаций за 90 прогонов.

Ещё по теме

Комментарии