Тест Bonsai-27B: 1-битная модель провалилась на агентских задачах, 2-битная уступила обычной 9B
Энтузиаст протестировал сверхсжатые модели Bonsai-27B (1-бит и 2-бит) на агентском бенчмарке Terminal-Bench 2.0 в видеокарте с 8GB VRAM. 2-битная версия показала 7.9% успешности — хуже обычной Qwen 9B (9.2%) при схожих требованиях к памяти. 1-битная модель вообще не справилась с агентскими задачами, зацикливаясь на бесконечной генерации текста.
Практический тест показывает реальные ограничения сверхсжатых моделей: экономия памяти оборачивается потерей точности и надёжности, что критично для агентских применений. Важно для тех, кто выбирает между экстремальным сжатием и просто меньшей моделью.
Тест сверхсжатых моделей Bonsai на агентских задачах
Энтузиаст с ником Creative-Regular6799 провёл практический тест моделей Ternary-Bonsai-27B (2-бит) и Bonsai-27B (1-бит) на бенчмарке Terminal-Bench 2.0, который проверяет способность модели работать как автономный агент.
Условия теста
Тестирование проходило на ноутбучной RTX 5070 с 8GB VRAM через специальную версию llama.cpp от PrismML (обычная версия не может загружать 2-битные ядра). Бенчмарк включал 89 задач с одной попыткой на задачу, ограничением в 40 ходов и температурой 0.2.
Результаты
2-битная Ternary-Bonsai-27B решила 7.9% задач — хуже, чем Qwen 3.5 9B (9.2%), которая также помещается в ту же видеокарту при обычном квантовании Q4. Из 7 решённых задач 6 справилась и полноразмерная Qwen 3.6 35B-A3B (24.3% общий результат). При этом вызовы инструментов работали безупречно, без единой ошибки парсинга.
1-битная модель оказалась непригодной для агентских сценариев. На простых запросах она работает корректно (правильно считает 12×12, проверяет простые числа), но в агентском цикле уходит в бесконечную генерацию. На первой же задаче модель выдала 14,000+ токенов без стоп-сигнала, просто болтая до исчерпания контекста в 32k токенов. Трассировка показала склонность к самопроверке даже на тривиальных запросах, что переходит в незавершаемые циклы на сложных задачах.
Выводы
Плюс: модели действительно помещаются в 8GB VRAM. Минус: экстремальное сжатие стоит точности. Проще запустить обычную 9B-модель на Q4, чем мириться с худшими результатами ради экономии памяти, которая в данном случае уже не критична.
Ключевые выводы
- 2-битная квантизация 27B-модели даёт худшие результаты, чем обычная 9B-модель на Q4 при тех же требованиях к VRAM
- 1-битные модели непригодны для агентских задач из-за склонности к бесконечным циклам генерации текста
- Экстремальное сжатие (1-2 бита) работает на простых запросах, но ломается на сложных многошаговых задачах
- Вызовы инструментов остаются стабильными даже при агрессивном квантовании
- Для работы с агрессивно квантованными моделями требуется специальный форк llama.cpp
Автор: Ксения Лаврова · Источник: reddit.com
Это честный полевой тест, который отрезвляет хайп вокруг экстремального квантования. Да, модели реально помещаются в 8GB. Но какой смысл втискивать 27B-параметровую модель, если она работает хуже обычной 9B на Q4? Особенно показателен провал 1-битной версии: на простых примерах вроде «сколько будет 12×12» всё ок, но в агентском цикле она уходит в бесконечную рефлексию и самопроверку, пока не упрётся в лимит контекста.
Вывод простой: если у вас 8GB VRAM, лучше взять нормальную 9B-модель на Q4, чем мучиться с экзотическими 1-2-битными 27B. Сжатие ради сжатия — это интересная инженерная задачка, но не практичное решение. По крайней мере, пока.
Комментарии