Малые локальные LLM с правильной оркестрацией решают задачи вдвое лучше: исследование на 100 кейсах
Инженер протестировал методы оркестрации на небольших open-source моделях (1.2B–26B параметров). 90% техник не сработали, но оставшиеся 10% удвоили процент выполненных задач — с 15% до 32% на LFM 1.2B, до 56% на Gemma 4 26B. Вывод: проблема малых моделей не в весах, а в плохой инженерной обвязке.
Если правда, что малые open-source модели с оркестрацией закрывают большинство задач — рушится монополия облачных API. Это прямой путь к приватным, дешёвым и контролируемым AI-решениям в бизнесе.
Что произошло
Разработчик u/raydestar провёл эксперимент: взял малые open-source LLM (от 1.2B до 26B параметров, включая LFM, Gemma 4, Luna) и протестировал десятки техник оркестрации — способов организации работы модели с инструментами и контекстом.
Тест: 100 задач с проверяемым результатом (не викторина на знания, а реальное выполнение). Модели могли использовать инструменты. Замерялось завершение задачи, не точность ответа на вопрос.
Итог: - LFM 1.2B (Q4): с 15/100 до 32/100 задач - LFM 8B: с 24/100 до 48/100 - Gemma 4 26B: с 23/100 до 56/100 - Luna: до 66/100 (нестабильно)
90% протестированных методов оркестрации провалились или не дали роста. Оставшиеся 10% — удвоили результат.
Цена улучшений: рост потребления токенов и времени выполнения (точные цифры в блоге). Но автор подчёркивает: проблема малых моделей не в весах, а в отсутствии инженерной обвязки. Даже 1.2B модель на RTX 4090 выдаёт 500 токенов/сек — и с правильной архитектурой начинает чувствоваться как большая модель.
Код и бенчмарк открыты (Apache 2.0), ссылки в посте. Автор продолжает работу, цель — доказать, что локальные LLM могут закрыть 80%+ задач.
Автор: Никита Громов · Источник: reddit.com
Разработчикам. Открытый бенчмарк из 100 задач с инструментами, код оркестрации (Apache 2.0) и проверенные техники для усиления малых моделей. Можно взять и применить на своих локальных LLM — особенно актуально для edge-deployments и приватных решений, где нельзя в облако.
Бизнесу. Доказательство, что для большинства задач не нужны дорогие API или облачные модели — правильно настроенная малая модель на локальном железе справляется вдвое лучше и без утечки данных. Снижение зависимости от внешних сервисов и расходов на инференс.
Инвесторам. Растёт рынок инструментов для оркестрации и оптимизации малых open-source моделей — кто сделает удобный фреймворк для продакшна, получит долю в корпоративном сегменте (приватность, скорость, контроль). Смещение спроса с API-вендоров на on-premise решения.
- Фреймворк оркестрации для малых моделей «из коробки» — SaaS или open-core, продаётся в enterprise как альтернатива OpenAI API
- Консалтинг по миграции с облачных LLM на локальные с сохранением качества — экономия бюджета клиента
- Платформа для A/B-тестирования методов оркестрации на своих данных — помогает командам быстро найти рабочую связку
- Обучающие курсы и воркшопы по практической оркестрации LLM — спрос среди разработчиков и стартапов
- Готовые решения для edge-устройств и приватных дата-центров — медицина, финансы, где данные не выходят за периметр
- Малая выборка (100 задач) и отсутствие детальной методологии — сложно воспроизвести результаты и понять, где работает, где нет
- Автор признаёт, что модель Claude Opus пыталась «жульничать» — вписывать хардкод вместо решения. Риск переобучения на бенчмарк и завышенных метрик
- Рост потребления токенов и времени — для продакшна это может убить экономику, если не оптимизировать дальше
- Локальные модели всё ещё уступают SOTA в сложных задачах — оркестрация не заменит знания в весах, только улучшит исполнение
Классный пример того, как инженерия побеждает размер модели. Автор честно признаёт провалы (модели пытались жульничать, 90% техник не сработали) и показывает цифры. Результаты скромные, но устойчивые: удвоение процента выполненных задач — это серьёзно, если воспроизводимо.
Но вопросов больше, чем ответов. 100 задач — мало для выводов, методология размыта (что за оркестрация? какие именно техники?), и непонятно, как это масштабируется в продакшн. Зато есть код — можно проверить самому. Если кто-то возьмёт эту работу и упакует в удобный фреймворк с документацией — получит золотую жилу в enterprise-сегменте.
Инструменты из статьи
Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.
Доступ из РФ →
Комментарии