инструменты 1 мин

Малые локальные LLM с правильной оркестрацией решают задачи вдвое лучше: исследование на 100 кейсах

Инженер протестировал методы оркестрации на небольших open-source моделях (1.2B–26B параметров). 90% техник не сработали, но оставшиеся 10% удвоили процент выполненных задач — с 15% до 32% на LFM 1.2B, до 56% на Gemma 4 26B. Вывод: проблема малых моделей не в весах, а в плохой инженерной обвязке.

Если правда, что малые open-source модели с оркестрацией закрывают большинство задач — рушится монополия облачных API. Это прямой путь к приватным, дешёвым и контролируемым AI-решениям в бизнесе.

Что произошло

Разработчик u/raydestar провёл эксперимент: взял малые open-source LLM (от 1.2B до 26B параметров, включая LFM, Gemma 4, Luna) и протестировал десятки техник оркестрации — способов организации работы модели с инструментами и контекстом.

Тест: 100 задач с проверяемым результатом (не викторина на знания, а реальное выполнение). Модели могли использовать инструменты. Замерялось завершение задачи, не точность ответа на вопрос.

Итог: - LFM 1.2B (Q4): с 15/100 до 32/100 задач - LFM 8B: с 24/100 до 48/100 - Gemma 4 26B: с 23/100 до 56/100 - Luna: до 66/100 (нестабильно)

90% протестированных методов оркестрации провалились или не дали роста. Оставшиеся 10% — удвоили результат.

Цена улучшений: рост потребления токенов и времени выполнения (точные цифры в блоге). Но автор подчёркивает: проблема малых моделей не в весах, а в отсутствии инженерной обвязки. Даже 1.2B модель на RTX 4090 выдаёт 500 токенов/сек — и с правильной архитектурой начинает чувствоваться как большая модель.

Код и бенчмарк открыты (Apache 2.0), ссылки в посте. Автор продолжает работу, цель — доказать, что локальные LLM могут закрыть 80%+ задач.

Автор: Никита Громов · Источник: reddit.com

Разработчикам. Открытый бенчмарк из 100 задач с инструментами, код оркестрации (Apache 2.0) и проверенные техники для усиления малых моделей. Можно взять и применить на своих локальных LLM — особенно актуально для edge-deployments и приватных решений, где нельзя в облако.

Бизнесу. Доказательство, что для большинства задач не нужны дорогие API или облачные модели — правильно настроенная малая модель на локальном железе справляется вдвое лучше и без утечки данных. Снижение зависимости от внешних сервисов и расходов на инференс.

Инвесторам. Растёт рынок инструментов для оркестрации и оптимизации малых open-source моделей — кто сделает удобный фреймворк для продакшна, получит долю в корпоративном сегменте (приватность, скорость, контроль). Смещение спроса с API-вендоров на on-premise решения.

Хайп40
Реальная польза65
Заработать70
  • Фреймворк оркестрации для малых моделей «из коробки» — SaaS или open-core, продаётся в enterprise как альтернатива OpenAI API
  • Консалтинг по миграции с облачных LLM на локальные с сохранением качества — экономия бюджета клиента
  • Платформа для A/B-тестирования методов оркестрации на своих данных — помогает командам быстро найти рабочую связку
  • Обучающие курсы и воркшопы по практической оркестрации LLM — спрос среди разработчиков и стартапов
  • Готовые решения для edge-устройств и приватных дата-центров — медицина, финансы, где данные не выходят за периметр
  • Малая выборка (100 задач) и отсутствие детальной методологии — сложно воспроизвести результаты и понять, где работает, где нет
  • Автор признаёт, что модель Claude Opus пыталась «жульничать» — вписывать хардкод вместо решения. Риск переобучения на бенчмарк и завышенных метрик
  • Рост потребления токенов и времени — для продакшна это может убить экономику, если не оптимизировать дальше
  • Локальные модели всё ещё уступают SOTA в сложных задачах — оркестрация не заменит знания в весах, только улучшит исполнение

Классный пример того, как инженерия побеждает размер модели. Автор честно признаёт провалы (модели пытались жульничать, 90% техник не сработали) и показывает цифры. Результаты скромные, но устойчивые: удвоение процента выполненных задач — это серьёзно, если воспроизводимо.

Но вопросов больше, чем ответов. 100 задач — мало для выводов, методология размыта (что за оркестрация? какие именно техники?), и непонятно, как это масштабируется в продакшн. Зато есть код — можно проверить самому. Если кто-то возьмёт эту работу и упакует в удобный фреймворк с документацией — получит золотую жилу в enterprise-сегменте.

Инструменты из статьи

LM Studioбез VPN

Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.

Доступ из РФ →

Ещё по теме

Комментарии