Почему мы удалили LLM-роутер: опыт Manifest после 7000 пользователей
Manifest запустил LLM-роутер в марте, а в июне его удалил. После 4 месяцев работы с 7000 пользователей выяснилось: экономия на inference оборачивается скрытыми затратами на поддержку, качество падает, а контекст задачи невозможно определить по одному промпту. Вывод: лучше один проверенный в бою LLM, чем умный роутинг.
Индустрия активно продаёт роутинг как способ снизить затраты на AI. Реальный опыт компании с тысячами пользователей показывает: это может быть дорогой иллюзией. Важно понимать trade-offs до внедрения.
Что произошло

Команда Manifest запустила LLM-роутер в марте 2024 как часть своего AI-гейтвея. Идея классическая: автоматически определять сложность запроса и отправлять простые задачи на дешёвые модели, сложные — на мощные. Экономия на inference казалась очевидной.
Через 4 месяца использования 7000 облачными пользователями команда получила гору обратной связи и GitHub-issues. В июне роутер объявили deprecated, 1 сентября окончательно выключили.
Главные причины провала:
1. Промпт не показывает реальную сложность задачи
Запрос "улучши тесты для репо $GIT_REPO" может быть элементарным (персональный HTML-сайт) или монстрообразным (ядро Linux). Роутер видит только триггер, а реальный контекст раскрывается через tool calls, поиск, RAG.
2. Кеш ломает всю логику роутинга
Префикс-кеш делает повторные запросы на 75-90% дешевле. Умный роутер добавляет "липкость" к модели, чтобы использовать кеш. Итог: роутер экономит, не роутя.
3. Скрытые затраты перевешивают экономию
Переключение между моделями усложняет evals, observability, промпт-инжиниринг. Команды тратят больше времени на отладку непредсказуемого поведения, чем экономят на токенах.
4. Инженеры должны понимать свои инструменты
Manifest отвергает идею "разработчики не должны думать о выборе модели". Как художник знает свои кисти, инженер должен осознанно выбирать LLM под задачу, а не делегировать это автоматике.
Автор: Павел Заславский · Источник: hnrss.org
Разработчикам. Ручной выбор модели под конкретную задачу даёт больше контроля, чем автороутинг. Меньше сюрпризов в продакшене, проще отлаживать, легче настроить evals. Prefix cache работает лучше при стабильной модели.
Бизнесу. Экономия на inference через роутинг оборачивается ростом затрат на поддержку, отладку и непредсказуемость качества. Для большинства продуктов проще выбрать одну battle-tested модель и оптимизировать под неё.
Инвесторам. Хайп вокруг LLM-роутеров может быть переоценён: скрытые operational costs съедают видимую экономию. Стартапы, продающие роутинг как silver bullet, рискуют столкнуться с оттоком клиентов через 6-12 месяцев.
- Делать observability и debugging-инструменты для мультимодельных систем — боль реальная, решений мало
- Развивать vertical AI-решения с жёстко зафиксированной моделью под конкретную нишу (например, код-ревью только на Claude, юрконсалтинг только на GPT-4)
- Строить сервисы оптимизации одной модели (fine-tuning, prompt engineering, caching) вместо роутинга между многими
- Консалтинг по выбору и настройке LLM под конкретные use cases — компании готовы платить за экспертизу вместо универсальной автоматики
- Разрабатывать prefix-cache aware инструменты для снижения затрат без роутинга
- Компании могут переплачивать за роутинг-решения, не видя реальной экономии в production
- Скрытые затраты на поддержку мультимодельных систем часто игнорируются при оценке ROI
- Хайп вокруг универсальных роутеров может отвлекать от реальной оптимизации конкретных моделей
- Команды рискуют потерять экспертизу в настройке LLM, делегируя выбор автоматике
Это один из тех редких честных постмортемов, которые индустрия AI редко показывает. Команда Manifest не стала продавать фичу ради хайпа — они её убили, когда увидели реальные цифры. И это круто.
Вывод простой: роутинг между моделями — это как микросервисы. Звучит умно на конференциях, но в реальности добавляет сложность, которую большинству продуктов не нужно. Один хорошо настроенный Claude 3.5 или GPT-4 с правильным кешированием побеждает десяток умных переключений. Инженеры должны понимать свои инструменты, а не надеяться, что автоматика всё решит. Скрытые затраты на поддержку мультимодельных систем почти всегда съедают мифическую экономию на токенах.
Комментарии