Как подобрать «дозу памяти» для AI-агента: исследование IBM на восьми моделях
IBM Research показала: агентная память работает не как выключатель, а как доза — её нужно калибровать под модель. Сильные модели (DeepSeek-V3.2) растут на +9,5 п.п. при полном наборе инструкций, слабые (gpt-oss-120b) — на +16,1 п.п. при выборочной подаче, а насыщенные вообще не показывают прироста. Главное: обучение идёт вокруг модели, без обновления весов.
Это первая работа, которая показывает: выбор модели для агента — это не только мощность, но и калибровка памяти. Вы можете переплачивать за frontier-модель или экономить токены на слабой, не зная, что правильная доза контекста решает обе проблемы.
Что произошло

IBM Research опубликовала исследование агентной памяти (ALTK-Evolve) на восьми моделях — от 30B до frontier-систем вроде DeepSeek-V3.2 (671B MoE). Идея: агент извлекает инструкции из прошлых успехов и ошибок, складывает их в набор guidelines и подаёт обратно при выполнении новых задач — без обновления весов модели.
Главный вывод: память — это не фича, которую включают, а доза, которую калибруют. Три паттерна:

- Сильные модели с запасом (DeepSeek-V3.2): +9,5 п.п. точности при полном наборе инструкций — они усваивают даже редкие кейсы.
- Слабые модели (gpt-oss-120b, 117B MoE): +16,1 п.п. при компактном ядре + выборочной подаче (retrieval) — полный набор их топит, +50% токенов при меньшей пользе.
- Насыщенные модели (GLM-5, 745B MoE): ноль прироста — либо уже на потолке, либо не применяют guidance эффективно.
Тесты на AppWorld (585 мультишаговых задач): выборочная подача (curated retrieval) дала лучшую точность при +5% токенов. Обучение идёт вокруг модели, не внутри — поэтому дёшево и портируемо.
Автор: Ксения Лаврова · Источник: HuggingFace Blog
Разработчикам. ALTK-Evolve показывает, как строить систему агентной памяти без файнтюна: извлекаешь guidelines из траекторий, подаёшь через retrieval или full injection в зависимости от модели. Prompt caching держит затраты на уровне +5% токенов даже при полном наборе. Код на HuggingFace.
Бизнесу. Агенты с памятью дают +16 п.п. точности в автоматизации процессов (платежи, календари, сообщения), но важно не переборщить с контекстом — слабая модель с правильной порцией памяти бьёт сильную с перегрузом. Экономия до 50% токенов при выборочной подаче.
Инвесторам. Рынок агентных систем смещается от простого масштабирования к калибровке контекста. IBM демонстрирует, что frontier-модели не всегда выигрывают — правильная архитектура памяти делает 117B-модель конкурентом 745B. Инфраструктура для retrieval и prompt caching становится критичной.
- Сделать SaaS-платформу для калибровки агентной памяти: автоматически тестирует модель, подбирает оптимальную стратегию подачи guidelines (full vs retrieval) и экономит до 50% токенов в продакшене
- Консалтинг для enterprise: аудит их AI-агентов, оптимизация под конкретные модели — многие льют весь контекст и переплачивают, не зная про calibration
- Инструмент для разработчиков агентов: библиотека для автоматического майнинга guidelines из траекторий + встроенный retrieval-движок с поддержкой prompt caching
- Маркетплейс готовых guideline-наборов под популярные задачи (CRM, support, аналитика) — продаёшь калиброванные наборы под разные tier-модели
- Система мониторинга агентов: показывает, когда модель «насытилась» и дальнейший тюнинг памяти бесполезен — экономит бюджет на эксперименты
- Исследование на одном бенчмарке (AppWorld, 585 задач) — неясно, как паттерны масштабируются на реальные enterprise-процессы с другой структурой задач
- Насыщенный паттерн (GLM-5) описан как наблюдение, а не объяснение — IBM сама не знает, почему 745B-модель не выросла, это может быть потолок задачи или проблема применения guidance
- Зависимость от качества майнинга guidelines: если агент накопил мусорные стратегии из неудачных траекторий, он будет масштабировать ошибки, а не учиться
- Экономика prompt caching завязана на провайдеров — если OpenAI/Anthropic изменят pricing, калибровка может стать невыгодной для слабых моделей
Это редкий случай, когда исследование от большой компании не продаёт свой продукт, а решает реальную инженерную проблему. IBM буквально говорит: «Мы не знаем, почему GLM-5 не растёт, но вот три паттерна, которые работают на восьми моделях». Честность подкупает. Главное открытие — не в том, что память помогает (это и так понятно), а в том, что её нужно калибровать: слабая модель с правильной порцией контекста обгоняет сильную с перегрузом.
Для продакшена это меняет экономику: вы можете не гнаться за frontier-моделями, а взять средний tier и оптимизировать контекст — экономия до 50% токенов при росте точности на +16 п.п. Prompt caching делает это доступным. Минус один: исследование на одном бенчмарке (AppWorld), и паттерн «насыщения» пока объяснён слабо. Но направление правильное — агенты перестают быть чёрным ящиком, появляются инженерные рычаги.
Комментарии