исследования 1 мин

Почему LLM проваливаются на реальных задачах: у них есть «кора», но нет «гиппокампа»

Автор утверждает, что предобученные LLM похожи на неокортекс человека — они знают общие факты, но лишены «гиппокампа», который у людей быстро запоминает конкретные эпизоды и превращает их в рабочие процедуры. Поэтому модели импровизируют на корпоративных задачах вместо того, чтобы следовать реальным, неписаным процедурам компании — и проваливаются в продакшене.

Если вы пытаетесь внедрить AI в реальные рабочие процессы, понимание этого структурного ограничения поможет не тратить время на стандартные решения (RAG, промпты), которые не решают корневую проблему — отсутствие «гиппокампа» для организационной памяти.

Проблема

Почему большие языковые модели, обученные на всём интернете, до сих пор плохо справляются с реальными корпоративными задачами? Автор предлагает аналогию из нейробиологии.

Человеческий мозг использует две системы памяти (теория дополняющих систем обучения, McClelland et al. 1995):

  • Неокортекс учится медленно и хранит общие знания о мире
  • Гиппокамп учится быстро: запоминает конкретные эпизоды, а потом превращает повторяющиеся паттерны в надёжные процедуры

Диагноз

Предобученная LLM — это по сути неокортекс без гиппокампа. Она прочитала весь интернет и знает общие вещи. Но у неё нет быстрой, специфичной для компании памяти, которая бы запомнила, как ваша команда реально обработала тот возврат прошлой весной и превратила это в воспроизводимую процедуру.

Вы бросаете этот «умный неокортекс» в компанию, и он начинает импровизировать. А импровизация в автоматизации = провал.

Ключевой момент: настоящая процедура вообще не была задокументирована. Она живёт в переписках команды, в головах пары людей и в одном исключении, которое все молча копируют.

Почему обычные решения не работают

  • RAG и поиск — это только половина гиппокампа: они находят документ, но не собирают разрозненные эпизоды в реальную процедуру. И документ часто уверенно врёт.
  • Агентские платформы заставляют вас использовать их агента на их стеке.

Что может помочь

Если диагноз верен, решение должно:

  1. Консолидировать разрозненные рабочие эпизоды (включая неписаные исключения)
  2. Превратить их в процедуры с ссылками на источники, одобрением людей и версионированием
  3. Позволить существующим агентам выполнять эти процедуры с человеческим контролем на чувствительных операциях
  4. Встроить governance: ссылки, одобрения, аудит-трейл — потому что вопрос «ваш AI выдал возврат, на каком основании?» останавливает внедрение намертво

Вопросы

Автор просит критики:

  • Действительно ли «модель не знает реальных процедур организации» — главный блокер? Или проблема в доверии, безопасности, или в том, что работа просто не повторяется?
  • Работает ли аналогия с кортексом/гиппокампом или разваливается при детальном рассмотрении?
  • Что реально делает агентов достаточно надёжными для боевого использования?

Ключевые выводы

  • Предобученные LLM знают общие факты, но не знают конкретных, неписаных процедур вашей компании — они импровизируют вместо того, чтобы следовать реальной практике
  • Настоящие рабочие процедуры редко живут в документах — они распределены по переписками, головам людей и молчаливо копируемым исключениям
  • RAG и поиск только находят документы, но не собирают разрозненные эпизоды в консолидированную процедуру
  • Governance (источники, одобрения, аудит) должен быть встроен с нуля, а не добавлен потом — вопрос «на каком основании?» останавливает внедрение
  • Аналогия с неокортексом (общие знания) и гиппокампом (быстрое запоминание эпизодов и консолидация в процедуры) объясняет структурное ограничение LLM

Автор: Ксения Лаврова · Источник: reddit.com

Мнение редакции

**Сильная аналогия, объясняющая реальную боль.** Автор попал в точку: LLM знают «как вообще», но не знают «как у нас». И проблема не в том, что моделям не хватает параметров или контекста — проблема в том, что реальные процедуры вообще не записаны. Они живут в Slack-переписках, в памяти двух человек и в том самом костыле, который все молча копируют уже два года.

Но есть нюанс: даже если вы соберёте все эти эпизоды и консолидируете их в процедуры, кто гарантирует, что они правильные? Гиппокамп человека отбирает и обобщает через повторение и обратную связь. Кто будет делать это для корпоративной памяти? И главное — кто будет отвечать, если AI выполнит процедуру, которую три месяца назад одобрил уволившийся менеджер? Governance здесь не просто nice-to-have, а условие выживания всей затеи.

Ещё по теме

Комментарии