ISNAD: средневековая система проверки достоверности для мультиагентных LLM
Исследователь адаптировал исламскую методологию проверки хадисов XII века (цепочки передатчиков isnād) для контроля достоверности в мультиагентных AI-системах. Каждое утверждение теперь несёт полную цепь источников с оценкой надёжности каждого звена — чтобы ловить «уверенно-неправильные» ответы до того, как они попадут к пользователю.
Мультиагентные системы уже в продакшене (customer support, аналитика, код-ассистенты), и проблема тихих ошибок — критична. Если решение масштабируется, это новый стандарт безопасности для enterprise AI.
Что сделали
Автор (Ali Zahid Raja) опубликовал препринт и код, где предлагает заимствовать методологию исламских учёных XII века для проверки достоверности в мультиагентных LLM-системах.
Проблема: в конвейере из нескольких агентов (парсер → экстрактор → несколько моделей → синтезатор) часть звеньев ненадёжна, но падают они тихо — на выходе получается гладкий уверенный ответ, который незаметно врёт. Сейчас проверяют агента (права доступа, авторизацию), но не само утверждение.
Решение: система isnād-rijāl. В классической форме каждое высказывание несёт полную цепь передатчиков (isnād), каждый передатчик оценён по честности и точности (rijāl), цепь крепка настолько, насколько крепко слабейшее звено, независимые цепи повышают уверенность, а безупречная цепь не спасает испорченное содержание (контент оценивается отдельно).
Адаптация: каждое утверждение в мультиагентной системе получает scored transmission chain, перекрёстная проверка по независимым цепям даёт оценку подтверждения, содержание оценивается отдельной осью.
Автор честно пишет, какие части валидированы, какие нет и почему — открыто перечисляет failure modes. Код и eval открыты, ждёт критики.
Автор: Сергей Ефимов · Источник: reddit.com
Разработчикам. Готовая библиотека на GitHub для встраивания claim-level провенанса в мультиагентные пайплайны. Позволяет отслеживать источник каждого факта, оценивать надёжность звеньев и фильтровать hallucinations до того, как ответ уйдёт пользователю. Полезно для RAG, агентных фреймворков, систем с цепочками вызовов моделей.
Бизнесу. Снижает риск тихих ошибок в продакшн-системах с несколькими LLM-агентами — особенно критично в финансах, медицине, юриспруденции, где цена неправильного ответа высока. Позволяет аудировать происхождение каждого факта и объяснять клиенту, почему система даёт тот или иной ответ.
Инвесторам. Исследовательский проект на стыке AI safety и практической инженерии. Если подход масштабируется, открывает нишу enterprise-инструментов для верификации мультиагентных систем — рынок растёт вместе с распространением агентных архитектур в критичных доменах.
- Обёртка для корпоративных RAG-систем: плагин, который добавляет цепочку провенанса к каждому ответу и выдаёт confidence score — продавать enterprise-клиентам в регулируемых отраслях
- Audit-as-a-Service для мультиагентных платформ (LangChain, AutoGPT, CrewAI): сервис, который логирует все цепи передачи и находит слабые звенья — предупреждает о рисках до релиза
- Обучающий датасет для fine-tuning моделей на честность: собирать размеченные цепи достоверности и продавать как ground truth для alignment-исследований
- Консалтинг по внедрению систем проверки достоверности в AI-продукты финтех, медтех, юртех — где ошибка = судебный иск
- Оверхед на трекинг каждой цепи может замедлить инференс в 2-3 раза — нужны бенчмарки на реальных объёмах
- Методология заточена под текстовые утверждения; для мультимодальных агентов (изображения, код) аналогия может не работать
- Автор сам признаёт, что часть механизмов не валидирована — рано внедрять в прод без дополнительных экспериментов
- Если модель научится подделывать цепь провенанса (генерить правдоподобные источники), система ломается
Это один из тех редких препринтов, где автор не продаёт хайп, а честно раскладывает, что работает, что нет и где дыры. Идея красивая: если средневековые учёные могли проверять достоверность устных преданий через цепочки передатчиков, почему бы не применить это к AI-агентам? В теории — элегантно, на практике — куча вопросов: как масштабировать, как считать оверхед, как защититься от подделки самой цепи.
Для enterprise-сценариев (финтех, медтех, юртех) это может быть прорывом — там цена тихой ошибки измеряется судебными исками и потерей репутации. Для стартапов — пока слишком сырое, чтобы тащить в прод. Но направление правильное: проверка утверждений, а не только агентов — это новая ось безопасности, которую индустрия только начинает осознавать. Следить за развитием стоит.
Комментарии