исследования 1 мин

ISNAD: система проверки достоверности для AI-агентов по принципам исламских учёных XII века

Исследователь адаптировал исламскую методологию проверки хадисов (isnād) для верификации данных в мультиагентных AI-системах. Вместо проверки только агента проверяется вся цепочка передачи информации — от источника до итогового ответа. Код и paper опубликованы.

Галлюцинации AI стоят денег и репутации, особенно в финансах и медицине. Проверка источников и цепей передачи данных — недостающее звено между экспериментом и продакшеном.

Что произошло

Разработчик Ali Zahid Raja опубликовал на arXiv исследование ISNAD — систему верификации данных для мультиагентных AI, основанную на исламской методологии проверки хадисов (isnād). Метод возник ~1400 лет назад: каждое утверждение несёт полную цепь передатчиков, каждый оценивается по надёжности, цепь слаба настолько, насколько слабо её самое ненадёжное звено.

Проблема в AI-2025: ответ проходит через скрейпер, экстрактор, несколько моделей, синтезатор. Где-то сломалось — и получаем уверенный, но тихо неправильный ответ. Индустрия фокусируется на верификации агента (идентичность, права доступа), почти никто не проверяет само утверждение.

ISNAD переносит принципы: - Отслеживание полной цепи передачи данных - Оценка надёжности каждого звена (модели, источника, агента) - Независимое подтверждение из нескольких цепей - Проверка итогового сообщения даже при идеальной цепи

Автор честно указал, что часть механизмов валидирована, часть — ещё нет. Paper и код в открытом доступе.

Автор: Ксения Лаврова · Источник: reddit.com

Разработчикам. Готовый фреймворк для трейсинга данных в мультиагентных системах. Можно встроить в RAG-пайплайны и AI-воркфлоу для отслеживания источников и оценки надёжности каждого шага. GitHub-репозиторий уже доступен.

Бизнесу. Механизм снижения рисков галлюцинаций в продуктовых AI-системах. Критично для финансов, медицины, юридических сервисов — где цена ошибки высока, а аудит источников обязателен.

Инвесторам. Растущий спрос на верификацию в AI-экосистеме. Похожие решения (например, chain-of-custody для данных) могут стать обязательными для enterprise AI, особенно при усилении регулирования.

Хайп35
Реальная польза65
Заработать55
  • SaaS для автоматического аудита источников в enterprise RAG-системах с визуализацией цепей доверия
  • Плагины для LangChain/LlamaIndex с встроенной верификацией каждого шага воркфлоу
  • Консалтинг по внедрению trust layer для финтеха и медтеха, где регулятор требует объяснимости
  • Marketplace верифицированных AI-агентов с рейтингом надёжности по историческим цепям
  • API для независимой кросс-проверки ответов от нескольких агентов с детекцией расхождений
  • Overhead производительности: отслеживание полной цепи и кросс-проверка замедляют инференс в реальном времени
  • Сложность внедрения: требует переписывания архитектуры пайплайнов, legacy-системы не адаптируются быстро
  • Неполная валидация: автор честно признал, что часть механизмов экспериментальна — в проде может вылезти
  • Масштабируемость: для большого числа агентов и источников граф доверия растёт экспоненциально

Знаете, что меня зацепило? Автор не продаёт «революцию», а честно пишет: вот работает, вот ещё не уверен, вот провалы. В мире AI-хайпа это как глоток свежего воздуха. Метод правда логичный: все проверяют паспорт агента, но никто не спрашивает, откуда он взял цифры. А ведь именно там и зарыта собака — в RAG-пайплайнах половина источников протухла ещё на этапе скрейпинга.

Практически это не silver bullet. Overhead будет, масштабировать сложно, и в легаси-системы не воткнёшь за неделю. Но для regulated industries — финтех, медтех, лигалтех — где аудит и chain-of-custody не опция, а закон, это может выстрелить. Особенно если регуляторы начнут требовать объяснимости не только модели, но и данных. Следить стоит.

Инструменты из статьи

AI-агент, который обучается выполнять рутинные задачи в браузере вместо вас....

Доступ из РФ →

Ещё по теме

Комментарии