исследования 1 мин

Таксономия ошибок в системах ответов на вопросы с опорой на источники

Статья разбирает, почему оценка RAG-систем не может быть бинарной («работает/не работает»). Авторы предлагают детальную таксономию сбоев на всех этапах: от полноты корпуса источников и качества чанкинга до корректности извлечения, синтеза ответа и атрибуции цитат.

Разработчикам RAG-систем и специалистам по оценке AI стоит изучить материал, чтобы перейти от поверхностных метрик к диагностике конкретных звеньев pipeline и понять, почему системы с цитатами могут оставаться ненадёжными.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Грамотная цитата не гарантирует полноты ответа: система может найти факты об одной части вопроса, но умолчать о другой — и полированный текст скроет пробел эффективнее, чем явная галлюцинация
  • Сбои возникают на разных стадиях: устаревший корпус источников, неправильная нарезка документов (чанкинг), слабый поиск, некорректный синтез или пропущенное уточнение — и каждый требует своего исправления
  • Публичные системы (госуслуги, университетские ассистенты) не могут игнорировать качество корпуса: точный поиск в устаревшем справочнике или в базе без авторитетных источников всё равно даёт неправильный ответ
  • Современные фреймворки (RAGAs, ARES, RAGChecker) разделяют метрики релевантности контекста, точности ответа и качества атрибуции, чтобы диагностировать, где именно сломалась цепочка
Сергей Ефимов Medium #llm
Читать оригинал

Ещё по теме

Комментарии