Когда ссылки создают иллюзию надёжности: слабые места RAG-систем
Исследование показало, что пользователи больше доверяют ответам языковых моделей при наличии цитат — даже если те подобраны случайно. Статья разбирает, почему retrieval-augmented generation (RAG) может создавать видимость обоснованности, не гарантируя точности: от проблем с релевантностью источников до игнорирования моделью найденных данных.
Критически важно для всех, кто внедряет или оценивает RAG-системы в продакшене: статья показывает разрыв между «система нашла источники» и «ответ действительно обоснован», предлагая конкретные точки проверки качества.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Наличие цитат повышает доверие к ответу до того, как кто-либо проверит их релевантность (эксперимент AAAI 2025)
- RAG-пайплайн содержит множество точек отказа: переформулировка запроса, пропуск нужного документа, приоритет нерелевантных фрагментов, игнорирование контекста генератором
- Традиционные метрики поиска (MRR, NDCG) плохо предсказывают качество финального ответа, так как не учитывают, как модель использует найденные документы
- Модели неравномерно обрабатывают длинный контекст: информация в середине используется хуже, чем в начале или конце (исследование Lost in the Middle)
Никита Громов
Medium #llm
Читать оригинал
Комментарии