Почему оценки релевантности не спасают RAG от галлюцинаций
Автор построил локальную RAG-систему на румынском языке для ответов на вопросы о таможенных процедурах и протестировал распространённое допущение: что высокий скор релевантности при retrieval гарантирует точность ответа. Эксперимент показал, что это допущение не работает на практике, и потребовался другой механизм контроля.
Разработчикам RAG-систем стоит прочитать, чтобы понять ограничения популярного подхода к контролю качества через retrieval scores и увидеть практический пример альтернативного решения с открытым кодом.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Стандартный подход — фильтровать ответы RAG по порогу similarity score — не обеспечивает защиту от галлюцинаций
- Даже при высоком скоре релевантности извлечённого контекста модель может генерировать неподтверждённые ответы
- Автор реализовал альтернативный механизм проверки, требующий явной привязки ответа к исходному документу
- Вся система работает локально (Ollama, 2B модель, embedding) без внешних API, что важно для приватности данных
Анна Мельникова
Medium #llm
Читать оригинал
Инструменты из статьи
Ollamaбез VPN
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →
Комментарии