инструменты 1 мин

71% ошибок RAG-системы оказались не галлюцинациями, а проблемой календаря

Автор построил RAG-систему для анализа финансовых отчётов SEC и обнаружил, что большинство ошибок (71%) — это не галлюцинации, а неправильная привязка чисел к фискальным периодам. Модель находила верные данные, но путала, к какому году они относятся, когда в контексте были цифры за несколько лет подряд.

Обязательно для тех, кто строит RAG для финансов или других доменов, где ошибка в одной цифре критична. Автор показывает методологию отладки, делится открытым репозиторием и объясняет, почему 90% точности в финансах опаснее честного «не знаю».

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Основная проблема финансовой RAG — не отсутствие данных или их выдумывание, а неспособность модели правильно связать число с нужным временным периодом
  • Промптинг в одиночку не решил проблему — потребовалось три уровня оптимизации: улучшение ретривала (кросс-энкодер дал +64% к recall@1), штрафы за футуристические заявления и смена модели с Llama на Qwen
  • Система протестирована на 56 отчётах из разных отраслей (ритейл, здравоохранение, энергетика) — ретривал держался на уровне 1.00 recall@10, но точность упала до 59% на кросс-секторных данных из-за ограничений 7B-модели
  • Автор выявил скрытый баг: пересборка ChromaDB каждый раз меняла ID чанков, из-за чего валидационные вопросы ссылались на несуществующие данные
RAGфинансыотладкаретривалвременные метки
Павел Заславский Medium #artificial-intelligence
Читать оригинал

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии