RAG на 200 PDF: почему чанки по абзацам сработали лучше, чем по 512 токенов
Строил базу знаний по внутренней документации. Первая версия резала на фиксированные 512 токенов — ответы получались рваные, модель теряла контекст таблиц.
Переехал на семантический чанкинг по абзацам с оверлапом в одно предложение — retrieval стал попадать заметно точнее, особенно на вопросах через несколько страниц.
Ещё добавил реранкер поверх векторного поиска — топ-5 стал реально релевантным. Без реранкера половина мусора.
Комментарии