AWS показал, как снизить расходы на RAG в Amazon Bedrock на 70% через сжатие контекста
AWS выпустил паттерн для RAG-приложений на Bedrock: маленькая модель (Claude Haiku) фильтрует контекст после поиска, оставляя только релевантные куски для основной модели (Claude Sonnet). Это даёт до 70% экономии на входных токенах при сохранении качества ответов. Реализация — одна Lambda-функция, работает с Bedrock Knowledge Bases.