AWS показал, как снизить расходы на RAG в Amazon Bedrock на 70% через сжатие контекста
AWS выпустил паттерн для RAG-приложений на Bedrock: маленькая модель (Claude Haiku) фильтрует контекст после поиска, оставляя только релевантные куски для основной модели (Claude Sonnet). Это даёт до 70% экономии на входных токенах при сохранении качества ответов. Реализация — одна Lambda-функция, работает с Bedrock Knowledge Bases.
Входные токены — главная статья расходов при масштабировании RAG. AWS предложил проверенный способ резать их без потери качества, что напрямую влияет на unit economics AI-продуктов.
Что произошло
AWS опубликовал готовый архитектурный паттерн для снижения затрат на RAG-приложения в Amazon Bedrock. Проблема: при масштабировании RAG входные токены становятся основной статьёй расходов — типичный запрос тянет 5-20 чанков из базы знаний, это тысячи токенов на каждый вопрос пользователя.
Решение простое: между поиском и финальным ответом вставляется дополнительный шаг — маленькая дешёвая модель (Claude Haiku) читает все найденные куски вместе с вопросом и выдаёт только релевантные фрагменты дословно. Потом основная модель (Claude Sonnet) получает сжатый контекст и генерирует ответ.
Вся логика умещается в одну Lambda-функцию. Паттерн совместим с Bedrock Knowledge Bases и работает через Converse API. AWS приводит экономическую модель: экономия появляется, когда произведение compression ratio на price ratio больше единицы. На практике это даёт до 70% сокращения входных токенов при сохранении качества ответов.
Бонусом — меньше галлюцинаций, потому что модель не отвлекается на нерелевантный контекст. Паттерн стакается с prompt caching и Intelligent Prompt Routing для усиления эффекта.
Автор: Анна Мельникова · Источник: aws.amazon.com
Разработчикам. Готовая Lambda-функция с Bedrock Converse API, легко встраивается в существующие RAG-пайплайны. Работает с Knowledge Bases из коробки, можно миксовать разные пары моделей внутри семейства. Стакается с prompt caching и rerank API для дополнительной оптимизации.
Бизнесу. Прямое снижение операционных расходов на AI-чат-боты и поисковые системы на 40-70% без потери качества. Особенно выгодно для техдокументации, юридических баз знаний, саппорта — где объёмы запросов большие, а контекст избыточный.
Инвесторам. AWS укрепляет позиции Bedrock как платформы для enterprise RAG, снижая барьер масштабирования. Компрессия контекста — прямой ответ на главную боль корпоративных клиентов: расходы на inference. Это усиливает lock-in и конкурентное преимущество перед вертикальными решениями.
- Сделать SaaS-обёртку для миграции существующих RAG-систем на этот паттерн с гарантией экономии — продавать как managed-сервис по модели revenue share от сэкономленного.
- Запустить консалтинг по оптимизации RAG для enterprise: аудит токенов, внедрение компрессии, настройка caching — fixed-price проекты с ROI-гарантиями.
- Построить вертикальное решение для legal tech или technical documentation на базе Bedrock Knowledge Bases с встроенной компрессией — продавать как белый ящик с прозрачной экономикой.
- Разработать open-source библиотеку для других облаков (Azure OpenAI, GCP Vertex AI) по той же схеме — монетизировать через enterprise-поддержку и training.
- Создать мониторинг-панель для RAG-экономики: показывает compression ratio, price ratio, savings по запросам — продавать как плагин к Bedrock или standalone SaaS.
- Экономия реальна только при высоком compression ratio — если контекст изначально релевантный, выигрыш минимален или компрессия добавляет latency без профита.
- Зависимость от конкретных пар моделей в семействе Claude на Bedrock — переход на другие семейства требует переоценки экономики.
- Дополнительный вызов модели увеличивает latency на 100-300 мс — для real-time приложений это может быть критично, нужно тестировать на конкретных use cases.
- AWS продвигает собственную экосистему (Knowledge Bases, Lambda, Bedrock) — решение сложно портировать на multi-cloud без переписывания.
Это типичный AWS-подход: взять известный паттерн из ML-практики (model cascading), упаковать в managed-сервис и продать как best practice. Ничего революционного, но работает и экономит реальные деньги — для тех, кто уже сидит на Bedrock и платит пятизначные счета за токены, это no-brainer.
Главный вопрос — latency penalty. Дополнительный вызов модели добавляет 100-300 мс, и для real-time чатов это может быть больно. Но для асинхронных сценариев (email support, document analysis, internal search) это прямая экономия без компромиссов. Если у вас RAG на Bedrock и объёмы растут — тестируйте, скорее всего окупится.
Инструменты из статьи
AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...
Доступ из РФ →
Комментарии