OpenAI берёт $10 за 1000 веб-поисков и впихивает 17к лишних токенов — разработчик показал, как сэкономить 87%
Разработчик измерил эффективность API веб-поиска OpenAI и обнаружил, что ~87% инжектируемых токенов (около 17 тысяч на запрос) не используются для ответа. Он создал локальный пайплайн с гибридным поиском, реранжированием и сжатием на уровне предложений — точность осталась на уровне 96%, но затраты на токены упали почти в 8 раз. Даже на 16 поисках экономия составила ~$1.50.
Если ваши агенты часто используют веб-поиск через API, вы можете незаметно тратить в разы больше, чем нужно — из-за огромного количества лишних токенов. Эксперимент показывает простой путь сократить расходы почти в 8 раз без потери качества.
Проблема: скрытая статья расходов
OpenAI берёт $10 за 1000 веб-поисков через API. Но есть нюанс: каждый запрос впихивает в контекст ~17 тысяч токенов результатов, за которые ты платишь отдельно при инференсе. Для агентов, активно использующих поиск, инструмент веб-поиска незаметно становится дороже самой модели.
Разработчик столкнулся с этим, создавая агента для поиска характеристик инструментов по модельным номерам. Высокие затраты побудили его собрать собственный локальный и бесплатный пайплайн.
Решение: гибридный поиск + сжатие
Пайплайн включает: - Мультидвижковый поиск с RRF-фьюжном - Локальный фетчинг страниц - Гибридный BM25 + эмбеддинги с cross-encoder реранкером - Сжатие на уровне предложений - Семантическое кэширование (точное совпадение запросов и семантическое)
Тесты на подмножестве бенчмарка SimpleQA от OpenAI показали:
Результаты
- Точность 96% — как у hosted-решения, но на 87% меньше токенов. Большая часть инжектируемого контекста не влияет на ответ.
- Сжатие на уровне предложений само по себе вдвое сократило объём токенов без потери recall.
- Семантическое кэширование — огромный пробел в hosted API. Перефразированные запросы («что добавили в TypeScript 5.9» vs «новые фичи TypeScript 5.9») можно матчить эмбеддингами и проверять NLI-моделью, делая повторы бесплатными.
- Даже на 16 поисковых запросах экономия составила ~$1.50.
Выводы
Код и отчёт опубликованы на GitHub. Вопрос к сообществу: кто-нибудь измерял, сколько из инжектируемого поискового контекста реально используется агентом?
Для тех, кто активно использует агентов с частыми поисками, подобная оптимизация может серьёзно снизить расходы.
Ключевые выводы
- ~87% токенов, которые API веб-поиска OpenAI инжектирует в контекст (~17k на запрос), не используются для формирования ответа
- Сжатие на уровне предложений вдвое сокращает объём результатов без потери качества
- Семантическое кэширование запросов (через эмбеддинги + NLI) отсутствует во всех frontier API, хотя резко снижает расходы
- При активном использовании агентов с частыми поисками инструмент веб-поиска может стоить дороже самой модели
- Локальный пайплайн с гибридным поиском и реранкером достигает паритета точности (96%) с hosted-решением при кратном снижении затрат
Автор: Павел Заславский · Источник: reddit.com
Это один из тех случаев, когда кто-то наконец померил, а не просто поныл про дорогой API. Парень показал цифры: OpenAI при веб-поиске льёт в контекст ~17 тысяч токенов, из которых реально работают процентов 15. Остальное — балласт, за который ты платишь дважды: и за поиск ($10 за тысячу), и за инференс. При активных агентах это разгоняет счёт быстрее, чем сама модель.
Что круто: он не просто пожаловался, а собрал open-source альтернативу с нормальным стеком (гибридный поиск, реранкер, семантическое кэширование) и показал, что точность не падает. Для тех, кто пилит агентов на продакшн, это реальный способ вырезать лишний жир из бюджета. Hosted API удобны, но удобство дорого стоит — особенно когда платишь за чужую неоптимальность.
Комментарии