Как я срезал счёт за OpenAI API в 3 раза кэшированием промптов
Долго не мог понять, почему прод жрёт токены как не в себя. Оказалось — гоняю один и тот же системный промпт на 4000 токенов в каждом запросе.
Включил prompt caching: статичную часть (инструкции + примеры) выношу в кэш, платится копейки за повторное чтение. За месяц с $780 упал до $260 при том же трафике.
Главное — держать кэшируемый префикс стабильным, любое изменение сбрасывает кэш. Вынес всё динамическое в самый конец сообщения.
Комментарии