Экономия на LLM: как сокращение ответа снижает счета в 3 раза, а сокращение промпта делает только хуже
Исследователи протестировали 9 моделей (GPT-4o, Claude, DeepSeek-R1, Qwen и др.) и выяснили: просьба к модели отвечать короче экономит до 3× на API-вызовах без потери точности, а сокращение входного промпта увеличивает расходы на 96% — модель компенсирует длинными ответами. Claude Code уже добавила режим concise output.