инструменты 1 мин

Что 68 266 запросов к Claude Code раскрывают о реальных нагрузках агентных систем

Автор разобрал публичный датасет из 393 реальных сессий Claude Code (68 тысяч запросов, 6,89 млрд входных токенов) и обнаружил, что паттерны трафика агентных систем радикально отличаются от типичных бенчмарков для LLM-инференса. Вместо простых пар «вопрос-ответ» здесь длинные сессии с растущим контекстом, периодической компактификацией истории и залпами параллельных субагентов.

Инженерам ML-инфраструктуры и платформ для агентов: если вы планируете кластеры на основе ShareGPT-бенчмарков, вы неверно оцениваете паттерны кэширования KV, всплески конкурентных запросов и жизненный цикл сессий. Автор показывает, как выглядит реальный трафик, и даёт воспроизводимые скрипты анализа.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Контекст растёт монотонно (до ~240k токенов), пока не срабатывает компактификация, сбрасывающая 78% истории и оставляющая системный промпт (~48k токенов) плюс краткий summary
  • 58,3% запросов — это субагенты, работающие параллельно; медианная сессия длится 1,8 часа, но p90 — 28 часов, а самая долгая — 10,5 суток
  • Распределение задержек между запросами бимодально: есть «машинный» режим (мгновенные залпы субагентов) и «человеческий» (пользователь отошёл), что ломает классические нагрузочные модели с одним логнормальным распределением
LLM inferenceагентные системыоптимизация нагрузкикэширование KVтелеметрия
Юлия Тарасова Medium #llm
Читать оригинал

Инструменты из статьи

Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...

Доступ из РФ →

Ещё по теме

Комментарии