Как спекулировать на бенчмарках: разбор манипуляций с KV-кэшем и Sparse Attention
Практик с многолетним опытом работы над эффективным attention и KV Cache Compression раскрыл распространённые манипуляции в исследованиях: использование «удобных» бенчмарков, отказ от честного сравнения с базовыми методами, скрытие слабых мест через агрегированные метрики и выбор насыщенных задач. Материал показывает, как выглядят «впечатляющие» результаты, которые на деле не работают в реальных сценариях.
0
33