#benchmarks

И исследования ·17 авг 2026

Как спекулировать на бенчмарках: разбор манипуляций с KV-кэшем и Sparse Attention

Практик с многолетним опытом работы над эффективным attention и KV Cache Compression раскрыл распространённые манипуляции в исследованиях: использование «удобных» бенчмарков, отказ от честного сравнения с базовыми методами, скрытие слабых мест через агрегированные метрики и выбор насыщенных задач. Материал показывает, как выглядят «впечатляющие» результаты, которые на деле не работают в реальных сценариях.

0 33
И исследования ·12 авг 2026

Google Research: передовые LLM знают 95% фактов, но не могут вспомнить треть из них

Исследователи Google разработали фреймворк для профилирования знаний LLM и обнаружили: модели вроде Gemini 3 и GPT-5 хранят 95-98% фактов в параметрах, но не могут вспомнить 26-34% из них без подсказок. Проблема не в отсутствии знаний, а в неспособности их извлечь — это меняет подход к улучшению точности моделей.

0 93