#оптимизация памяти

М модели ·22 июл 2026

Механизм GQA в архитектуре Qwen3

Техническое объяснение механизма группированного внимания (GQA) в модели Qwen3-0.6B. Автор разбирает, почему GQA решает проблему пропускной способности памяти при декодировании, как конкретно настроено соотношение голов внимания (16 query / 8 key-value), и какие операции устраняют несоответствие размерностей между Q и K/V тензорами.

0 125
М модели ·16 мая 2026

Новые архитектуры LLM: как модели научились экономить память при длинных контекстах

Свежие open-source языковые модели (Gemma 4, DeepSeek V4, ZAYA1, Laguna XS.2) используют архитектурные трюки для сжатия KV-кэша и снижения затрат на внимание. Главные приёмы: переиспользование ключей-значений между слоями (cross-layer attention), сжатая конволюционная аттеншн и бюджетирование внимания по слоям — всё ради работы с длинными контекстами при меньших требованиях к памяти.

0 61