#Qwen3

М модели ·22 июл 2026

Механизм GQA в архитектуре Qwen3

Техническое объяснение механизма группированного внимания (GQA) в модели Qwen3-0.6B. Автор разбирает, почему GQA решает проблему пропускной способности памяти при декодировании, как конкретно настроено соотношение голов внимания (16 query / 8 key-value), и какие операции устраняют несоответствие размерностей между Q и K/V тензорами.

0 125
М модели ·6 сен 2025

Qwen3 под капотом: разбираем архитектуру популярной LLM на чистом PyTorch

Себастьян Рашка опубликовал детальный технический разбор архитектуры Qwen3 — одной из самых популярных открытых языковых моделей. Материал включает реализацию с нуля на PyTorch всех ключевых компонентов: от плотных версий до Mixture-of-Experts архитектур. Qwen3 выделяется коммерческой лицензией Apache 2.0, производительностью на уровне Claude Opus 4 и широкой линейкой моделей от 0.6B до 480B параметров.

0 118