исследования 1 мин

DWARF-55M: новая архитектура с почти полностью разреженным вниманием

Исследователь представил DWARF-55M — экспериментальную архитектуру языковой модели, где 9 из 10 слоёв используют разреженное внимание вместо полного. Это снижает вычислительные затраты на обработку контекста до почти O(1), сохраняя надёжное извлечение информации на длине до 6144 токенов при обучении на 2048. Модель обучена на 10B токенов и доступна на Huggingface для экспериментов.

Если подход докажет масштабируемость, разреженное внимание может стать реальной альтернативой для обработки длинных контекстов — быстрее и дешевле полного внимания, без потери качества извлечения информации.

DWARF-55M: эксперимент с разреженным вниманием

Пользователь Reddit под ником MariusNocturnum опубликовал результаты многомесячных исследований: базовую модель DWARF-55M-Base, построенную на новой архитектуре DWARF (Dynamic Sparse Query-Gather).

Как это работает

Классические трансформеры используют полное внимание (full causal attention) — каждый токен смотрит на все предыдущие. Это дорого: вычисления растут квадратично с длиной контекста.

DWARF идёт другим путём: - 9 из 10 слоёв используют DSQG — разреженное внимание с фиксированным набором смещений (ближние + дальние токены). - Один слой полного внимания на 25% глубины (слой L7 из 32) служит «глобальным микшером». - Вместо сканирования всей истории модель обращается только к заранее выбранным позициям, затем динамически взвешивает их через query/key-сигналы.

Результат: почти O(1) по длине контекста — пропускная способность KV-cache и затраты на внимание остаются постоянными при росте контекста.

Что показали тесты

  • Модель обучена на 2048 токенах контекста, но демонстрирует надёжное извлечение информации до 6144 токенов (3× от обучающей длины).
  • Обучение на 10B токенов датасета Dolma3 Mix 150B.
  • Используется модифицированный токенизатор OLMo1 Base (ChatML-формат, 50282 токена).

Экспериментальная HISA-ветка

На GitHub доступен альтернативный путь — HISA (полностью разреженная архитектура), где полное внимание заменено разреженным уже на слое L3. По словам автора, производительность сравнима с гибридной версией, но подход пока не отшлифован до конца.

Доступность

Модель и код открыты: - Huggingface: веса для экспериментов. - GitHub: полный код с поддержкой обеих архитектур.

Это исследовательский прототип, но он показывает: разреженное внимание может быть не просто компромиссом, а рабочей альтернативой для длинных контекстов.

Ключевые выводы

  • DWARF использует 9 слоёв разреженного внимания и 1 слой полного — вычисления почти O(1) по контексту
  • Модель, обученная на 2048 токенах, надёжно работает до 6144 (3× экстраполяция)
  • DSQG заменяет полное сканирование фиксированным набором смещений + динамическим взвешиванием
  • Экспериментальная HISA-ветка полностью разреженная, показывает сопоставимые результаты
  • Открытый код и веса на Huggingface/GitHub для экспериментов

Автор: Сергей Ефимов · Источник: reddit.com

Мнение редакции

**Честно говоря, это один из тех моментов, когда хочется сказать «наконец-то».** Полное внимание в трансформерах — это как искать ключи, проверяя каждый сантиметр квартиры. DWARF предлагает: давайте смотреть только в карманы и на полки — остальное статистически не нужно. И судя по результатам, подход рабочий: модель на 2048 токенах тянет 6144 без провалов.

Да, это прототип на 55M параметров и 10B токенов обучения — не промышленный масштаб. Но сама идея **почти-O(1) по контексту** — это ключ к дешёвым длинным контекстам, если масштабируется. Пока неясно, как поведёт себя DWARF на 7B+ и 100B+ токенах обучения, но код открыт, веса доступны — кто-то точно попробует. Если сработает, индустрия получит альтернативу MoA и кольцевому вниманию. Следим.

Ещё по теме

Комментарии