DWARF-55M: новая архитектура с почти полностью разреженным вниманием
Исследователь представил DWARF-55M — экспериментальную архитектуру языковой модели, где 9 из 10 слоёв используют разреженное внимание вместо полного. Это снижает вычислительные затраты на обработку контекста до почти O(1), сохраняя надёжное извлечение информации на длине до 6144 токенов при обучении на 2048. Модель обучена на 10B токенов и доступна на Huggingface для экспериментов.
0
26