SupraElegans-500K: нейросеть без трансформера на 500К параметров вдохновлена червём C. elegans
SupraLabs выпустила экспериментальную языковую модель на 500К параметров без архитектуры трансформера: вместо attention используется разреженный рекуррентный граф нейронов с мембранным потенциалом, идея взята из нервной системы червя C. elegans. Модель токен за токеном обновляет состояние нейронов, не храня KV-кэш, и работает автогрессивно. Это научный эксперимент, не претендующий на качество больших моделей.
Показывает, что можно строить языковые модели без трансформеров и attention — для исследователей это новая площадка для экспериментов, для индустрии пока не имеет значения.
Что произошло
SupraLabs выложила в открытый доступ SupraElegans-500K — крошечную языковую модель на ~500 тысяч параметров, построенную на рекуррентном разреженном графе нейронов без трансформера, attention, позиционного кодирования и KV-кэша. Архитектура вдохновлена нервной системой червя C. elegans: в модели три популяции нейронов (сенсорные, ассоциативные, выходные), разреженная направленная связность (фан-ин/фан-аут 10-20 на нейрон), знаковая сигнализация (возбуждающая/тормозящая) и постоянное рекуррентное состояние.
Контекст хранится не в кэше, а в мембранном потенциале нейронов, который обновляется токен за токеном. Каждый токен прогоняется через 3 микрошага распространения сигнала по графу, затем выходная популяция преобразуется в логиты словаря. Топология графа — фиксированная случайная, генерируется один раз при инициализации, не обучается.
Модель обучена на малом бюджете токенов с усечённым BPTT, состояние между чанками отсоединяется, но не сбрасывается. Токенизатор BPE на уровне байтов, обучен с нуля. Бенчмарки слабые: HellaSwag 26.5%, ARC-Easy 21%, WinoGrande 52% — модель не предназначена для конкуренции с трансформерами по качеству, это демонстрация принципа работы альтернативной архитектуры.
Код и веса опубликованы на HuggingFace под Apache 2.0, есть интеграция с Transformers и CLI для инференса.
Автор: Сергей Ефимов · Источник: reddit.com
Разработчикам. Можно поковыряться в архитектуре без attention: разреженный граф на scatter-add вместо матриц, рекуррентное состояние вместо KV-кэша, полный контроль над внутренним состоянием модели токен за токеном. Хороший playground для экспериментов с нестандартными архитектурами и исследования limits малых моделей.
Бизнесу. Пока нулевая практическая ценность для продакшна: качество текста хуже любого современного трансформера, нет инструкшн-тюнинга, нет безопасности. Интересно как пруф концепта для edge-устройств или ниш, где важен малый размер и отсутствие кэша, но реальных кейсов пока нет.
Инвесторам. Чистая научная работа без коммерческих амбиций на данном этапе. Потенциально интересно, если архитектура масштабируется и обгонит трансформеры по эффективности на малых параметрах — но сейчас это далёкая ставка. Рынок ultra-low-parameter моделей для IoT и edge пока не сформирован.
- Форкнуть и попробовать обучить на специализированном домене (код, медицина, узкая нишевая генерация) — может, при малом размере модель покажет приемлемое качество в узкой задаче.
- Исследовать применение на устройствах с жёсткими ограничениями по памяти: IoT, микроконтроллеры, старые смартфоны — отсутствие KV-кэша даёт преимущество.
- Добавить обучение топологии графа (вместо фиксированной случайной) и сравнить с NAS-подходами для малых моделей — может получиться публикация или стартап-pivot.
- Использовать как baseline для исследований альтернативных архитектур: сравнивать новые идеи с этой моделью, а не с GPT, чтобы показать прогресс на малых масштабах.
- Попробовать применить к задачам, где нужна онлайн-адаптация состояния: чат-боты с памятью, агенты, reinforcement learning — рекуррентное состояние можно манипулировать вручную.
- Качество катастрофически плохое по сравнению даже с маленькими трансформерами — практически бесполезно для реальных задач.
- Топология графа фиксирована и случайна — огромное ограничение, нет доказательств, что архитектура масштабируется или обучаема.
- Отсутствуют сравнения с трансформером того же размера — невозможно оценить честный апсайд или даунсайд подхода.
- Хайп вокруг биоинспирированных архитектур часто заканчивается ничем, когда оказывается, что обычные сверточки или attention всё равно лучше.
- Проект может остаться one-off экспериментом без продолжения и комьюнити поддержки.
SupraElegans — это как собрать велосипед из палок и верёвок, чтобы доказать, что можно ездить не на алюминиевой раме. Да, едет. Нет, на работу не поедешь. Но если ты исследователь или просто любопытный разработчик — залезть под капот и поиграться с рекуррентным графом вместо attention очень поучительно. Основная ценность тут не в качестве текста (оно плохое), а в демонстрации альтернативного подхода к хранению контекста: вместо KV-кэша — мембранный потенциал нейронов, вместо матриц — разреженный граф.
Верить ли, что это будущее? Пока нет. Топология графа случайна и фиксирована, бенчмарки провальные, сравнений с нормальным трансформером того же размера нет. Но если авторы сделают граф обучаемым и покажут масштабирование — может стать интересным направлением для edge AI и ultra-low-power устройств. А пока — это научный эксперiment и open-source площадка для ковыряния. Уважаю за открытость и смелость опубликовать то, что заведомо проигрывает трансформерам.
Комментарии