исследования 1 мин

SupraElegans-500K: нейросеть без трансформера на 500К параметров вдохновлена червём C. elegans

SupraLabs выпустила экспериментальную языковую модель на 500К параметров без архитектуры трансформера: вместо attention используется разреженный рекуррентный граф нейронов с мембранным потенциалом, идея взята из нервной системы червя C. elegans. Модель токен за токеном обновляет состояние нейронов, не храня KV-кэш, и работает автогрессивно. Это научный эксперимент, не претендующий на качество больших моделей.

Показывает, что можно строить языковые модели без трансформеров и attention — для исследователей это новая площадка для экспериментов, для индустрии пока не имеет значения.

Что произошло

SupraLabs выложила в открытый доступ SupraElegans-500K — крошечную языковую модель на ~500 тысяч параметров, построенную на рекуррентном разреженном графе нейронов без трансформера, attention, позиционного кодирования и KV-кэша. Архитектура вдохновлена нервной системой червя C. elegans: в модели три популяции нейронов (сенсорные, ассоциативные, выходные), разреженная направленная связность (фан-ин/фан-аут 10-20 на нейрон), знаковая сигнализация (возбуждающая/тормозящая) и постоянное рекуррентное состояние.

Контекст хранится не в кэше, а в мембранном потенциале нейронов, который обновляется токен за токеном. Каждый токен прогоняется через 3 микрошага распространения сигнала по графу, затем выходная популяция преобразуется в логиты словаря. Топология графа — фиксированная случайная, генерируется один раз при инициализации, не обучается.

Модель обучена на малом бюджете токенов с усечённым BPTT, состояние между чанками отсоединяется, но не сбрасывается. Токенизатор BPE на уровне байтов, обучен с нуля. Бенчмарки слабые: HellaSwag 26.5%, ARC-Easy 21%, WinoGrande 52% — модель не предназначена для конкуренции с трансформерами по качеству, это демонстрация принципа работы альтернативной архитектуры.

Код и веса опубликованы на HuggingFace под Apache 2.0, есть интеграция с Transformers и CLI для инференса.

альтернативные архитектурыбиоинспирированные моделималые моделирекуррентные сетиоткрытый код

Автор: Сергей Ефимов · Источник: reddit.com

Разработчикам. Можно поковыряться в архитектуре без attention: разреженный граф на scatter-add вместо матриц, рекуррентное состояние вместо KV-кэша, полный контроль над внутренним состоянием модели токен за токеном. Хороший playground для экспериментов с нестандартными архитектурами и исследования limits малых моделей.

Бизнесу. Пока нулевая практическая ценность для продакшна: качество текста хуже любого современного трансформера, нет инструкшн-тюнинга, нет безопасности. Интересно как пруф концепта для edge-устройств или ниш, где важен малый размер и отсутствие кэша, но реальных кейсов пока нет.

Инвесторам. Чистая научная работа без коммерческих амбиций на данном этапе. Потенциально интересно, если архитектура масштабируется и обгонит трансформеры по эффективности на малых параметрах — но сейчас это далёкая ставка. Рынок ultra-low-parameter моделей для IoT и edge пока не сформирован.

Хайп35
Реальная польза15
Заработать10
  • Форкнуть и попробовать обучить на специализированном домене (код, медицина, узкая нишевая генерация) — может, при малом размере модель покажет приемлемое качество в узкой задаче.
  • Исследовать применение на устройствах с жёсткими ограничениями по памяти: IoT, микроконтроллеры, старые смартфоны — отсутствие KV-кэша даёт преимущество.
  • Добавить обучение топологии графа (вместо фиксированной случайной) и сравнить с NAS-подходами для малых моделей — может получиться публикация или стартап-pivot.
  • Использовать как baseline для исследований альтернативных архитектур: сравнивать новые идеи с этой моделью, а не с GPT, чтобы показать прогресс на малых масштабах.
  • Попробовать применить к задачам, где нужна онлайн-адаптация состояния: чат-боты с памятью, агенты, reinforcement learning — рекуррентное состояние можно манипулировать вручную.
  • Качество катастрофически плохое по сравнению даже с маленькими трансформерами — практически бесполезно для реальных задач.
  • Топология графа фиксирована и случайна — огромное ограничение, нет доказательств, что архитектура масштабируется или обучаема.
  • Отсутствуют сравнения с трансформером того же размера — невозможно оценить честный апсайд или даунсайд подхода.
  • Хайп вокруг биоинспирированных архитектур часто заканчивается ничем, когда оказывается, что обычные сверточки или attention всё равно лучше.
  • Проект может остаться one-off экспериментом без продолжения и комьюнити поддержки.

SupraElegans — это как собрать велосипед из палок и верёвок, чтобы доказать, что можно ездить не на алюминиевой раме. Да, едет. Нет, на работу не поедешь. Но если ты исследователь или просто любопытный разработчик — залезть под капот и поиграться с рекуррентным графом вместо attention очень поучительно. Основная ценность тут не в качестве текста (оно плохое), а в демонстрации альтернативного подхода к хранению контекста: вместо KV-кэша — мембранный потенциал нейронов, вместо матриц — разреженный граф.

Верить ли, что это будущее? Пока нет. Топология графа случайна и фиксирована, бенчмарки провальные, сравнений с нормальным трансформером того же размера нет. Но если авторы сделают граф обучаемым и покажут масштабирование — может стать интересным направлением для edge AI и ultra-low-power устройств. А пока — это научный эксперiment и open-source площадка для ковыряния. Уважаю за открытость и смелость опубликовать то, что заведомо проигрывает трансформерам.

Ещё по теме

Комментарии