#малые модели

И исследования ·9 авг 2026

SupraElegans-500K: нейросеть без трансформера на 500К параметров вдохновлена червём C. elegans

SupraLabs выпустила экспериментальную языковую модель на 500К параметров без архитектуры трансформера: вместо attention используется разреженный рекуррентный граф нейронов с мембранным потенциалом, идея взята из нервной системы червя C. elegans. Модель токен за токеном обновляет состояние нейронов, не храня KV-кэш, и работает автогрессивно. Это научный эксперимент, не претендующий на качество больших моделей.

0 56
И исследования ·23 июл 2026

Дистилляция 8B-модели в 0.6B на MacBook: точность 100%, но few-shot промптинг всё сломал

Исследователь дистиллировал специализированную 8B-модель в 0.6B для обработки финансовых документов на обычном Mac. Маленькая модель достигла 100% точности классификации против 36% у базовой, но few-shot промптинг парадоксально ухудшил результаты: модель начала путать примеры из промпта с целевым документом. Обучение заняло 12 минут и потребовало всего 4.1 ГБ RAM.

0 94