исследования 1 мин

Почему нейросети с одинаковой функцией выглядят по-разному: разбор на 1,8 млн обученных моделей

Исследование показало, что 98% деградации точности при чтении весов независимо обученных нейросетей объясняется математическими симметриями параметров (перестановки нейронов, смена знаков, фазовые сдвиги). Но даже при полном устранении симметрий работа с весами уступает прямому вызову функции сети в 1.5 раза по точности и в 3.4 раза по вычислениям.

Это фундаментальный результат для всех, кто работает с meta-learning, neural architecture search или federated learning. Если ваша система читает веса моделей, вы теперь знаете, что 98% проблем от симметрий, но их устранение не гарантирует победу над прямым вызовом функции.

Что произошло

Исследователь разобрал фундаментальную проблему machine learning: почему чтение смысла напрямую из весов нейросети работает хорошо, когда модели обучены с одной стартовой точкой, но ломается, если их обучили независимо.

Объяснение обычно сводят к симметриям параметров — можно переставить нейроны, поменять знаки, и получить те же предсказания при совершенно других весах. Но это не одно утверждение, а три разных: что симметрия есть, что её учёт улучшает предсказания, и что она полностью объясняет проблему.

Автор математически доказал структуру группы симметрий для SIREN-сетей (неявные представления с синусоидальными активациями) и обучил 1,8 млн таких моделей на MNIST, FashionMNIST и CIFAR-10 с контролируемыми протоколами.

Ключевой результат: рандомизация только симметрий (при фиксированной функции сети) убивает 79.1 из 80.4 процентных пунктов точности между моделями с общей и независимой инициализацией на MNIST. Симметрия достаточна, чтобы воспроизвести почти всю деградацию.

Разбивка вклада: смена знаков даёт 63 пункта потери, перестановки нейронов 15, фазовые сдвиги около 1.

Но финальный твист: даже с полным учётом симметрий (точность 91.7%) прямой вызов функции сети бьёт работу с весами — 95.3% точности при 1.6 мегафлопс против 64.4% при 5.5 мегафлопс для лучшего метода на весах.

Вывод автора: если полный инвариант информационно эквивалентен доступу к функции, оправдание работы с весами должно быть вычислительным, а не информационным.

weight-spaceсимметрииSIRENmeta-learningINR

Автор: Никита Громов · Источник: reddit.com

Разработчикам. Появился строгий математический анализ симметрий в SIREN-сетях с открытым кодом, тестами и 1.8 млн обученных моделей. Можно использовать готовые инварианты для weight-space learning или убедиться, что проще вызывать функцию напрямую, чем читать веса. Код, доказательства и воспроизводимые протоколы на GitHub.

Бизнесу. Результат бьёт по идее универсальных метамоделей, читающих веса любых сетей. Даже идеальный учёт симметрий проигрывает прямому вызову функции в разы по скорости и точности. Если продукт строится на weight-space inference, нужны сильные вычислительные преимущества, чистая информация не спасёт.

Инвесторам. Фундаментальное исследование показывает, что подходы к обобщению через веса сетей упираются не в симметрии, а в вычислительную эффективность. Стартапы в meta-learning и neural architecture search должны доказать вычислительное, а не информационное преимущество. Направление ещё живо, но ставка только на invariant encodings рискованна.

Хайп15
Реальная польза78
Заработать62
  • Адаптировать доказанные инварианты для других архитектур с периодическими активациями (Fourier features, coordinate networks) — готовая теоретическая база под руками
  • Разработать специализированные ускорители для функциональных запросов к INR вместо weight-space inference — исследование показало, что это выгоднее
  • Использовать результаты для оптимизации federated learning: если симметрии убивают 98% точности, можно канонизировать веса перед агрегацией
  • Построить бенчмарк для weight-space methods с контролем симметрий — сейчас таких чистых протоколов нет, а спрос в meta-learning растёт
  • Применить группу симметрий для сжатия параметров INR: если фазовые сдвиги почти не влияют, можно их квантовать жёстче
  • Результаты специфичны для SIREN и неявных представлений, перенос на трансформеры или свёрточные сети неочевиден
  • Автор честно разделяет sufficiency и causal mediation — но многие интерпретируют как доказательство причинности, что может привести к ошибкам в применении
  • Вычислительная стоимость работы с полными инвариантами может быть неподъёмной для больших моделей, масштабирование не показано
  • Исследование подрывает целый класс подходов к meta-learning через weight-space, но не предлагает альтернативу — риск застрять без хороших решений

Это исследование — редкий пример научной честности в ML. Автор не просто показал, что симметрии весов объясняют почти всю проблему weight-space learning, но и откровенно сказал: даже если мы их победим, прямой вызов функции всё равно лучше. То есть целое направление получило математический приговор — работа с весами должна быть выгодна вычислительно, а не информационно.

Особенно ценно разделение sufficiency и causal mediation. Автор доказал, что симметрии достаточны, чтобы воспроизвести деградацию, но не утверждает, что они её причина в каждом конкретном случае. Это уровень строгости, которого не хватает большинству ML-бумаг. Плюс полная открытость: код, тесты, 1.8 млн моделей, лабораторный журнал, ledger предсказаний. Если вы в meta-learning или federated learning — это обязательное чтение, даже если результаты неудобные.

Ещё по теме

Комментарии