Основы ИИ: активационные функции и почему сети нужна нелинейность
Автор объясняет, почему нейронные сети без нелинейных активационных функций бесполезны: любое количество линейных слоёв схлопывается в одну матричную операцию и может проводить только прямые линии в пространстве признаков. Нелинейность (даже простая ReLU) ломает это ограничение и позволяет сети строить сложные границы решений.
Полезно тем, кто изучает архитектуры нейросетей или хочет понять, почему современные модели работают: статья доступно объясняет фундаментальную роль активационных функций и связь между глубиной сети и её выразительной силой.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Композиция линейных преобразований (Wx + b) всегда остаётся линейным преобразованием, поэтому глубокая сеть без активаций эквивалентна одному слою
- Активационные функции (sigmoid, tanh, ReLU) вносят нелинейность, позволяя сети разделять данные сложными границами (круги, спирали), а не только прямыми линиями
- Глубина и случайная инициализация слоёв создают разные "изгибы" в представлении данных, что позволяет сети различать омонимы и контексты (пример с "flies" — глагол vs существительное)
- Теорема о универсальной аппроксимации (UAT): сеть с нелинейной активацией и достаточным числом нейронов может приблизить любую непрерывную функцию на ограниченной области
Никита Громов
Medium #artificial-intelligence
Читать оригинал
Комментарии