От рекуррентных сетей к трансформерам: что дальше?
Автор исследует философские и математические основы архитектуры Transformer, описанной в статье «Attention Is All You Need» (2017). Он утверждает, что фундаментальные идеи трансформеров не должны работать с точки зрения классической математики и теории вероятностей, но работают — и объясняет почему, а также что нужно изменить для приближения ИИ к человеческому уровню.
Статья будет интересна исследователям и архитекторам ИИ-систем, которые хотят понять глубинные философские и математические ограничения современных подходов к NLP и задуматься о путях развития архитектур нейросетей за пределами текущих парадигм.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Математика хорошо описывает изменения, но плохо справляется с описанием развития; вероятность как основа ИИ имеет четыре фундаментальных ограничения
- Рекуррентные сети генерируют текст слово за словом, ища количественные соответствия (как подбор множителя), но теряют контекст на длинных последовательностях
- Механизм внимания позволяет учитывать важность всех слов в предложении, а трансформеры идут дальше — генерируют слова на основе смысловых связей, а не последовательности
- Статический и динамический подходы к вычислениям приводят к качественно разным результатам, даже если формально выглядят идентично
Сергей Ефимов
Medium #artificial-intelligence
Читать оригинал
Комментарии