Что на самом деле нужно механизму внимания
Автор разбирает распространённое заблуждение, что attention можно «прикрутить» к любой модели для улучшения. На примере от логистической регрессии до трансформеров показано, что внимание работает только там, где есть части входа, взаимодействующие друг с другом. Отдельно объясняется, почему оригинальное позиционное кодирование в трансформерах было заменено на RoPE.
Полезно всем, кто изучает трансформеры и хочет понять не «что делает attention», а «когда и почему он вообще нужен». Объясняет ключевое архитектурное решение современных LLM — переход от синусоидального кодирования к RoPE.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Attention — не универсальное улучшение, а инструмент для задач с множественными взаимосвязанными частями входа
- Чистый механизм внимания не различает порядок слов («собака укусила человека» vs «человек укусил собаку»)
- Синусоидальное позиционное кодирование давало абсолютные позиции, а не относительные расстояния между словами
- RoPE (Rotary Position Embeddings) решает проблему, кодируя расстояние между словами через геометрию вращения векторов, что позволяет моделям обобщаться на длинные контексты
Артём Ковалёв
Medium #artificial-intelligence
Читать оригинал
Комментарии