Что на самом деле нужно механизму внимания
Автор разбирает распространённое заблуждение, что attention можно «прикрутить» к любой модели для улучшения. На примере от логистической регрессии до трансформеров показано, что внимание работает только там, где есть части входа, взаимодействующие друг с другом. Отдельно объясняется, почему оригинальное позиционное кодирование в трансформерах было заменено на RoPE.
0
41