исследования 1 мин

Что на самом деле нужно механизму внимания

Автор разбирает распространённое заблуждение, что attention можно «прикрутить» к любой модели для улучшения. На примере от логистической регрессии до трансформеров показано, что внимание работает только там, где есть части входа, взаимодействующие друг с другом. Отдельно объясняется, почему оригинальное позиционное кодирование в трансформерах было заменено на RoPE.

Полезно всем, кто изучает трансформеры и хочет понять не «что делает attention», а «когда и почему он вообще нужен». Объясняет ключевое архитектурное решение современных LLM — переход от синусоидального кодирования к RoPE.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Attention — не универсальное улучшение, а инструмент для задач с множественными взаимосвязанными частями входа
  • Чистый механизм внимания не различает порядок слов («собака укусила человека» vs «человек укусил собаку»)
  • Синусоидальное позиционное кодирование давало абсолютные позиции, а не относительные расстояния между словами
  • RoPE (Rotary Position Embeddings) решает проблему, кодируя расстояние между словами через геометрию вращения векторов, что позволяет моделям обобщаться на длинные контексты
attentionтрансформерыпозиционное кодированиеRoPEархитектура моделей
Артём Ковалёв Medium #artificial-intelligence
Читать оригинал

Ещё по теме

Комментарии