#attention

И исследования ·2 авг 2026

Что на самом деле нужно механизму внимания

Автор разбирает распространённое заблуждение, что attention можно «прикрутить» к любой модели для улучшения. На примере от логистической регрессии до трансформеров показано, что внимание работает только там, где есть части входа, взаимодействующие друг с другом. Отдельно объясняется, почему оригинальное позиционное кодирование в трансформерах было заменено на RoPE.

0 41
И исследования ·27 июл 2026

Как на самом деле работают LLM — руководство для новичков

Автор объясняет устройство языковых моделей через метафору города TokenTown, где каждый район — это этап обработки данных. Статья показывает путь текста от токенизации через механизм внимания (attention) до генерации следующего слова, избегая как упрощённых аналогий, так и сложной математики.

0 19