Словарь, токены и эмбеддинги: фундамент для понимания трансформеров
Статья объясняет три базовых понятия, без которых невозможно разобраться в работе больших языковых моделей: словарь (vocabulary) как полный набор известных модели текстовых единиц, токены как минимальные обрабатываемые фрагменты текста и эмбеддинги как векторные представления, которые несут семантическую информацию.
Новичкам в NLP и ML, которые хотят понять архитектуру трансформеров и LLM с нуля — статья раскладывает по полочкам самые базовые концепции, часто принимаемые как данность в более продвинутых материалах.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Токен — не всегда целое слово: это может быть слово, его часть, знак препинания или специальный символ
- Token ID — просто адрес в словаре, сам по себе не несущий смысла
- Эмбеддинг-слой работает как таблица поиска, преобразуя ID токена в плотный вектор признаков
- Трансформер работает именно с векторами эмбеддингов, а не с исходным текстом или ID токенов
Ксения Лаврова
Medium #llm
Читать оригинал
Комментарии