модели 1 мин

Словарь, токены и эмбеддинги: фундамент для понимания трансформеров

Статья объясняет три базовых понятия, без которых невозможно разобраться в работе больших языковых моделей: словарь (vocabulary) как полный набор известных модели текстовых единиц, токены как минимальные обрабатываемые фрагменты текста и эмбеддинги как векторные представления, которые несут семантическую информацию.

Новичкам в NLP и ML, которые хотят понять архитектуру трансформеров и LLM с нуля — статья раскладывает по полочкам самые базовые концепции, часто принимаемые как данность в более продвинутых материалах.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Токен — не всегда целое слово: это может быть слово, его часть, знак препинания или специальный символ
  • Token ID — просто адрес в словаре, сам по себе не несущий смысла
  • Эмбеддинг-слой работает как таблица поиска, преобразуя ID токена в плотный вектор признаков
  • Трансформер работает именно с векторами эмбеддингов, а не с исходным текстом или ID токенов
Ксения Лаврова Medium #llm
Читать оригинал

Ещё по теме

Комментарии