#токенизация

И исследования ·29 июл 2026

Токены, контекст, параметры: как на самом деле работает большая языковая модель

Статья объясняет техническую архитектуру LLM через три ключевых компонента: токенизацию текста, механизм контекстного окна и структуру параметров нейросети. Автор разбирает, как трансформеры обрабатывают последовательности токенов, почему контекст — это временная рабочая память, а параметры — долгосрочные паттерны, и как attention-механизм позволяет модели предсказывать следующий токен.

0 66
М модели ·24 июл 2026

Словарь, токены и эмбеддинги: фундамент для понимания трансформеров

Статья объясняет три базовых понятия, без которых невозможно разобраться в работе больших языковых моделей: словарь (vocabulary) как полный набор известных модели текстовых единиц, токены как минимальные обрабатываемые фрагменты текста и эмбеддинги как векторные представления, которые несут семантическую информацию.

0 76
И инструменты ·26 июл 2026

Оптимизация BPE-токенизатора: Часть 1

Автор показывает, как оптимизировать Byte Pair Encoding токенизатор — критически важный компонент языковых моделей, влияющий на скорость генерации первого токена. Статья начинается с наивной реализации BPE, выявляет её узкие места (квадратичная сложность, сдвиги массива, промахи кэша) и предлагает первые оптимизации через использование связного списка в единой аллокации памяти (арена).

0 45
И инструменты ·23 июл 2026

Gigatoken: токенизатор на Rust обрабатывает текст в 989 раз быстрее HuggingFace

Студент PhD из Стэнфорда выпустил Gigatoken — BPE-токенизатор на Rust, обрабатывающий 24,53 ГБ/с на 144-ядерном сервере (в 681–989 раз быстрее OpenAI tiktoken и HuggingFace tokenizers). Ускорение достигнуто ручной оптимизацией претокенизации с SIMD, кешированием повторяющихся слов и минимизацией взаимодействия с Python. Библиотека под MIT-лицензией, поддерживает 23 семейства токенизаторов (GPT, Llama, Qwen, DeepSeek и др.), доступна через pip install gigatoken.

0 49
И исследования ·27 июл 2026

Как на самом деле работают LLM — руководство для новичков

Автор объясняет устройство языковых моделей через метафору города TokenTown, где каждый район — это этап обработки данных. Статья показывает путь текста от токенизации через механизм внимания (attention) до генерации следующего слова, избегая как упрощённых аналогий, так и сложной математики.

0 19