исследования 1 мин

Словарь GPT-2 как гиперболическое дерево: 32 тысячи токенов в интерактивном шаре Пуанкаре

Разработчик визуализировал все 32 070 токенов GPT-2 в виде интерактивного гиперболического дерева внутри шара Пуанкаре. Использованы только сырые эмбеддинги без дополнительного обучения — структура возникает естественным образом, потому что словарь модели имеет древовидную форму, которая лучше помещается в гиперболическое пространство, чем в плоское.

Это редкий пример того, как можно увидеть внутреннее устройство языковой модели без упрощений — не статичная картинка, а живая интерактивная карта, показывающая реальную геометрию токенов. Полезно для понимания, как модели организуют знания о языке.

Словарь GPT-2 в гиперболическом пространстве

Разработчик под ником Limp-Contest-7309 опубликовал интерактивную визуализацию всего словаря GPT-2 — 32 070 токенов, размещённых внутри шара Пуанкаре в гиперболическом пространстве. Это продолжение предыдущего проекта с 2D-проекцией, но теперь в полноценной трёхмерной навигации.

Как это работает

Использованы только сырые эмбеддинги токенов GPT-2-small, без какой-либо дополнительной оптимизации или обучения. Раскладка построена точно, потому что структура сходства токенов естественным образом формирует лес: одно гигантское дерево (~2300 токенов), несколько сотен мелких семейных деревьев и около 6700 изолированных токенов без близких соседей.

Деревья плохо помещаются в плоское пространство, но идеально вписываются в гиперболическое, где доступное место растёт экспоненциально с расстоянием от центра. Визуализация работает в браузере — можно вращать, зумить и тапать по токенам. При касании токена всё пространство сдвигается вокруг него (преобразование Мёбиуса) — естественный способ перемещения в гиперболической геометрии.

Что можно найти

  • Плотная внутренняя оболочка содержит изолированные токены — слишком общие, чтобы иметь взаимных ближайших соседей
  • Можно найти «dog», пройти по связям к «cats», или начать с «Monday» и прогуляться по дням недели
  • Единственная связь «Trump» внутри дерева — «Ivanka»

Всё упаковано в один HTML-файл, работает полностью на клиенте, включая мобильные браузеры. Проект демонстрирует внутреннюю структуру токенов языковой модели без искусственных преобразований — чистая геометрия обученных представлений.

Ключевые выводы

  • Словарь GPT-2 имеет естественную древовидную структуру: одно большое дерево, несколько сотен малых и тысячи изолированных токенов
  • Гиперболическое пространство позволяет точно разместить иерархические структуры без искажений, в отличие от плоских проекций
  • Семантические связи токенов видны буквально — дни недели образуют цепочку, животные кластеризуются, а политики связаны персональными именами
  • Визуализация работает без серверов и тяжёлых вычислений — всё в одном HTML-файле на клиенте
  • Около 20% токенов словаря (6700 из 32000) не имеют близких соседей — слишком общие или редкие

Автор: Сергей Ефимов · Источник: reddit.com

Мнение редакции

Это один из тех проектов, где математическая красота и практическая польза встречаются. Обычно внутренности моделей показывают через скучные графики или упрощённые 2D-проекции. Здесь же можно буквально полетать внутри словаря GPT-2 и увидеть, как токены группируются в семантические кластеры — дни недели, животные, имена.

Особенно интересно, что автор ничего не подгонял: использованы сырые эмбеддинги из модели, а древовидная структура возникла сама. Это говорит о том, что GPT-2 действительно выучила что-то осмысленное о структуре языка, а не просто запомнила паттерны. Факт, что 20% токенов изолированы, тоже любопытен — модель считает их слишком общими или специфичными для кластеризации. И да, связь Trump–Ivanka как единственная в дереве — это мем, но и показатель того, какие ассоциации модель вытащила из обучающих данных 2019 года.

Ещё по теме

Комментарии