Классификация через галлюцинации: как LLM помогают тегировать контент без строгих словарей
Дуг Тёрнбулл предложил способ тегирования контента через LLM: модель генерирует теги «из головы», затем векторный поиск по эмбеддингам подбирает ближайшие реальные теги из базы. Саймон Уиллисон тестирует подход для своего блога с 1856 тегами.
Показывает, как превратить слабость LLM (склонность выдумывать) в силу, решая реальные задачи автоматизации без дорогого обучения классификаторов.
Саймон Уиллисон столкнулся с проблемой: у него в блоге 1856 тегов, и скормить их все в промпт нереально. Классическая задача — как научить LLM работать с большим словарём?
Дуг Тёрнбулл нашёл элегантное решение: не ограничивай модель существующими тегами. Пусть она галлюцинирует — придумывает теги с нуля, опираясь только на контекст и примеры формата. Затем используешь векторные эмбеддинги: генерированные теги превращаешь в векторы и ищешь ближайшие соседи среди реальных тегов из базы.
В примере промпта для категоризации товаров модель видит структуру вроде Furniture / Living Room Furniture / Coffee Tables и сама генерирует подходящую классификацию для запроса brown coffee table. Дальше эмбеддинги автоматически мапят выдуманные категории на реальные.
Подход работает, потому что современные LLM неплохо понимают семантику и способны генерировать правдоподобные структуры, даже не зная точного словаря. Векторный поиск замыкает цепочку, превращая креативную выдумку в практический результат.
Автор: Павел Заславский · Источник: simonwillison.net
Разработчикам. Можно строить системы классификации и тегирования без жёсткой привязки к словарю: LLM генерирует теги на лету, векторный поиск мапит на реальные. Удобно для CMS, e-commerce, поисковых движков с большими таксономиями.
Бизнесу. Упрощает автоматизацию каталогизации товаров и контента: не нужно обучать классификатор на каждом новом словаре, достаточно примеров формата. Снижает затраты на ручное тегирование и поддержку таксономий.
Инвесторам. Показывает, как комбинация генеративных моделей и векторного поиска решает задачи, где раньше требовались специализированные ML-модели. Потенциал в e-commerce, контент-платформах, enterprise-поиске.
- SaaS для автотегирования блогов, CMS, e-commerce каталогов: API принимает контент, возвращает теги из вашей базы без обучения классификатора
- Плагины для WordPress, Shopify, Notion: автоматическое тегирование статей и товаров через LLM + векторный поиск
- Инструмент для миграции и нормализации таксономий: генерация промежуточных категорий LLM'ом, затем маппинг на целевой словарь
- Улучшение внутреннего поиска в enterprise: пользователь ищет свободным текстом, LLM генерирует теги, векторный поиск находит релевантные документы по тегам
- Консалтинг по автоматизации каталогизации для ритейла и маркетплейсов: внедрение LLM-пайплайнов вместо ручной разметки
- Качество зависит от того, насколько хорошо модель понимает домен: для узкоспециализированных таксономий может галлюцинировать невпопад
- Векторный поиск может подобрать близкие, но неточные теги: нужна валидация или человек в цикле для критичных приложений
- Для очень больших и разнородных словарей (десятки тысяч тегов) может потребоваться дополнительная фильтрация или иерархический поиск
- Промпт-инжиниринг и подбор примеров критичны: плохие примеры формата → плохие галлюцинации → плохой маппинг
Это один из тех моментов, когда понимаешь: мы только начинаем осваивать паттерны работы с LLM. Вместо того чтобы бороться с галлюцинациями, Тёрнбулл использует их как промежуточный слой абстракции — пусть модель фантазирует, а векторный поиск приземлит результат в реальность. Красиво и практично.
В реальности это работает там, где важна скорость и гибкость: e-commerce, контент-платформы, внутренний поиск. Да, точность не стопроцентная, но для большинства задач хватает. И главное — не нужно обучать классификатор на каждом новом словаре. Обновил базу эмбеддингов, и всё. Годный паттерн для автоматизации рутины.
Комментарии