#эмбеддинги

И инструменты ·15 авг 2026

GameCombiner: как находить игры через векторную математику без LLM и почему это круче чатботов

Разработчик Eli создал GameCombiner — инструмент, который превращает 146,288 игр в 1024-мерные векторы на основе жанров, тегов и описаний, позволяя находить новые игры через математическое комбинирование. Без LLM, без генерации — только реальные игры из каталога, детерминированный результат.

0 65
И инструменты ·14 авг 2026

Классификация через галлюцинации: как LLM помогают тегировать контент без строгих словарей

Дуг Тёрнбулл предложил способ тегирования контента через LLM: модель генерирует теги «из головы», затем векторный поиск по эмбеддингам подбирает ближайшие реальные теги из базы. Саймон Уиллисон тестирует подход для своего блога с 1856 тегами.

0 64
И исследования ·10 авг 2026

Synthetic Query Probing: как сравнивать эмбеддинг-модели и ставить пороги схожести

Исследователи предложили метод Synthetic Query Probing для сравнения разных эмбеддинг-моделей (например, OpenAI ADA vs AWS Titan). Вместо сравнения эмбеддингов напрямую (невозможно) они сравнивают пространства схожести — similarity scores для пар контента. Выяснилось: Titan разных размерностей линейно связаны, а Titan vs ADA — нелинейно, с разными диапазонами. Это помогает подбирать пороги для RAG и понимать, как модели ведут себя относительно друг друга.

0 58
И исследования ·27 июл 2026

Почему нельзя найти вектор правды в эмбеддингах LLM: парадокс Тарского в действии

Исследователи пытаются найти направление в эмбеддингах LLM, которое соответствует «правде». Но математическая логика доказывает: такой универсальный детектор истины невозможен — это парадокс самореференции, как у Гёделя и Тарского. Эксперимент на Qwen3.5-4B показал: на обычных фразах проба работает на 94%, на самореферентных («эта фраза ложна») — вываливается в nonsense.

0 87
И инструменты ·27 июл 2026

Azure HorizonDB: Embeddings, гибридный поиск и графы знаний внутри PostgreSQL

Статья описывает подход Microsoft к использованию Azure HorizonDB — облачной версии PostgreSQL, где вся AI-инфраструктура (эмбеддинги, поиск, ранжирование, графовые связи) работает внутри самой базы данных, а не через набор внешних сервисов. Автор пошагово показывает, как построить AI-агента для рекомендаций, используя только возможности базы данных.

0 87
И исследования ·1 авг 2026

Как рассуждает LLM: в чём его мышление отличается от человеческого и почему

Автор разбирает две категории различий между рассуждениями LLM и человека: первые связаны с конкретной архитектурой (отсутствие памяти между сессиями, невозможность пересмотреть уже сказанное) и потенциально устранимы новым дизайном, вторые — это фундаментальные математические ограничения любого алгоритма, доказанные задолго до появления языковых моделей.

0 44
М модели ·24 июл 2026

Словарь, токены и эмбеддинги: фундамент для понимания трансформеров

Статья объясняет три базовых понятия, без которых невозможно разобраться в работе больших языковых моделей: словарь (vocabulary) как полный набор известных модели текстовых единиц, токены как минимальные обрабатываемые фрагменты текста и эмбеддинги как векторные представления, которые несут семантическую информацию.

0 76
М модели ·23 июл 2026

Руководство по LLM для новичков: как ИИ учится предсказывать следующее слово

Статья объясняет базовые принципы работы больших языковых моделей простым языком. Автор разбирает ключевые концепции — токены, эмбеддинги, трансформеры, обучение и предсказание следующего токена — без сложной математики, показывая, что в основе LLM лежит относительно простая идея предсказания следующего элемента в последовательности текста.

0 19