Как рассуждает LLM: в чём его мышление отличается от человеческого и почему
Автор разбирает две категории различий между рассуждениями LLM и человека: первые связаны с конкретной архитектурой (отсутствие памяти между сессиями, невозможность пересмотреть уже сказанное) и потенциально устранимы новым дизайном, вторые — это фундаментальные математические ограничения любого алгоритма, доказанные задолго до появления языковых моделей.
Тем, кто работает с LLM или оценивает их возможности, важно различать устранимые архитектурные недостатки и фундаментальные ограничения — это помогает строить реалистичные ожидания и правильно применять технологию.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Текст превращается в числа (эмбеддинги), затем механизм внимания добавляет контекст, а основные знания хранятся в сжатом виде как перекрывающиеся векторные направления
- Обучение идёт в два этапа: предобучение на предсказании следующего токена и дообучение на человеческой обратной связи
- Неправильные ответы генерируются с той же уверенностью, что и правильные — это следствие архитектуры, где модель никогда не обучалась говорить «не знаю»
- Некоторые ограничения — результат инженерных решений и могут быть устранены, другие — математически неизбежны для любого алгоритма
Ксения Лаврова
Medium #artificial-intelligence
Читать оригинал
Комментарии