исследования 1 мин

Почему нельзя найти вектор правды в эмбеддингах LLM: парадокс Тарского в действии

Исследователи пытаются найти направление в эмбеддингах LLM, которое соответствует «правде». Но математическая логика доказывает: такой универсальный детектор истины невозможен — это парадокс самореференции, как у Гёделя и Тарского. Эксперимент на Qwen3.5-4B показал: на обычных фразах проба работает на 94%, на самореферентных («эта фраза ложна») — вываливается в nonsense.

Если вы строите AI safety, фактчекинг или trustworthy AI — знание этих пределов спасёт от переобещаний и провалов. Математика не договаривается, но понимание границ позволяет делать честные продукты.

Что произошло

Исследователи AI safety пытаются найти направление правды в эмбеддингах LLM — вектор, который показывает, истинно ли утверждение. Идея: если модель кодирует понятия (пол, эмоции) как направления в пространстве, может быть, и правду можно так же поймать?

Маркс, Тегмарк и другие натренировали классификаторы на правдивых и ложных фразах — работает удивительно хорошо. Но есть фундаментальная проблема.

Автор применил атаку Тарского: подал модели фразу вроде «Проба истины скажет, что это предложение ЛОЖНО». Парадокс самореференции: если правда — то ложь, если ложь — то правда. Эксперимент на Qwen3.5-4B показал: на обычных фразах точность 94%, на парадоксальных — полный разброс, система теряет ориентиры.

Математика (Гёдель, Тарский, Тьюринг) давно доказала: система не может содержать полный предикат истины для языка, достаточно выразительного, чтобы описать саму себя. LLM работают с языком, который описывает их самих — значит, универсальная проба правды невозможна по определению.

Но на практике пробы работают неплохо на обычных данных. Почему? Потому что реальные тексты редко содержат самореферентные парадоксы.

Автор: Артём Ковалёв · Источник: hnrss.org

Разработчикам. Пробы истины в эмбеддингах можно использовать для фильтрации фактчекинга и детекции галлюцинаций — но помните про границы: парадоксы самореференции ломают любой детектор. Difference-in-means подход даёт 94% точности на чистых данных, но не ждите универсальности.

Бизнесу. Детекторы правды для LLM нужны в модерации контента, фактчекинге, AI safety — и рынок растёт. Но продавать как абсолютное решение нельзя: фундаментальные ограничения математики никуда не денутся. Применимо как heuristic, не как истина в последней инстанции.

Инвесторам. AI safety, fact-checking, trustworthy AI — горячие темы с деньгами. Но технологии детекции правды упираются в математические пределы. Инвестировать в стартапы, обещающие 100% truth detection — риск переоценки. Разумные продукты — partial решения для конкретных доменов.

Хайп35
Реальная польза75
Заработать60
  • Строить domain-specific детекторы правды для медицины, финансов, науки — где самореференция редка, а точность высока
  • Продавать AI fact-checking as-a-service для медиа и платформ, позиционируя как heuristic, а не абсолют
  • Разрабатывать инструменты AI safety с честными ограничениями — прозрачность как конкурентное преимущество
  • Создавать образовательные продукты про пределы AI: курсы, консалтинг для компаний, внедряющих LLM
  • Исследовать альтернативные подходы: не binary TRUE/FALSE, а вероятностные или fuzzy truth values, как предлагает автор
  • Продавать детекторы правды как универсальное решение — игнорируя математические пределы — подорвёт доверие к индустрии
  • Переоценка AI safety стартапов, обещающих решить проблему hallucinations через truth probes — фундаментальные ограничения не позволят
  • Регуляторы могут потребовать невозможного — 100% accuracy на детекции лжи в AI, что технически недостижимо
  • Академический хайп вокруг Linear Representation Hypothesis может привести к разочарованию при столкновении с практикой

Это одна из тех статей, где академическая красота встречается с суровой реальностью. Да, пробы истины работают — Маркс и Тегмарк не врали. Но автор напоминает про Гёделя и Тарского: система не может содержать полный предикат истины для языка, который описывает её саму. LLM обучены на естественном языке, который описывает всё, включая сами LLM — значит, универсальный детектор правды невозможен. Парадокс самореференции убивает любую попытку.

Но вот что круто: на практике это не так критично. Реальные тексты редко содержат фразы типа «эта фраза ложна». В медицине, финансах, науке детекторы правды могут работать на 90%+. Вопрос не в том, возможно ли идеальное решение (нет), а в том, достаточно ли хорошее для конкретной задачи. AI safety должна строиться на честности: partial solutions, а не обещания всемогущества. Инвесторам — не покупаться на стартапы, обещающие 100% truth detection. Разработчикам — использовать как heuristic, а не истину в последней инстанции.

Ещё по теме

Комментарии