Разработчик собрал AI-агента на базе месопотамских предсказаний — и показал главную проблему автономных систем
Исследователь создал House of IFs — AI-агента, который предсказывает будущее по новостям, используя логику древних месопотамских предзнаменований (ЕСЛИ странный знак → ТО результат). Проект показывает, как AI-агенты выдают убедительные паттерны из случайных данных и постоянно искажают факты, даже имея точные источники.
Агенты уже принимают решения о вашей карьере и кредите. Этот проект показывает, что они делают это с точностью вавилонского оракула — только выглядят убедительнее.
Что произошло
Разработчик, изучающий социальные последствия AI, создал экспериментальный проект House of IFs (ifthen.today). Это полноценный AI-агент с RAG, векторными эмбеддингами, общей памятью и циклами вызова инструментов — но работает он как древний месопотамский оракул.
Каждый день система сканирует новости, находит "странные знаки" и строит предсказания по логике IF-THEN, которую использовали вавилонские жрецы 3000 лет назад. Агент связывает события с похожими паттернами из недавней истории и выдаёт "предзнаменования".
Главный инсайт: даже с доступом к точным источникам чатбот упорно приукрашивает, додумывает и заполняет пробелы. Система превращает случайные совпадения в убедительные паттерны — именно так работают современные агенты в рекрутинге, клиентском сервисе и администрировании.
Проект — одновременно техническая реализация агентной архитектуры и критика того, как AI создаёт иллюзию смысла там, где его нет. Автор специально выбрал самую абсурдную задачу (предсказания), чтобы показать хрупкость систем, которые уже применяют в найме и принятии решений.
Автор: Сергей Ефимов · Источник: reddit.com
Разработчикам. Полный стек агентной архитектуры на живом примере: RAG с эмбеддингами, shared memory, tool loops. Проект показывает реальную проблему: LLM агрессивно галлюцинирует даже при строгом grounding. Если чатбот врёт про новости с точными ссылками — как он поведёт себя в проде с корпоративными данными?
Бизнесу. Агенты в HR и клиентском сервисе уже внедряют — но проект наглядно доказывает, что они создают псевдопаттерны из шума. Если система убеждает в несуществующих закономерностях на исторических данных, она так же убедительно ошибётся при найме или оценке клиента. Риск дискриминации и ложных выводов растёт.
Инвесторам. Рынок агентных систем ($1.5B+ в 2024) строится на хрупких технологиях. Проект показывает: даже с RAG и tool-use агенты генерируют убедительную ерунду. Это не баг — это фундаментальная особенность LLM. Кто решит grounding и hallucination control в продакшене — тот возьмёт долю. Остальные получат скандалы и судебные иски.
- Инструменты для проверки точности агентов: платформа, которая логирует каждый вызов, проверяет grounding и галлюцинации — как Sentry, но для LLM-агентов
- Консалтинг по аудиту AI-агентов: помогать компаниям до внедрения найти слабые места в системах найма/клиентского сервиса, чтобы избежать юридических рисков
- "Hallucination benchmark": датасет и метрики для тестирования агентов на склонность к выдумыванию — продавать B2B как compliance-инструмент
- Образовательная платформа для non-tech менеджеров: показывать на наглядных примерах (как House of IFs), где AI врёт и почему нельзя слепо доверять агентам
- Специализированные агенты с жёстким constraint-режимом: продукт, который работает только с whitelisted источниками и отказывается отвечать при неуверенности — для регулируемых индустрий (медицина, финансы)
- Массовое внедрение агентов в критичные области (HR, кредитование) без понимания hallucination problem — скандалы и судебные иски уже на подходе
- Иллюзия контроля: RAG и tool-use создают ощущение точности, но система всё равно додумывает. Бизнес принимает решения на основе убедительной выдумки
- Регуляторы пока не понимают масштаб проблемы: нет стандартов проверки агентных систем, а они уже в бою
- Дискриминация через псевдопаттерны: агент находит ложные корреляции в исторических данных (например, отклоняет кандидатов по признакам, которые звучат логично, но статистически некорректны)
Это один из самых полезных pet-проектов последнего времени — не потому что технически сложный, а потому что наглядный. Автор взял абсурдную задачу (месопотамские предсказания) и показал: агент с RAG, памятью и tool-use всё равно выдаёт убедительную чушь. Это не баг архитектуры — это фича LLM: заполнять пробелы правдоподобными выдумками.
Реальная проблема: такие же системы уже фильтруют резюме и принимают кредитные решения. Разница лишь в том, что там нет иронии — бизнес верит паттернам, которые агент нашёл в шуме. Если ваш стартап строит агента для критичных задач, добавьте в roadmap не только фичи, но и жёсткий контроль grounding. Иначе первый скандал похоронит продукт быстрее, чем его успеют масштабировать.
Комментарии