инструменты 1 мин

Замена промптов на граф состояний поднимает точность AI-агента с 78% до 95% при меньшем расходе токенов

Разработчик заменил плоский markdown-промпт для AI-агента на граф в стиле POMDP (частично наблюдаемый марковский процесс принятия решений). Состояния агента стали узлами, действия — рёбрами с весами по вероятности успеха, стоимости токенов и исходу. Точность выполнения задач выросла с 78% до 95%, расход токенов снизился. Тестировали на Claude Opus 4.8 и Codex GPT-5.5.

Если вы разрабатываете или используете AI-агентов, этот подход может радикально поднять надёжность и снизить затраты. Показывает, что следующий шаг эволюции агентов — не более сложные промпты, а структурированные графы с обучением.

Что произошло

Разработчик с Reddit (u/Mysterious-Try-1966) столкнулся с проблемой: плоские markdown-промпты (даже с GraphRAG) дают агентам контекст, но не показывают, где именно в цепочке действий сломался процесс. Нет объяснимости, медленная сходимость, нет потолка улучшения.

Решение: смоделировать агента как частично наблюдаемый марковский процесс принятия решений (POMDP). Состояния, которые агент может наблюдать, превратились в узлы графа, действия — в рёбра. Каждое ребро взвешено по трём параметрам: вероятность успеха, стоимость токенов, исход. Агент сначала исследует граф (exploration), затем использует его как стандартное обучение с подкреплением (exploitation).

Тесты на одной батче задач в трёх конфигурациях (плоский файл, GraphRAG-brain, POMDP-граф) для Claude Opus 4.8 и Codex GPT-5.5. Средняя точность выросла с ~0.78 до ~0.95. При этом расход токенов оказался ниже, чем у плоского файла.

Автор опубликовал математику и полное сравнение по ссылке в комментариях (детали не приведены).

Автор: Анна Мельникова · Источник: reddit.com

Разработчикам. Новая архитектура для AI-агентов: вместо flat prompt используй граф состояний и действий с весами (вероятность успеха, стоимость, исход). Дебажишь цепочку действий — видишь, где сломалось. Подходит для задач с последовательными шагами и частичной наблюдаемостью. Уже работает на Claude Opus и Codex GPT.

Бизнесу. Точность автономных агентов растёт на 20% при снижении затрат на токены. Применимо в customer support, автоматизации процессов, где важна надёжность и прозрачность ошибок. Переход от prompt engineering к graph-based RL — новая волна оптимизации агентских систем.

Инвесторам. Фреймворк показывает путь к enterprise-grade агентам: меньше токенов, выше точность, объяснимость действий. Интерес к RL-подходам в LLM-агентах растёт, особенно в B2B-автоматизации. Если паттерн масштабируется, стартапы в этой нише получат конкурентное преимущество перед prompt-based решениями.

Хайп45
Реальная польза70
Заработать65
  • Фреймворк или SDK для быстрого превращения промптов в POMDP-графы — продать как open-source библиотеку или SaaS для разработчиков агентов
  • Консалтинг для B2B: аудит и переделка существующих AI-агентов (customer support, internal tools) под граф-архитектуру с гарантией роста точности
  • Платформа для визуализации и дебага AI-агентов: граф состояний, replay ошибок, A/B тесты стратегий — инструмент для enterprise-команд
  • Инструмент мониторинга агентов: отслеживание успешности действий в реальном времени, автоматическая оптимизация весов графа, предупреждения об ошибках
  • Обучающий курс или бутлег для разработчиков: как переходить от prompt engineering к RL-графам, с примерами на Claude/GPT
  • Единичный Reddit-пост без кода, воспроизводимости и peer review — может быть переоценкой или искажением результатов
  • Claude Opus 4.8 и Codex GPT-5.5 — названия моделей не совпадают с официальными релизами (Opus 3.5, GPT-4), возможна путаница или тестовые сборки
  • Подход требует дополнительной инфраструктуры (хранение графа, RL-логика), что усложняет внедрение по сравнению с простым промптом
  • Масштабируемость под вопросом: на больших пространствах состояний граф может стать огромным, сложность exploration/exploitation растёт

Если цифры правда, это один из тех моментов, когда понимаешь: промпт-инженеры скоро станут граф-архитекторами. Идея простая — превратить агента из текстового автомата в систему с состояниями, где каждое действие взвешено по успеху и цене. Видишь, где сломалось, фиксишь конкретное ребро, а не весь промпт. Это уже не prompt hacking, а почти классическое RL.

Но есть нюансы. Названия моделей странные (Opus 4.8? GPT-5.5?), код не выложен, воспроизвести нельзя. Может, автор работает с internal builds, может, путаница. Без деталей это красивая история на Reddit, а не готовый паттерн. Но направление верное: объяснимость и RL для агентов — это то, куда идёт рынок. Если строишь серьёзных агентов, попробуй подход на своих задачах, только не жди plug-and-play решения.

Ещё по теме

Комментарии