инструменты 1 мин

Почему AI-агенты проваливают задачи, даже когда всё «выглядит нормально»

Разработчик обнаружил слабое место автономных AI-агентов: проверка только финального результата пропускает критичные ошибки в процессе выполнения. Создан open-source инструмент Watch Skill, который записывает и анализирует весь процесс работы агента покадрово, позволяя находить скрытые сбои — от NaN в чекауте до зависших модалок.

Автономные AI-агенты выходят из лабораторий в реальные продукты. Если они не умеют проверять себя — каждый запуск может быть провалом, который выглядит как успех. Это про надёжность систем, на которые скоро будут полагаться деньги и репутация.

Что произошло

Разработчик из Reddit выявил фундаментальную проблему современных AI-агентов: они проверяют только финальный результат работы, игнорируя процесс. Агент может дойти до нужной страницы, но по пути столкнуться с критичными сбоями — $NaN в корзине, модалка закрыла кнопку, загрузка показала мусор. Финальный скриншот говорит «успех», а реальное выполнение — провал.

В ответ создан open-source проект Watch Skill (MIT-лицензия) — система записи и анализа действий агента в браузере. Вместо проверки последнего кадра инструмент: - Записывает весь процесс работы агента - Разбивает запись на значимые моменты - Делает их доступными для поиска - Позволяет агенту проверять выполнение против исходных критериев

Ключевая фича — память. Записи не загружаются целиком в контекст при каждой проверке. Агент может запросить конкретный момент: «Когда сумма в корзине стала невалидной?», «Закрывала ли модалка кнопку отправки?», «Что изменилось между провальной и успешной попыткой?»

Цикл работы: задача → запись → инспекция → поиск ошибки → фикс → новая запись → верификация.

Автор: Павел Заславский · Источник: reddit.com

Разработчикам. Готовый инструмент для отладки browser automation и desktop agents. Вместо костылей с финальными скриншотами — полноценная трассировка выполнения с поиском по видео. Работает с Playwright, Puppeteer, любыми автоматизациями. MIT-лицензия, можно встроить в CI/CD.

Бизнесу. Автоматизация тестирования и QA выходит на новый уровень. Агенты смогут самостоятельно проверять сложные пользовательские сценарии и находить edge-cases, которые пропускают обычные тесты. Экономия на ручном QA реальна, но требует инвестиций в настройку.

Инвесторам. Рынок AI-агентов растёт, но их надёжность — узкое место. Инструменты верификации и observability для автономных систем — недооценённая ниша. Если агенты начнут работать с реальными транзакциями, спрос на такие решения взлетит.

Хайп25
Реальная польза70
Заработать65
  • QA-as-a-Service на базе AI-агентов с built-in верификацией — продавать часы тестирования, а не headcount
  • Observability-платформа для автономных агентов: Datadog/Sentry для AI-действий, платная модель за хранение и аналитику
  • Консалтинг по внедрению надёжных AI-агентов для e-commerce — интеграция Watch Skill в checkout flows, мониторинг транзакций
  • Developer tool: плагин для Cursor/VSCode, который автоматом записывает и анализирует browser automations при разработке
  • Compliance-решение: аудит действий AI-агентов для финтеха и хелскеа — требование регуляторов скоро появится
  • Хранение и обработка видеозаписей каждого запуска агента — дорого по compute и storage, масштабирование проблематично
  • Проблема курицы и яйца: агент должен сам понимать, что искать в записи. Если критерии проверки плохие — инструмент бесполезен
  • Open-source MIT — monetization не очевидна, проект может остаться экспериментом без коммерческого развития
  • Агенты пока слишком тупые для сложных задач — verification второго порядка, пока не решена надёжность первого

Это одна из тех проблем, которые кажутся очевидными постфактум, но все игнорируют. Агенты правда не умеют нормально проверять себя — мы закрываем глаза, потому что в 80% случаев всё ок. Но когда ставка — реальная транзакция или критичный бизнес-процесс, эти 20% убьют доверие к технологии.

Watch Skill — не продакшн-решение, это proof of concept. Но подход правильный: treat execution as evidence, а не только final state. Если агенты станут массовыми, observability-платформы для них вырастут в отдельную индустрию — как APM для микросервисов. Пока что это niche, но через год-два может взорваться. Следите за тем, кто первым сделает enterprise-версию с нормальной монетизацией.

Ещё по теме

Комментарии