Почему AI-агенты проваливают задачи, даже когда всё «выглядит нормально»
Разработчик обнаружил слабое место автономных AI-агентов: проверка только финального результата пропускает критичные ошибки в процессе выполнения. Создан open-source инструмент Watch Skill, который записывает и анализирует весь процесс работы агента покадрово, позволяя находить скрытые сбои — от NaN в чекауте до зависших модалок.
Автономные AI-агенты выходят из лабораторий в реальные продукты. Если они не умеют проверять себя — каждый запуск может быть провалом, который выглядит как успех. Это про надёжность систем, на которые скоро будут полагаться деньги и репутация.
Что произошло
Разработчик из Reddit выявил фундаментальную проблему современных AI-агентов: они проверяют только финальный результат работы, игнорируя процесс. Агент может дойти до нужной страницы, но по пути столкнуться с критичными сбоями — $NaN в корзине, модалка закрыла кнопку, загрузка показала мусор. Финальный скриншот говорит «успех», а реальное выполнение — провал.
В ответ создан open-source проект Watch Skill (MIT-лицензия) — система записи и анализа действий агента в браузере. Вместо проверки последнего кадра инструмент: - Записывает весь процесс работы агента - Разбивает запись на значимые моменты - Делает их доступными для поиска - Позволяет агенту проверять выполнение против исходных критериев
Ключевая фича — память. Записи не загружаются целиком в контекст при каждой проверке. Агент может запросить конкретный момент: «Когда сумма в корзине стала невалидной?», «Закрывала ли модалка кнопку отправки?», «Что изменилось между провальной и успешной попыткой?»
Цикл работы: задача → запись → инспекция → поиск ошибки → фикс → новая запись → верификация.
Автор: Павел Заславский · Источник: reddit.com
Разработчикам. Готовый инструмент для отладки browser automation и desktop agents. Вместо костылей с финальными скриншотами — полноценная трассировка выполнения с поиском по видео. Работает с Playwright, Puppeteer, любыми автоматизациями. MIT-лицензия, можно встроить в CI/CD.
Бизнесу. Автоматизация тестирования и QA выходит на новый уровень. Агенты смогут самостоятельно проверять сложные пользовательские сценарии и находить edge-cases, которые пропускают обычные тесты. Экономия на ручном QA реальна, но требует инвестиций в настройку.
Инвесторам. Рынок AI-агентов растёт, но их надёжность — узкое место. Инструменты верификации и observability для автономных систем — недооценённая ниша. Если агенты начнут работать с реальными транзакциями, спрос на такие решения взлетит.
- QA-as-a-Service на базе AI-агентов с built-in верификацией — продавать часы тестирования, а не headcount
- Observability-платформа для автономных агентов: Datadog/Sentry для AI-действий, платная модель за хранение и аналитику
- Консалтинг по внедрению надёжных AI-агентов для e-commerce — интеграция Watch Skill в checkout flows, мониторинг транзакций
- Developer tool: плагин для Cursor/VSCode, который автоматом записывает и анализирует browser automations при разработке
- Compliance-решение: аудит действий AI-агентов для финтеха и хелскеа — требование регуляторов скоро появится
- Хранение и обработка видеозаписей каждого запуска агента — дорого по compute и storage, масштабирование проблематично
- Проблема курицы и яйца: агент должен сам понимать, что искать в записи. Если критерии проверки плохие — инструмент бесполезен
- Open-source MIT — monetization не очевидна, проект может остаться экспериментом без коммерческого развития
- Агенты пока слишком тупые для сложных задач — verification второго порядка, пока не решена надёжность первого
Это одна из тех проблем, которые кажутся очевидными постфактум, но все игнорируют. Агенты правда не умеют нормально проверять себя — мы закрываем глаза, потому что в 80% случаев всё ок. Но когда ставка — реальная транзакция или критичный бизнес-процесс, эти 20% убьют доверие к технологии.
Watch Skill — не продакшн-решение, это proof of concept. Но подход правильный: treat execution as evidence, а не только final state. Если агенты станут массовыми, observability-платформы для них вырастут в отдельную индустрию — как APM для микросервисов. Пока что это niche, но через год-два может взорваться. Следите за тем, кто первым сделает enterprise-версию с нормальной монетизацией.
Комментарии