Ваши инструменты проходят все тесты. Но это не значит, что агент сможет их использовать
Разработчик создал MCP-сервер с 830 зелёными тестами, но когда LLM-агент попытался им воспользоваться, обнаружилось 17 багов. Проблема в том, что стандартные unit-тесты проверяют каждый инструмент изолированно, а агенты используют их в связке — и баги прячутся именно в рассогласованиях между инструментами, которые традиционное тестирование не видит.
Разработчикам AI-агентов и MCP-серверов — показывает критический слепой угол традиционного тестирования и предлагает практический метод выявления багов на стыке инструментов до продакшена.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Инструмент discovery сообщал, что поля опциональны, а инструмент create их требовал — оба работали корректно по отдельности, но противоречили друг другу
- Подсказка в ошибке обещала функцию (поиск по имени), которая существовала только в одном инструменте, но текст скопировали в другой — агент терял попытки на невозможные вызовы
- Метод обнаружения прост: дать LLM доступ к серверу без контекста, попросить решить реальную задачу через несколько инструментов и собрать все моменты путаницы
- Надёжность для агентов — это согласованность между инструментами, а не только корректность внутри каждого из них
Никита Громов
Medium #artificial-intelligence
Читать оригинал
Комментарии