инструменты 1 мин

Supabase выпустил Evals — открытый бенчмарк для проверки AI-агентов на реальных задачах разработки

Supabase открыл исходники Evals — фреймворк для тестирования AI-агентов (Claude Code, Codex, OpenCode) на реальных задачах: создание схем БД, отладка Edge-функций, исправление RLS-политик. Запускается локально, результаты на публичном лидерборде. Основа — реальные тикеты поддержки и баги, проверка через детерминированные тесты + LLM-as-a-judge.

Если ваш бизнес внедряет AI-агентов в разработку или инфраструктуру, вам нужен способ мерить риск ошибок на продакшн-задачах. Supabase показал как построить такую систему открыто и воспроизводимо.

Что произошло

Supabase опубликовал под Apache-2.0 фреймворк Evals — систему для оценки AI-агентов на задачах реальной разработки. В отличие от синтетических бенчмарков, здесь агенты пишут схемы PostgreSQL, чинят сломанные Edge-функции и правят политики Row Level Security — всё как в боевой поддержке.

Фреймворк поднимает контейнер с полноценным Supabase-стеком и локальным CLI, агент работает с настоящим MCP-сервером и командами. Задачи взяты из реальных тикетов и GitHub-issues, разбиты на три оси: продукты (БД, auth, storage), темы (RLS, миграции, SDK) и стадии (build, deploy, investigate, resolve).

Оценка комбинированная: детерминированные проверки плюс LLM-судья. Агенту даётся одна попытка на retry. Результаты публикуются на supabase.com/evals, внутренний regression-сюит обновляется каждый день.

В первых тестах Claude Code читал ~2 страницы доки на задачу, Codex — ~8. Переписав описание одного skill, активацию подняли с 10% до 60% сессий. Проект запускается локально через pnpm, нужен Docker и свободные порты 54321–54329.

AI-агентыcode evaluationdeveloper toolsopen sourcebackend infrastructure

Автор: Марина Соколова · Источник: marktechpost.com

Разработчикам. Готовый фреймворк для регресс-тестирования доков и навыков агентов, сравнения harness разных моделей перед релизом SDK. Можно форкнуть, добавить свои сценарии из поддержки и гейтить CI на проценте успеха. Реальный стек вместо моков — агент дёргает живой CLI и MCP-сервер, видишь где ломается продакшн-flow.

Бизнесу. Валидация AI-агентов на задачах клиентской поддержки: если агент неправильно пишет RLS-политику, в финтехе или медицине это инцидент безопасности. Можно использовать для контроля качества внутренних AI-тулов, гарантировать что SDK-обновления не ломают популярные use case, и оценивать ROI от внедрения coding-агентов в dev-процесс.

Инвесторам. Открытый стандарт оценки AI-агентов на инфраструктурных задачах — важный сигнал для рынка dev-tooling. Если Supabase публикует метрики регрессий и skill activation, другие платформы последуют. Растёт спрос на специализированные eval-фреймворки для вертикальных доменов (финтех, compliance, healthcare), где ошибка агента = юридический риск.

Хайп30
Реальная польза70
Заработать65
  • Форкнуть Evals под свой продукт: добавить задачи из поддержки, гейтить релизы по проценту успеха агентов — готовый CI-пайплайн для AI-driven dev tools
  • Создать платную надстройку: автоматическое обогащение eval-сценариев из тикетов Jira/Linear, дашборды с трендами по моделям, интеграция в Slack для команд разработки
  • Специализированные eval-фреймворки для регулируемых индустрий: финтех (проверка compliance в коде), healthcare (HIPAA-совместимость), аудит безопасности для агентов, пишущих IAM-политики
  • Консалтинг по настройке skill-описаний: Supabase поднял активацию skill с 10% до 60% простым редактированием промта — услуга оптимизации промтов для корпоративных агентов
  • Платформа для vendor lock-in prevention: сравнительное тестирование агентов разных провайдеров на задачах клиента перед миграцией, SaaS с готовыми отраслевыми eval-наборами
  • LLM-as-a-judge субъективен: разные версии судьи-модели дадут разные оценки, лидерборд нестабилен при обновлении GPT/Claude
  • Переобучение на публичных сценариях: если производители моделей оптимизируют под опубликованные задачи Supabase, бенчмарк теряет репрезентативность
  • Инфраструктурные барьеры: запуск требует Docker, 9 свободных портов, API-ключи — порог входа выше чем у обычных code benchmarks, меньше adoption
  • Узкая специализация: eval заточен под Supabase-специфичные задачи (RLS, Edge Functions), воспроизводимость для других бэкендов под вопросом

Это первый серьёзный шаг от игрушечных code benchmarks к оценке AI-агентов на задачах, где ошибка стоит денег или создаёт дыру в безопасности. Supabase взял реальные тикеты, поднял контейнер с полным стеком и заставил агентов работать с живым CLI — никаких моков. Результат: Claude читает меньше доки чем Codex, но skill activation зависит от формулировки промта сильнее чем от модели. Это золото для тех, кто внедряет AI в dev-процесс.

Но есть нюанс: LLM-as-a-judge нестабилен, публичные сценарии рискуют стать мишенью для переобучения, а запуск требует Docker и кучу портов. Зато Apache-2.0 и открытый код — можно форкнуть под свой продукт, добавить задачи из своей поддержки и гейтить релизы по проценту успеха. Для инфраструктурных платформ, финтеха и всех, где агент может написать опасный код, это must have инструмент.

Инструменты из статьи

Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...

Доступ из РФ →

Ещё по теме

Комментарии