модели 2 мин

KAT-Coder-V2.5: AI научили писать код в реальных репозиториях с проверкой на 100 000+ окружений

Команда KwaiKAT из Kuaishou выпустила KAT-Coder-V2.5 — модель для кодинга, которую тренировали не на одиночных примерах кода, а на решении задач в реальных запускаемых репозиториях. Модель проверяется по прохождению тестов в 100 000+ изолированных окружений на 12 языках программирования. Открытая версия KAT-Coder-V2.5-Dev доступна под Apache-2.0 на Hugging Face, а продакшн-версия — через StreamLake.

Это шаг от «генерации кода по запросу» к полноценным AI-агентам, способным работать в реальных проектах. Если подход масштабируется, AI сможет брать GitHub issues и делать pull request'ы без человека в цепочке — а это уже конкретная угроза джуниор-позициям.

Обучение на реальных репозиториях

Команда KwaiKAT из китайской компании Kuaishou представила KAT-Coder-V2.5 — модель для генерации кода, которая работает иначе, чем привычные GPT или Claude. Вместо одиночных ответов «напиши функцию» её тренировали решать задачи в полноценных репозиториях: клонировать проект, настраивать окружение, писать патч и проверять, что он проходит все тесты.

Продакшн-версия доступна через сервис StreamLake, а открытый вариант KAT-Coder-V2.5-Dev выложен на Hugging Face под Apache-2.0.

AutoBuilder: окружения, которые реально работают

Ключевой компонент — AutoBuilder, система для создания проверяемых окружений. Она анализирует репозиторий, автоматически пишет скрипт установки зависимостей и запускает тесты в изолированной песочнице. Проверка не просто смотрит на exit-коды, а парсит структурированный вывод тест-фреймворков: окружение принимается, только если собирается 90%+ ожидаемых тестов и результаты воспроизводятся между запусками.

Задачи берутся из реальных pull request'ов и коммитов (подход из SWE-bench). Из истории Git вырезаны все следы референсного решения, чтобы модель не могла подсмотреть правильный ответ. В итоге получилось 100 000+ окружений на 12 языках с успешностью построения 57%.

Фильтрация траекторий и мультиэкспертное обучение

Просто брать траектории, где тесты прошли, — плохая идея: модель может зашить хардкод или обойти механизмы проверки. KwaiKAT фильтрует данные строже: оценивает качество исследования кода, локализацию проблемы, минимальность патча, честность (не обманывает ли тесты).

Для траекторий «почти прошло» дают целевые подсказки (не раскрывая решение), поднимают pass rate с 0% до ~20%, затем регенерируют без подсказок.

Тренировали через асимметричный PPO: критик видит привилегированный контекст (будущие ходы, тесты, патчи), актор — только состояние окружения. На инференсе критик выкидывается. Награды трёхуровневые: базовые баллы за прохождение тестов, штрафы за дубликаты и мусор, бонусы за частичное решение в провалившихся попытках.

Результаты

На бенчмарке PinchBench KAT-Coder-V2.5 набирает 94.9, обгоняя Claude Opus 4.8 (93.5). На SWE-Bench Pro — второе место с 65.2 против 69.2 у лидера. Открытая версия весит ~70B параметров (по косвенным признакам).

Инфраструктурные баги дороже алгоритмов

Интересный момент: во время тренировки V2 проблемой оказалась не модель, а инфраструктура. ~16% траекторий падали из-за багов в песочнице (переполнение диска, некорректные переменные окружения, рассинхрон токенов при перезапуске чатов). После фиксов количество невалидных роллаутов упало с 6-7% до <1%, и коллапсы тренировки сократились на порядок. Типичная проблема ML в продакшене: перфоманс модели упирается в баги сервисной обвязки.

Ключевые выводы

  • Обучение на 100 000+ реальных репозиториев с автоматической настройкой окружений и прогоном тестов — новый уровень датасетов для code AI
  • Проверка не по exit-кодам, а по структурированному выводу тест-фреймворков с воспроизводимостью результатов убирает ложноположительные валидации
  • Фильтрация траекторий по процессу, а не только по финальному результату, отсекает модельные читы (хардкод, обход тестов) и извлекает ценное поведение из провалов
  • ~16% траекторий в V2 падали не из-за модели, а из-за инфраструктурных багов (диск, переменные окружения, токенизация) — фиксы подняли стабильность на порядок
  • Асимметричный PPO с привилегированным контекстом для критика (будущие ходы, патчи, тесты) позволяет обучать агента на информации, недоступной на инференсе

Автор: Артём Ковалёв · Источник: marktechpost.com

Мнение редакции

**Редакция:** Это редкий случай, когда промо-пост от vendor'а реально стоит внимания. KwaiKAT не просто обучили модель на парах «вопрос-код», а замахнулись на end-to-end workflow: клонировать репо, поставить зависимости, написать патч, прогнать тесты. AutoBuilder, который строит 100 тысяч окружений с 57% успешностью — это инженерный подвиг, даже если половина деталей в статье утаена.

Особенно ценно признание, что ~16% проблем в тренировке V2 были не в алгоритме RL, а в банальных инфраструктурных багах (диск переполнился, токены рассинхронились). Типичная история production ML: модель готова, а падает на переменных окружения. Цифры на бенчмарках выглядят сильно (94.9 на PinchBench vs 93.5 у Opus), но тут важно понимать: замеряли на **едином харнессе Claude Code**, то есть условия одинаковые, но это не значит, что модель лучше Claude в дикой природе. Зато открытые веса под Apache-2.0 — это жест доброй воли, который позволит community проверить заявления. Пока что это одна из самых серьёзных попыток превратить code AI из «умного автокомплита» в агента, способного самостоятельно фиксить баги.

Инструменты из статьи

Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...

Доступ из РФ →

Ещё по теме

Комментарии