KAT-Coder-V2.5: AI научили писать код в реальных репозиториях с проверкой на 100 000+ окружений
Команда KwaiKAT из Kuaishou выпустила KAT-Coder-V2.5 — модель для кодинга, которую тренировали не на одиночных примерах кода, а на решении задач в реальных запускаемых репозиториях. Модель проверяется по прохождению тестов в 100 000+ изолированных окружений на 12 языках программирования. Открытая версия KAT-Coder-V2.5-Dev доступна под Apache-2.0 на Hugging Face, а продакшн-версия — через StreamLake.
Это шаг от «генерации кода по запросу» к полноценным AI-агентам, способным работать в реальных проектах. Если подход масштабируется, AI сможет брать GitHub issues и делать pull request'ы без человека в цепочке — а это уже конкретная угроза джуниор-позициям.
Обучение на реальных репозиториях
Команда KwaiKAT из китайской компании Kuaishou представила KAT-Coder-V2.5 — модель для генерации кода, которая работает иначе, чем привычные GPT или Claude. Вместо одиночных ответов «напиши функцию» её тренировали решать задачи в полноценных репозиториях: клонировать проект, настраивать окружение, писать патч и проверять, что он проходит все тесты.
Продакшн-версия доступна через сервис StreamLake, а открытый вариант KAT-Coder-V2.5-Dev выложен на Hugging Face под Apache-2.0.
AutoBuilder: окружения, которые реально работают
Ключевой компонент — AutoBuilder, система для создания проверяемых окружений. Она анализирует репозиторий, автоматически пишет скрипт установки зависимостей и запускает тесты в изолированной песочнице. Проверка не просто смотрит на exit-коды, а парсит структурированный вывод тест-фреймворков: окружение принимается, только если собирается 90%+ ожидаемых тестов и результаты воспроизводятся между запусками.
Задачи берутся из реальных pull request'ов и коммитов (подход из SWE-bench). Из истории Git вырезаны все следы референсного решения, чтобы модель не могла подсмотреть правильный ответ. В итоге получилось 100 000+ окружений на 12 языках с успешностью построения 57%.
Фильтрация траекторий и мультиэкспертное обучение
Просто брать траектории, где тесты прошли, — плохая идея: модель может зашить хардкод или обойти механизмы проверки. KwaiKAT фильтрует данные строже: оценивает качество исследования кода, локализацию проблемы, минимальность патча, честность (не обманывает ли тесты).
Для траекторий «почти прошло» дают целевые подсказки (не раскрывая решение), поднимают pass rate с 0% до ~20%, затем регенерируют без подсказок.
Тренировали через асимметричный PPO: критик видит привилегированный контекст (будущие ходы, тесты, патчи), актор — только состояние окружения. На инференсе критик выкидывается. Награды трёхуровневые: базовые баллы за прохождение тестов, штрафы за дубликаты и мусор, бонусы за частичное решение в провалившихся попытках.
Результаты
На бенчмарке PinchBench KAT-Coder-V2.5 набирает 94.9, обгоняя Claude Opus 4.8 (93.5). На SWE-Bench Pro — второе место с 65.2 против 69.2 у лидера. Открытая версия весит ~70B параметров (по косвенным признакам).
Инфраструктурные баги дороже алгоритмов
Интересный момент: во время тренировки V2 проблемой оказалась не модель, а инфраструктура. ~16% траекторий падали из-за багов в песочнице (переполнение диска, некорректные переменные окружения, рассинхрон токенов при перезапуске чатов). После фиксов количество невалидных роллаутов упало с 6-7% до <1%, и коллапсы тренировки сократились на порядок. Типичная проблема ML в продакшене: перфоманс модели упирается в баги сервисной обвязки.
Ключевые выводы
- Обучение на 100 000+ реальных репозиториев с автоматической настройкой окружений и прогоном тестов — новый уровень датасетов для code AI
- Проверка не по exit-кодам, а по структурированному выводу тест-фреймворков с воспроизводимостью результатов убирает ложноположительные валидации
- Фильтрация траекторий по процессу, а не только по финальному результату, отсекает модельные читы (хардкод, обход тестов) и извлекает ценное поведение из провалов
- ~16% траекторий в V2 падали не из-за модели, а из-за инфраструктурных багов (диск, переменные окружения, токенизация) — фиксы подняли стабильность на порядок
- Асимметричный PPO с привилегированным контекстом для критика (будущие ходы, патчи, тесты) позволяет обучать агента на информации, недоступной на инференсе
Автор: Артём Ковалёв · Источник: marktechpost.com
**Редакция:** Это редкий случай, когда промо-пост от vendor'а реально стоит внимания. KwaiKAT не просто обучили модель на парах «вопрос-код», а замахнулись на end-to-end workflow: клонировать репо, поставить зависимости, написать патч, прогнать тесты. AutoBuilder, который строит 100 тысяч окружений с 57% успешностью — это инженерный подвиг, даже если половина деталей в статье утаена.
Особенно ценно признание, что ~16% проблем в тренировке V2 были не в алгоритме RL, а в банальных инфраструктурных багах (диск переполнился, токены рассинхронились). Типичная история production ML: модель готова, а падает на переменных окружения. Цифры на бенчмарках выглядят сильно (94.9 на PinchBench vs 93.5 у Opus), но тут важно понимать: замеряли на **едином харнессе Claude Code**, то есть условия одинаковые, но это не значит, что модель лучше Claude в дикой природе. Зато открытые веса под Apache-2.0 — это жест доброй воли, который позволит community проверить заявления. Пока что это одна из самых серьёзных попыток превратить code AI из «умного автокомплита» в агента, способного самостоятельно фиксить баги.
Инструменты из статьи
Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...
Доступ из РФ →
Комментарии