Cisco выпустила Antares: мини-модели на 350M и 1B параметров, которые ищут уязвимости в реальном коде
Cisco Foundation AI представила Antares — семейство специализированных языковых моделей для поиска уязвимостей в кодовых базах. Модели на 350M и 1B параметров доступны в открытом доступе (Apache 2.0) и показывают результаты, сопоставимые с гигантскими моделями вроде GPT-5.5, при этом работая в сотни раз быстрее и дешевле.
Это первый открытый инструмент, который может работать на локальном железе и реально помогает DevSecOps-командам автоматизировать триаж уязвимостей в закрытых кодовых базах — без утечки кода в облако и с предсказуемым качеством.
Что выпустили
Cisco Foundation AI открыла исходники Antares — семейства небольших языковых моделей, заточенных под одну узкую задачу: находить уязвимый код в реальных проектах. Даёшь модели описание уязвимости (CWE) и репозиторий — она возвращает список файлов, где засела проблема.
В открытый доступ вышли две модели: Antares-350M и Antares-1B (под лицензией Apache 2.0). Вместе с ними Cisco выложила VLoc Bench — бенчмарк на 500 реальных задач из 290 GitHub-репозиториев с настоящими уязвимостями (npm, pip, Maven, Go, Rust, Composer).
Как это работает
Antares не просто генерирует текст — она работает как агент. Модель получает только описание типа уязвимости (CWE), без подсказок. Дальше запускается в изолированном Docker-контейнере с репозиторием и выполняет терминальные команды (поиск, чтение файлов). Лимит — 15 команд на задачу. В конце выдаёт ранжированный список файлов.
Особенность: модель обучали на синтетических траекториях от GPT-OSS-120B (71,5% — рассуждения о кибербезопасности, 15,4% — траектории поиска кода), а потом дообучали через GRPO (вариант RLHF с программно вычисляемой наградой, без модели вознаграждения).
Результаты
Antares-1B достигла 0.209 File F1 — выше, чем GLM-5.2 с 753 миллиардами параметров (0.186) и почти как GPT-5.5 (0.229). При этом модель в 753 раза меньше.
- Antares-350M: 0.135 F1 — обгоняет Gemma-4-31B (0.101) и Gemini 2.5 Flash (0.102)
- Antares-3B: 0.223 F1 — почти вровень с GPT-5.5
- Традиционные сканеры (Semgrep, CodeQL) показали 0.086 и 0.023 соответственно
Базовые Granite 4.0 без дообучения показали ~0.000 F1 — вся магия в пост-тренинге. GRPO добавил 11-25% к качеству и снизил разброс результатов на 42-65%.
Практический смысл
Cisco не пытается заменить SAST/DAST-инструменты. Antares автоматизирует первый этап триажа: быстро находит подозрительные файлы в незнакомой кодовой базе. Дальше — дело DevSecOps-команды.
Модели работают на потребительском железе, не требуют API-ключей и облачных зависимостей. Для компаний с закрытыми репозиториями это критично.
Ключевые выводы
- Модель на 1B параметров показала результаты, сопоставимые с моделями в 750 раз крупнее (GLM-5.2 на 753B) — задача оказалась узкой и хорошо поддающейся специализации
- Базовые Granite 4.0 без дообучения показали нулевую точность, хотя уже умели работать с инструментами — вся экспертиза пришла из пост-тренинга на синтетических траекториях
- GRPO (RL без модели вознаграждения) снизил разброс результатов на 42-65%, что важнее прироста среднего качества — предсказуемость критична в продакшене
- Традиционные статические анализаторы (Semgrep, CodeQL) показали в 2-10 раз худшие результаты, не справляясь с контекстом репозитория
- Модели самостоятельно выработали разные стратегии: маленькие (350M/1B) больше ищут и возвращают больше файлов, 3B-модель предпочла чтение и точность
Автор: Юлия Тарасова · Источник: marktechpost.com
**Это не очередной «ChatGPT для кода».** Cisco сделала узкоспециализированный инструмент для реальной боли DevSecOps: когда прилетает CVE, а непонятно, где в 200 тысячах строк кода засела дыра. Модель работает как младший инженер по безопасности — лазит по файлам, читает код, ищет паттерны. И делает это так, что обгоняет модели в 750 раз крупнее.
Особенно интересны два момента. Первый: базовая Granite умела пользоваться инструментами, но без спецтренинга показывала ноль — навык «читать код как секьюрити-инженер» пришёл целиком из дообучения на синтетике от GPT-OSS-120B. Второй: маленькие модели сами нащупали разные стратегии — 1B-модель работает как параноик (ищет везде, возвращает всё подозрительное), а 3B — как снайпер (меньше файлов, но точнее). Никто их этому не учил, они сами выбрали стиль под свои возможности. Для production-инструмента это важнее, чем +5% на бенчмарке.
Комментарии