безопасность 1 мин

Zhipu GLM-5.3: что стоит за громким заголовком о китайской модели, которая «обошла GPT в кибербезопасности»

Китайская Zhipu представила GLM-5.3 — модель для кода и поиска уязвимостей. Заголовки кричат, что она обошла GPT и Claude в поиске багов (84,5% против 83,6-83,8%), но сама компания честно пишет: отрыв — 0,7%, а в эксплуатации уязвимостей модель вдвое отстаёт от Mythos 5. Все тесты запускались в американском агенте Claude Code. Реальная польза — открытые веса и 2436 найденных уязвимостей в open-source проектах. Реальный разрыв — в инструментах, не в моделях.

Это первая демонстрация того, как китайские лаборатории обходят американские ограничения на публикацию моделей двойного назначения. Вопрос не в том, кто лучше ищет баги, а в том, кто раньше сделает это доступным для всех — включая тех, кто использует модели для атак.

Что произошло

14 августа китайская Zhipu (Z.ai) выпустила GLM-5.3 — модель, заточенную под код и кибербезопасность. В релизе компания сообщила, что модель набрала 84,5% в бенчмарке CyberGym (поиск уязвимостей), чуть обойдя Mythos 5 от Anthropic (83,8%) и GPT-5.6 Sol (83,6%). СМИ восприняли это как победу Китая в гонке AI-безопасности.

Но сама Zhipu в том же документе написала: модель отстаёт тем сильнее, чем сложнее задача. В ExploitBench (разработка эксплойтов) GLM-5.3 набрала 54,4%, Mythos 5 — 78%. В ExploitGym (создание рабочих эксплойтов за 2 часа) GLM-5.3 выполнила 105 задач, Mythos 5 — 181. То есть найти баг китайская модель может примерно так же, а вот превратить его в работающую атаку — вдвое хуже.

Все тесты Zhipu запускала через Claude Code 2.1.207 — американский агент-фреймворк от Anthropic. Это честно (единая среда для сравнения), но показательно: инфраструктурный слой всё ещё американский, даже когда модель — китайская.

Компания также сообщила, что нашла 2436 уязвимостей в 269 open-source проектах. 107 — критических, 990 — высокой опасности. Самая старая уязвимость датируется 1981 годом, средний возраст бага — 26,6 лет. 53 обнародованы, 2383 — под эмбарго.

Веса модели планируется выложить в открытый доступ, в отличие от закрытых Anthropic и OpenAI.

Автор: Сергей Ефимов · Источник: artificialintelligence-news.com

Разработчикам. Модель можно скачать и использовать для аудита собственного кода. CyberGym-результат реальный, но для продакшена важнее ExploitBench, где GLM-5.3 вдвое слабее. Zhipu тестировала через Claude Code, что намекает: инфраструктура важнее модели.

Бизнесу. Открытые веса означают возможность встроить модель в внутренние DevSecOps-процессы без вендорлока. Реальное преимущество Китая не в превосходстве модели, а в доступности. Американские лаборатории держат киберспособности за закрытым API из соображений безопасности, Zhipu идёт ва-банк на открытость.

Инвесторам. Хайп вокруг одного бенчмарка скрывает реальную картину: gap в эксплуатации уязвимостей кратный, а не процентный. Деньги стоит вкладывать в инфраструктуру (Claude Code), а не в погоню за процентами в тестах. Рынок DevSecOps растёт, но конкурентное преимущество — в интеграции, не в raw модели.

Хайп75
Реальная польза55
Заработать60
  • Встроить GLM-5.3 в CI/CD pipeline для автоматического поиска уязвимостей при каждом коммите — дешевле проприетарных решений
  • Создать SaaS-платформу для непрерывного аудита open-source зависимостей с использованием китайских open-weights моделей
  • Предложить консалтинг по миграции старых кодовых баз: если средняя уязвимость висит 26 лет, компании заплатят за аудит legacy-кода
  • Разработать red-team-as-a-service для компаний в странах, где американские API недоступны (санкции, compliance)
  • Запустить marketplace эксплойтов для bug bounty программ, где модель — первичный фильтр для настоящих исследователей
  • Разрыв 0,7% в одном прогоне не статистически значим — при повторных замерах может исчезнуть
  • Китайские модели отстают в эксплуатации уязвимостей в 1,5-2 раза — это критично для реальной безопасности
  • Открытые веса означают, что модель скачают и злоумышленники — риск ассиметричного вооружения
  • Все тесты запускались в американском агенте Claude Code — реальная зависимость осталась, просто сместилась на слой ниже

Когда видишь заголовок «Китай обошёл США», стоит открыть цифры. Zhipu сама написала, что чем дальше от детекции к эксплуатации, тем сильнее отставание. 0,7% на CyberGym — это погрешность измерения, а 54% против 78% на ExploitBench — это реальный gap. Но медиа выбрали первое, потому что продаётся.

Реальная история не в процентах, а в стратегии. Anthropic и OpenAI закрывают кибервозможности за API из-за рисков двойного назначения. Zhipu говорит: мы выложим веса открыто. Это не про превосходство модели, а про изменение правил игры. И да, все тесты китайская модель прошла через американский агент Claude Code. Инфраструктура всё ещё важнее модели.

Инструменты из статьи

Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...

Доступ из РФ →

Ещё по теме

Комментарии