Открытые модели из Китая догоняют лидеров по возможностям — но безопасность отстаёт на годы
Китайская открытая модель GLM-5.2 от Z.ai сравнялась с GPT-5.5 и Claude Opus 4.7 по кибер- и био-возможностям, но отказывается выполнять опасные задачи в 0% случаев — против почти 100% у Claude. Открытые веса позволяют скачать модель и убрать все защиты. Разрыв между мощностью и безопасностью растёт, а регуляторы не готовы.
Это первый случай, когда открытая модель вышла на уровень закрытых лидеров по опасным возможностям — и сделала это вообще без публичных safety-гарантий. Precedent создан, регуляторы заметят.
Что произошло

Китайская компания Z.ai выпустила открытую модель GLM-5.2, которая отстаёт от GPT-5.5 и Claude Opus 4.7 всего на несколько месяцев по кибер- и био-возможностям. Но есть нюанс: по данным SaferAI, GLM-5.2 не отказала ни разу при запросах на киберугрозы и двойного назначения в биологии. Claude Opus 4.7 отказывала так стабильно, что SaferAI вообще не смогла провести на ней CyberGym-тест (бенчмарк для оценки кибер-возможностей).
Проблема открытых моделей — веса можно скачать и запустить на своём железе, удалив все защиты: refusal training, системные промпты, API-контроль. Frontier-компании вроде OpenAI и Anthropic полагаются на эти механизмы, но даже на закрытых моделях джейлбрейки работают постоянно. Far.ai нашла сотни универсальных джейлбрейков на Grok 4.5 и Gemini 3.1 Pro — комбинация ролеплея, фейковой истории диалога и follow-up промптов ломает защиты.
Z.ai не опубликовала framework безопасности, не провела публичных тестов перед релизом. Китайские регуляторы исторически фокусировались на политконтенте и стабильности, а не на катастрофических рисках вроде кибератак и био-угроз. По словам эксперта из Stanford Cyber Policy Center, китайская система уверена в контроле внутри страны, но открытые модели уходят дальше границ.
Автор: Сергей Ефимов · Источник: TechCrunch AI
Разработчикам. GLM-5.2 работает через API и в виде открытых весов — можно скачать, файнтюнить, менять системные промпты. Никаких защит на уровне архитектуры. Если нужна мощная открытая модель без отказов — вот она. Но если думаете про безопасность продукта — посмотрите на Claude Opus 4.7 с плотным refusal training или изучите pre-training data filtering (работает для био, для кибера — слабо).
Бизнесу. Открытые модели быстро приближаются к закрытым по возможностям, но с нулевыми гарантиями безопасности. Если ваш продукт в critical-секторе (финтех, здравоохранение, безопасность) — лучше закрытые API с контролем. Если строите на open-source — готовьтесь к репутационным рискам и регуляторным вопросам, особенно в ЕС и США.
Инвесторам. Гонка открытых моделей ускоряется — Китай выходит на frontier. Но разрыв в безопасности создаёт риски для всей индустрии: регуляторы могут жёстко прижать открытые веса, если начнутся инциденты. Ставки на безопасность (SaferAI-подобные стартапы,eval-инфраструктуру, data filtering) выглядят умнее, чем ставки на очередную open-модель без защит.
- Стартапы в области AI safety evaluation — спрос на независимые тесты frontier-моделей растёт, регуляторы будут требовать обязательные проверки перед релизом.
- Инструменты для pre-training data filtering и post-training detoxification — особенно для bio-рисков, где это работает без потери качества.
- API-обёртки и managed-сервисы над открытыми моделями с встроенными защитами — для компаний, которым нужна мощность open-source без репутационных рисков.
- Консалтинг по AI compliance для китайских и западных компаний — разрыв в подходах к безопасности между США и Китаем открывает нишу для мостов и адаптации стандартов.
- Инфраструктура для аудита использования открытых моделей — блокчейн-логи, watermarking весов, трекинг производных файнтюнов.
- Открытые модели без защит могут привести к громким инцидентам — и жёстким запретам на релиз весов вообще (precedent уже есть в ЕС).
- Китайские модели могут иметь скрытые backdoors или зависимости от инфраструктуры, подконтрольной правительству.
- Джейлбрейки становятся всё изощрённее — даже закрытые модели ломаются, у открытых вообще нет шансов.
- Pre-training data filtering для кибер-возможностей почти не работает — нельзя сделать сильную кодинг-модель, которая не умеет хакать. Это значит, что любая топовая модель — потенциально оружие.
Это тот момент, когда индустрия подошла к красной черте, но продолжает идти дальше. GLM-5.2 — это не просто сильная модель, это proof of concept: можно выпустить frontier-систему вообще без публичных safety-тестов, и никто тебя не остановит. Пока. Китай делает ставку на контроль внутри страны, но открытые веса — это глобальная история. Скачал — и делай что хочешь, хоть в подвале.
Реально важный вопрос здесь не технический, а политический: кто первым испугается громкого инцидента и начнёт запрещать релизы весов. Precedent уже есть — в ЕС обсуждают обязательные eval'ы перед релизом. Если SaferAI или подобные организации найдут действительно опасную уязвимость в открытой модели, которую используют для атаки — игра закончится. А до тех пор мы наблюдаем гонку, в которой скорость важнее безопасности.
Инструменты из статьи
Продвинутая языковая модель от xAI, заточенная под написание кода, агентские...
Доступ из РФ →
Комментарии