безопасность 1 мин

Уязвимость Claude, GPT и Gemini: как украсть внутренние рассуждения моделей через API

Исследователи нашли способ извлечь зашифрованные reasoning traces (внутренние рассуждения) из API Claude, GPT и Gemini. Используя джейлбрейк слабой модели, можно расшифровать мысли более сильной модели из того же семейства. В публичных логах агентов на GitHub/HF обнаружили 315 тысяч расшифрованных блоков с реальными API-ключами, паролями и личными данными — 64 артефакта существовали только внутри скрытых рассуждений.

Это первая публичная демонстрация кражи скрытых рассуждений LLM через легитимный API. Если вы используете reasoning-модели в проде или храните логи агентов — вы в зоне риска. Проблема системная, затрагивает всех крупных провайдеров и требует немедленного аудита.

Что произошло

Команда исследователей обнаружила фундаментальную уязвимость в архитектуре reasoning API от OpenAI (o1/o3), Anthropic (Claude Opus/Sonnet) и Google (Gemini). Провайдеры возвращают внутренние рассуждения модели как зашифрованный блок с подписью, который клиент отправляет обратно при продолжении диалога. Оказалось, эти блоки портативны: их можно инжектить в другой запрос.

Атака проста: берём зашифрованный reasoning trace от сильной модели, инжектим его в джейлбрейкнутую слабую модель того же провайдера (например, Haiku) и просим «переписать содержимое вложенного блока». Модель расшифровывает и выдаёт текст мыслей чужой модели — полностью, включая черновики, отброшенные гипотезы, внутренние комментарии.

Исследователи собрали 6708 публичных траекторий агентов с GitHub и Hugging Face, содержащих эти зашифрованные блоки. Применив декодинг-пайплайн, получили 315 320 расшифрованных reasoning-блоков.

Внутри — не только математика. В реальных пользовательских сессиях нашли 704 артефакта приватности: 62 API-ключа, 33 пароля, 24 access token, 30 email-адресов, плюс имена, почтовые адреса, внутренние URL. Из них 64 артефакта существовали только в reasoning — в видимом чате их не было.

Особенно показателен пример с санитизацией репозитория: модель в reasoning перечисляет стратегию поиска токенов (AKIA, sk-, ghp_, hf_), находит их в конфигах и diff-файлах, но в финальном ответе пользователю выдаёт уже очищенный текст. Reasoning — это сырой черновик, где модель честно проговаривает все найденные секреты.

Автор: Елена Верещагина · Источник: hnrss.org

Разработчикам. Если вы встраиваете OpenAI/Anthropic/Google reasoning API в продакшн — срочно аудит: проверяйте, не логируете ли вы зашифрованные блоки reasoning в публичные репозитории или облачные хранилища. Reasoning blocks нельзя считать безопасными — их можно переиспользовать и расшифровать через джейлбрейкнутую модель. Если храните траектории агентов — зачищайте signature-поля, иначе утечка reasoning = утечка всех промежуточных мыслей и данных, включая невидимые пользователю.

Бизнесу. Для компаний, использующих reasoning API в чувствительных сценариях (финтех, здравоохранение, юридические консультации) — это риск утечки конфиденциальной логики принятия решений и клиентских данных. Если ваши агенты работают с API-ключами, внутренними URL или персональными данными — модель может «запомнить» их в reasoning и случайно слить при логировании. Необходим пересмотр политики логирования: reasoning traces нельзя хранить в открытом виде или публиковать.

Инвесторам. Уязвимость затрагивает все три ведущих провайдера reasoning API — это системный риск для сегмента AI-агентов и enterprise LLM. Ожидайте всплеск спроса на self-hosted решения и on-premise inference, особенно в регулируемых индустриях. Стартапы, предлагающие безопасное управление reasoning traces или zero-knowledge inference, могут выиграть. Для OpenAI/Anthropic/Google — репутационный удар и необходимость дорогостоящего редизайна архитектуры API.

Хайп15
Реальная польза85
Заработать70
  • Разработать middleware-сервис для санитизации reasoning traces перед логированием: автоматическое удаление зашифрованных блоков, секретов и PII из траекторий агентов — продавать как SaaS для enterprise AI-команд.
  • Создать аудит-платформу для проверки публичных GitHub/HF репозиториев на утечки reasoning blocks и встроенных секретов — фриум для open source, платные алерты для компаний.
  • Предложить self-hosted reasoning API (например, на базе Llama 4 с reasoning capabilities) с гарантией, что reasoning traces не покидают периметр клиента — позиционировать как compliance-friendly альтернативу.
  • Консалтинг для финтеха/медтеха/legal: аудит существующих интеграций с OpenAI/Anthropic/Google, разработка политик безопасного логирования и incident response для утечек reasoning.
  • Разработать open source библиотеку для детекции и зачистки reasoning signatures из JSON/парсинга API-ответов — монетизация через enterprise-поддержку и managed-версию.
  • Вектор атаки требует доступа к зашифрованным блокам и джейлбрейкнутой модели — барьер для массовой эксплуатации пока высокий, но публичные логи GitHub/HF создают огромную поверхность атаки.
  • Провайдеры могут быстро пропатчить уязвимость (добавить контекстную привязку блоков, изменить формат подписи) — окно для эксплуатации может закрыться в течение недель.
  • Паника вокруг reasoning API может замедлить adoption у enterprise-клиентов, особенно в регулируемых индустриях — краткосрочный удар по выручке провайдеров.
  • Если начнётся массовое сканирование публичных репозиториев на утечки reasoning, ожидайте волну GDPR/CCPA исков и compliance-кризисов у компаний, случайно заливших клиентские данные в логи.

Честно, это один из самых элегантных взломов года. Провайдеры думали, что шифрование reasoning traces защитит их — но забыли, что модель сама себе дешифровщик. Достаточно скормить зашифрованный блок джейлбрейкнутой модели того же семейства, и она выдаст всё как на духу. Исследователи не просто нашли уязвимость — они вскрыли системную ошибку в архитектуре: reasoning blocks сделали переносимыми ради удобства API, но это превратило их в portable exploit.

Особенно жутко выглядит пример с санитизацией репозитория: модель в reasoning честно перечисляет все найденные токены (AKIA, sk-, ghp_), обсуждает стратегию зачистки, но в видимом ответе выдаёт уже cleaned версию. Reasoning — это сырой черновик, где модель проговаривает всё, включая то, что не должна была запомнить. А теперь представьте, сколько компаний заливают такие логи в S3 или GitHub для отладки. Это не просто утечка — это тикающая бомба compliance-кризиса. Провайдеры пропатчат, конечно, но вопрос остаётся: можно ли вообще доверять облачному reasoning API в сценариях с чувствительными данными? Рынок self-hosted inference сейчас потирает руки.

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии