Исследователи вскрыли «внутренний монолог» AI-моделей — и нашли утечки паролей
Учёные из Германии нашли способ извлекать скрытые «рассуждения» передовых AI-моделей (OpenAI, Anthropic, Google). Обнаружены две проблемы: утечка приватных данных (пароли, API-ключи) через зашифрованные трейсы и подозрение, что китайские модели вроде Kimi K3 могли копировать логику западных моделей через дистилляцию. Уязвимость частично закрыта, но метод всё ещё работает.
Если вы используете GPT, Claude или Gemini через API — ваши приватные данные могли утечь через скрытые рассуждения моделей. Дистилляция становится оружием в US-China AI-гонке, и это влияет на доступность open-source моделей.
Что произошло

Команда исследователей из Германии (Тюбингенский университет, Max Planck, MATS Research, Snyk) обнаружила уязвимость в API всех крупных AI-моделей — OpenAI, Anthropic, Google. Суть: передовые модели при решении сложных задач выполняют скрытые «рассуждения» (chain of thought), которые компании шифруют и отправляют на компьютер пользователя для экономии вычислений.
Исследователи придумали трюк: подменить зашифрованный трейс рассуждений и скормить его меньшей версии той же модели. Малая модель слабее обучена отказывать (меньше alignment-тренировки) — и выдаёт расшифрованный текст «мыслей» большой модели. Так вытащили пароли, API-ключи и другие приватные данные из внутренних трейсов.
Вторая находка: китайская модель Kimi K3 (Moonshot AI) показывает поразительно похожую логику рассуждений на Claude Opus и GPT. Прямых доказательств дистилляции нет, но паттерны совпадают. DeepSeek и Inkling такого сходства не показали.
Компании оперативно прикрыли утечку приватных данных через API, но полностью закрыть извлечение трейсов невозможно без переделки архитектуры API. Дистилляция стала горячей темой в геополитике AI: США обвиняют Китай в копировании моделей, Китай говорит, что дистилляция — норма индустрии.
Автор: Елена Верещагина · Источник: wired.com
Разработчикам. Появился метод извлечения скрытых chain-of-thought трейсов через API-атаку на слабо выровненные малые версии моделей. Если используете reasoning-модели через API — проверьте, что приватные данные не попадают в скрытые рассуждения. Уязвимость частично закрыта, но архитектура API остаётся проблемной.
Бизнесу. Риск утечки корпоративных данных через API передовых моделей был реальным до недавнего патча. Если модель рассуждает над вашими API-ключами или паролями — они могли утечь. Дистилляция чужих моделей стала проще, что обостряет конкуренцию с китайскими open-weight моделями.
Инвесторам. Уязвимость показала хрупкость защиты интеллектуальной собственности в AI. Китайские компании могут быстрее копировать западные модели, снижая барьеры входа. Геополитический риск растёт: США может ограничить дистилляцию, что ударит по open-source экосистеме и Meta.
- Сервисы аудита AI-безопасности: проверка API на утечки приватных данных через chain-of-thought трейсы
- Инструменты для детекции дистилляции: помогать компаниям понять, копируют ли их модели конкуренты
- Безопасные API-обёртки: middleware, который зачищает приватные данные из reasoning-трейсов перед отправкой в модель
- Консалтинг для enterprise: как безопасно использовать reasoning-модели без риска утечки корпоративных секретов
- Разработка alignment-методов для малых моделей: чтобы они не выдавали скрытые данные при атаках подменой
- Патч неполный: метод всё ещё частично работает, полная защита требует переделки API
- Геополитический риск: США может запретить дистилляцию, что убьёт open-source AI и даст преимущество Китаю
- Переоценка проблемы: пока нет прямых доказательств, что китайские компании использовали именно этот метод
- Баланс между безопасностью и открытостью: чрезмерные ограничения затормозят инновации
Штука реально серьёзная, хотя и не сенсация уровня «всё сломано». Утечку паролей прикрыли быстро, но сам факт, что reasoning-трейсы можно вытащить — показывает, насколько хрупка защита интеллектуальной собственности в AI. Компании шифруют «мысли» моделей и отправляют на клиент ради экономии денег на inference — а это оказалось дырой.
По поводу китайских моделей: прямых доказательств дистилляции нет, но Kimi K3 рассуждает очень похоже на Claude. Может быть совпадение, может — копирование через эту или другую технику. Главное — дистилляция стала политическим оружием: США кричит, что Китай ворует модели, Марк Цукерберг кричит, что без дистилляции не будет open-source. Кто прав? Оба понемногу. Но если вы заливаете секреты в промпты reasoning-моделей — пересмотрите подход.
Инструменты из статьи
Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии