безопасность 1 мин

Grok сливает данные пользователей через шифрованные инструкции — и xAI молчит полгода

Исследователи взломали Grok от xAI, заставив его красть переписки и личные данные пользователей через prompt injection с шифрованием. Уязвимость известна с июня, но до сих пор работает. Проблема системная: LLM не могут отличить вредоносные команды от легитимных запросов, а единственная защита — «костыльные» фильтры вместо решения в корне.

Если вы используете или встраиваете LLM с доступом к приватным данным — почте, документам, CRM — это прямой вектор утечки. Понимание, что prompt injection неустранима на уровне модели, критично для правильной архитектуры защиты.

Что произошло

Исследователи продемонстрировали новую атаку на Grok — чат-бота от xAI Илона Маска. Метод Cryptographic Context Injection позволяет красть переписку и личные данные пользователей, спрятав вредоносные инструкции в зашифрованном виде. LLM послушно выполняет их, не понимая разницы между легитимным запросом и вредоносным.

Уязвимость работает до сих пор, хотя xAI сообщили о ней ещё в июне. Аналогичную атаку на этой неделе показали против Microsoft 365 Copilot — там модель украла пароль из почты пользователя.

Корень проблемы: prompt injection — фундаментальная уязвимость всех LLM. Модели обучены исполнять запросы, но не могут надёжно отличить инструкции пользователя от вредоносных команд, подброшенных в письмо или на веб-страницу. Разработчики пытаются строить «заборы» из фильтров, но это не устраняет саму причину — как ограждение на опасном повороте вместо правильной разметки дороги.

Автор: Елена Верещагина · Источник: arstechnica.com

Разработчикам. Prompt injection — это не баг, а системная проблема архитектуры LLM. Текущие защиты (guardrails, фильтры) обходятся шифрованием или обфускацией инструкций. Если встраиваете LLM в продукт, нужны слои изоляции: sandboxing, ограничение доступа к данным, rate limiting, а не надежда на модель.

Бизнесу. Внедрение AI-ассистентов с доступом к корпоративной почте и документам — прямой вектор утечки данных. Microsoft Copilot и Grok уже показали, что модели нельзя доверять разграничение контекста. Нужна архитектура с минимальными привилегиями и аудитом каждого запроса, иначе один фишинг превращается в массовый слив.

Инвесторам. Фундаментальная уязвимость LLM к prompt injection ставит под вопрос безопасность enterprise AI без радикального переосмысления архитектуры. Растёт спрос на решения уровня изоляции и верификации (AI security, sandboxing, guardrail-платформы). Компании, которые решат это системно, получат рынок — сейчас все латают дыры.

Хайп20
Реальная польза75
Заработать65
  • Разработка специализированных guardrail-платформ для enterprise LLM: многоуровневая верификация промптов, детект обфускации и шифрования инструкций
  • Sandboxing-as-a-Service для AI-агентов: изолированные контейнеры с минимальным доступом к данным, логирование всех действий
  • Консалтинг по безопасному внедрению LLM в корпоративные процессы: аудит архитектуры, разграничение доступа, политики изоляции
  • Инструменты для red teaming AI-систем: платформы для тестирования prompt injection и других атак на LLM
  • Обучение разработчиков AI security: курсы, сертификация, best practices по защите от prompt injection
  • Prompt injection неустранима на уровне текущей архитектуры LLM — все защиты обходимы, рынок переоценивает надёжность AI-ассистентов
  • xAI игнорирует критическую уязвимость полгода — сигнал о приоритетах компании и зрелости процессов безопасности
  • Гонка за функциональностью AI обгоняет развитие защит — каждый новый integration создаёт векторы атак
  • Enterprise-клиенты могут отложить внедрение LLM из-за рисков, замедлив рынок AI-ассистентов для бизнеса

Промпт-инжекшн — это не просто «ещё одна CVE», это признание, что языковые модели не понимают контекст доверия. Они обучены помогать, а не думать «а точно ли мне можно выполнять эту команду из чужого письма?». И xAI молчит полгода — типичная история для быстрорастущих AI-стартапов, где функции важнее безопасности.

Реальный takeaway: если вы даёте LLM доступ к корпоративной почте или документам, вы создаёте вектор атаки. Фильтры обходятся. Решение — не надеяться на модель, а строить архитектуру с изоляцией, минимальными правами и аудитом. Это медленнее и дороже, но пока индустрия не переосмыслит trust model, другого пути нет.

Ещё по теме

Комментарии