регулирование 1 мин

Почему водяные знаки для AI-текстов бесполезны — и что это значит перед EU AI Act

С августа 2026 года в ЕС вступает в силу требование маркировать весь AI-контент водяными знаками. Google использует SynthID (изменение вероятности выбора токенов), OpenAI/Anthropic, возможно, подменяют юникод-символы. Но любой метод легко обойти редактированием — это фундаментальная проблема текста как сжатого носителя.

Если вы используете AI для контента, продукта или бизнеса в ЕС — вас коснутся эти изменения. Понимание ограничений watermarking поможет не тратить деньги на бесполезные решения и подготовиться к регуляторным рискам.

Что произошло

С 1 августа 2026 года в ЕС начнёт действовать EU AI Act, который обязывает всех провайдеров LLM маркировать свои выводы как «искусственно созданные» (статья 50). Это значит: если ChatGPT, Claude или Gemini хотят работать в Европе, они должны внедрить водяные знаки в тексте.

Проблема в том, что текст — это крайне сжатая среда. В отличие от изображения, где можно изменить цвет нескольких пикселей незаметно для глаза, в тексте любое изменение очевидно. Нельзя просто вставить скрытый код в предложение — получишь опечатки или нелепицу.

Как пытаются решить:

  • Google SynthID: при генерации токенов (слов) модель немного меняет вероятности выбора — не берёт самый вероятный токен, а выбирает из топ-5 тот, у которого выше специальный SynthID-скор (вычисляется по предыдущим токенам). Статистически это оставляет след, но снижает качество при temperature=0 (когда нужен самый точный ответ).

  • OpenAI/Anthropic (предположительно): подменяют обычные пробелы (U+0020) на визуально идентичные юникод-символы (U+2004, U+3000) — так называемые гомоглифы. Человек не видит разницы, но детектор — да.

Почему это не работает:

Любая правка текста (перефразирование, копипаст в другой редактор, замена символов) убивает водяной знак. Нельзя запретить пользователю редактировать вывод. А проверка через сам запуск модели слишком дорогая и даёт много ложных срабатываний (люди часто пишут как AI).

Автор статьи утверждает: текстовые водяные знаки — это костыль, который не выдержит столкновения с реальностью.

Автор: Ольга Ким · Источник: hnrss.org

Разработчикам. SynthID и юникод-трюки показывают, как работают вероятностные сэмплеры в LLM — полезно понимать для дебага и оптимизации inference. Если делаете свой AI-продукт для ЕС, придётся либо интегрировать чужую маркировку, либо изобретать свою (и она всё равно будет ломаться).

Бизнесу. EU AI Act создаёт новые обязательства: с августа 2026 нужно маркировать AI-контент. Если вы используете ChatGPT/Claude в продакшене для клиентов в ЕС — готовьтесь к изменениям условий сервиса и возможным ограничениям на редактирование выводов. Если вы SaaS-провайдер — придётся предлагать бесплатную проверку водяных знаков всем гражданам ЕС.

Инвесторам. Регуляторный риск растёт: требования EU AI Act неясны и технически невыполнимы. Компании вроде OpenAI/Google будут тратить ресурсы на костыльные решения вместо продукта. С другой стороны, возникает рынок инструментов для детекции и обхода водяных знаков — но это скорее ниша для стартапов, чем масштабная история.

Хайп30
Реальная польза65
Заработать55
  • Разработка anti-watermark-инструментов: расширения для браузеров, API для автоматической очистки юникод-гомоглифов и перефразирования текста (спрос будет от контент-мейкеров и маркетологов).
  • Консалтинг по EU AI Act для компаний: помощь в интеграции watermarking API, аудит pipeline на соответствие регуляторным требованиям (особенно для SaaS с клиентами в ЕС).
  • Альтернативные детекторы AI-контента: не на водяных знаках, а на стилометрии и статистике — продавать журналистам, издателям, вузам (спрос вырастет, когда стандартные watermark-детекторы начнут ломаться).
  • AI-прокси для обхода маркировки: сервисы, которые пропускают AI-текст через перефразировщик и убирают следы (серая зона, но платёжеспособная аудитория есть).
  • Инструменты для compliance: дашборды для отслеживания использования AI в компании, логирование запросов к LLM с watermark-проверкой для внутреннего аудита.
  • EU AI Act технически невыполним в части watermarking — это может привести к формальному compliance (галочка в UI) без реальной защиты, что дискредитирует регулирование.
  • Водяные знаки снижают качество выводов (особенно при строгом сэмплинге) — пользователи будут жаловаться, что «AI в ЕС работает хуже», и уходить на VPN или самохост.
  • Рынок инструментов для обхода watermark будет расти быстрее, чем рынок детекторов — это гонка вооружений, в которой защита всегда проигрывает.
  • Компании могут получить штрафы за формальное несоответствие даже при добросовестной попытке внедрить водяные знаки (регулятор не всегда понимает технические ограничения).

EU AI Act — это попытка законодателей решить проблему, которую инженеры считают технически нерешаемой. Текст слишком плотный, чтобы прятать в нём метки без потери качества. Google SynthID звучит умно, но на практике это компромисс: либо жертвуешь точностью модели, либо водяной знак исчезает при первой правке.

Что реально интересно: это создаёт рынок инструментов для обхода маркировки (перефразировщики, антидетекторы) и консалтинга по compliance. Но главное — это сигнал, что регуляторы пока не понимают технологию, с которой имеют дело. Если вы строите AI-продукт для ЕС, готовьтесь к формальному checkbox compliance и параллельно — к тому, что пользователи найдут способы обойти любые ограничения.

Инструменты из статьи

Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.

Доступ из РФ →

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии