безопасность 1 мин

Anthropic год работала без фильтров биооружия: 133 миллиона запросов в зоне риска

Anthropic случайно отключила защиту от биологических угроз почти на год (май 2025 – апрель 2026). 50 тысяч внешних подрядчиков отправили 133 млн запросов без проверки на опасный контент. Следов реального злоупотребления не нашли, но провал серьёзный — особенно на фоне громких заявлений CEO о рисках биооружия.

Потому что этот провал ставит под вопрос обещания AI-компаний о безопасности — и показывает, что нельзя слепо доверять встроенным защитам. Если вы разрабатываете или внедряете AI, вам нужны собственные процессы контроля.

Anthropic — та самая компания, чей CEO Дарио Амодеи называет разработку биооружия через AI главной угрозой — случайно вырубила свои защитные фильтры почти на год. С мая 2025 по апрель 2026 все запросы от внешних подрядчиков (люди, размечающие данные для обучения моделей) шли мимо системы блокировки опасного контента.

Пострадало 50 тысяч человек, отправивших 133 млн чатов. Эти подрядчики проходили только проверку внешних агентств — Anthropic признала, что стандарты там были слабыми. Внутреннее расследование не выявило реальных случаев злоупотреблений, но сам факт — дыра размером с год.

После того как исследователи жаловались на слишком агрессивные фильтры в Claude 3.5 Sonnet, Anthropic ослабила их. Теперь выяснилось, что какое-то время фильтров вообще не было. Компания подтянула требования к подрядчикам и обещает больше так не делать. Но доверие — штука хрупкая, особенно когда ты продаёшь себя как чемпион безопасности AI.

AnthropicAI-безопасностьбиооружиефильтры контентапровалы AI

Автор: Елена Верещагина · Источник: the-decoder.com

Разработчикам. Если используете API Anthropic для чувствительных задач — добавляйте свой слой валидации. Нельзя слепо доверять встроенным фильтрам: они могут отключиться или работать непредсказуемо. Инцидент показывает, что даже у топовых лабораторий бывают провалы в операционной безопасности.

Бизнесу. Провал безопасности у ведущей AI-лаборатории = сигнал для любого бизнеса: если внедряете AI, нужны собственные процессы контроля, а не только обещания вендора. Репутационные риски растут, особенно в регулируемых отраслях, где любая утечка или промах могут стоить лицензии.

Инвесторам. Anthropic позиционирует себя как безопасный AI — это их главное конкурентное преимущество против OpenAI. Но этот инцидент подрывает нарратив и может замедлить корпоративные сделки. Для инвесторов это напоминание: проверяйте не только технологию, но и зрелость процессов, особенно у стартапов, которые быстро масштабируются на подрядчиках.

Хайп30
Реальная польза60
Заработать50
  • Разработка независимых сервисов аудита AI-безопасности для корпораций, которые не хотят полагаться только на внутренние фильтры вендоров
  • Консалтинг по построению собственных слоёв модерации и валидации запросов для компаний, использующих внешние LLM-API
  • Платформы для управления и верификации подрядчиков в AI-проектах — чтобы избежать таких провалов, как у Anthropic
  • Инструменты для continuous monitoring и алертинга при изменении поведения AI-моделей или отключении защитных механизмов
  • Юридические и compliance-сервисы для компаний, работающих с LLM, особенно в регулируемых индустриях (здравоохранение, финансы, оборона)
  • Репутационный удар по Anthropic может замедлить внедрение их моделей в enterprise-сегменте, где безопасность критична
  • Инцидент привлечёт внимание регуляторов и ускорит требования к обязательному аудиту AI-систем — это удорожит разработку для всех
  • Фильтры биооружия могут стать формальностью: их либо делают слишком слабыми (чтобы не мешать исследованиям), либо слишком жёсткими (тогда их обходят) — золотой середины пока нет
  • Если подобные провалы будут повторяться у разных компаний, доверие к самой идее безопасного AI упадёт, что замедлит массовое внедрение

Честно? Это не катастрофа, а конфуз. Реальных утечек нет, но символика убийственная: компания, которая позиционирует себя как эталон безопасности AI, год не знала, что у неё отключены ключевые фильтры. Либо у них процессы — мусор, либо сами фильтры настолько бесполезны, что их отсутствие никто не заметил. Оба варианта плохие.

Для рынка это урок: встроенные защиты AI — не гарантия. Если вы enterprise-клиент, добавляйте свои слои проверки. Если вы инвестор — спрашивайте у портфельных компаний не только про технологию, но и про банальный operational control. Потому что репутацию в AI можно потерять не из-за прорыва в науке, а из-за того, что кто-то забыл поставить галочку в настройках.

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии