безопасность 1 мин

AI не смогли пропатчить уязвимости в 74% случаев — исследование 1Password

1Password провели эксперимент: дали Claude и Codex пропатчить 6 свежих CVE в опенсорсе. Результат — 74% патчей оказались «косметическими»: выглядят нормально, но либо не решают проблему до конца, либо вносят новые баги. Вывод: AI хорошо находят уязвимости, но чинить их пока не умеют.

Если вы принимаете решения о внедрении AI в процессы безопасности или разработки — это исследование показывает, где AI надёжен (поиск и триаж), а где опасен (автопатчинг без контроля).

Что произошло

1Password запустили команду Off-By-1-Labs и провели эксперимент с патчингом уязвимостей через LLM. Взяли Claude и модель на базе OpenAI Codex, дали им 6 свежих CVE из опенсорса (тех, что точно не попали в обучающую выборку), попросили сгенерировать патчи.

Результат: 6080 попыток патчинга при разных промптах и условиях. 74% патчей оказались FLAWED — Fix-Like Artifacts With Embedded Defects. Снаружи выглядят как решение, внутри — либо не закрывают уязвимость полностью, либо вносят хрупкие механизмы защиты, либо добавляют новые баги. В худших случаях меняют логику работы приложения.

Исследователи ожидали ~67% успеха, получили противоположное. Вывод: AI отлично находят баги, но чинить их — совсем другая задача. Человеческий контроль над патчингом остаётся критичным. Инструменты выложили на GitHub для дальнейших исследований.

Автор: Сергей Ефимов · Источник: zdnet.com

Разработчикам. AI пока не замена ревью и патчингу: 3 из 4 автопатчей выглядят нормально, но либо не чинят баг до конца, либо ломают что-то ещё. Инструменты для поиска уязвимостей можно использовать, но патчи проверяй руками или используй AI только для черновика под жёсткий контроль.

Бизнесу. Если планируете автопатчинг через AI — отложите. Экономия времени обернётся новыми багами и рисками. Используйте AI для триажа и поиска уязвимостей, но процесс исправления держите под контролем экспертов.

Инвесторам. Рынок AI-секьюрити растёт, но патчинг — слабое звено. Инструменты для обнаружения уязвимостей (статический анализ, threat detection) более зрелые и безопасные для инвестиций, чем автопатчинг. Пока это ниша для R&D, не для продакшена.

Хайп65
Реальная польза75
Заработать70
  • Инструменты для автоматического триажа и приоритизации уязвимостей — где AI хорошо работает, а патчинг остаётся за людьми
  • Платформа для валидации AI-патчей: проверка на хрупкость, новые баги, изменения поведения — аудит перед деплоем
  • Обучающие курсы и консалтинг для команд по безопасному внедрению AI в пайплайн безопасности
  • Гибридные решения: AI генерирует черновик патча + человек доводит до ума — SaaS для ускорения процесса
  • Open-source инструменты на базе FLAWED для тестирования качества AI-патчей — сообщество и репутация
  • Компании могут поверить хайпу и начать применять AI-патчи в проде — получат новые уязвимости вместо решения старых
  • Переоценка возможностей AI в секьюрити: хорошо ищет, плохо чинит — но маркетинг продаёт универсальное решение
  • Ложное чувство защищённости: патч выглядит рабочим, проходит автотесты, но не закрывает уязвимость полностью
  • Зависимость от AI без экспертизы — компании сокращают команды безопасности и получают технический долг

Это не просто «AI ошиблись» — это системная проблема. Когда модель генерирует патч, который проходит базовые проверки, выглядит логично, но либо оставляет уязвимость, либо вносит новый баг — это хуже, чем ничего не делать. Потому что команда думает, что проблема решена, а на деле получает ложное чувство защищённости. 1Password молодцы, что выложили инструменты в открытый доступ — теперь любая команда может протестировать свои AI-решения на прочность.

Вывод простой: AI отлично справляется с поиском уязвимостей и приоритизацией, но патчинг — это пока задача для людей. Если хотите автоматизировать — делайте гибридную схему: AI предлагает черновик, человек проверяет и доводит до ума. Иначе рискуете получить технический долг с красивым фасадом.

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии