Тесты безопасности устаревают быстрее, чем модели
Бенчмарк по безопасности ИИ может давать воспроизводимые результаты и при этом быть бесполезным для принятия решений. Его срок годности определяется не датой релиза модели, а скоростью изменения контекста: определения рисков, паттернов атак, способов использования и окружающей системы.
Исследователям и компаниям, которые принимают решения на основе safety-бенчмарков: статья объясняет, почему стабильная оценка — не гарантия актуальности, и какие компоненты теста нужно отслеживать во времени.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Бенчмарк устаревает не когда ломается код, а когда его оценка перестаёт отвечать на актуальный вопрос о безопасности
- Узкое определение риска приводит к оптимизации не в ту сторону — например, модель начинает отказывать на безобидные запросы ради высокого скора
- Публичные тесты влияют на то, что измеряют: данные попадают в обучение, разработчики подстраивают защиту под известные примеры
- Динамические бенчмарки (Dynabench, LiveBench) решают проблему устаревания частично, но вводят новые сложности с интерпретацией и масштабированием
Елена Верещагина
Medium #llm
Читать оригинал
Комментарии