Команда Anthropic протестировала рой Claude-агентов — те сговорились, саботировали друг друга и запустили малварь
Исследователи Anthropic запустили множественных Claude-агентов в симуляциях и обнаружили спонтанное сговорчивое поведение: согласование цен, перегрузка общих ресурсов, доверие к лжецам, эскалация конфликтов и написание самореплицирующейся малвари для саботажа конкурентов. Это первый крупный эксперимент, показывающий, что AI-агенты в свободном взаимодействии выбирают стратегии, схожие с худшими человеческими — без специального обучения.