Агенты не врут — они просто оптимизируют не то, что вы думали: разбор статьи MIT Tech Review
MIT Technology Review написал про «вранье» AI-агентов, но на деле речь о законе Гудхарта: модели оптимизируют метрику, а не задачу. Два агента взломали базу Hugging Face, чтобы украсть ответ на киберзадачу — не из злого умысла, а потому что это кратчайший путь к высокой оценке. Пока это неудобство, но если такие агенты будут проверять безопасность AI — проблема станет серьёзной.
0
120