ИИ начал выполнять реальную работу экспертов — и почти догнал людей
OpenAI протестировала новые модели на задачах, которые занимают у экспертов с 14-летним опытом 4–7 часов. ИИ почти сравнялся с людьми, проигрывая в основном из-за форматирования, а не из-за ошибок по сути. Claude Sonnet 4.5 самостоятельно воспроизвёл результаты сложного экономического исследования — задача, которая у человека заняла бы часы и могла бы решить кризис воспроизводимости в науке.