ИИ переписал 61 000 строк кода за $251 и управил роботом за 9 минут вместо 3 часов
Epoch и METR выпустили бенчмарк MirrorCode, где Claude Opus 4.7 переписал программу на 61 тыс. строк за 14 часов ($251), тогда как человеку понадобилось бы 2-17 недель. Другой тест Anthropic: новая модель автономно справилась с задачами для робота за 9 минут — годом ранее человеку требовалось 181 минуту. Вывод: масштабирование моделей общего назначения автоматически улучшает специализированные навыки — от кодинга до робототехники.
Это прямое доказательство, что большие универсальные модели решают специализированные задачи (кодинг, робототехника) без дополнительного обучения. Если тренд сохранится, следующее поколение моделей может автоматизировать задачи, требующие недель работы, и сделать роботов массово применимыми — просто за счёт роста «общего интеллекта».
ИИ переписывает программы без исходников
Epoch AI и METR представили MirrorCode — бенчмарк для оценки способности ИИ выполнять долгосрочные задачи программирования. Модель получает доступ только к командной строке готовой программы (без кода и интернета) и должна написать её с нуля, основываясь на поведении.
Результаты впечатляют: - Claude Opus 4.7 за 14 часов ($251) переписал pkl от Apple — 61 тыс. строк кода. По оценкам, человеку понадобилось бы 2-17 недель. - Из 25 программ 17 были решены на 100%, ещё 4 — на 99%+. Модели справились с программами размером до 87 тыс. строк на разных языках. - Самые сложные задачи: Python-линтер ruff, математический пакет giac_subset, библиотека mailauth.
Масштабирование разблокирует робототехнику
Anthropic показала побочный эффект роста интеллекта моделей на примере проекта Fetch:
- Август 2025: Claude Opus 4.1 не справляется с задачами для четвероногого робота. Человек с помощью модели выполняет набор задач за 181 минуту.
- Май 2026: Opus 4.7 автономно выполняет те же задачи за 9 минут 35 секунд (не смог лишь вернуть мяч в стартовую позицию — с этим и люди мучились).
Ключевой момент: модель не обучали специально для робототехники. Улучшение — прямое следствие общего масштабирования.
«Горький урок» в действии
Оба эксперимента иллюстрируют классический принцип AI: универсальное масштабирование эффективнее узкой специализации. Модели научились самостоятельно понимать структуру программ через ввод-вывод и управлять роботами без специальной настройки.
Вывод Anthropic: "Эти улучшения, как и многие другие в истории LLM, возникли из гораздо более общего масштабирования".
Что дальше?
MirrorCode опубликован (22 из 25 программ, 132 задачи на 6 языках). Способность моделей "обратно конструировать" сложные системы через чёрный ящик поднимает вопрос: смогут ли сверхумные агенты воссоздать нашу промышленную цивилизацию, просто взаимодействуя с её артефактами?
Ключевые выводы
- ИИ переписывает десятки тысяч строк кода за часы вместо недель, имея доступ только к CLI программы
- Масштабирование общих моделей автоматически улучшает узкоспециализированные навыки (кодинг, робототехника) без целевого обучения
- За год производительность робота с ИИ выросла в 20 раз (181 мин → 9 мин) просто из-за более умной модели
- 8 из 25 программ MirrorCode всё ещё не решены идеально — есть предел текущих моделей
- Способность ИИ реконструировать системы через ввод-вывод может позволить агентам самостоятельно воспроизводить технологии
Автор: Ксения Лаврова · Источник: importai.substack.com
Два эксперимента из Import AI — это учебник по «горькому уроку» AI в действии. Вместо тонкой настройки под задачу просто взяли и накачали модель интеллектом — результат: кодинг ускорился в разы, робот поумнел в 20 раз. Причём Anthropic честно признаётся: "Мы вообще не пытались улучшить робототехнику, это побочка от скейлинга".
Что настораживает: если модель может реверс-инжинирить 87-тысячную программу, просто "потыкав" её через терминал, то что мешает ей так же разобрать наш мир? В MirrorCode 8 задач всё ещё не решены — но это вопрос времени. Бизнес-вывод простой: узкая специализация AI-решений теряет смысл, когда GPT-next-gen сделает то же самое out-of-the-box. Ставка на фронтир-модели, а не на костыли.
Комментарии