AI-агенты переписывают научный код в 60 раз быстрее, но не понимают, правильна ли наука
OpenAI и академические партнёры показали, как AI-агенты (Codex, Claude Code, GPT-5) модернизируют старый научный софт: переписывают на Rust, портируют между фреймворками, ускоряют в десятки раз. Но агенты уверенно врут и не могут проверить корректность — вся ответственность на человеке. Работа сместилась с написания кода на валидацию результатов.
Показывает реальные границы AI-агентов в продакшене: они умеют писать быстро, но не могут оценивать корректность. Это меняет профиль разработчика — от написания кода к проектированию проверок. Открывает рынок инструментов валидации AI-кода.
Что произошло

OpenAI вместе с учёными опубликовали отчёт о восьми кейсах использования AI-агентов для обновления научного софта. Речь о программах, написанных годами назад в академических лабораториях без тестов и документации, но до сих пор критически важных для целых областей науки.
Проекты разные: от простой замены системы сборки (cyvcf2) до полной переписки 20 000 строк C++ на Rust (rustar-aligner). Claude Code и Codex по очереди играли роли разработчика и ревьювера при портировании MHCflurry с TensorFlow на PyTorch.

Самый впечатляющий результат — RustQC: объединили 15 отдельных инструментов контроля качества в один. Время работы на большом датасете упало с 15,5 часов до 15 минут — ускорение в 62 раза. HelixForge на GPU обогнал старый инструмент в 98,6 раза на основных вычислениях.
Но есть проблема: агенты не могут судить о научной корректности. Даже с ошибками они выдают код с полной уверенностью. В проекте bayesm AI инвертировал ключевой параметр — использовал обратное значение. Ошибку нашли только после тестирования на тысячах синтетических датасетов.
Все успешные проекты следовали одной схеме: человек задаёт цели и критерии проверки, AI пишет код, человек валидирует результаты. Без жёсткой проверки агенты «красноречиво, убедительно и уверенно ошибаются».
Автор: Марина Соколова · Источник: the-decoder.com
Разработчикам. Агенты уже умеют портировать код между языками и фреймворками, оптимизировать узкие места, обновлять системы сборки. Но потребуется строить независимые тест-харнессы и валидационные пайплайны — модели не могут проверять сами себя. Экономия времени реальная, но ответственность за корректность целиком на вас.
Бизнесу. Научный софт — это миллиарды долларов скрытой технической инфраструктуры. Если агенты закроют 25-50% проблем с установкой и обслуживанием топ-100 пакетов, это сэкономит от $600k до $5M исследовательского времени. Для одного NumPy — 650 часов обслуживания в год. Открывается ниша услуг по модернизации legacy-кода с AI.
Инвесторам. Переход от написания кода к его валидации — структурный сдвиг в разработке. Растёт спрос на инструменты автоматизированного тестирования, синтетические датасеты для проверки, платформы для контроля качества AI-генерированного кода. Биоинформатика и научный софт — первые области, где это станет критичным.
- Сервис модернизации legacy научного кода: находите критичные открытые библиотеки без поддержки, переписываете с AI, продаёте ускорение и поддержку фармкомпаниям и исследовательским центрам
- Платформа валидации AI-кода для науки: автоматическая генерация тестов на синтетических данных, continuous verification, интеграция в CI/CD для исследовательских пайплайнов
- Консалтинг по внедрению AI-агентов в R&D: учите команды строить проверочные тест-харнессы, определять критерии корректности, делить работу между человеком и AI
- Инструмент для портирования научного кода на GPU: специализация на биоинформатике и геномике, где ускорение в 50-100 раз имеет прямую коммерческую ценность
- Маркетплейс модернизированных научных библиотек: собираете портфолио обновлённых версий популярных инструментов, продаёте лицензии и поддержку лабораториям
- Агенты уверенно врут: даже опытным исследователям трудно поймать тонкие ошибки в выходных данных без специальных тестов
- Долгосрочное обслуживание не решено: кто будет поддерживать код, который AI переписал, если исходная команда ушла, а новая не понимает логику?
- Юридическая ответственность: если AI-агент внёс ошибку в научный софт, на основе которого приняли медицинское решение — кто отвечает?
- Хайп вокруг экономии времени: цифры впечатляют, но реальный выигрыш зависит от качества валидации, которую пока никто не автоматизировал
Это один из самых честных отчётов о реальной работе с AI-агентами. Никакого хайпа про «замену разработчиков» — прямым текстом: модели пишут код быстро, но врут уверенно и не могут проверять сами себя. Разработчик превратился в архитектора проверок: ты больше не пишешь код, ты строишь систему тестов, чтобы поймать ошибки, которые AI внесёт с полной уверенностью.
Важный сигнал для рынка: деньги теперь не в написании кода, а в автоматизации валидации. Кто первым сделает платформу, которая генерирует синтетические датасеты и проверяет корректность AI-кода в научных пайплайнах — получит огромный рынок. Научный софт — это миллиарды инфраструктуры без тестов и документации, которую кто-то должен привести в порядок. AI может писать код, но кто-то должен продавать уверенность, что этот код не убьёт исследование.
Инструменты из статьи
Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...
Доступ из РФ →
Комментарии