OpenAI представила Astra — модель решила 10 задач, над которыми математики бились десятилетиями
OpenAI официально анонсировала Astra — новое семейство моделей, способных работать над задачами часами и днями. Внутренняя версия закрыла 10 открытых математических проблем, не решённых минимум 10 лет (а некоторые — намного дольше). Это прорыв в научном рассуждении AI, но до Millennium Prize Problems ($1M каждая) пока не дотянули. Все решения обошлись примерно в $2000 токенов.
Это первая публичная демонстрация AI, способного решать задачи, над которыми люди бились десятилетиями, за считанные доллары. Если технология масштабируется, это переворот в R&D, науке, проектировании — везде, где нужна долгая интеллектуальная работа.
Что произошло
OpenAI официально подтвердила имя Astra — новое семейство моделей, заточенных под долгие задачи (часы-дни работы, а не минуты). Внутренняя версия закрыла 10 открытых проблем в математике и теоретической информатике, над которыми не было прогресса минимум 10 лет. Среди решённых: вопрос о существовании non-sofic groups (теория групп), задачи в криптографии на решётках, квантовой сложности, экстремальной комбинаторике.
Все доказательства формализованы в Lean (машинно-проверяемые), стоимость генерации всех 10 решений — около $2000 по ценам API Sol. OpenAI опубликовала полный разбор рассуждений модели для каждой задачи.
Сэм Альтман показывал Astra политикам в Вашингтоне на этой неделе. Модель может координировать несколько агентов на протяжении долгого времени — ключевая фича для сложных проектов и науки. Пока неясно, выйдет ли это как GPT-6 или GPT-5.7, даты релиза нет. Система станет первой, которую проверят по новому AI-фреймворку администрации Трампа (обязательная подача в правительство перед релизом).
К марту 2028 OpenAI хочет полностью автономного AI-исследователя, к сентябрю 2025 — систему уровня research intern. Astra — кандидат.
Ключевой вопрос: сможет ли модель не накапливать ошибки в долгих задачах и самокорректироваться при росте контекста. Сейчас это главная слабость агентных систем. Мульти-агентные сетапы иногда хуже работают на связанных задачах из-за overhead координации.
Автор: Артём Ковалёв · Источник: the-decoder.com
Разработчикам. Появляется класс моделей для многочасовых задач с самокоррекцией и мульти-агентной координацией. Доказательства формализуются в Lean автоматически — можно встраивать в CI для верификации алгоритмов. Пока главная проблема — накопление ошибок в длинном контексте, но направление ясное.
Бизнесу. Открываются ниши для AI-ассистентов в R&D, проектировании, юридических исследованиях — везде, где нужны дни работы над одной задачей. Стоимость сложных решений падает на порядки (10 математических прорывов за $2000). Но риск: мульти-агентные системы могут терять в производительности на связанных задачах.
Инвесторам. OpenAI строит новый класс моделей для научного рассуждения и автономных исследователей. К 2028 обещают полностью автономного AI-учёного. Это фундаментальный сдвиг, но требует кратного роста инфраструктуры и compute. Вопрос: успеет ли выручка за этим ростом.
- AI-powered R&D платформы для компаний: сдать модели долгую задачу (от оптимизации процессов до поиска патентов), получить решение за ночь вместо недель работы команды.
- Сервисы автоматической формализации и верификации кода/алгоритмов в Lean — для финтеха, крипты, критичных систем.
- AI research intern as a service: SaaS для научных лабораторий и стартапов, которым нужен дешёвый ассистент-исследователь уровня джуна (OpenAI обещает к сентябрю 2025).
- Вертикальные решения для сложных проектов (drug discovery, материаловедение, финмоделирование) — где нужна многодневная работа AI без человека в петле.
- Инструменты для проверки AI-генерированных доказательств и решений — спрос вырастет с ростом использования таких моделей в науке и бизнесе.
- Мульти-агентные системы могут проигрывать на связанных задачах из-за overhead и накопления ошибок — пока это нерешённая проблема.
- Нет гарантий, что модель не начнёт компаундить ошибки на длинных задачах при росте контекста — ключевой технический риск.
- Огромные требования к compute и инфраструктуре — если выручка OpenAI не успеет за планами, проект может затормозить.
- Новый регуляторный фреймворк Трампа (обязательная проверка моделей перед релизом) может затянуть выход на рынок и создать барьеры для конкурентов, но и для самой OpenAI.
Это действительно серьёзная веха — не потому что AI вдруг стал умнее математиков, а потому что он научился думать днями, а не секундами. 10 решённых задач — не случайность, это доказательство концепции нового класса систем. Но давайте без иллюзий: модель пока не тянет на Millennium Prize Problems ($1M каждая), и сам Noam Brown признаёт, что пробовали, не вышло.
Важнее другое: OpenAI впервые показала, что AI может работать автономно над сложной задачей без человека в петле, формализовать доказательства в Lean и не сходить с ума в длинном контексте. Пока что. Ключевой риск — накопление ошибок и координация агентов в долгих процессах. Если эту проблему решат — рынок AI-исследователей и автономных R&D-систем взлетит. Если нет — останется красивой демкой для регуляторов.
Комментарии