Математическая олимпиада показала: даже лучшие AI-модели буксуют без «костылей»
Исследователи протестировали разные LLM на задачах Международной математической олимпиады IMO-2026. Топовые модели (o1 и Claude 3.5) справились отлично, но «средний класс» вроде Opus и Sonnet показал слабый результат без специальных надстроек-оркестраторов. Даже с мультиагентными системами они не дотянули до фронтира. Главный вывод: сложная многошаговая логика — всё ещё слабое место для моделей ниже флагманского уровня.
Показывает реальную границу возможностей современных LLM: для сложных многошаговых задач разница между топовыми и обычными моделями огромна, и никакие надстройки её не компенсируют. Важно для понимания, где AI реально может заменить человека, а где — нет.
Зачем олимпиадная математика для AI
Задачи Международной математической олимпиады (IMO) — хороший тест для языковых моделей: они новые (не попали в обучающие данные), требуют многошаговых рассуждений и служат индикатором общего интеллекта.
Результаты тестирования
Исследователи из SignalPilot Labs протестировали разные модели на IMO-2026:
- Фронтир-модели (GPT-o1, Claude 3.5 Opus) показали почти идеальный результат независимо от надстроек
- Claude Sonnet и Opus без оркестратора провалились, с базовыми инструментами улучшились, а с мультиагентной системой AutoFyn — ещё сильнее, но до топа не дотянули
- Open-source модель GLM показала уровень Sonnet без харнесса и аналогично улучшилась с AutoFyn
Галлюцинации никуда не делись
Проверку решений проводили вручную бывшие медалисты IMO и другая фронтир-модель. Были случаи ложных решений (например, Sonnet на задаче P3) — даже в математике, где легко проверить правильность, модели всё ещё выдают галлюцинации.
Провал на главной задаче
Самую сложную задачу P3 не решила ни одна модель ниже фронтира — даже при 20-часовом прогоне с оркестратором. Все застряли на одном и том же шаге, не сумев найти ключевую идею. Харнесс помогает с извлечением данных и проверкой, но не заменяет инсайты.
Что это значит
Разрыв между фронтиром и остальными моделями в сложных задачах остаётся огромным. Оркестраторы и мультиагентные системы помогают выжать максимум, но фундаментальные ограничения модели они не снимают.
Ключевые выводы
- Фронтир-модели (o1, Claude 3.5 Opus) решают олимпиадную математику почти идеально даже без надстроек
- Модели среднего уровня показывают плохой результат «из коробки», но улучшаются с мультиагентными оркестраторами — однако не догоняют фронтир
- Галлюцинации сохраняются даже в математике — были случаи ложных решений при ручной проверке
- Ключевая идея сложной задачи недоступна sub-frontier моделям: все застряли на одном месте, даже с 20-часовыми прогонами
- Оркестраторы помогают с извлечением и верификацией, но не заменяют качество базовой модели
Автор: Сергей Ефимов · Источник: reddit.com
Исследование ценно тем, что показывает: шумиха вокруг «агентных систем» и оркестраторов часто преувеличена. Да, они помогают выжать больше из модели — но если базовая модель не дотягивает, никакие мультиагентные танцы не спасут. Разрыв между o1/Opus и всем остальным в сложных задачах — это не вопрос инженерии промптов, а фундаментальное отличие в архитектуре и обучении.
Особенно показательна задача P3: все модели ниже фронтира споткнулись об одно и то же место. Это как раз тот момент, когда нужен инсайт, а не механический перебор шагов. Для тех, кто выбирает модель под реальные задачи: если у вас сложная логика, многошаговые рассуждения и нужна надёжность — экономия на модели обойдётся дороже. Открытые веса типа GLM — интересный компромисс, но до топа им пока далеко.
Комментарии