исследования 1 мин

Математическая олимпиада показала: даже лучшие AI-модели буксуют без «костылей»

Исследователи протестировали разные LLM на задачах Международной математической олимпиады IMO-2026. Топовые модели (o1 и Claude 3.5) справились отлично, но «средний класс» вроде Opus и Sonnet показал слабый результат без специальных надстроек-оркестраторов. Даже с мультиагентными системами они не дотянули до фронтира. Главный вывод: сложная многошаговая логика — всё ещё слабое место для моделей ниже флагманского уровня.

Показывает реальную границу возможностей современных LLM: для сложных многошаговых задач разница между топовыми и обычными моделями огромна, и никакие надстройки её не компенсируют. Важно для понимания, где AI реально может заменить человека, а где — нет.

Зачем олимпиадная математика для AI

Задачи Международной математической олимпиады (IMO) — хороший тест для языковых моделей: они новые (не попали в обучающие данные), требуют многошаговых рассуждений и служат индикатором общего интеллекта.

Результаты тестирования

Исследователи из SignalPilot Labs протестировали разные модели на IMO-2026:

  • Фронтир-модели (GPT-o1, Claude 3.5 Opus) показали почти идеальный результат независимо от надстроек
  • Claude Sonnet и Opus без оркестратора провалились, с базовыми инструментами улучшились, а с мультиагентной системой AutoFyn — ещё сильнее, но до топа не дотянули
  • Open-source модель GLM показала уровень Sonnet без харнесса и аналогично улучшилась с AutoFyn

Галлюцинации никуда не делись

Проверку решений проводили вручную бывшие медалисты IMO и другая фронтир-модель. Были случаи ложных решений (например, Sonnet на задаче P3) — даже в математике, где легко проверить правильность, модели всё ещё выдают галлюцинации.

Провал на главной задаче

Самую сложную задачу P3 не решила ни одна модель ниже фронтира — даже при 20-часовом прогоне с оркестратором. Все застряли на одном и том же шаге, не сумев найти ключевую идею. Харнесс помогает с извлечением данных и проверкой, но не заменяет инсайты.

Что это значит

Разрыв между фронтиром и остальными моделями в сложных задачах остаётся огромным. Оркестраторы и мультиагентные системы помогают выжать максимум, но фундаментальные ограничения модели они не снимают.

Ключевые выводы

  • Фронтир-модели (o1, Claude 3.5 Opus) решают олимпиадную математику почти идеально даже без надстроек
  • Модели среднего уровня показывают плохой результат «из коробки», но улучшаются с мультиагентными оркестраторами — однако не догоняют фронтир
  • Галлюцинации сохраняются даже в математике — были случаи ложных решений при ручной проверке
  • Ключевая идея сложной задачи недоступна sub-frontier моделям: все застряли на одном месте, даже с 20-часовыми прогонами
  • Оркестраторы помогают с извлечением и верификацией, но не заменяют качество базовой модели

Автор: Сергей Ефимов · Источник: reddit.com

Мнение редакции

Исследование ценно тем, что показывает: шумиха вокруг «агентных систем» и оркестраторов часто преувеличена. Да, они помогают выжать больше из модели — но если базовая модель не дотягивает, никакие мультиагентные танцы не спасут. Разрыв между o1/Opus и всем остальным в сложных задачах — это не вопрос инженерии промптов, а фундаментальное отличие в архитектуре и обучении.

Особенно показательна задача P3: все модели ниже фронтира споткнулись об одно и то же место. Это как раз тот момент, когда нужен инсайт, а не механический перебор шагов. Для тех, кто выбирает модель под реальные задачи: если у вас сложная логика, многошаговые рассуждения и нужна надёжность — экономия на модели обойдётся дороже. Открытые веса типа GLM — интересный компромисс, но до топа им пока далеко.

Ещё по теме

Комментарии