исследования 1 мин

Могут ли открытые модели Kimi K3 и GLM повторить математические прорывы Claude и o3?

Пользователь Reddit предлагает провести эксперимент: запустить свежие открытые модели (Kimi K3, GLM) на локальных серверах без доступа к интернету и проверить, смогут ли они решить те же математические задачи и найти уязвимости в безопасности, что недавно продемонстрировали закрытые модели от OpenAI и Anthropic. Цель — понять, насколько реальные возможности open-source моделей близки к закрытым флагманам.

Это может ответить на ключевой вопрос: действительно ли возможности уровня «прорыв в математике» доступны открытым моделям, или это по-прежнему привилегия закрытых систем с огромными ресурсами. Если open-source модели справятся — это сдвиг в демократизации AI.

Вызов open-source сообществу

Пользователь Reddit поднял интересный вопрос: открытые модели становятся всё мощнее, но почему никто не пытается воспроизвести конкретные достижения закрытых систем?

Суть предложения: - Взять свежие открытые модели (Kimi K3, GLM) - Запустить на локальном кластере без доступа к интернету - Проверить, смогут ли они решить те же задачи, что недавно решили o3 и Claude

Тестовые задачи:

Математика: - Опровержение гипотезы в дискретной геометрии (o3 от OpenAI) - Решение 87-летней математической загадки (Claude)

Автор отмечает, что обе модели завершили обучение до публикации этих решений — значит, не могли запомнить ответы из данных.

Кибербезопасность: - Задачи, решённые Mythos от Anthropic - Использовать старые коммиты с GitHub (до исправления уязвимостей)

Условие: результаты должны проверить квалифицированные математики и эксперты по безопасности.

Зачем это нужно

Это не просто любопытство. Если открытые модели действительно могут повторить эти результаты, это меняет всю картину: прорывные возможности AI окажутся доступны широкому сообществу, а не только корпорациям.

Сейчас мы видим бенчмарки и демо, но мало кто проверяет, могут ли open-source модели решать конкретные задачи мирового уровня, которые уже решили закрытые системы.

Остаётся вопрос: есть ли у кого-то ресурсы и желание провести такой эксперимент?

Ключевые выводы

  • Открытые модели прогрессируют, но их редко тестируют на конкретных достижениях закрытых систем — в основном сравнивают бенчмарки
  • Изоляция от интернета при тесте критична: это исключит возможность модели найти готовые решения онлайн
  • Kimi K3 и GLM завершили обучение до публикации решений — теоретически могут решить задачи «с нуля»
  • Проверка квалифицированными экспертами необходима: AI может генерировать убедительно выглядящий, но неверный результат
  • Если эксперимент удастся, это докажет, что прорывные возможности AI доступны не только Big Tech

Автор: Ксения Лаврова · Источник: reddit.com

Мнение редакции

Вопрос автора звучит наивно, но бьёт в точку. Мы постоянно слышим про «прорывы» от OpenAI и Anthropic — решённые математические гипотезы, найденные 0-day уязвимости. Но кто проверял, могут ли открытые модели то же самое? Бенчмарки — это одно, а решить конкретную задачу мирового уровня — совсем другое.

Проблема в том, что такой эксперимент требует ресурсов (кластер для запуска), времени и экспертизы (математики/специалисты по безопасности для проверки). Но если кто-то его проведёт, результат будет важнее сотни бенчмарков: либо мы увидим, что open-source реально наступает на пятки закрытым моделям, либо поймём, что разрыв всё ещё огромен. Пока что закрытые лаборатории держат монополию на «wow-моменты» — и никто толком не проверяет, насколько она реальна.

Инструменты из статьи

Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...

Доступ из РФ →

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии