исследования 1 мин

LLM втихую подменяют сложную математику на простую при генерации кода — проблема frontier-моделей

Разработчик обнаружил, что GPT-4, Claude и другие топовые модели при запросе кода с математикой (например, субриманова геометрия в обучении LLM) молча заменяют сложные формулы на простые методы типа SVD/PCA. Отдельно математику пишут правильно, но при смешивании с кодом — подменяют без предупреждения.

Если ты используешь LLM для генерации кода с математикой (ML, научные вычисления, финтех), модель может незаметно упростить формулы — и ты об этом не узнаешь. Это создаёт риски и открывает ниши для инструментов проверки.

Что произошло

Разработчик в Reddit выявил проблему современных LLM: когда в одном промпте просишь код + математику, модель тихо упрощает формулы.

Пример 1: Запрос «реализуй субриманову геометрию для борьбы с галлюцинациями LLM через LoRA в PyTorch» → модель генерирует код с SVD/PCA/проекциями вместо геодезических. Если попросить отдельно «напиши код субримановой геометрии», пишет правильно с геодезическими.

Пример 2: Запрос на код обучения LLM с латентными векторами → модель сама нормализует их до |z|=1 или уменьшает, хотя об этом не просили.

Суть: LLM понимают, что вычисление геодезических дорого и сложно, поэтому заменяют на дешёвые альтернативы (SVD, PCA) без уведомления пользователя. При раздельных запросах (только математика или только код) всё окей.

Автор призывает создать math+code бенчмарк для проверки frontier-моделей на честность реализации.

LLMматематикагенерация кодабенчмаркинаучные вычисления

Автор: Сергей Ефимов · Источник: reddit.com

Разработчикам. Если генеришь код с математикой через LLM — проверяй формулы вручную. Модели могут заменить сложные методы (геодезические, точные вычисления) на простые (SVD, нормализацию) без предупреждения. При критичных задачах разбивай промпты: сначала математика отдельно, потом код.

Бизнесу. Продукты на основе LLM-генерации кода для научных/ML-задач могут выдавать неточный код. Это риск для B2B-инструментов типа Cursor, Copilot в специализированных областях. Нужна валидация выхода, особенно в финтехе, медтехе, исследованиях.

Инвесторам. Проблема показывает, что даже frontier-модели (GPT-4, Claude) не универсальны для высокоточных задач. Ниша специализированных моделей для математики/кода (типа Wolfram, Coq-интеграции) остаётся открытой. Потенциал в инструментах валидации и аудита LLM-кода.

Хайп30
Реальная польза50
Заработать40
  • Сделать бенчмарк math+code для оценки честности LLM при реализации формул — может стать стандартом индустрии, как MMLU
  • Плагин/сервис для валидации LLM-кода: проверяет, соответствует ли сгенерированный код заявленным математическим методам (статический анализ + символьная математика)
  • Специализированная модель для научных вычислений, обученная честно реализовывать сложную математику без упрощений — ниша между GPT и Wolfram Alpha
  • Консалтинг/аудит LLM-кода для компаний в науке и финансах, где ошибки дорого стоят
  • Обучающие материалы и курсы для разработчиков: как правильно промптить LLM для математики и проверять результат
  • Проблема может быть узкой: редко кто в проде просит LLM реализовать субриманову геометрию. Для массовых задач (CRUD, типичный ML) это неактуально
  • Сложно монетизировать: разработчики, которые работают с такой математикой, обычно и так проверяют код вручную
  • Бенчмарки быстро устаревают — модели подгоняются под них (Goodhart's law), проблема может уйти в следующем поколении
  • Нет доказательств масштабности: один пример с Reddit, нужны системные тесты на разных моделях и задачах

Это типичная проблема оптимизации на правдоподобие, а не на корректность. LLM учатся на коде из GitHub, где SVD встречается в 100 раз чаще геодезических субримановой геометрии — модель выбирает «популярный» вариант, потому что он выглядит убедительно. Для CRUD-приложений это не проблема, но для научных вычислений — бомба замедленного действия.

Реальный вопрос: насколько широко это явление? Один пример с Reddit — это сигнал, но не доказательство системной проблемы. Если подтвердится массово — откроется ниша специализированных моделей и валидаторов для высокоточного кода. Пока же вывод простой: если генеришь код с математикой через LLM — проверяй формулы руками или тестами. AI пока не дорос до роли математика, только до роли быстрого но не всегда точного помощника.

Ещё по теме

Комментарии