исследования 1 мин

Модель с точностью 35% обыграла рынок на 12%: когда калибровка важнее accuracy

Исследователь обучил модель предсказывать доходность акций S&P 500 на основе качественных факторов из 10-K отчётов. Точность — всего 35%, но топ-20 компаний по рангу модели принесли 20,6% годовых против 7,9% рынка. Главный урок: для инвестиционных решений важна калибровка и ранжирование, а не классическая accuracy. Второй сюрприз: добавление признаков ухудшило результат — слабые сигналы просто добавили шум.

Исследование демонстрирует, что для задач с ранжированием (инвестиции, рекомендации, приоритизация) корректная калибровка вероятностей важнее максимизации accuracy. Контринтуитивный результат о вреде лишних признаков напоминает: в реальных ML-проектах «больше данных» не всегда ведёт к улучшению, особенно при слабых или зашумлённых сигналах.

Когда 35% точности достаточно для победы

Исследователь провёл бэктест на акциях S&P 500 за 2014–2020 годы, оценивая компании по качественным факторам из годовых отчётов: конкурентное преимущество (moat), рыночная позиция, менеджмент, распределение капитала. Оценки делались «на момент времени» — модель видела только исторические данные, без survivorship bias.

Результат 1: ранжирование важнее accuracy

Модель угадала точный исход лишь в 35% случаев (базовая вероятность — 27%). Но топ-20 компаний по её рангу принесли 20,6% годовых, а худшие 20 — убыток, при среднерыночных 7,9%. Ключ — калибровка: вероятности модели коррелировали с реальными исходами, что позволило корректно ранжировать компании.

Brier score 0.181, калибровочная кривая идёт по диагонали. Для инвестиционной стратегии «отбери лучших и действуй» важна именно способность модели к правильному упорядочиванию, а не точность предсказания класса.

Результат 2: больше фичей = больше шума

Информационный выигрыш (information gain) упал с 0.107 на 6 декоррелированных признаках до 0.023 при использовании всех 16. Автор подчёркивает: это не избыточность или корреляция (они уже схлопнуты), а именно слабые сигналы, накапливающиеся как шум.

Ограничения

Автор честно признаёт: - Малая выборка (~250 компаний) - 12-летний горизонт - Нет учёта транзакционных издержек - Победивший сектор (полупроводники) виден в обучающих данных — модель показывает, что сработало, а не что можно было знать заранее - Риск «halo effect»: LLM-оценки могли быть смещены в сторону уже успешных компаний

Методика: кросс-валидация по тикерам (компания не попадает одновременно в train и test), предиктор — калибруемая база знаний без классического обучения, с пообъектной декомпозицией вклада фич.

Проект не претендует на торговую стратегию, а демонстрирует контринтуитивный принцип: для задач с ранжированием калибровка и ordering важнее raw accuracy.

Ключевые выводы

  • Калибровка и ранжирование критичнее точности для инвестиционных моделей: 35% accuracy дали 20,6% годовых у топовых компаний
  • Добавление признаков может ухудшить модель: слабые сигналы накапливаются как шум, снижая information gain с 0.107 до 0.023
  • Point-in-time бэктест без survivorship bias честнее, но не гарантирует прогнозную силу: успех полупроводников виден в обучающих данных
  • Brier score и калибровочные кривые — адекватные метрики для вероятностных моделей принятия решений
  • LLM-оценки качественных факторов рискуют эффектом ореола от уже успешных компаний

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

Это один из тех кейсов, где цифры выглядят провально (35% точности!), но реальная полезность модели — в другом измерении. Автор честно показывает: если твоя задача — отобрать топовых, то способность правильно упорядочить объекты по вероятности важнее, чем угадать точный класс. Калибровка и Brier score становятся ключевыми метриками, а не precision/recall.

Второй инсайт про вред лишних фич — классика, которую все знают, но регулярно забывают. Здесь автор аккуратно показал: это не про корреляцию (она учтена), а про слабые сигналы, которые просто добавляют шум. Честности добавляют открытые ограничения: малая выборка, видимость победившего сектора в данных, риск halo effect от LLM-оценок. Проект не про «вот вам альфа», а про методологию и метрики — в этом его ценность. Если строите ранжирующую модель, возьмите на заметку.

Ещё по теме

Комментарии