#метрики качества

И исследования ·19 июл 2026

Почему «идеальное сжатие» AI-моделей может проваливать задачу — исследование 12 доменов с предсказаниями против реальности

Исследователь показал на 12 доменах (от радаров до языковых моделей): алгоритм сжатия, оптимальный по метрике восстановления данных, может проигрывать на реальной задаче другому методу с «худшим» восстановлением — потому что задача чувствительна к другим измерениям данных. Когда меняешь задачу — победитель меняется местами. Все предсказания зарегистрированы заранее, включая провалы.

0 19
И инструменты ·16 июл 2026

Почему высокий F1-score классификатора — ещё не повод расслабляться

Разработчик обучил multi-label классификатор для модерации Discord с micro F1 = 0.94, но детальный анализ показал проблемы: recall токсичных сообщений всего 78%, редкие классы не работают из-за дисбаланса в данных. Оказалось, что агрегированные метрики скрывают реальные провалы, а для продакшена нужно смотреть на precision/recall по каждому классу, правильно взвешивать потери и выбирать чекпоинт по macro F1.

0 200