инструменты 1 мин

LLM не единственный инструмент для оценки качества AI-генерации

Автор сравнивает популярный подход «LLM как судья» с классическими ML-моделями на задаче детекции AI-сгенерированных текстов песен. Оказалось, что дотюненный BERT и даже простые модели превосходят фронтирные LLM в точности, скорости и стоимости.

ML-инженерам и продуктовым командам, которые используют LLM для оценки качества: статья показывает, что специализированные классические модели могут быть точнее, дешевле и удобнее в продакшене, чем универсальные LLM-судьи.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Файнтюненный BERT и Deep Averaging Network достигли macro-F1 ~0.99, обогнав все протестированные LLM-судьи (лучший результат у Gemini 3.5 Flash — 0.95)
  • Дешёвые LLM-судьи (Claude Haiku, GPT-4.1-nano, Gemini Flash Lite) показали F1 0.5–0.72, уступив даже XGBoost на структурных признаках (0.80) без доступа к словам
  • LLM-судьи склонны к дефолту «это человек» (GPT-4.1-nano пропускает 88% AI-текстов), тогда как обученные модели калиброваны и выдают вероятности для гибкой настройки порога
  • Стоимость одного прогона через LLM-судей ($0.97–2.74) vs $0 для локальных моделей становится критичной при частых перезапусках в CI/CD
evalLLM-as-judgeBERTклассический MLдетекция AI-текстов
Марина Соколова Medium #llm
Читать оригинал

Ещё по теме

Комментарии