исследования 1 мин

Эксперимент показал: LLM-скоринг резюме — это лотерея, а не bias

Разработчик переделал исследование LLM-скоринга резюме после критики методологии. Новые тесты на 4800+ прогонах показали: большую часть «предвзятости» создаёт случайный шум, а не реальная дискриминация. Изменение цвета машины в резюме влияет на оценку почти так же, как смена имени или вуза — модели просто нестабильны.

Если планируешь использовать LLM для оценки людей (резюме, код-ревью, модерация), это исследование показывает критичные ограничения технологии: модели нестабильны на уровне, который делает их решения ненадёжными и юридически опасными.

Что произошло

Разработчик провёл серию экспериментов с LLM-скорингом резюме после того, как коммьюнити Reddit раскритиковало его первое исследование. В оригинале 45% разницы в оценках приписали предвзятости моделей. Три пользователя указали на методологические проблемы — и автор проверил каждую гипотезу:

Тест 1 (320 прогонов): пересадка обоснований из позитивных оценок в негативные и обратно. Результат: баллы сдвигаются в сторону чужого reasoning в 99.7% случаев. Но базовая нестабильность моделей оказалась огромной — большая часть «bias» из первого исследования была просто шумом.

Тест 2 (4800 прогонов): перенос поля Score в конец схемы промпта не снизил дисперсию, а увеличил долю противоречивых решений (нанять/не нанять) с 33% до 54%. «Слепые» инструкции тоже не помогли.

Тест 3 (4165 прогонов): изменение незначимых деталей (цвет машины в резюме) сдвигает оценки почти так же сильно, как смена имени или университета (0.328 против 0.362 балла). Модели никогда не упоминали цвет машины в reasoning, но оценка всё равно менялась.

Выяснилось, что у разных обёрток API разные системные промпты: CLI-версия Claude добавляет скрытый system prompt, который сдвигает оценки на 0.247 балла — это 88% от всего «демографического сигнала». Вывод: бенчмарки не переносятся между интерфейсами.

LLMbiasHRисследованиянестабильность

Автор: Артём Ковалёв · Источник: reddit.com

Разработчикам. Если строишь HR-инструмент на LLM, учитывай базовую нестабильность: одно и то же резюме может получить разные баллы даже при незначимых правках. Wrapper API (CLI vs библиотека) тоже влияет на результаты из-за скрытых system prompts. Нужны многократные прогоны и усреднение, а не одиночные вызовы.

Бизнесу. LLM-скоринг резюме пока не готов для продакшна: модели слишком нестабильны, чтобы гарантировать справедливую оценку кандидатов. Если используешь такие решения, готовься к юридическим рискам и репутационным проблемам — случайный шум легко выдаст себя за дискриминацию.

Инвесторам. HR-tech на LLM выглядит хайпово, но сырьё: базовая нестабильность моделей создаёт огромные compliance-риски. До решения этой проблемы масштабные внедрения в enterprise маловероятны. Зато появляется ниша для стартапов, которые обеспечат stability layer поверх LLM.

Хайп25
Реальная польза72
Заработать58
  • Стартап-обёртка для HR-LLM с системой multi-run averaging и детекцией аномальных сдвигов оценок — решение проблемы нестабильности
  • Аудит-инструмент для оценки fairness LLM-систем: генерация синтетических резюме с плацебо-правками для проверки моделей
  • Консалтинг по compliance для компаний, внедряющих AI-рекрутинг: документирование рисков и защита от судебных исков
  • Альтернативный подход: вместо скоринга резюме делать LLM-помощник для рекрутеров, который подсвечивает факты, но не выносит итоговые оценки
  • Юридические иски за дискриминацию, если компания использует нестабильную LLM-систему для найма
  • Переоценка зрелости LLM для критичных решений: исследование показывает, что модели пока не готовы работать в HR без человека
  • Репутационные риски: публичный скандал из-за абсурдных критериев вроде цвета машины в резюме похоронит продукт
  • Техническая ловушка: разные API-обёртки дают разные результаты, что делает A/B-тесты и бенчмарки ненадёжными

Это одно из самых трезвых исследований LLM в HR, которое я видел. Автор честно признал ошибки и перепроверил методологию — редкость в эпоху AI-хайпа. Результат неутешителен: модели слишком нестабильны для критичных решений о людях. Да, reasoning выглядит убедительно, но под капотом — лотерея. Особенно показательна деталь про API-обёртки: CLI-версия Claude незаметно добавляет системный промпт, который сдвигает оценки на 88% от всего демографического сигнала. Это значит, что любой бенчмарк LLM-fairness может быть артефактом конкретной обёртки.

Для рынка HR-tech это холодный душ: инвесторы вливают деньги в стартапы, обещающие AI-рекрутинг, но технология пока не дозрела. Если используешь LLM для найма, готовься к судам и скандалам. Реальная возможность здесь — не полная автоматизация, а ассистенты для рекрутеров, которые подсвечивают факты, но не принимают итоговых решений. Пока LLM не научатся стабильности, доверять им судьбы людей рано.

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Ещё по теме

Комментарии