Эксперимент показал: LLM-скоринг резюме — это лотерея, а не bias
Разработчик переделал исследование LLM-скоринга резюме после критики методологии. Новые тесты на 4800+ прогонах показали: большую часть «предвзятости» создаёт случайный шум, а не реальная дискриминация. Изменение цвета машины в резюме влияет на оценку почти так же, как смена имени или вуза — модели просто нестабильны.
Если планируешь использовать LLM для оценки людей (резюме, код-ревью, модерация), это исследование показывает критичные ограничения технологии: модели нестабильны на уровне, который делает их решения ненадёжными и юридически опасными.
Что произошло
Разработчик провёл серию экспериментов с LLM-скорингом резюме после того, как коммьюнити Reddit раскритиковало его первое исследование. В оригинале 45% разницы в оценках приписали предвзятости моделей. Три пользователя указали на методологические проблемы — и автор проверил каждую гипотезу:
Тест 1 (320 прогонов): пересадка обоснований из позитивных оценок в негативные и обратно. Результат: баллы сдвигаются в сторону чужого reasoning в 99.7% случаев. Но базовая нестабильность моделей оказалась огромной — большая часть «bias» из первого исследования была просто шумом.
Тест 2 (4800 прогонов): перенос поля Score в конец схемы промпта не снизил дисперсию, а увеличил долю противоречивых решений (нанять/не нанять) с 33% до 54%. «Слепые» инструкции тоже не помогли.
Тест 3 (4165 прогонов): изменение незначимых деталей (цвет машины в резюме) сдвигает оценки почти так же сильно, как смена имени или университета (0.328 против 0.362 балла). Модели никогда не упоминали цвет машины в reasoning, но оценка всё равно менялась.
Выяснилось, что у разных обёрток API разные системные промпты: CLI-версия Claude добавляет скрытый system prompt, который сдвигает оценки на 0.247 балла — это 88% от всего «демографического сигнала». Вывод: бенчмарки не переносятся между интерфейсами.
Автор: Артём Ковалёв · Источник: reddit.com
Разработчикам. Если строишь HR-инструмент на LLM, учитывай базовую нестабильность: одно и то же резюме может получить разные баллы даже при незначимых правках. Wrapper API (CLI vs библиотека) тоже влияет на результаты из-за скрытых system prompts. Нужны многократные прогоны и усреднение, а не одиночные вызовы.
Бизнесу. LLM-скоринг резюме пока не готов для продакшна: модели слишком нестабильны, чтобы гарантировать справедливую оценку кандидатов. Если используешь такие решения, готовься к юридическим рискам и репутационным проблемам — случайный шум легко выдаст себя за дискриминацию.
Инвесторам. HR-tech на LLM выглядит хайпово, но сырьё: базовая нестабильность моделей создаёт огромные compliance-риски. До решения этой проблемы масштабные внедрения в enterprise маловероятны. Зато появляется ниша для стартапов, которые обеспечат stability layer поверх LLM.
- Стартап-обёртка для HR-LLM с системой multi-run averaging и детекцией аномальных сдвигов оценок — решение проблемы нестабильности
- Аудит-инструмент для оценки fairness LLM-систем: генерация синтетических резюме с плацебо-правками для проверки моделей
- Консалтинг по compliance для компаний, внедряющих AI-рекрутинг: документирование рисков и защита от судебных исков
- Альтернативный подход: вместо скоринга резюме делать LLM-помощник для рекрутеров, который подсвечивает факты, но не выносит итоговые оценки
- Юридические иски за дискриминацию, если компания использует нестабильную LLM-систему для найма
- Переоценка зрелости LLM для критичных решений: исследование показывает, что модели пока не готовы работать в HR без человека
- Репутационные риски: публичный скандал из-за абсурдных критериев вроде цвета машины в резюме похоронит продукт
- Техническая ловушка: разные API-обёртки дают разные результаты, что делает A/B-тесты и бенчмарки ненадёжными
Это одно из самых трезвых исследований LLM в HR, которое я видел. Автор честно признал ошибки и перепроверил методологию — редкость в эпоху AI-хайпа. Результат неутешителен: модели слишком нестабильны для критичных решений о людях. Да, reasoning выглядит убедительно, но под капотом — лотерея. Особенно показательна деталь про API-обёртки: CLI-версия Claude незаметно добавляет системный промпт, который сдвигает оценки на 88% от всего демографического сигнала. Это значит, что любой бенчмарк LLM-fairness может быть артефактом конкретной обёртки.
Для рынка HR-tech это холодный душ: инвесторы вливают деньги в стартапы, обещающие AI-рекрутинг, но технология пока не дозрела. Если используешь LLM для найма, готовься к судам и скандалам. Реальная возможность здесь — не полная автоматизация, а ассистенты для рекрутеров, которые подсвечивают факты, но не принимают итоговых решений. Пока LLM не научатся стабильности, доверять им судьбы людей рано.
Инструменты из статьи
AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...
Доступ из РФ →
Комментарии