Как повторные запуски выявляют нестабильность, скрытую за единичной демонстрацией
Одна успешная генерация языковой модели не гарантирует повторяемости результата. Статья показывает, что даже при «детерминированных» настройках (температура=0, фиксированный seed) модели выдают разные ответы на идентичные запросы из-за особенностей API, численной точности и конфигурации инфраструктуры.
Критически важно для всех, кто оценивает модели для продакшена или принимает решения на основе их выводов: единственный успешный результат не должен служить доказательством надёжности системы. Необходимы повторные запуски и разделение «средней успешности» от «стабильной успешности».
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Провайдеры моделей (Anthropic, Google Cloud) официально предупреждают: идентичные запросы могут давать разные результаты даже при temperature=0
- Исследование 2025 года обнаружило разброс точности до 15% между запусками, а разрыв между лучшим и худшим результатом достигал 70%
- Агрегированные метрики (например, стабильные 80% точности) могут скрывать нестабильность на уровне отдельных задач — модель отвечает правильно на разные 80 вопросов в разных запусках
- Причина нестабильности — не только семплирование, но и порядок вычислений с плавающей точкой, размер батча, количество GPU и их поколение
Артём Ковалёв
Medium #llm
Читать оригинал
Комментарии