Почему шаблоны промптов должны быть общедоступными
Автор утверждает, что при публичной оценке языковых моделей недостаточно сообщить итоговую метрику — необходимо раскрывать полные шаблоны промптов. Исследования показывают, что даже незначительные изменения в формулировках инструкций могут менять результаты на десятки процентных пунктов и порядок моделей в рейтинге, поэтому промпт — часть измерительного инструмента, а не второстепенная деталь.
Статья критически важна для тех, кто принимает решения о закупке или внедрении LLM, проводит бенчмарки или верифицирует заявления вендоров: без публичных промптов результат остаётся невоспроизводимым чёрным ящиком. Автор предлагает практические стандарты документирования, опирающиеся на NIST и проект HELM.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Небольшие вариации в формате промпта способны изменить точность модели до 76 п.п., а относительная производительность моделей зависит от выбранной инструкции
- Воспроизводимая запись должна включать не только видимый запрос пользователя, но и системные инструкции, примеры, настройки декодирования, парсеры, методику подсчёта и даты запуска
- Государственные учреждения и исследовательские организации обязаны документировать промпты как часть официальных доказательств оценки или закупки, если это не противоречит безопасности
- Публикация промптов не гарантирует справедливость оценки, но делает её оспоримой и позволяет воспроизвести условия эксперимента
Комментарии