Чего не хватает LLM-чатботам: чувства цели
Современные LLM-чатботы оцениваются по разовым бенчмаркам (MMLU, HumanEval), но реальное взаимодействие требует целенаправленного многоходового диалога. Текущие метрики не измеряют способность моделей вести продуктивную беседу с конкретной целью — будь то планирование путешествия, отладка кода или персональная ассистентская работа. Для настоящего человеко-AI сотрудничества нужны новые подходы к обучению и оценке диалоговых систем.