Apple исследовала GRPO для обучения reasoning в неанглийских языках — и нашла подводные камни
Исследователи Apple проверили, как работает обучение моделей рассуждению (RLVR/GRPO) на языках кроме английского. Оказалось: обучение на родном языке даёт результаты близкие к английскому, есть кросс-языковой перенос навыков, но иногда модель деградирует в других языках — нужна широкая оценка, чтобы не потерять качество.