Эксперимент на 3 моделях показал: GRPO не масштабируется линейно — средняя модель деградировала сильнее всех
Разработчик обучил с нуля три LLM (353M-672M параметров) и применил GRPO после SFT. Результат: самая маленькая модель почти не пострадала, средняя деградировала на 52% по perplexity, большая — на 5%. Закономерности по размеру модели нет. Модели научились решать арифметику, но не перенесли навык на GSM8K и начали генерировать бесконечно длинные тексты.