#GRPO

И исследования ·19 авг 2026

Эксперимент на 3 моделях показал: GRPO не масштабируется линейно — средняя модель деградировала сильнее всех

Разработчик обучил с нуля три LLM (353M-672M параметров) и применил GRPO после SFT. Результат: самая маленькая модель почти не пострадала, средняя деградировала на 52% по perplexity, большая — на 5%. Закономерности по размеру модели нет. Модели научились решать арифметику, но не перенесли навык на GSM8K и начали генерировать бесконечно длинные тексты.

0 93
И инструменты ·14 авг 2026

Как писать кастомные reward-функции для обучения Amazon Nova Forge с подкреплением

AWS опубликовала детальный гайд по написанию reward-функций для multi-turn reinforcement learning в Nova Forge. Главная мысль: в RL модель учится тому, что оценивает ваша reward-функция, и неправильный reward незаметно сломает обучение, даже если метрики выглядят нормально. Для сложных многоходовых задач AWS предлагает Bring Your Own Orchestration — запуск вашей логики награждения в собственном окружении.

0 81