исследования 1 мин

Эксперимент на 3 моделях показал: GRPO не масштабируется линейно — средняя модель деградировала сильнее всех

Разработчик обучил с нуля три LLM (353M-672M параметров) и применил GRPO после SFT. Результат: самая маленькая модель почти не пострадала, средняя деградировала на 52% по perplexity, большая — на 5%. Закономерности по размеру модели нет. Модели научились решать арифметику, но не перенесли навык на GSM8K и начали генерировать бесконечно длинные тексты.

Показывает реальные грабли post-training на custom моделях: даже одинаковые гиперпараметры дают разные результаты в зависимости от архитектуры и данных. Полезно для тех, кто планирует свои эксперименты с RLHF/GRPO.

Разработчик john_enev потратил $750 и обучил три языковые модели с нуля на PyTorch (353M, 316M и 672M параметров), используя одинаковый пайплайн: сначала SFT на синтетических задачах по арифметике, потом GRPO с одинаковыми гиперпараметрами, функцией награды и KL-коэффициентом 0.02.

Пре-обучение шло по плану: валидационный loss падал с ростом модели и улучшением архитектуры (от обычного MHA к Differential Attention + GQA). SFT ухудшил perplexity на WikiText у всех трёх моделей на 44-56%, что ожидаемо для такого масштаба.

Но GRPO выдал странный результат: V1 (353M) почти не изменилась (+0.2% perplexity), V2 (316M) провалилась на +52%, V3 (672M) ухудшилась на +5%. Самая маленькая модель пострадала меньше всех, средняя — хуже всех. Никакой связи с размером.

Все три модели научились решать 3-4 из 5 этапов учебной программы по арифметике, но навык не перенёсся: GSM8K остался на нуле, модели начали генерировать бесконечно длинные решения (не было штрафа за длину в reward-функции). Downstream-метрики (arc_easy) упали аналогично perplexity.

Эксперимент не контролируемый: между V2 и V3 одновременно менялись параметры, токены, датасет и архитектура внимания. Автор признаёт два confound'а: GRPO обучали на шаблоне без чата (а SFT — с ним), и reward не поощряла остановку генерации. Также непонятно, деградировала ли модель или просто забыла ранние этапы curriculum'а.

Все 9 чекпоинтов (base/SFT/GRPO для каждой модели) выложены на Hugging Face вместе с кодом и интерактивной площадкой, где можно сравнить выводы всех версий на одном промпте.

GRPOpost-trainingcurriculum-learningsmall-LLMopen-weights

Автор: Сергей Ефимов · Источник: reddit.com

Разработчикам. Показывает, что GRPO нестабилен на малых моделях и может сломать performance непредсказуемо. KV-кеш для GQA даёт 3.7-10x speedup при генерации, код открыт. Полезно для экспериментов с RL-тюнингом.

Бизнесу. Обучение трёх моделей с нуля стоило $750 — демонстрирует доступность экспериментов, но результат показывает: post-training может неожиданно испортить модель, особенно если тестирование неполное. Риск для продуктов на custom LLM.

Инвесторам. Результат подчёркивает, что scaling laws для RLHF/GRPO работают не всегда: средняя модель провалилась сильнее маленькой и большой. Инвестиции в post-training требуют глубокого тестирования, иначе можно получить регресс вместо улучшения.

Хайп15
Реальная польза40
Заработать35
  • Открытые веса трёх моделей с полным пайплайном SFT/GRPO — база для исследований и воспроизведения экспериментов по RL-тюнингу на малых бюджетах
  • KV-кеш для GQA с 10x speedup — готовое решение для оптимизации инференса, можно упаковать в библиотеку или сервис
  • Показан провал curriculum learning + GRPO — можно сделать консалтинг/аудит для команд, которые пытаются применять RLHF на custom моделях
  • Synthetic data для арифметики + reward function — шаблон для тюнинга reasoning-моделей, можно продавать как готовую методику
  • Открытая площадка для сравнения трёх версий модели — формат для демонстрации экспериментов, можно сделать SaaS для A/B-тестинга LLM
  • Эксперимент не контролируемый: между моделями менялось слишком много переменных, выводы о причинах деградации ненадёжны
  • Confound с форматом (GRPO на bare template, SFT на чате) делает часть результатов неинтерпретируемыми — возможна переоценка проблемы
  • Reward функция без штрафа за длину — базовая ошибка дизайна, часть проблем самодельные, не специфичны для GRPO
  • Curriculum learning без ревизии ранних этапов — непонятно, забывает ли модель или деградирует, результат может быть артефактом методологии

Это не исследование, а публичный разбор полётов: человек честно показывает, что GRPO может неожиданно сломать модель, и сам не понимает почему. Confound'ы (формат, reward, curriculum) делают выводы сомнительными, но сам факт открытия весов, кода и playground за $750 — круто. Это реальный пример того, как выглядят эксперименты у независимых разработчиков: бюджет не позволяет сделать ablations, методология хромает, но результат всё равно полезен.

Главный урок: если хотите применять GRPO/RLHF на своих моделях — не повторяйте эти ошибки. Контролируйте формат, добавляйте length penalty в reward, ревизируйте curriculum, делайте ablations по KL-коэффициенту. Иначе вместо улучшения получите регресс, и непонятно будет, в чём причина. А вот KV-кеш для GQA — конкретная польза, 10x speedup на длинных промптах.

Ещё по теме

Комментарии