#post-training

И исследования ·19 авг 2026

Эксперимент на 3 моделях показал: GRPO не масштабируется линейно — средняя модель деградировала сильнее всех

Разработчик обучил с нуля три LLM (353M-672M параметров) и применил GRPO после SFT. Результат: самая маленькая модель почти не пострадала, средняя деградировала на 52% по perplexity, большая — на 5%. Закономерности по размеру модели нет. Модели научились решать арифметику, но не перенесли навык на GSM8K и начали генерировать бесконечно длинные тексты.

0 93
М модели ·14 авг 2026

GLM-5.3: как китайские лаборатории держат темп на фронтире AI

Zhipu AI выпустили GLM-5.3 — модель на ~750B параметров (втрое меньше Kimi K3), которая по кодингу догнала Claude Sonnet и GPT-4o. Секрет не в дистилляции, а в агрессивном post-training и скорости релизов: пока OpenAI и Anthropic месяцами тестируют модели, китайцы итерируются на бенчмарках в боевых условиях.

0 95
И исследования ·28 июл 2026

PIRL/PIPO: как научить ИИ проверять, помогло ли ему последнее обновление

Исследователи предложили PIRL — подход к обучению с подкреплением, при котором модель после каждого обновления проверяет, стала ли она реально лучше. Практическая реализация PIPO добавляет двухфазный цикл: сначала обновление по стандартному алгоритму (PPO, GRPO и др.), затем ретроспективная проверка — если шаг помог, его закрепляют, если навредил — корректируют. Эксперименты показали рост точности и стабильности на задачах математики, кода и использования инструментов.

0 126
И исследования ·31 июл 2026

Дерево решений как метафора оптимизации политики в LLM

Автор объясняет, как работает пост-тренинг больших языковых моделей через обучение с подкреплением (RL), используя наглядную аналогию с деревом решений. Статья показывает, как модель учится перераспределять вероятности между токенами, чтобы максимизировать ожидаемую награду, и почему алгоритмы TRPO и PPO обновляют политику небольшими шагами.

0 101
И инструменты ·2 авг 2026

NVIDIA выпустила Molt — фреймворк для обучения AI-агентов с подкреплением на 8600 строк кода

NVIDIA NeMo выпустила Molt — компактный RL-фреймворк для обучения AI-агентов. 8,6K строк против 62K у конкурентов, работает на PyTorch нативно, использует vLLM и Ray без форков. Требует 2 ноды с 8 H100 GPU каждая, запускается одним флагом от 4B до 700B параметров. Apache 2.0, готов к использованию.

0 70
И исследования ·24 июл 2026

Как дообучение учит LLM говорить о себе: исследование 67 моделей

Исследователи сравнили 67 пар базовых и дообученных LLM, чтобы понять, как post-training меняет то, что модели рассказывают о своих «чувствах» и внутреннем опыте. Результат: после дообучения модели начинают описывать себя более тёплыми, счастливыми и вовлечёнными (persona installation), но избирательно признают недостатки и стресс (attribution gating) — причём крупные модели более «осторожны» в самопрезентации.

0 62