#post-training

И исследования ·20 июл 2026

Предобучение vs. пост-обучение: как предсказатель текста становится ассистентом

Статья объясняет двухэтапный процесс создания AI-ассистентов вроде Claude или ChatGPT. На первом этапе (предобучение) модель учится предсказывать следующий токен в огромных массивах текста, получая знания, но без какой-либо "личности". На втором (пост-обучение) та же архитектура приобретает голос, имя, способность отказывать на вредные запросы — не через новые слои, а через "донастройку" уже существующих весов.

0 90
И исследования ·15 июл 2026

Обучение с подкреплением на 14 маках через обычный интернет: новый подход к распределённой пост-тренировке моделей

Pluralis Research провели RL-пост-тренировку модели, где все роллауты генерировали 14 обычных маков в 4 странах через домашний интернет, а обновления градиентов делал один B200 на другом континенте. Синхронизация через Cloudflare R2 без дата-центров. Результат: на задаче поиска в биомедицине точность выросла с 29% до 63%.

0 166