исследования 1 мин

Предобучение vs. пост-обучение: как предсказатель текста становится ассистентом

Статья объясняет двухэтапный процесс создания AI-ассистентов вроде Claude или ChatGPT. На первом этапе (предобучение) модель учится предсказывать следующий токен в огромных массивах текста, получая знания, но без какой-либо "личности". На втором (пост-обучение) та же архитектура приобретает голос, имя, способность отказывать на вредные запросы — не через новые слои, а через "донастройку" уже существующих весов.

Обязательно для тех, кто занимается интерпретируемостью LLM или проектирует AI-продукты: объясняет, где в архитектуре "живут" рефлексы безопасности и личность модели, и почему это не просто косметика, а фундаментальная перестройка внутренних репрезентаций.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Базовая модель после предобучения не имеет фиксированной идентичности и может имитировать любой стиль из обучающих данных
  • Пост-обучение (файн-тюнинг + обучение с подкреплением) придаёт модели постоянный голос, рефлексы отказа и стилистические привычки без программирования правил вручную
  • Исследование Anthropic обнаружило J-пространство — компактную внутреннюю "рабочую область" для рассуждений, которая существует уже в базовой модели, но пост-обучение меняет её содержимое с нейтрального предсказания на "реакции" (например, слова "WARNING" появляются ещё до генерации ответа)
  • Пост-обучение устанавливает самомониторинг: когда Claude играет роль, в J-пространстве появляются маркеры типа "fictional" и "disclaimer"
pretrainingpost-trainingConstitutional AIJ-spaceинтерпретируемость
Ксения Лаврова Medium #llm
Читать оригинал

Инструменты из статьи

AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...

Доступ из РФ →

Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.

Доступ из РФ →

Ещё по теме

Комментарии