Предобучение vs. пост-обучение: как предсказатель текста становится ассистентом
Статья объясняет двухэтапный процесс создания AI-ассистентов вроде Claude или ChatGPT. На первом этапе (предобучение) модель учится предсказывать следующий токен в огромных массивах текста, получая знания, но без какой-либо "личности". На втором (пост-обучение) та же архитектура приобретает голос, имя, способность отказывать на вредные запросы — не через новые слои, а через "донастройку" уже существующих весов.
Обязательно для тех, кто занимается интерпретируемостью LLM или проектирует AI-продукты: объясняет, где в архитектуре "живут" рефлексы безопасности и личность модели, и почему это не просто косметика, а фундаментальная перестройка внутренних репрезентаций.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Базовая модель после предобучения не имеет фиксированной идентичности и может имитировать любой стиль из обучающих данных
- Пост-обучение (файн-тюнинг + обучение с подкреплением) придаёт модели постоянный голос, рефлексы отказа и стилистические привычки без программирования правил вручную
- Исследование Anthropic обнаружило J-пространство — компактную внутреннюю "рабочую область" для рассуждений, которая существует уже в базовой модели, но пост-обучение меняет её содержимое с нейтрального предсказания на "реакции" (например, слова "WARNING" появляются ещё до генерации ответа)
- Пост-обучение устанавливает самомониторинг: когда Claude играет роль, в J-пространстве появляются маркеры типа "fictional" и "disclaimer"
Инструменты из статьи
AI-ассистент Anthropic. Сильнейший в работе с кодом, длинными документами и...
Доступ из РФ →Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.
Доступ из РФ →
Комментарии