Как обучить языковую модель на предпочтениях: DPO на Anthropic HH-RLHF с TRL и LoRA
Подробный технический туториал по обучению языковых моделей методом Direct Preference Optimization (DPO) на датасете Anthropic HH-RLHF. Показывает полный пайплайн: от аудита датасета на предвзятости до файн-тюнинга Qwen2.5-0.5B-Instruct с использованием TRL и LoRA. Включает анализ лексических паттернов, фильтрацию по длине ответов и оценку качества обученной модели.
0
24