#DPO

И инструменты ·20 авг 2026

Как обучить языковую модель на предпочтениях: DPO на Anthropic HH-RLHF с TRL и LoRA

Подробный технический туториал по обучению языковых моделей методом Direct Preference Optimization (DPO) на датасете Anthropic HH-RLHF. Показывает полный пайплайн: от аудита датасета на предвзятости до файн-тюнинга Qwen2.5-0.5B-Instruct с использованием TRL и LoRA. Включает анализ лексических паттернов, фильтрацию по длине ответов и оценку качества обученной модели.

0 24
И инструменты ·23 июл 2026

Графовое проектирование агентов: шумиха вокруг старой идеи и реальная проблема структурированных выводов

Новый термин «graph engineering» описывает оркестрацию нескольких агентных циклов в одну систему — по сути, переупаковку концепций, которые Anthropic описала ещё в 2024. Параллельно автор поднимает менее очевидную проблему: требование структурированного вывода (JSON-схем) может ухудшить качество ответов модели, даже если парсинг работает идеально.

0 34