AWS показала, как научить Nova думать на своих данных без дорогих разметок
Amazon представила метод Self-Distilled Reasoning (SDR) для дообучения моделей Nova 2, который позволяет сохранить способность к рассуждениям даже при обучении на данных без промежуточных цепочек мыслей. SDR использует собственные reasoning-токены базовой модели, предотвращая «катастрофическое забывание» и улучшая точность на целевых задачах без необходимости дорогой ручной разметки.
Для компаний, использующих Amazon Nova и похожие модели, это практический способ дообучить AI на своих данных без потери ключевых способностей модели и без огромных затрат на разметку. SDR делает thinking-модели доступнее для специализированных задач.
Проблема дообучения без reasoning-следов
Когда компании дообучают модели вроде Amazon Nova 2 на своих данных методом Supervised Fine-Tuning (SFT), они сталкиваются с дилеммой. Создание качественных цепочек рассуждений (chain-of-thought) для обучающих данных дорого и непрактично, поэтому обычно модель обучают только на парах «вопрос-ответ».
Однако это приводит к reasoning suppression — модель теряет способность рассуждать, даже если специально включить режим reasoning при инференсе. Эксперименты показывают драматические последствия: точность на математических задачах падает с 70% (базовая модель) до 6% после стандартного SFT.
Self-Distilled Reasoning как решение
AWS предлагает метод Self-Distilled Reasoning (SDR): вместо дорогой ручной разметки система использует reasoning-следы самой базовой модели Nova 2 Lite как «учителя». Модель фактически учится на собственных объяснениях, что работает как регуляризация при обучении.
Ключевые преимущества SDR:
- Почти полное восстановление математических способностей (с 6% обратно к ~68-70%)
- Улучшение точности на целевых задачах на 6,5% по сравнению с методом model merging
- Не требует отдельной модели-учителя или ручной аннотации
- Применимо к существующим SFT-датасетам в любой области
Почему это работает
Стандартный SFT обучает модель игнорировать промежуточные шаги рассуждений, так как функция потерь штрафует токены, не ведущие напрямую к ответу. Это пример shortcut learning — модель находит «короткий путь» вместо настоящего понимания.
SDR решает проблему catastrophic forgetting (катастрофического забывания ранее изученного) эффективнее традиционного model merging, сохраняя и общие способности модели, и производительность на целевых задачах.
Эксперименты на трёх бенчмарках подтвердили: включение reasoning при обучении и инференсе даёт прирост до 12,6% точности по сравнению с отключенным режимом.
Автор: Артём Ковалёв · Источник: aws.amazon.com
История простая: дообучаешь модель на своих данных — она тупеет и теряет умение решать сложные задачи. AWS нашла изящное решение: пусть модель учится на собственных объяснениях вместо дорогих человеческих разметок. Математика падала с 70% до 6%, теперь восстанавливается обратно. Красиво.
Но есть нюанс: это AWS-блог про AWS-модели. Насколько хорошо SDR перенесётся на другие архитектуры — большой вопрос. Плюс методология не раскрыта полностью: какие конкретно три бенчмарка, какие гиперпараметры, воспроизводимость под вопросом. Идея self-distillation не нова, но применение к reasoning-следам — интересный поворот. Если у вас в проде Nova и задача fine-tune на своих данных — стоит попробовать, хуже точно не будет.
Комментарии