AWS показала, как научить Nova думать на своих данных без дорогих разметок
Amazon представила метод Self-Distilled Reasoning (SDR) для дообучения моделей Nova 2, который позволяет сохранить способность к рассуждениям даже при обучении на данных без промежуточных цепочек мыслей. SDR использует собственные reasoning-токены базовой модели, предотвращая «катастрофическое забывание» и улучшая точность на целевых задачах без необходимости дорогой ручной разметки.
Для компаний, использующих Amazon Nova и похожие модели, это практический способ дообучить AI на своих данных без потери ключевых способностей модели и без огромных затрат на разметку. SDR делает thinking-модели доступнее для специализированных задач.
Проблема дообучения без reasoning-следов
Когда компании дообучают модели вроде Amazon Nova 2 на своих данных методом Supervised Fine-Tuning (SFT), они сталкиваются с дилеммой. Создание качественных цепочек рассуждений (chain-of-thought) для обучающих данных дорого и непрактично, поэтому обычно модель обучают только на парах «вопрос-ответ».
Однако это приводит к reasoning suppression — модель теряет способность рассуждать, даже если специально включить режим reasoning при инференсе. Эксперименты показывают драматические последствия: точность на математических задачах падает с 70% (базовая модель) до 6% после стандартного SFT.
Self-Distilled Reasoning как решение
AWS предлагает метод Self-Distilled Reasoning (SDR): вместо дорогой ручной разметки система использует reasoning-следы самой базовой модели Nova 2 Lite как «учителя». Модель фактически учится на собственных объяснениях, что работает как регуляризация при обучении.
Ключевые преимущества SDR:
- Почти полное восстановление математических способностей (с 6% обратно к ~68-70%)
- Улучшение точности на целевых задачах на 6,5% по сравнению с методом model merging
- Не требует отдельной модели-учителя или ручной аннотации
- Применимо к существующим SFT-датасетам в любой области
Почему это работает
Стандартный SFT обучает модель игнорировать промежуточные шаги рассуждений, так как функция потерь штрафует токены, не ведущие напрямую к ответу. Это пример shortcut learning — модель находит «короткий путь» вместо настоящего понимания.
SDR решает проблему catastrophic forgetting (катастрофического забывания ранее изученного) эффективнее традиционного model merging, сохраняя и общие способности модели, и производительность на целевых задачах.
Эксперименты на трёх бенчмарках подтвердили: включение reasoning при обучении и инференсе даёт прирост до 12,6% точности по сравнению с отключенным режимом.
Ключевые выводы
- Стандартное дообучение без reasoning-следов приводит к потере способности модели рассуждать и падению точности на сложных задачах до 90% (с 70% до 6% на математике)
- Self-Distilled Reasoning использует собственные рассуждения базовой модели как обучающий сигнал, не требуя дорогой ручной разметки или отдельной модели-учителя
- SDR превосходит традиционный model merging: восстанавливает математические способности до ~68-70% при одновременном улучшении точности на целевых задачах на 6,5%
- Reasoning-режим при обучении и инференсе критически важен: даёт прирост производительности до 12,6% на целевых метриках
- Метод работает как регуляризация внутри обучения и применим к любым существующим SFT-датасетам независимо от домена
Автор: Артём Ковалёв · Источник: aws.amazon.com
**История простая:** дообучаешь модель на своих данных — она тупеет и теряет умение решать сложные задачи. AWS нашла изящное решение: пусть модель учится на собственных объяснениях вместо дорогих человеческих разметок. Математика падала с 70% до 6%, теперь восстанавливается обратно. Красиво.
**Но есть нюанс:** это AWS-блог про AWS-модели. Насколько хорошо SDR перенесётся на другие архитектуры — большой вопрос. Плюс методология не раскрыта полностью: какие конкретно три бенчмарка, какие гиперпараметры, воспроизводимость под вопросом. Идея self-distillation не нова, но применение к reasoning-следам — интересный поворот. Если у вас в проде Nova и задача fine-tune на своих данных — стоит попробовать, хуже точно не будет.
Комментарии