модели 1 мин

AWS показала, как научить Nova думать на своих данных без дорогих разметок

Amazon представила метод Self-Distilled Reasoning (SDR) для дообучения моделей Nova 2, который позволяет сохранить способность к рассуждениям даже при обучении на данных без промежуточных цепочек мыслей. SDR использует собственные reasoning-токены базовой модели, предотвращая «катастрофическое забывание» и улучшая точность на целевых задачах без необходимости дорогой ручной разметки.

Для компаний, использующих Amazon Nova и похожие модели, это практический способ дообучить AI на своих данных без потери ключевых способностей модели и без огромных затрат на разметку. SDR делает thinking-модели доступнее для специализированных задач.

Проблема дообучения без reasoning-следов

Когда компании дообучают модели вроде Amazon Nova 2 на своих данных методом Supervised Fine-Tuning (SFT), они сталкиваются с дилеммой. Создание качественных цепочек рассуждений (chain-of-thought) для обучающих данных дорого и непрактично, поэтому обычно модель обучают только на парах «вопрос-ответ».

Однако это приводит к reasoning suppression — модель теряет способность рассуждать, даже если специально включить режим reasoning при инференсе. Эксперименты показывают драматические последствия: точность на математических задачах падает с 70% (базовая модель) до 6% после стандартного SFT.

Self-Distilled Reasoning как решение

AWS предлагает метод Self-Distilled Reasoning (SDR): вместо дорогой ручной разметки система использует reasoning-следы самой базовой модели Nova 2 Lite как «учителя». Модель фактически учится на собственных объяснениях, что работает как регуляризация при обучении.

Ключевые преимущества SDR:

  • Почти полное восстановление математических способностей (с 6% обратно к ~68-70%)
  • Улучшение точности на целевых задачах на 6,5% по сравнению с методом model merging
  • Не требует отдельной модели-учителя или ручной аннотации
  • Применимо к существующим SFT-датасетам в любой области

Почему это работает

Стандартный SFT обучает модель игнорировать промежуточные шаги рассуждений, так как функция потерь штрафует токены, не ведущие напрямую к ответу. Это пример shortcut learning — модель находит «короткий путь» вместо настоящего понимания.

SDR решает проблему catastrophic forgetting (катастрофического забывания ранее изученного) эффективнее традиционного model merging, сохраняя и общие способности модели, и производительность на целевых задачах.

Эксперименты на трёх бенчмарках подтвердили: включение reasoning при обучении и инференсе даёт прирост до 12,6% точности по сравнению с отключенным режимом.

Ключевые выводы

  • Стандартное дообучение без reasoning-следов приводит к потере способности модели рассуждать и падению точности на сложных задачах до 90% (с 70% до 6% на математике)
  • Self-Distilled Reasoning использует собственные рассуждения базовой модели как обучающий сигнал, не требуя дорогой ручной разметки или отдельной модели-учителя
  • SDR превосходит традиционный model merging: восстанавливает математические способности до ~68-70% при одновременном улучшении точности на целевых задачах на 6,5%
  • Reasoning-режим при обучении и инференсе критически важен: даёт прирост производительности до 12,6% на целевых метриках
  • Метод работает как регуляризация внутри обучения и применим к любым существующим SFT-датасетам независимо от домена

Автор: Артём Ковалёв · Источник: aws.amazon.com

Мнение редакции

**История простая:** дообучаешь модель на своих данных — она тупеет и теряет умение решать сложные задачи. AWS нашла изящное решение: пусть модель учится на собственных объяснениях вместо дорогих человеческих разметок. Математика падала с 70% до 6%, теперь восстанавливается обратно. Красиво.

**Но есть нюанс:** это AWS-блог про AWS-модели. Насколько хорошо SDR перенесётся на другие архитектуры — большой вопрос. Плюс методология не раскрыта полностью: какие конкретно три бенчмарка, какие гиперпараметры, воспроизводимость под вопросом. Идея self-distillation не нова, но применение к reasoning-следам — интересный поворот. Если у вас в проде Nova и задача fine-tune на своих данных — стоит попробовать, хуже точно не будет.

Ещё по теме

Комментарии