исследования 1 мин

Дистилляция 8B-модели в 0.6B на MacBook: точность 100%, но few-shot промптинг всё сломал

Исследователь дистиллировал специализированную 8B-модель в 0.6B для обработки финансовых документов на обычном Mac. Маленькая модель достигла 100% точности классификации против 36% у базовой, но few-shot промптинг парадоксально ухудшил результаты: модель начала путать примеры из промпта с целевым документом. Обучение заняло 12 минут и потребовало всего 4.1 ГБ RAM.

Показывает практический путь к созданию compliance-friendly AI-инструментов для регулируемых индустрий на обычном железе, но вскрывает неочевидные ловушки few-shot промптинга и дистилляции для малых моделей.

Эксперимент с дистилляцией на MacBook

Пользователь Reddit провёл практический эксперимент по дистилляции большой языковой модели для обработки финансовых документов. Задача — обогащать чанки текста перед индексацией в RAG: писать краткие саммари и проставлять категориальные метки (тип секции, уровень детализации, наличие чисел, прогнозный характер).

Постановка задачи: - Teacher: 8B модель с reasoning разметила ~170 реальных 10-K отчётов - Student: Qwen3-0.6B с QLoRA (rank 32), обучение 12 минут, пик RAM 4.1 ГБ - Eval: 49 документов компаний, не представленных в обучающей выборке

Неожиданные результаты

Точность классификации секций: - Базовая 0.6B (zero-shot): 36% - После дистилляции: 100% - Few-shot промптинг: 33% (хуже случайного угадывания!)

Парадокс few-shot: при добавлении примеров в промпт маленькая модель начала «протекать» — 14 из 21 саммари описывали компанию из примера, а не целевой документ, иногда копируя названия дословно. Исследователь проверил на разных наборах примеров — эффект повторился.

Три ключевых вывода

  1. Few-shot токсичен для малых моделей: у 0.6B просто нет capacity, чтобы держать примеры отдельно от целевого ввода

  2. Дистилляция переносит стиль, не знание: студент получил 100% точность на классификации, но верность фактам упала с 0.83 до 0.73 — модель стала смелее формулировать, но чаще добавляет галлюцинации

  3. Студент копирует привычки учителя: тот же 0.6B, обученный на разметке от Llama-3.1-8B, показал 0.98 faithfulness, но учитель был «ленивее» в разметке — студент унаследовал эту лень

Практический смысл

Для регулируемых индустрий (финансы, медицина, юриспруденция) локальная маленькая модель часто не просто дешевле API — это единственный вариант из-за compliance. Эксперимент показывает, что дистилляция работает на узких задачах, но требует тщательного аудита учителя перед обучением.

Весь код опубликован в открытом доступе для воспроизведения на Mac с MLX.

Ключевые выводы

  • Few-shot промптинг может активно вредить малым моделям (<1B): они физически не могут изолировать примеры от целевого ввода
  • Дистилляция передаёт стиль и уверенность учителя, но не его знание — студент получает точность на классификации ценой фактической верности
  • Качество дистиллированной модели напрямую наследует привычки учителя, включая лень и небрежность — аудит разметки критичен
  • Для compliance-задач локальная 0.6B модель за 12 минут обучения может быть не просто дешевле API, а единственным легальным вариантом
  • В узких доменах малая специализированная модель может превзойти базовую большую: 100% vs 36% точности при 8x ускорении
дистилляциямалые моделиfew-shotлокальное обучениефинансы

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

**Это один из тех экспериментов, которые стоят больше десятка академических бенчмарков.** Чувак решал реальную проблему — обрабатывать финдокументы локально, без отправки конфиденциальных данных в API — и задокументировал всё с кодом и цифрами. Результаты контринтуитивны: few-shot, который должен помогать, превращает маленькую модель в овощ. Объяснение простое и brutal — у 0.6B банально нет capacity держать примеры отдельно от задачи, контекст «протекает».

Но главное открытие про дистилляцию: **студент наследует не знание учителя, а его привычки**. Если учитель ленится в разметке — студент скопирует лень. Если учитель уверенно галлюцинирует — студент скопирует уверенность вместе с галлюцинациями. Это значит, что перед distillation нужно вручную проверять выборку разметки от учителя, иначе потратите GPU на клонирование его косяков. Практическая ценность для тех, кто реально деплоит модели в финансах/медицине/праве — максимальная. Репозиторий с воспроизводимым кодом — респект.

Ещё по теме

Комментарии