Дистилляция 8B-модели в 0.6B на MacBook: точность 100%, но few-shot промптинг всё сломал
Исследователь дистиллировал специализированную 8B-модель в 0.6B для обработки финансовых документов на обычном Mac. Маленькая модель достигла 100% точности классификации против 36% у базовой, но few-shot промптинг парадоксально ухудшил результаты: модель начала путать примеры из промпта с целевым документом. Обучение заняло 12 минут и потребовало всего 4.1 ГБ RAM.
Показывает практический путь к созданию compliance-friendly AI-инструментов для регулируемых индустрий на обычном железе, но вскрывает неочевидные ловушки few-shot промптинга и дистилляции для малых моделей.
Эксперимент с дистилляцией на MacBook
Пользователь Reddit провёл практический эксперимент по дистилляции большой языковой модели для обработки финансовых документов. Задача — обогащать чанки текста перед индексацией в RAG: писать краткие саммари и проставлять категориальные метки (тип секции, уровень детализации, наличие чисел, прогнозный характер).
Постановка задачи: - Teacher: 8B модель с reasoning разметила ~170 реальных 10-K отчётов - Student: Qwen3-0.6B с QLoRA (rank 32), обучение 12 минут, пик RAM 4.1 ГБ - Eval: 49 документов компаний, не представленных в обучающей выборке
Неожиданные результаты
Точность классификации секций: - Базовая 0.6B (zero-shot): 36% - После дистилляции: 100% - Few-shot промптинг: 33% (хуже случайного угадывания!)
Парадокс few-shot: при добавлении примеров в промпт маленькая модель начала «протекать» — 14 из 21 саммари описывали компанию из примера, а не целевой документ, иногда копируя названия дословно. Исследователь проверил на разных наборах примеров — эффект повторился.
Три ключевых вывода
-
Few-shot токсичен для малых моделей: у 0.6B просто нет capacity, чтобы держать примеры отдельно от целевого ввода
-
Дистилляция переносит стиль, не знание: студент получил 100% точность на классификации, но верность фактам упала с 0.83 до 0.73 — модель стала смелее формулировать, но чаще добавляет галлюцинации
-
Студент копирует привычки учителя: тот же 0.6B, обученный на разметке от Llama-3.1-8B, показал 0.98 faithfulness, но учитель был «ленивее» в разметке — студент унаследовал эту лень
Практический смысл
Для регулируемых индустрий (финансы, медицина, юриспруденция) локальная маленькая модель часто не просто дешевле API — это единственный вариант из-за compliance. Эксперимент показывает, что дистилляция работает на узких задачах, но требует тщательного аудита учителя перед обучением.
Весь код опубликован в открытом доступе для воспроизведения на Mac с MLX.
Ключевые выводы
- Few-shot промптинг может активно вредить малым моделям (<1B): они физически не могут изолировать примеры от целевого ввода
- Дистилляция передаёт стиль и уверенность учителя, но не его знание — студент получает точность на классификации ценой фактической верности
- Качество дистиллированной модели напрямую наследует привычки учителя, включая лень и небрежность — аудит разметки критичен
- Для compliance-задач локальная 0.6B модель за 12 минут обучения может быть не просто дешевле API, а единственным легальным вариантом
- В узких доменах малая специализированная модель может превзойти базовую большую: 100% vs 36% точности при 8x ускорении
Автор: Никита Громов · Источник: reddit.com
**Это один из тех экспериментов, которые стоят больше десятка академических бенчмарков.** Чувак решал реальную проблему — обрабатывать финдокументы локально, без отправки конфиденциальных данных в API — и задокументировал всё с кодом и цифрами. Результаты контринтуитивны: few-shot, который должен помогать, превращает маленькую модель в овощ. Объяснение простое и brutal — у 0.6B банально нет capacity держать примеры отдельно от задачи, контекст «протекает».
Но главное открытие про дистилляцию: **студент наследует не знание учителя, а его привычки**. Если учитель ленится в разметке — студент скопирует лень. Если учитель уверенно галлюцинирует — студент скопирует уверенность вместе с галлюцинациями. Это значит, что перед distillation нужно вручную проверять выборку разметки от учителя, иначе потратите GPU на клонирование его косяков. Практическая ценность для тех, кто реально деплоит модели в финансах/медицине/праве — максимальная. Репозиторий с воспроизводимым кодом — респект.
Комментарии