Энтузиаст дообучил 1B-модель на ответах Claude и упаковал её в 657 МБ
Разработчик-одиночка GnLOLot выложил MiniCPM5-1B-Claude-Opus-Fable5-Thinking — локальную языковую модель на 1 миллиард параметров, дообученную на текстовых трейсах Claude Opus. Модель весит от 657 МБ до 2.1 ГБ в зависимости от квантизации, работает без API и облака, но это НЕ классическая дистилляция — модель училась имитировать стиль ответов Claude, а не копировала его способности. Бенчмарки не опубликованы, реальные возможности остаются под вопросом.
Этот эксперимент показывает, как можно создавать лёгкие локальные модели, обучая их на выходах крупных коммерческих систем. Но он также вскрывает разницу между настоящей дистилляцией (перенос знаний) и файн-тюнингом на ответах (имитация стиля) — важное различие для понимания реальных возможностей таких моделей.
Локальная модель на базе Claude-трейсов
Разработчик GnLOLot опубликовал локальную языковую модель MiniCPM5-1B-Claude-Opus-Fable5-Thinking с квантизированными сборками GGUF. В основе лежит openbmb/MiniCPM5-1B — открытая модель на 1.08 миллиарда параметров с архитектурой LlamaForCausalLM, 24 слоями и контекстным окном в 128K токенов.
Не дистилляция, а файн-тюнинг на выходах
Важное уточнение: это не классическая дистилляция. У разработчика нет доступа к весам или логитам Claude — вместо этого он собрал диалоги с Claude Opus (Fable 5), записал текстовые ответы и reasoning-трейсы, а затем дообучил базовую модель на этих данных методом supervised fine-tuning.
Практический эффект: модель научилась имитировать формат и стиль ответов Claude, но не переняла его глубинных возможностей. Параметров в 1B физически недостаточно для frontier-уровня рассуждений.
Технические характеристики
- Размеры квантизаций: Q4_K_M (~657 МБ, наименьший размер), Q5_K_M (~751 МБ), Q8_0 (~1.1 ГБ, рекомендуется по умолчанию), F16 (~2.1 ГБ)
- Контекст: 128K токенов (унаследовано от базовой модели)
- Поддержка: llama.cpp, Ollama, LM Studio, jan, KoboldCpp
- Режимы: Think mode (с reasoning-блоками) и No Think mode через
enable_thinking
Запуск
Одна команда через Ollama:
ollama run hf.co/GnLOLot/MiniCPM5-1B-Claude-Opus-Fable5-Thinking-GGUF:Q4_K_M
Рекомендованные параметры сэмплинга для режима Think: temperature=0.9, top_p=0.95.
Оговорки
- Нет бенчмарков и публичного датасета — заявленные способности не проверить
- Лицензионная неясность: базовая модель под Apache-2.0, но дообучение на выходах Claude может нарушать условия использования Anthropic
- Размер 657 МБ — это минимальная квантизация Q4_K_M, не дефолтная сборка
Ключевые выводы
- Это supervised fine-tuning на текстовых ответах Claude, а не weight-level distillation — модель копирует стиль, но не переносит способности
- Модель работает полностью локально (от 657 МБ до 2.1 ГБ), не требует API-ключей и облачных вызовов
- Отсутствуют публичные бенчмарки и датасет — реальное качество работы непроверяемо
- Лицензионная зона риска: дообучение на выходах Claude может конфликтовать с ToS Anthropic, несмотря на Apache-2.0 базовой модели
- Квантизация Q4_K_M даёт наименьший размер 657 МБ, но рекомендуется Q8_0 (~1.1 ГБ) для лучшего баланса
Автор: Артём Ковалёв · Источник: marktechpost.com
**Интересная DIY-история, но с важными оговорками.** С технической стороны всё чисто: взяли открытую базу MiniCPM5-1B, собрали ответы Claude Opus (проект Fable 5), дообучили на них и упаковали в GGUF с несколькими квантизациями. Получилось что-то запускаемое на ноутбуке без GPU за секунды. Круто для экспериментов.
Но называть это "thinking model" — натяжка. Supervised fine-tuning на текстовых выходах != дистилляция способностей. Модель научилась *выглядеть* как Claude (формат reasoning-блоков, структура ответов), но не *мыслить* как он — на миллиарде параметров физически не влезут фронтирные рассуждения. Плюс нет ни бенчмарков, ни публичного датасета, ни честной оценки. А лицензионный вопрос (можно ли дообучаться на выходах Claude?) вообще висит в воздухе. Так что это крутая демка возможностей локальных моделей, но не прорыв в reasoning — скорее proof-of-concept с открытыми вопросами.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.
Доступ из РФ →
Комментарии