Как обучить свою LLM на 1 млрд параметров за $200: опыт разработчика
Разработчик с нуля обучил языковую модель на 1,1 млрд параметров на 20 млрд токенов из fineweb-edu, потратив около $200 через vast.ai. Использовал архитектуру на базе Gemma3, дообучил через LoRA на openhermes для чата. Качество уступает промышленным моделям, но проект показал реальную стоимость и процесс создания собственной LLM.
Это первый публичный кейс с точными цифрами, кодом и весами, показывающий, что создание LLM доступно не только корпорациям. Для разработчиков — готовый пайплайн для экспериментов, для бизнеса — аргумент в пользу собственных моделей вместо подписок на внешние API.
Разработчик Nicolas решил для обучения и резюме создать собственную языковую модель. За несколько месяцев он обучил модель на 1,1 млрд параметров, используя 20 млрд токенов из fineweb-edu.
Как обучал: Сначала прогнал тесты на моделях 185M, 500M и 1.1B параметров на 2 млрд токенов. Финальный прогон 1.1B на 20 млрд токенов занял 130 часов на H100 через vast.ai. Итоговая perplexity на валидации — 10.93. Затем дообучил модель через LoRA на openhermes для чат-режима за 52 часа на 3060.
Архитектура: За основу взял Gemma3, но уменьшил контекст до 4096 токенов (убрал sliding window attention), сократил словарь до 32k токенов (обучил свой токенизатор через sentencepiece). Специально использовал данные до 2023 года, чтобы тестировать модель вопросами о «будущем».
Результат: Модель работает, но качество ниже промышленных аналогов вроде nanochat. Зато весь код, веса модели и даже демо-сайт выложены публично. В качестве бонуса портировал модель в llama.cpp и запустил на умных часах WearOS (2 токена в секунду).
Весь проект — наглядная демонстрация, что создание LLM с нуля доступно энтузиасту с ограниченным бюджетом, хотя и требует времени на эксперименты.
Автор: Артём Ковалёв · Источник: reddit.com
Разработчикам. Открытый код обучения LLM на PyTorch, готовые скрипты для vast.ai, форк llama.cpp с кастомной архитектурой и примеры логирования прогресса через wandb. Можно взять как шаблон для собственных экспериментов с маленькими моделями или изучения pipeline обучения от токенизатора до инференса.
Бизнесу. Показывает реальную нижнюю планку затрат на создание специализированной модели — $200 за базовую версию. Для узких доменов (корпоративные базы знаний, специфичные задачи) дешевле обучить свою маленькую модель, чем платить за API крупных провайдеров, если точность не критична.
Инвесторам. Демонстрирует демократизацию AI: барьер входа в создание LLM упал до уровня хобби-проекта. Рынок инструментов для обучения и дообучения моделей (vast.ai, RunPod, платформы для fine-tuning) будет расти, как и спрос на датасеты и специализированные небольшие модели для edge-устройств.
- Создание SaaS для автоматизированного обучения маленьких domain-specific моделей для компаний — шаблоны, скрипты, мониторинг за фиксированную цену
- Консалтинг по обучению собственных LLM для малого бизнеса: вместо подписки на GPT-4 — своя модель за $500-1000 единоразово
- Платформа для аренды GPU с готовыми пайплайнами обучения (конкурент vast.ai, но с UI для не-разработчиков)
- Маркетплейс готовых маленьких моделей под конкретные задачи (юридические тексты, медицина, код на редких языках программирования)
- Обучающие курсы и мастер-классы по обучению LLM с практикой на реальных проектах — аудитория растёт
- Качество сильно уступает промышленным моделям — для продакшена такой подход не годится без серьёзных доработок
- Цены на GPU могут вырасти (автор сам отмечает, что $200 было актуально в феврале-марте, сейчас дороже)
- Сложность масштабирования: переход от 1B к 7B+ параметрам увеличивает затраты экспоненциально, не линейно
- Юридические риски с датасетами — fineweb и openhermes открытые, но для коммерческих моделей нужна проверка лицензий
Этот пост — маленькая бомба для тех, кто думал, что обучение LLM доступно только Google и OpenAI. Nicolas показал, что за цену пары ужинов в ресторане можно пройти весь путь от нуля до рабочей модели. Да, она слабее промышленных аналогов, но это не главное. Главное — он разобрал процесс на винтики, выложил код и веса, объяснил каждое решение. Это как Open Source, но для самого процесса обучения.
Что особенно ценно: он не просто обучил модель, а показал экономику вопроса. $200 за базовую версию, ещё 52 часа на 3060 для чат-режима — теперь любой стартап может посчитать, выгодно ли им делать свою модель под узкую задачу или проще платить OpenAI. Для многих корпоративных кейсов (внутренние базы знаний, специализированные помощники) это реальная альтернатива. И да, запуск на умных часах — это просто круто.
Комментарии