Программист год писал тренер для SDXL под свои 12 ГБ видеопамяти — и выложил бесплатно
Разработчик создал Aozora — бесплатный GUI-тренер для файнтюнинга SDXL и Anima на потребительских GPU с 12 ГБ видеопамяти. Инструмент тренирует 80-90% полной модели SDXL в пределах 11.8 ГБ VRAM (~1.55 сек/итерация) и 100% Anima в разрешении 1152×1152 (~11.4 ГБ, 2.67 сек/итерация). Код написан с нуля, а не обёртка над существующими решениями.
Снижает барьер входа для экспериментов с кастомизацией моделей генерации изображений: теперь не нужна дорогая видеокарта с 24 ГБ. Может стать альтернативой коммерческим решениям для индивидуальных разработчиков и энтузиастов.
Когда существующие решения не подходят
Год назад разработчик столкнулся с типичной проблемой: попытки файнтюнить SDXL на RTX 3060 (12 ГБ) упирались либо в необходимость снижать разрешение, либо в непрозрачные конфигурационные файлы, либо требовали GPU с 24 ГБ памяти.
Решение — написать собственный тренер — оказалось сложнее, чем казалось. Несколько месяцев ушло на попытки стабилизировать SDXL в рамках 12 ГБ, ещё полгода — на глубокое изучение архитектуры модели, чтение оригинальных статей и переписывание оптимизатора.
Что получилось
Результат — Aozora, бесплатный GUI-тренер для SDXL и Anima на потребительских GPU. На RTX 3060 он тренирует:
- 80-90% полного SDXL UNet в пределах 11.8 ГБ VRAM (~1.55 сек/итерация)
- 100% модели Anima в разрешении 1152×1152 при ~11.4 ГБ (~2.67 сек/итерация)
Главное отличие от конкурентов — прозрачный интерфейс: кривая learning rate, распределение timestep, взвешивание потерь, таргетинг слоёв и метрики тренировки доступны напрямую, без копания в конфигах.
Технические детали
Aozora — не обёртка над другими тренерами. Код написан с нуля, намеренно минималистичный, с опциональным бэкендом для attention-механизмов. Пока протестирован только на Windows и находится в бета-версии.
Разработчик открыт к фидбеку по совместимости и багам — проект активно развивается на GitHub.
Ключевые выводы
- Файнтюнинг SDXL на 12 ГБ VRAM реально возможен при глубокой оптимизации архитектуры
- Прозрачность настроек важнее количества опций — лишние параметры скрывают суть
- Создание тренера с нуля заняло год, но дало контроль над всеми аспектами процесса
- Проект демонстрирует, что качественные инструменты для AI не обязательно требуют корпоративных ресурсов
- Beta-версия пока только под Windows — кроссплатформенность в планах
Автор: Марина Соколова · Источник: reddit.com
**История классическая: проблема → фрустрация → год в подвале → open source.** И это круто. Но давайте честно: проект в бета-версии, протестирован на одной машине автора, работает только под Windows. Скриншоты интерфейса выглядят прилично, но реальная проверка — сколько людей вне комьюнити Reddit смогут его завести и не уткнуться в "dependency hell".
**Почему это важнее, чем кажется:** индустрия генеративных моделей стремительно уходит в корпоративную сторону — облачные сервисы, закрытые API, подписки. Проекты вроде Aozora напоминают, что независимый файнтюнинг на своём железе — это не анахронизм, а важная альтернатива. Если автор доведёт до стабильного релиза и расширит поддержку платформ — это может стать de facto стандартом для хоумлаб-экспериментов. Но пока это "обещание", а не продукт. Следим за развитием.
Комментарии