K2Lab: региональный промптинг и изоляция LoRA для Krea2 без утечек
Разработчик создал инструмент для Krea2, позволяющий применять разные промпты и LoRA к отдельным областям изображения без взаимного влияния. Система работает через управление вниманием между токенами текста и изображения в заданных регионах, что решает проблему «утечки» стилей и персонажей при использовании нескольких LoRA одновременно.
Решает критическую проблему multi-character генерации с LoRA — утечку стилей и черт персонажей между областями. Даёт практический инструмент для точного контроля композиции в Krea2 на доступном железе.
K2Lab: региональный контроль над генерацией в Krea2
Энтузиаст под ником coyoteka представил K2Lab — самостоятельное приложение для работы с моделью Krea2, реализующее региональный промптинг и изолированное применение LoRA.
Как это работает
Основная идея: пользователь рисует прямоугольные области на холсте, для каждой задаёт отдельный промпт (что показать) и опционально промпт персонажа (как выглядит), плюс глобальный промпт для стиля и освещения. LoRA назначаются либо глобально, либо привязываются к конкретным областям — и не влияют за их пределами.
Технически это достигается через управление кросс-модальным вниманием: токены изображения внутри области могут обращаться только к «своим» текстовым токенам, а внешние токены текста не видят внутренние токены картинки. Это предотвращает утечку промптов на поздних шагах диффузии. При этом токены изображения могут взаимодействовать через границы, чтобы избежать прямоугольных артефактов и обеспечить связность сцены.
Изоляция LoRA обеспечивается пятью слоями правил: дельты LoRA обнуляются вне региона, региональный текст с LoRA недоступен внешним токенам изображения, текст снаружи не видит токены внутри, LoRA с глобальными K/V-проекциями пропускаются (остаются только Q-дельты), а для персонажных LoRA триггер-слово автоматически добавляется в региональный промпт.
Возможности
- Региональный промптинг без утечек между областями
- Применение нескольких LoRA одновременно к разным персонажам
- Редактирование изображений: VAE-энкодинг с региональной обработкой и настраиваемым шумоподавлением
- Улучшение лиц: через ONNX-детекцию или ручное выделение лассо, с возможностью применять LoRA на разной силе
- Тонкая настройка spatial conditioning, Lanczos-апскейл, редактирование проекторных векторов Krea
- Работает на GPU от 8 ГБ VRAM / 24 ГБ RAM, оптимизировано под AMD (RX 9060XT)
Технические детали
Изначально автор пытался сделать это как набор нодов для ComfyUI, но переключился на PySide с использованием части бэкенда Comfy. Подход полностью воспроизводим — можно реализовать те же механики в нодах, но автор предпочёл standalone-решение.
Степень ограничения внимания на границах настраивается (spatial falloff, step-based easing) — сильное conditioning на ранних шагах, затем глобальное внимание для бесшовной сборки.
Код открыт на GitHub: k2lab. Автор честно предупреждает: разрабатывал для себя, нет гарантий работоспособности у других, но метод можно адаптировать.
Ключевые выводы
- Региональный промптинг реализован через управление кросс-модальным вниманием между токенами текста и изображения, а не простым маскированием
- Изоляция LoRA требует пяти слоёв контроля, включая обнуление дельт вне региона и пропуск глобальных K/V-проекций
- Токены изображения намеренно могут взаимодействовать через границы областей, чтобы избежать прямоугольных артефактов
- Подход позволяет применять одну LoRA несколько раз к разным персонажам с разной силой без взаимного влияния
- Решение оптимизировано под AMD GPU и работает от 8 ГБ VRAM, что расширяет доступность для локального запуска
Автор: Никита Громов · Источник: reddit.com
**Это один из тех постов, где технический энтузиаст решает реальную боль.** Проблема multi-LoRA в одной сцене — это не академическая задачка: попробуй сгенерить двух разных персонажей с их кастомными LoRA, и получишь кашу из черт лиц и стилей. K2Lab атакует проблему на уровне механики внимания, а не костылями вроде последовательной генерации или инпейнта.
**Что тут реально работает:** изоляция через пять слоёв контроля — это не перестраховка, а необходимость. LoRA утекают коварно: через text-to-image attention, через глобальные проекции, через триггеры. Автор методично закрывает все лазейки. При этом он **не ломает связность сцены** — токены картинки могут общаться через границы, иначе получишь швы как в плохом фотошопе.
**Ложка дёгтя:** это proof-of-concept от разработчика «для себя», а не production-ready продукт. Багов можно ждать, документации — минимум. Но сам подход — золото для тех, кто копается в региональном conditioning. И да, ComfyUI-ноды на базе этого метода — вопрос времени, если кто-то возьмётся.
Комментарии