инструменты 2 мин

K2Lab: региональный промптинг и изоляция LoRA для Krea2 без утечек

Разработчик создал инструмент для Krea2, позволяющий применять разные промпты и LoRA к отдельным областям изображения без взаимного влияния. Система работает через управление вниманием между токенами текста и изображения в заданных регионах, что решает проблему «утечки» стилей и персонажей при использовании нескольких LoRA одновременно.

Решает критическую проблему multi-character генерации с LoRA — утечку стилей и черт персонажей между областями. Даёт практический инструмент для точного контроля композиции в Krea2 на доступном железе.

K2Lab: региональный контроль над генерацией в Krea2

Энтузиаст под ником coyoteka представил K2Lab — самостоятельное приложение для работы с моделью Krea2, реализующее региональный промптинг и изолированное применение LoRA.

Как это работает

Основная идея: пользователь рисует прямоугольные области на холсте, для каждой задаёт отдельный промпт (что показать) и опционально промпт персонажа (как выглядит), плюс глобальный промпт для стиля и освещения. LoRA назначаются либо глобально, либо привязываются к конкретным областям — и не влияют за их пределами.

Технически это достигается через управление кросс-модальным вниманием: токены изображения внутри области могут обращаться только к «своим» текстовым токенам, а внешние токены текста не видят внутренние токены картинки. Это предотвращает утечку промптов на поздних шагах диффузии. При этом токены изображения могут взаимодействовать через границы, чтобы избежать прямоугольных артефактов и обеспечить связность сцены.

Изоляция LoRA обеспечивается пятью слоями правил: дельты LoRA обнуляются вне региона, региональный текст с LoRA недоступен внешним токенам изображения, текст снаружи не видит токены внутри, LoRA с глобальными K/V-проекциями пропускаются (остаются только Q-дельты), а для персонажных LoRA триггер-слово автоматически добавляется в региональный промпт.

Возможности

  • Региональный промптинг без утечек между областями
  • Применение нескольких LoRA одновременно к разным персонажам
  • Редактирование изображений: VAE-энкодинг с региональной обработкой и настраиваемым шумоподавлением
  • Улучшение лиц: через ONNX-детекцию или ручное выделение лассо, с возможностью применять LoRA на разной силе
  • Тонкая настройка spatial conditioning, Lanczos-апскейл, редактирование проекторных векторов Krea
  • Работает на GPU от 8 ГБ VRAM / 24 ГБ RAM, оптимизировано под AMD (RX 9060XT)

Технические детали

Изначально автор пытался сделать это как набор нодов для ComfyUI, но переключился на PySide с использованием части бэкенда Comfy. Подход полностью воспроизводим — можно реализовать те же механики в нодах, но автор предпочёл standalone-решение.

Степень ограничения внимания на границах настраивается (spatial falloff, step-based easing) — сильное conditioning на ранних шагах, затем глобальное внимание для бесшовной сборки.

Код открыт на GitHub: k2lab. Автор честно предупреждает: разрабатывал для себя, нет гарантий работоспособности у других, но метод можно адаптировать.

Ключевые выводы

  • Региональный промптинг реализован через управление кросс-модальным вниманием между токенами текста и изображения, а не простым маскированием
  • Изоляция LoRA требует пяти слоёв контроля, включая обнуление дельт вне региона и пропуск глобальных K/V-проекций
  • Токены изображения намеренно могут взаимодействовать через границы областей, чтобы избежать прямоугольных артефактов
  • Подход позволяет применять одну LoRA несколько раз к разным персонажам с разной силой без взаимного влияния
  • Решение оптимизировано под AMD GPU и работает от 8 ГБ VRAM, что расширяет доступность для локального запуска
региональный промптингLoRAKrea2генерация изображенийopen source

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

**Это один из тех постов, где технический энтузиаст решает реальную боль.** Проблема multi-LoRA в одной сцене — это не академическая задачка: попробуй сгенерить двух разных персонажей с их кастомными LoRA, и получишь кашу из черт лиц и стилей. K2Lab атакует проблему на уровне механики внимания, а не костылями вроде последовательной генерации или инпейнта.

**Что тут реально работает:** изоляция через пять слоёв контроля — это не перестраховка, а необходимость. LoRA утекают коварно: через text-to-image attention, через глобальные проекции, через триггеры. Автор методично закрывает все лазейки. При этом он **не ломает связность сцены** — токены картинки могут общаться через границы, иначе получишь швы как в плохом фотошопе.

**Ложка дёгтя:** это proof-of-concept от разработчика «для себя», а не production-ready продукт. Багов можно ждать, документации — минимум. Но сам подход — золото для тех, кто копается в региональном conditioning. И да, ComfyUI-ноды на базе этого метода — вопрос времени, если кто-то возьмётся.

Ещё по теме

Комментарии