инструменты 1 мин

Ideogram v4 Instant заработала в ComfyUI — 8 шагов без потери качества и артефактов контраста

Пользователь конвертировал дистиллированную версию Ideogram 4 (8-шаговую) в формат ComfyUI и поделился скриптом. Главная победа — скорость базовой модели за 8 шагов без затемнения и проблем с контрастом, которые вызывают speed-LoRA. Весит ~10 ГБ, генерит за ~10 секунд на 4090.

Практический рецепт для тех, кто генерит в ComfyUI и хочет скорости без артефактов. Distillation побеждает LoRA-ускорители — тренд, за которым стоит следить.

Быстрая Ideogram 4 теперь работает в ComfyUI

Неделю назад fal.ai выложила веса ideogram-v4-instant — дистиллированной 8-шаговой версии Ideogram 4 — только в формате diffusers. Официальной сборки для ComfyUI не появилось, поэтому один из пользователей конвертировал модель самостоятельно и поделился скриптом.

Что даёт

  • 8 шагов без CFG: качество на уровне базовой модели, но генерация в разы быстрее
  • Никаких артефактов контраста: в отличие от speed-LoRA (вроде TurboTime), которые затемняют и портят баланс, distilled-версия держит качество
  • ~10 секунд на картинку на RTX 4090 при 1024px — быстрее примерно на 10%, но главное — упрощённый граф без костылей

Как использовать

  1. Принять лицензию и скачать веса с HuggingFace (fal/ideogram-v4-instant, ~19 ГБ)
  2. Запустить скрипт конвертации, указав существующий чекпоинт Ideogram 4 как --ref — он проверит соответствие тензоров и создаст fp8-файл ~10 ГБ
  3. Настроить workflow: UNETLoader на новый файл, убрать speed-LoRA и unconditional-модель, переключиться на BasicGuider, 8 шагов, euler/simple, shift 5

Техническая магия

Официальная сборка fal использует раздельные тензоры внимания (to_q/to_k/to_v), а ComfyUI ожидает объединённые qkv. Скрипт склеивает их по нулевой размерности, переименовывает to_out.0o и кастует большие матрицы в fp8 (нормы и эмбеддинги остаются bf16).

Почему скрипт, а не готовый файл? Веса под gated-лицензией (некоммерческое использование) — автор не может выкладывать зеркала, поэтому каждый качает сам и принимает условия.

Ключевые выводы

  • CFG-distilled модель даёт скорость без качественных потерь, характерных для speed-LoRA
  • 8 шагов против десятков стандартных — дистилляция в действии, без архитектурных изменений
  • Конверсия diffusers → ComfyUI требует перестройки attention-тензоров (split → fused qkv)
  • Gated-модели вынуждают к распространению скриптов вместо готовых файлов из-за лицензии
  • На практике fp8-квантизация больших матмул + bf16 для embeddings — оптимальный баланс скорости и точности
image-generationdiffusiondistillationcomfyuiconversion

Автор: Павел Заславский · Источник: reddit.com

Мнение редакции

**Здесь показательная история о том, как комьюнити латает дыры за вендорами.** Fal выкатила distilled-модель, но забила на формат, которым реально пользуются люди — и через неделю пришлось конвертить самим. Хорошая новость: distillation работает. 8 шагов дают качество базы без артефактов, которыми славятся TurboTime и прочие speed-LoRA (затемнение, пережжённый контраст — знакомо?).

**На практике важнее другое:** это ещё один сигнал, что дистилляция обгоняет LoRA-костыли. Вместо стека из базы + ускорителя + CFG-танцев — одна модель, 8 шагов, euler. Проще, чище, надёжнее. И да, скрипт на 5 килобайт вместо 10-гигового торрента — это правильно, когда лицензия gated. Автор даже Claude подключил для конверсии — инструменты используются по назначению, без пафоса.

Инструменты из статьи

Ideogramбез VPN

Генерация изображений с лучшей отрисовкой текста внутри картинки.

Доступ из РФ →

Ещё по теме

Комментарии