Ideogram v4 Instant заработала в ComfyUI — 8 шагов без потери качества и артефактов контраста
Пользователь конвертировал дистиллированную версию Ideogram 4 (8-шаговую) в формат ComfyUI и поделился скриптом. Главная победа — скорость базовой модели за 8 шагов без затемнения и проблем с контрастом, которые вызывают speed-LoRA. Весит ~10 ГБ, генерит за ~10 секунд на 4090.
Практический рецепт для тех, кто генерит в ComfyUI и хочет скорости без артефактов. Distillation побеждает LoRA-ускорители — тренд, за которым стоит следить.
Быстрая Ideogram 4 теперь работает в ComfyUI
Неделю назад fal.ai выложила веса ideogram-v4-instant — дистиллированной 8-шаговой версии Ideogram 4 — только в формате diffusers. Официальной сборки для ComfyUI не появилось, поэтому один из пользователей конвертировал модель самостоятельно и поделился скриптом.
Что даёт
- 8 шагов без CFG: качество на уровне базовой модели, но генерация в разы быстрее
- Никаких артефактов контраста: в отличие от speed-LoRA (вроде TurboTime), которые затемняют и портят баланс, distilled-версия держит качество
- ~10 секунд на картинку на RTX 4090 при 1024px — быстрее примерно на 10%, но главное — упрощённый граф без костылей
Как использовать
- Принять лицензию и скачать веса с HuggingFace (fal/ideogram-v4-instant, ~19 ГБ)
- Запустить скрипт конвертации, указав существующий чекпоинт Ideogram 4 как
--ref— он проверит соответствие тензоров и создаст fp8-файл ~10 ГБ - Настроить workflow: UNETLoader на новый файл, убрать speed-LoRA и unconditional-модель, переключиться на BasicGuider, 8 шагов, euler/simple, shift 5
Техническая магия
Официальная сборка fal использует раздельные тензоры внимания (to_q/to_k/to_v), а ComfyUI ожидает объединённые qkv. Скрипт склеивает их по нулевой размерности, переименовывает to_out.0 → o и кастует большие матрицы в fp8 (нормы и эмбеддинги остаются bf16).
Почему скрипт, а не готовый файл? Веса под gated-лицензией (некоммерческое использование) — автор не может выкладывать зеркала, поэтому каждый качает сам и принимает условия.
Ключевые выводы
- CFG-distilled модель даёт скорость без качественных потерь, характерных для speed-LoRA
- 8 шагов против десятков стандартных — дистилляция в действии, без архитектурных изменений
- Конверсия diffusers → ComfyUI требует перестройки attention-тензоров (split → fused qkv)
- Gated-модели вынуждают к распространению скриптов вместо готовых файлов из-за лицензии
- На практике fp8-квантизация больших матмул + bf16 для embeddings — оптимальный баланс скорости и точности
Автор: Павел Заславский · Источник: reddit.com
**Здесь показательная история о том, как комьюнити латает дыры за вендорами.** Fal выкатила distilled-модель, но забила на формат, которым реально пользуются люди — и через неделю пришлось конвертить самим. Хорошая новость: distillation работает. 8 шагов дают качество базы без артефактов, которыми славятся TurboTime и прочие speed-LoRA (затемнение, пережжённый контраст — знакомо?).
**На практике важнее другое:** это ещё один сигнал, что дистилляция обгоняет LoRA-костыли. Вместо стека из базы + ускорителя + CFG-танцев — одна модель, 8 шагов, euler. Проще, чище, надёжнее. И да, скрипт на 5 килобайт вместо 10-гигового торрента — это правильно, когда лицензия gated. Автор даже Claude подключил для конверсии — инструменты используются по назначению, без пафоса.
Комментарии