инструменты 1 мин

Энтузиаст научил крошечную нейросеть убирать артефакты GPT Image 2

Независимый разработчик создал лёгкую модель (0.48M параметров), которая удаляет характерные артефакты GPT Image 2: чрезмерную резкость, случайные яркие пятна и чешуйчатую текстуру на коже и тканях. Модель работает в латентном пространстве FLUX.2 VAE, обрабатывает изображение за ~0.7 секунды и требует всего 3GB VRAM.

Это практический пример того, как небольшая целевая модель решает конкретную проблему генеративных систем. Подход интересен не только пользователям GPT Image 2, но и как кейс борьбы с артефактами через латентное пространство — метод может масштабироваться на другие модели.

Самодельный фильтр для GPT Image 2

Разработчик под ником Parking_Baby_57 опубликовал открытую модель, которая устраняет характерные артефакты GPT Image 2 — проблему, которая стала особенно заметной в последнее время.

Суть проблемы

GPT Image 2 оставляет на всех изображениях узнаваемый набор дефектов: избыточную резкость, случайные яркие точки, неестественно жёсткие края и чешуйчатый паттерн, который появляется на коже, тканях и фоне. Эти артефакты стали своего рода "цифровым отпечатком" модели.

Техническое решение

Вместо работы с пикселями напрямую, автор использовал латентное пространство FLUX.2 VAE. Алгоритм прост: - Изображение кодируется в латентное представление - Крошечная остаточная UNet (0.48M параметров) предсказывает коррекцию - Результат декодируется обратно в пиксели

Вся обработка занимает ~0.7 секунды на изображение 1.5MP и требует около 3GB видеопамяти. Фактически всё время уходит на VAE — сама корректирующая сеть практически бесплатна.

Ограничения

Автор честно признаёт слабые места решения. Артефакты и реальная текстура живут на одном масштабе, поэтому их полное разделение невозможно — устранение шума неизбежно съедает часть настоящих деталей.

На части изображений артефакты и детали сцеплены настолько плотно, что выбрать подходящую силу коррекции не получается: либо смягчение заметно, либо мусор остаётся. Параметр α (сила коррекции) приходится подбирать вручную, и оптимальное значение варьируется от картинки к картинке.

Модель не улучшает структурно сломанные изображения — она просто делает их "тише" и приятнее для глаза.

Доступность

Код, веса и демо опубликованы открыто на GitHub и HuggingFace. Есть веб-демо для быстрого тестирования без установки.

Ключевые выводы

  • Артефакты GPT Image 2 достаточно стабильны, чтобы служить цифровым отпечатком модели — это делает их предсказуемыми и устранимыми
  • Работа в латентном пространстве VAE эффективнее обработки пикселей: артефакты и контент там частично разделены
  • Микро-модель в 0.48M параметров справляется с узкой задачей лучше, чем крупные универсальные денойзеры
  • Полное разделение артефактов и реальной текстуры невозможно — они живут на одном пространственном масштабе
  • Автоматический подбор силы коррекции остаётся нерешённой проблемой
постобработкаVAEартефактыopen-sourceгенерация изображений

Автор: Анна Мельникова · Источник: reddit.com

Мнение редакции

Это классный пример garage AI — когда один человек с GPU и упрямством решает проблему, которую крупные лаборатории игнорируют. Автор не продаёт чудо-лекарство, а честно признаёт: да, это костыль, да, иногда ломается, да, настраивать приходится руками. Но костыль рабочий и открытый.

Особенно ценно, что решение крошечное — меньше мегабайта весов. Это наглядно показывает, что для узких задач не нужны миллиардные монстры. И да, подход через латентное пространство умнее пиксельных фильтров — артефакты и контент там уже частично разделены самим VAE. Единственное, что смущает — отсутствие автоподбора силы коррекции. Пока это инструмент для тех, кто готов покрутить ручки.

Ещё по теме

Комментарии