Apple исследует проблему «выбросов» в Diffusion Transformers: как лишние токены замедляют генерацию изображений
Команда Apple Machine Learning обнаружила, что в моделях генерации изображений на основе Diffusion Transformers (DiTs) появляются токены-«выбросы» с аномально высокими значениями, которые потребляют непропорционально много внимания модели, но не несут полезной информации. Проблема встречается и в энкодерах (ViT), и внутри самих DiT. Исследователи предложили методы подавления этих токенов, что улучшает качество и эффективность генерации.
Если вы строите продукт на генерации изображений или fine-tuning DiT-моделей, эта техника может напрямую снизить затраты на инференс и улучшить качество выдачи. Для edge-разработчиков — шанс сделать генерацию на мобилках реальностью.
Что произошло

Исследователи Apple Machine Learning опубликовали работу о проблеме outlier tokens в Diffusion Transformers — архитектурах для генерации изображений, которые сейчас лежат в основе многих SOTA-моделей типа Stable Diffusion 3 и FLUX.
В чём суть: в процессе работы трансформеров появляются токены с аномально большими значениями (high-norm tokens), которые притягивают к себе львиную долю внимания модели, хотя по факту несут минимум смысловой информации. Раньше эту проблему изучали для Vision Transformers (классификация, распознавание), но для генеративных моделей исследований почти не было.
Apple показала, что выбросы возникают на двух уровнях: - В предобученных энкодерах (ViT), которые преобразуют изображение в латентное пространство. - Внутри самих DiT, особенно в средних слоях — там токены-выбросы развиваются прямо в процессе денойзинга.
Команда предложила методы подавления этих токенов (например, через нормализацию и фильтрацию в механизме внимания). Результат: модели генерируют качественнее и быстрее, меньше "застревают" на артефактах.
Автор: Сергей Ефимов · Источник: machinelearning.apple.com
Разработчикам. Если работаете с DiT или fine-tuning Stable Diffusion/FLUX, стоит проверить слои на outliers — они могут жрать вычисления впустую. Apple дала конкретные техники подавления, можно интегрировать в пайплайн. Особенно актуально для inference на краю: меньше мусорных токенов = меньше latency.
Бизнесу. Для компаний, строящих сервисы генерации контента (креативы, дизайн, медиа), это способ снизить стоимость инференса и улучшить качество на выходе без переобучения моделей. Плюс преимущество в скорости: если конкуренты будут генерировать 5 секунд, вы — 3.
Инвесторам. Проблема efficiency в генеративных моделях — один из главных барьеров масштабирования. Решения типа этого снижают compute costs, открывают дорогу для on-device генерации (мобилки, edge). Следите за Apple и стартапами, которые встроят эти методы в inference-инфраструктуру — это конкурентное преимущество в AI-as-a-Service.
- Inference-оптимизаторы для DiT-моделей: SaaS или open-source библиотеки, которые автоматически детектят и подавляют outliers в продакшен-пайплайнах генерации (Stable Diffusion, Midjourney-клоны).
- On-device генерация: методы Apple позволяют сжать модели без потери качества — ниша для мобильных и edge-приложений (AI-фоторедакторы, креативные инструменты).
- Консалтинг и fine-tuning для e-commerce и контент-студий: помочь бизнесу интегрировать оптимизированные DiT для генерации продуктовых фото, рекламных креативов.
- Инструменты для ML-инженеров: плагины для PyTorch/Diffusers, которые добавляют outlier detection и mitigation в training/inference, по аналогии с quantization toolkits.
- Research-as-a-Service: углублённый аудит моделей клиентов на скрытые узкие места (outliers, attention bottlenecks) — продавать как экспертизу.
- Техника узкоспециализированная: работает для DiT, но неясно, насколько переносится на другие архитектуры (LLM, мультимодальные модели) — можно переоценить универсальность.
- Apple публикует исследование, но не релизит код/инструменты — если не появится open-source реализация, выгоду получат только те, кто умеет реплицировать с нуля.
- Улучшения могут быть незначительны на практике: в статье результаты на бенчмарках, но реальный прирост качества в продакшене может оказаться меньше ожиданий.
- Конкуренция от больших игроков: Google, Meta, Stability AI могут быстро встроить похожие техники в свои модели — окно для стартапов узкое.
Это типичное инженерное исследование от Apple: никакого пафоса, зато конкретная польза для тех, кто в теме. Outlier tokens — реальная проблема, о которой мало кто говорит вслух, но которая влияет на каждую продакшен-модель с DiT под капотом. Если вы fine-tuning Stable Diffusion или строите свой сервис генерации, стоит проверить свои модели на эту дыру — можете сэкономить на железе и выиграть в скорости.
Но есть нюанс: Apple пока не выкатила open-source инструменты, так что придётся реплицировать самим или ждать, пока кто-то из комьюнити запилит библиотеку. Для больших команд это не проблема, а для соло-разработчиков — барьер. В целом: если вы в генеративных моделях всерьёз, это must-read; если просто «интересуетесь AI» — можно пропустить, прорыва тут нет.
Комментарии