Apple масштабирует Categorical Flow Maps до 1.7B параметров: альтернатива авторегрессии для языковых моделей
Apple Research обучила языковую модель на 1.7B параметров с технологией Categorical Flow Maps (CFM), которая генерирует текст за 4 шага вместо сотен токенов последовательно. Это попытка заменить авторегрессивные модели (GPT-стиль) непрерывными потоковыми, как в Stable Diffusion — быстрее сэмплирование, гибче управление. Раньше CFM проверяли только на моделях до 1B параметров, теперь Apple показала, что работает и на промышленных масштабах.
Если непрерывные потоковые модели заменят авторегрессию, это изменит экономику AI-inference (дешевле, быстрее) и откроет новые возможности для on-device моделей. Пока это эксперимент, но с именем Apple за спиной.
Что сделали

Apple Research обучила языковую модель на 1.7 миллиарда параметров, используя подход Categorical Flow Maps (CFM) — метод непрерывной генерации дискретных данных (текста). Модель обучена на 2.1 триллионах токенов, затем сжата через self-distillation до версии, которая генерирует текст за 4 шага.
Классические языковые модели (GPT и подобные) работают авторегрессивно: генерируют по одному токену, каждый раз учитывая все предыдущие. CFM работает иначе: переводит гауссовский шум в готовый текст за несколько итераций, как диффузионные модели для картинок (Stable Diffusion). Преимущество — параллелизация, ускорение сэмплирования, гибкое управление генерацией.
Раньше CFM проверяли только на моделях до 1B параметров. Apple первой показала, что метод масштабируется до промышленных размеров. Качество текста сравнимо с авторегрессивными моделями, энтропия токенов близка к реальным данным. Исследователи также предложили способ оценивать вероятность (likelihood bound) для CFM, что позволяет сравнивать модель с классическими бенчмарками.
Технические детали
Основная сложность — баланс loss-функции и планирование времени (time scheduling) при обучении. Apple выявила проблемы, возникающие при масштабировании, и предложила рекомендации по настройке.
В отличие от дискретных диффузионных моделей, CFM работает в полунепрерывном пространстве: one-hot кодированный текст постепенно превращается в гауссовский шум и обратно. Это позволяет использовать методы из continuous flow matching, которые хорошо работают для изображений и аудио.
Автор: Сергей Ефимов · Источник: machinelearning.apple.com
Разработчикам. CFM открывает новые возможности для языковых моделей: параллельное декодирование вместо авторегрессивного (ускорение генерации в 10-100 раз потенциально), tilting и guided generation как в SD. Код и методики Apple помогут адаптировать диффузионные техники из CV в NLP. Ограничения масштабирования пока не до конца понятны, но 1.7B — уже proof of concept для production.
Бизнесу. Если CFM действительно заменит авторегрессию, это снизит стоимость inference в AI-сервисах (меньше шагов — меньше затрат GPU). Пока это research, но если Apple продолжит инвестировать, появится новый класс языковых моделей для edge-устройств и облачных API. Риск: качество может не дотянуть до GPT-4 класса, тогда это останется нишевым решением для специфических задач.
Инвесторам. Apple делает ставку на альтернативу трансформерам — сигнал, что авторегрессивные модели не единственный путь. Если CFM масштабируется дальше (10B+), это может переформатировать рынок LLM-инфраструктуры (новые чипы, оптимизация для flow-моделей). Пока risk/reward высок: технология сырая, но потенциал огромен (сжатие costs, новые форматы приложений). Следить за адоптацией в продуктах Apple (Siri, on-device AI).
- Ускорители для flow-based LLM: разработка специализированных чипов/библиотек под CFM (аналог FlashAttention для трансформеров).
- Гибридные модели: комбинировать CFM для черновой генерации (4 шага) + авторегрессивный refiner для точности — быстро и качественно.
- Edge AI на телефонах: CFM требует меньше последовательных вычислений, что идеально для мобильных устройств с ограниченной памятью.
- Guided generation API: сервисы для tilting и контроля над текстом (тон, стиль, факты) — как ControlNet для текста.
- Инструменты для distillation: платформы для self-distillation больших моделей в CFM-компакты (SaaS для ML-команд).
- Качество пока не доказано на сложных задачах (reasoning, длинные контексты) — может оказаться, что CFM хорош только для простой генерации.
- Экосистема tooling вокруг авторегрессивных моделей огромна (fine-tuning, RLHF, quantization) — CFM придётся всё строить с нуля.
- Apple пока не выпустила модель в продакшн — это может быть просто research paper без реальной адоптации.
- Сложность обучения на больших масштабах (авторы сами признают проблемы с loss weighting) — возможно, метод не масштабируется дальше 10B без прорывов.
Это классический Apple move: взять чужую идею (CFM появились не у них), довести до ума и показать, что работает на серьёзных масштабах. 1.7B параметров — это уже не игрушка, а валидация подхода. Но давайте честно: пока это research paper, а не продукт. Авторегрессивные модели доминируют не просто так — они предсказуемы, хорошо изучены, под них заточена вся инфраструктура (от RLHF до quantization).
Что реально интересно: если CFM действительно ускоряет inference в 10+ раз без потери качества, это меняет экономику on-device AI. Apple может встроить такую модель в iPhone и обрабатывать запросы локально, не отправляя данные в облако — огромный козырь в эпоху privacy-паранойи. Но большой вопрос: почему они не показали сравнение с GPT-3.5/4 на reasoning-задачах? Скорее всего, потому что CFM пока проигрывает на сложных кейсах. Следим за адоптацией в реальных продуктах — если увидим CFM в Siri или Apple Intelligence, тогда поверим по-настоящему.
Комментарии