Битва диффузии и авторегрессии: первое честное сравнение показывает узкую нишу, а не революцию
Лаборатория впервые напрямую сравнила свои диффузионную и авторегрессионную модели одинакового размера. Результат: диффузионная LLaDA2.2 проигрывает на общих знаниях и коде, выигрывает только на агентных задачах с множественными обращениями, зато в 1.6-2.3 раза быстрее. Это не смена парадигмы, а решение для узкой ниши — циклов агентов, где важна скорость декодирования.
Год дебатов о будущем архитектур языковых моделей наконец получил фактическую основу вместо домыслов. Это первое честное сравнение, которое показывает реальные границы применимости новых подходов и помогает разработчикам принимать обоснованные решения вместо следования хайпу.
Первое честное сравнение архитектур
Год дебатов о будущем языковых моделей наконец получил фактическую основу. Лаборатория выпустила диффузионную модель LLaDA2.2 и сразу сравнила её со своей же авторегрессионной моделью аналогичного размера (класс 100B параметров). Это не маркетинговое сравнение с чужой слабой моделью — обе разработки одной команды.
Результаты без прикрас
На общих знаниях и большинстве задач по программированию диффузионная модель уступает авторегрессионной. Перевес появляется только на специфических агентных бенчмарках:
- tau2 bench: 80.33 против 76.36
- MCP Atlas (многоходовые вызовы инструментов): 46.21 против 41.12
Главное преимущество — скорость декодирования: в среднем 1.6x быстрее, на агентных нагрузках до 2.3x. Достигается за счёт механизма вставки, удаления и замены токенов внутри блока вместо последовательной генерации.
Практические ограничения
Веса открыты под Apache 2.0 (205.8 GB), но пока нет поддержки llama.cpp и готовых решений для сервинга. Структурированный вывод слабее, чем у авторегрессионной базы — сами авторы это признают.
Вывод
Это не победа диффузии как парадигмы. Данные подтверждают узкую гипотезу: для агентных циклов, где каждый ход оплачивается латентностью декодирования, диффузионный бэкенд даёт сопоставимое качество заметно быстрее. Ниша, а не революция. Зато теперь есть способ измерять компромиссы вместо споров на эмоциях.
Ключевые выводы
- Первое прямое сравнение диффузионной и авторегрессионной архитектур от одной лаборатории на равных условиях
- Диффузионная модель LLaDA2.2 проигрывает на общих задачах, выигрывает только на агентных бенчмарках с многоходовыми взаимодействиями
- Скорость декодирования в 1.6-2.3 раза выше — единственное явное преимущество диффузии
- Результат указывает на нишевое применение (агентные циклы с высокой латентностью), а не на смену парадигмы генерации
- Открытые веса (Apache 2.0) позволяют независимую проверку, но практическое использование затруднено размером и отсутствием инфраструктуры
Автор: Артём Ковалёв · Источник: reddit.com
Наконец-то кто-то перестал спорить и просто **измерил**. Год дебатов о том, какая архитектура лучше для языковых моделей, свёлся к простому факту: диффузия быстрее (в 1.6-2.3 раза), но хуже справляется с большинством задач. Выигрывает только там, где AI постоянно переспрашивает и действует — агенты с инструментами, многоходовые диалоги.
Честность этой работы в том, что лаборатория сравнила свои же модели друг с другом, а не подобрала слабого конкурента для красивой картинки. И результат не героический: диффузия — это **решение для узкой ниши**, где критична скорость каждого шага агента, а не универсальная замена. Открытые веса (Apache 2.0) позволяют проверить всё самостоятельно, но 205 GB без llama.cpp и готового сервинга — это пока для энтузиастов с серверной стойкой, а не для продакшена. Зато теперь есть данные вместо веры.
Комментарии