исследования 1 мин

Битва диффузии и авторегрессии: первое честное сравнение показывает узкую нишу, а не революцию

Лаборатория впервые напрямую сравнила свои диффузионную и авторегрессионную модели одинакового размера. Результат: диффузионная LLaDA2.2 проигрывает на общих знаниях и коде, выигрывает только на агентных задачах с множественными обращениями, зато в 1.6-2.3 раза быстрее. Это не смена парадигмы, а решение для узкой ниши — циклов агентов, где важна скорость декодирования.

Год дебатов о будущем архитектур языковых моделей наконец получил фактическую основу вместо домыслов. Это первое честное сравнение, которое показывает реальные границы применимости новых подходов и помогает разработчикам принимать обоснованные решения вместо следования хайпу.

Первое честное сравнение архитектур

Год дебатов о будущем языковых моделей наконец получил фактическую основу. Лаборатория выпустила диффузионную модель LLaDA2.2 и сразу сравнила её со своей же авторегрессионной моделью аналогичного размера (класс 100B параметров). Это не маркетинговое сравнение с чужой слабой моделью — обе разработки одной команды.

Результаты без прикрас

На общих знаниях и большинстве задач по программированию диффузионная модель уступает авторегрессионной. Перевес появляется только на специфических агентных бенчмарках:

  • tau2 bench: 80.33 против 76.36
  • MCP Atlas (многоходовые вызовы инструментов): 46.21 против 41.12

Главное преимущество — скорость декодирования: в среднем 1.6x быстрее, на агентных нагрузках до 2.3x. Достигается за счёт механизма вставки, удаления и замены токенов внутри блока вместо последовательной генерации.

Практические ограничения

Веса открыты под Apache 2.0 (205.8 GB), но пока нет поддержки llama.cpp и готовых решений для сервинга. Структурированный вывод слабее, чем у авторегрессионной базы — сами авторы это признают.

Вывод

Это не победа диффузии как парадигмы. Данные подтверждают узкую гипотезу: для агентных циклов, где каждый ход оплачивается латентностью декодирования, диффузионный бэкенд даёт сопоставимое качество заметно быстрее. Ниша, а не революция. Зато теперь есть способ измерять компромиссы вместо споров на эмоциях.

Ключевые выводы

  • Первое прямое сравнение диффузионной и авторегрессионной архитектур от одной лаборатории на равных условиях
  • Диффузионная модель LLaDA2.2 проигрывает на общих задачах, выигрывает только на агентных бенчмарках с многоходовыми взаимодействиями
  • Скорость декодирования в 1.6-2.3 раза выше — единственное явное преимущество диффузии
  • Результат указывает на нишевое применение (агентные циклы с высокой латентностью), а не на смену парадигмы генерации
  • Открытые веса (Apache 2.0) позволяют независимую проверку, но практическое использование затруднено размером и отсутствием инфраструктуры

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

Наконец-то кто-то перестал спорить и просто **измерил**. Год дебатов о том, какая архитектура лучше для языковых моделей, свёлся к простому факту: диффузия быстрее (в 1.6-2.3 раза), но хуже справляется с большинством задач. Выигрывает только там, где AI постоянно переспрашивает и действует — агенты с инструментами, многоходовые диалоги.

Честность этой работы в том, что лаборатория сравнила свои же модели друг с другом, а не подобрала слабого конкурента для красивой картинки. И результат не героический: диффузия — это **решение для узкой ниши**, где критична скорость каждого шага агента, а не универсальная замена. Открытые веса (Apache 2.0) позволяют проверить всё самостоятельно, но 205 GB без llama.cpp и готового сервинга — это пока для энтузиастов с серверной стойкой, а не для продакшена. Зато теперь есть данные вместо веры.

Ещё по теме

Комментарии