#диффузионные модели

И исследования ·7 авг 2026

Apple сравнила диффузионные и авторегрессионные языковые модели: когда параллельная генерация текста побеждает

Исследователи Apple опубликовали детальное сравнение двух архитектур LLM: классических авторегрессионных моделей (генерируют текст токен за токеном) и диффузионных (генерируют параллельно). Вывод: диффузия работает быстрее на коротких контекстах благодаря параллелизму, но проигрывает на длинных последовательностях и батчах. Ключ к ускорению DLM — сокращение шагов сэмплирования.

0 112
М модели ·9 авг 2026

Google превратила готовую Gemma в диффузионную модель — зачем обучать с нуля, если можно переделать

Google DeepMind показала, что text-to-text диффузионную модель можно сделать из готовой LLM, потратив меньше 10% от исходного бюджета на обучение. DiffusionGemma генерирует текст не слово за словом, а блоками по 256 токенов параллельно — как картинка из шума. Результат: 1500 токенов в секунду на H100, лучше решает задачи с обратными зависимостями (судоку, математика), но в целом слабее базовой модели.

0 71
И исследования ·6 авг 2026

Round-Trip Consistency: как диффузионные модели сами находят свои ошибки без ground truth

Исследователи научили диффузионную модель ходить вперёд и назад во времени, используя один флаг направления. Прогнав последовательность вперёд, а затем обратно, модель должна вернуться к началу — расхождение показывает накопленную ошибку без необходимости в эталонных данных, ансамблях или физических уравнениях. Бонус: одна двунаправленная сеть работает лучше двух специализированных.

0 36
И инструменты ·29 июл 2026

SeedVR2-1.4B: upscaler-модель в 6 раз легче ByteDance, которая влезает в 16 ГБ RAM

Энтузиаст дистиллировал 7B-параметровую модель апскейла SeedVR2 ByteDance в 1.4B версию с 6 слоями вместо 36. Результат: 2.7 ГБ на диске вместо 15.3 ГБ, работает в 4.6 ГБ оперативки вместо 14–16 ГБ, в 1.6–5.6× быстрее. Качество близко к учителю на 2×–4× масштабе, на 8× деградирует, но остается юзабельным.

0 90
И исследования ·24 июл 2026

Битва диффузии и авторегрессии: первое честное сравнение показывает узкую нишу, а не революцию

Лаборатория впервые напрямую сравнила свои диффузионную и авторегрессионную модели одинакового размера. Результат: диффузионная LLaDA2.2 проигрывает на общих знаниях и коде, выигрывает только на агентных задачах с множественными обращениями, зато в 1.6-2.3 раза быстрее. Это не смена парадигмы, а решение для узкой ниши — циклов агентов, где важна скорость декодирования.

0 115
И инструменты ·21 июл 2026

LTX-2.3 научили стирать людей с видео без масок — протестировали на многолюдной улице

Lightricks выпустили Clean Plate IC-LoRA для видеомодели LTX-2.3: адаптер удаляет всех людей и машины с видео, восстанавливая фон и сохраняя движение камеры, без ручной разметки. Работает через ComfyUI, весит 330 МБ, требует ~24 ГБ VRAM для HD.

0 60
И исследования ·22 июл 2026

Как я учил нейросеть рисовать: история о 92 000 потерянных шагах и модели, которая умела рисовать только снег

Энтузиаст тренирует диффузионную модель изображений на одной RTX 5090, сталкиваясь с абсурдными багами: модель, рисующая только снег, случайный откат на 92 000 шагов из-за двух строк кода, крах из-за символа галочки в логах. Модель научилась генерировать простые объекты, но большинство проблем были не в AI, а в собственном коде.

0 18