Google выпустил DiffusionGemma — языковую модель, которая генерирует текст в 4 раза быстрее
Google DeepMind представила DiffusionGemma — экспериментальную open-source модель на 26B параметров (MoE), которая генерирует текст блоками, а не последовательно. На GPU она работает до 4 раз быстрее обычных LLM, но с компромиссами по качеству. Идея — для локальных интерактивных задач, где важна скорость, а не идеальная точность.