модели 1 мин

Google превратила готовую Gemma в диффузионную модель — зачем обучать с нуля, если можно переделать

Google DeepMind показала, что text-to-text диффузионную модель можно сделать из готовой LLM, потратив меньше 10% от исходного бюджета на обучение. DiffusionGemma генерирует текст не слово за словом, а блоками по 256 токенов параллельно — как картинка из шума. Результат: 1500 токенов в секунду на H100, лучше решает задачи с обратными зависимостями (судоку, математика), но в целом слабее базовой модели.

Это доказательство, что специализированные AI-модели можно делать дёшево, адаптируя готовые LLM. Открывает путь к нишевым AI-продуктам без гигантских затрат на обучение с нуля.

Google DeepMind опубликовала технический отчёт о DiffusionGemma — экспериментальной модели, которую сделали из готовой Gemma-4-26B-A4B. Вместо классической генерации текста токен за токеном модель уточняет блоки по 256 токенов параллельно, как диффузионные модели для картинок вытягивают изображение из шума. На H100 выдаёт ~1500 токенов в секунду.

Ключевое: обучение с нуля не понадобилось. Команда потратила меньше 10% от исходного токен-бюджета Gemma 4, применив двухэтапную схему: сначала модель учится восстанавливать зашумлённые блоки текста, потом идёт комбо из reinforcement learning и sampler distillation (SD·RL). RL повышает качество ответов, дистилляция сэмплера сокращает число шагов вычислений. Совмещение обоих процессов подняло качество на reasoning-бенчмарках в среднем на 10 пунктов и почти вчетверо увеличило число токенов на шаг.

Диффузионная генерация помогает там, где нужно учитывать контекст «из будущего». Обычная LLM в математической задаче из отчёта начинает ответ с «-1», понимает по ходу вывода, что правильно «-25», и дописывает исправление. DiffusionGemma развивает ответ и рассуждение параллельно, исправляя ошибки до финализации. На судоку после минимального дообучения модель решает ~85% задач, базовая Gemma проваливается полностью. Структурированные форматы (JSON, код) готовы за 2-3 итерации уточнения.

Модель сохранила способность генерировать текст токен за токеном — можно переключаться между режимами под задачу. Но абсолютная производительность ниже базовой авторегрессивной модели: DiffusionGemma не обучали как диффузионную с нуля, фаза дообучения короткая, SD·RL приоритизировал скорость над пиковым качеством, архитектура и данные унаследованы от Gemma 4 без оптимизации под диффузию. Модель иногда зацикливается на повторениях слов (артефакт агрессивного сокращения шагов), на мультимодальных задачах забывает закрыть секцию рассуждений. Преимущество по скорости держится для одиночных запросов, при ~32 конкурентных запросах классические LLM догоняют.

Google называет DiffusionGemma экспериментом для ускорения исследований text diffusion и даёт сообществу базу для специализированных адаптаций. Модель уже используют стартап Interfaze (многоязычное распознавание речи) и проект по генерации радиологических отчётов. Доступна под Apache 2.0 на Hugging Face.

диффузионные моделиtext generationGoogle DeepMindretrofit обучениеopen source AI

Автор: Артём Ковалёв · Источник: the-decoder.com

Разработчикам. Готовая техника retrofit-обучения диффузионной модели из LLM с минимальным бюджетом. Можно экспериментировать с параллельной генерацией блоков для задач с обратными зависимостями (код, структурированные форматы, reasoning). Модель на HF, Apache 2.0, можно форкать и дообучать под свои кейсы.

Бизнесу. Диффузионные text-модели дешевле в обучении (меньше 10% токен-бюджета оригинала) и быстрее на узких задачах (судоку, JSON, код), но в общих кейсах слабее классических LLM. Для продакшна пока рановато, но направление открывает ниши, где важна скорость генерации структурированных данных (автоматизация отчётов, code repair, распознавание речи).

Инвесторам. Google показывает путь к удешевлению разработки специализированных моделей — не обучать с нуля, а адаптировать готовые. Экономия капекса на AI-инфраструктуре, рост числа нишевых AI-продуктов для vertical-решений (медицина, код, речь). Пока экспериментальная стадия, но если диффузионные text-модели выстрелят, это новый класс инструментов под конкретные индустрии.

Хайп35
Реальная польза60
Заработать55
  • Форкнуть DiffusionGemma под специфичные задачи — генерация кода, JSON-схем, медицинских отчётов (уже используют в радиологии)
  • Сделать SaaS для автоматизации структурированных отчётов (финансы, право, медицина) — диффузия быстрее на таких задачах
  • Адаптировать под multilingual speech-to-text (пример Interfaze) — диффузия хорошо работает с последовательностями
  • Создать инструмент для code repair / refactoring — модель фиксит ошибки параллельно, не переписывая весь код
  • Продавать консалтинг по retrofit-обучению моделей — как сэкономить 90% токен-бюджета, переделав готовую LLM под диффузию
  • Абсолютное качество ниже базовой Gemma — для общих задач диффузия пока проигрывает классическим LLM
  • Зацикливания на повторениях слов, баги на мультимодальных задачах — модель сырая, для прода не готова
  • Преимущество по скорости теряется при 32+ конкурентных запросах — не масштабируется как классическая LLM
  • Архитектура и данные унаследованы от Gemma 4, не оптимизированы под диффузию — потенциал не раскрыт, хайп на будущее

Вот это по-настоящему интересно — не потому что DiffusionGemma круче Gemma 4 (она слабее), а потому что Google показала рабочий способ делать специализированные модели дёшево. Меньше 10% токен-бюджета, и ты превращаешь готовую LLM в диффузионную — для узких задач это может выстрелить. Судоку, код, JSON — там, где классические LLM страдают от последовательной генерации, диффузия рулит. Но давайте без иллюзий: в общих задачах DiffusionGemma проигрывает, зацикливается на повторениях, и её преимущество по скорости испаряется, когда запросов больше 32. Это экспериментальная игрушка, не продуктовое решение.

Тем не менее, методология retrofit-обучения — это золото. Если ты делаешь AI-продукт под конкретную индустрию (медицина, код, финансы) и тебе не нужна универсальная LLM, можно взять open-source модель, переобучить за разумные деньги и получить специализированный инструмент. Google открыто называет DiffusionGemma экспериментом для исследователей — и это честно. Но стартапы уже используют (Interfaze, радиологические отчёты), значит, ниша есть. Следите за этим направлением — если диффузия для текста выстрелит, классические LLM получат серьёзного конкурента в vertical-решениях.

Ещё по теме

Комментарии