инструменты 1 мин

Уменьшили текстовый энкодер MiniMax H3 в 8 раз: с 32B до 4B без потери качества видео

Энтузиаст заменил 32-миллиардный текстовый энкодер MiniMax H3 (занимает 15.7 GB) на компактный Qwen3-VL 4B/8B с обучаемым проектором. Результат: видео и голос почти неотличимы от оригинала, но требуется в разы меньше памяти и быстрее генерация.

Видеогенерация перестаёт требовать серверные GPU — это открывает двери для стартапов, локальных решений и массовых приложений на доступном железе.

Что произошло

Энтузиаст из сообщества StableDiffusion провёл эксперимент с моделью генерации видео MiniMax H3. Оригинальная модель использует текстовый энкодер на 32 миллиарда параметров (15.7 GB в памяти) только для того, чтобы превратить текстовый промпт в тензор для генерации видео.

Разработчик заменил этот гигант на компактные версии Qwen3-VL (4B или 8B параметров) и добавил обучаемый проектор — небольшую сеть, которая переводит эмбеддинги из пространства Qwen в пространство оригинального энкодера. Остальные части пайплайна (DiT, VAE, семплер) остались без изменений.

Результаты

В первой версии была проблема: звук получался на 7.6 дБ тише оригинала. После доработки разницу сократили до 3.5 дБ, голос теперь практически совпадает. Качество следования промпту улучшилось: для 4B-версии метрика выросла с 0.7169 до 0.7944, для 8B — с 0.7528 до 0.7970. Для корректной генерации известных людей добавили 500 самых популярных персон из TMDB — токены имён улучшились с 0.8265 до 0.8844.

Код и веса опубликованы под MIT-лицензией на GitHub и HuggingFace. Автор позиционирует это как proof of concept на одной машине.

видеогенерацияоптимизация моделейтекстовые энкодерыдистилляция AIopen source

Автор: Юлия Тарасова · Источник: reddit.com

Разработчикам. Готовая нода для ComfyUI и веса на HuggingFace позволяют сразу генерировать видео на слабых GPU. Можно развивать направление: экспериментировать с другими энкодерами (LLaMA, Phi), обучать проекторы для своих задач, оптимизировать пайплайны под edge-устройства.

Бизнесу. Генерация видео становится доступнее: дешевле инфраструктура, быстрее обработка, возможен запуск на потребительском железе. Рынок video-as-a-service получает пространство для новых игроков без миллионных инвестиций в GPU-кластеры. Локальные решения для маркетинга и контента становятся реальностью.

Инвесторам. Тренд на дистилляцию и компрессию AI-моделей набирает обороты. Стартапы, которые снижают порог входа для видеогенерации (меньше VRAM, быстрее inference), могут отобрать долю рынка у тяжеловесов. Потенциал в edge AI, SaaS для малого бизнеса, локальных решениях для контента.

Хайп35
Реальная польза70
Заработать75
  • Видеогенерация на потребительских GPU: SaaS с оплатой по минутам, без очередей и облачных подписок
  • Edge-решения для маркетинга: локальная генерация роликов для соцсетей и рекламы на слабом железе
  • Кастомные энкодеры под вертикаль: обучить проектор для специфичных доменов (медицина, право, дизайн)
  • Инфраструктурная экономия: дешёвые видео-API для стартапов, которые не могут арендовать A100
  • Open-source экосистема: плагины, обучающие данные, маркетплейс проекторов под разные модели
  • Proof of concept на одной машине — масштабируемость и стабильность на разных наборах данных под вопросом
  • Метрики (косинусная близость) не гарантируют визуальное качество — субъективная оценка может расходиться с цифрами
  • Известные люди — 500 персон из TMDB это капля, для коммерческого применения нужно больше
  • Лицензионные риски: MiniMax H3 может иметь ограничения на модификацию, юридическая чистота проекта не раскрыта

Это один из тех случаев, когда community-driven разработка обгоняет корпоративные решения. Да, пока это proof of concept, но сам факт, что энкодер размером с небольшой смартфон выдаёт почти тот же результат, что и монстр на 15 GB — сигнал к переоценке архитектур. Индустрия привыкла к гонке параметров, а тут оказывается, что можно меньше, быстрее и доступнее.

С другой стороны, метрики косинусной близости — не приговор. Видео это субъективная штука, и пока не увидишь сотни генераций на разных промптах, нельзя сказать наверняка, что качество держится. Но MIT-лицензия и открытый код — это серьёзная заявка на проверку сообществом. Если подход выстрелит, ждите волну стартапов на дешёвой видеогенерации.

Инструменты из статьи

Платформа для генерации видео с акцентом на моушн-дизайн и брендинг....

Доступ из РФ →

Ещё по теме

Комментарии