инструменты 1 мин

MiniMax-Music3: открытая модель создаёт полные 5-минутные песни из текста и описания

MiniMax выпустил MiniMax-Music3 — открытую модель для генерации музыки, которая создаёт полноценные композиции длительностью до 5 минут из текста песни с разметкой структуры и детального описания звучания. Модель работает на двух GPU, доступна для коммерческого использования с условиями, весит под 24 ГБ и выдаёт 32 кГц стерео WAV за один проход.

Это первая открытая музыкальная модель, которая генерирует готовые композиции нужной длины без API-зависимости и даёт точный контроль структуры. Для создателей контента, игровых студий и SaaS это возможность встроить музыкальную генерацию в продукт без лицензионных сборов и ограничений закрытых API.

MiniMax выпустил MiniMax-Music3 — text-to-music модель с открытыми весами, которая генерирует полноценные композиции длительностью до пяти минут в формате 32 кГц 16-бит стерео WAV за один прогон. В отличие от большинства музыкальных моделей, которые работают с короткими фрагментами или требуют многошаговой генерации, MiniMax-Music3 принимает два входа: текст песни с тегами структуры ([Intro], [Verse], [Chorus] и так далее) и подробное описание аранжировки, вокала и общего стиля.

Архитектура построена на Hybrid-LM: большая языковая модель на 8 миллиардов параметров (Global LLM на базе Qwen3) отвечает за долгосрочную структуру, маленькая 0.6B модель (Local LLM) прорабатывает детали внутри каждого фрейма. Вместо стандартной цепочки дискретных токенов синтез идёт через flow matching модуль на 2.4B параметров и Flow-VAE декодер на 123М, которые работают с непрерывными скрытыми состояниями — дискретный декодер токенизатора вообще не загружается.

Модель запускается тремя способами: через SGLang-Omni на двух GPU (разделение задач между картами), через diffusers под 24 ГБ VRAM (или 8 ГБ с оффлоадом в CPU/групповым оффлоадом), или в ComfyUI с готовыми FP16/INT8 весами. Веса, код инференса и документация вышли в один день.

Лицензия разрешает коммерческое использование с двумя условиями: обязательная видимая атрибуция 'MiniMax-Music3' в UI продукта, и письменное разрешение для организаций с годовой выручкой от продуктов на базе модели свыше 20 миллионов долларов. Хостерам генерации для третьих лиц нужны механизмы защиты от нарушения авторских прав.

Автор: Никита Громов · Источник: marktechpost.com

Разработчикам. Готовый inference через SGLang-Omni, diffusers или ComfyUI, поддержка GPU-оффлоада вплоть до 8 ГБ, открытые веса и код в день релиза. Можно встроить в конвейер генерации контента, батч-обработки или адаптивных систем без API-зависимости. Flow matching вместо классического дискретного декодирования даёт более гладкий звук.

Бизнесу. Подходит для инди-студий, создателей контента, рекламных агентств, игровых разработчиков, платформ UGC-видео, подкастов, e-learning и фитнес-приложений. Лицензия позволяет коммерческое использование с атрибуцией, но крупному бизнесу (выручка >20M USD) нужно отдельное разрешение. Снижает затраты на лицензирование музыки и ускоряет прототипирование.

Инвесторам. Открытие генерации длинных музыкальных композиций с контролируемой структурой выводит музыкальные AI в прикладную зону: игры, реклама, creator economy, SaaS-инструменты. Сектора UGC-платформ, геймдева и аудиоконтента получают дешёвую альтернативу лицензированию, но монетизация упрётся в compliance и лицензионные барьеры для крупных игроков.

Хайп35
Реальная польза60
Заработать55
  • Сервис адаптивных саундтреков для игр: музыка генерируется под уровень, настроение, действия игрока в реальном времени без лицензионных сборов.
  • SaaS-платформа для создателей контента (TikTok, Reels, YouTube Shorts): автогенерация фоновых треков под видео с контролем стиля и структуры, монетизация через подписки.
  • Инструмент для рекламных агентств: быстрое создание джинглов и звукового брендинга под бриф клиента, батч-генерация вариантов для A/B-тестов.
  • Offline-генератор для подкастов и курсов: автосоздание вступительной/фоновой музыки для образовательных платформ и подкаст-хостингов без необходимости API.
  • Демо-треки для музыкантов: быстрая генерация черновиков композиций для дальнейшей доработки живыми музыкантами, монетизация через плагины DAW или standalone-приложения.
  • Лицензия с порогом 20M USD создаёт неопределённость для растущих стартапов: при пересечении порога требуется переговоры с MiniMax, условия неизвестны.
  • Обязательная защита от нарушений авторских прав ложится на хостера: расходы на модерацию, детекцию сходства, юридические риски при распространении инфрингинг-контента.
  • Качество длинных композиций под вопросом: 5 минут в один прогон могут давать структурные артефакты, повторы, несвязность частей — нужна практическая проверка.
  • Высокие требования к железу (два GPU для референсной инференции, 24 ГБ VRAM для diffusers) ограничивают доступность для мелких игроков без облака.

MiniMax-Music3 интересен не хайпом, а прагматикой: это первая открытая модель, которая генерирует длинные композиции с явным контролем структуры и не требует API. Для инди-геймдева, создателей контента и нишевых SaaS это реальная альтернатива лицензированию музыки и закрытым API вроде Suno или Udio. Двухвходовой контроль (текст с тегами структуры + описание аранжировки) даёт достаточную гибкость, а возможность запустить на двух GPU или даже в 8 ГБ VRAM с оффлоадом снижает барьер входа.

Но дьявол в лицензии: порог в 20 миллионов долларов годовой выручки от продуктов на базе модели означает, что успешный стартап рано или поздно столкнётся с необходимостью переговоров с MiniMax на неизвестных условиях. Обязательная атрибуция в UI — мелочь, а вот требование к защите от инфрингинга для хостеров генерации — это реальные расходы на модерацию и юридические риски. Качество длинных композиций ещё предстоит проверить на практике: 5 минут в один прогон могут давать повторы и структурные провалы. В целом это не революция, но полезный инструмент для тех, кто готов встроить музыкальную генерацию в продукт и не боится возни с инфраструктурой.

Ещё по теме

Комментарии