Китайская ИИ-лаборатория MiniMax представила MiniMaxMusic 3 — новую открытую высокопроизводительную модель для синтеза музыки, способную генерировать целостные композиции длительностью до 5 минут. В основе лежит гибридная архитектура, объединяющая глобальную языковую модель на 8 миллиардов параметров и локальную модель на 0,6 миллиардов параметров, работающие в тандеме для раздельного моделирования музыкальной структуры и акустических деталей. Модель принимает текст песни с возможными тегами секций и детальное описание желаемого стиля, вокала и аранжировки, а на выходе выдает 32-килогерцевый 16-битный стереофонический WAV-файл. Music 3 уже доступна для тестирования через демо-версию.
Подробнее о MiniMax Music 3
Ключевая особенность Music 3 — способность удерживать долгосрочную музыкальную связность на протяжении всей композиции длительностью до 5 минут. Модель сохраняет тематические мотивы, ритм, вокальную идентичность и последовательность аранжировок, что позволяет создавать полноценные структуры песен: вступление, куплет, предприпев, припев, бридж, инструментальный проигрыш и концовку.
Для управления генерацией используются два входных параметра: текст песни и описание музыки. Текст может включать явные теги секций, например [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental] и [Outro], что дает пользователю структурный контроль. Описание музыки определяет жанр, эмоциональный окрас, тембр вокала, инструменты, аранжировку и особенности продюсирования. Разработчики рекомендуют применять структурированные субтитры с тремя блоками: глобальные метаданные (жанр, BPM, тональность, звукоряд, эмоциональная прогрессия, сценарий прослушивания, производственный профиль), вокальные данные (пол вокалиста, тембр, стиль исполнения, гармония, бэк-вокал, эффекты) и аранжировка (основные и второстепенные инструменты, их эволюция по секциям, грув, бас, перкуссия, текстуры, пространственные эффекты).
Гибридная архитектура MiniMax Music 3 использует иерархический авторегрессионный подход, который разделяет глобальное музыкальное моделирование и локальное акустическое. Глобальная модель на 8 миллиардов параметров (инициализированная на основе Qwen3-8B) предсказывает первый кодовый словарь Residual Vector Quantization покадрово, отвечая за долгосрочную семантическую и структурную прогрессию песни. Локальная модель на 0,6 млрд параметров восстанавливает оставшиеся семь акустических кодовых словарей в каждом кадре, наполняя музыку деталями — вокальной артикуляцией, инструментальной фактурой, временной непрерывностью.
Ключевой инновацией является модуль синтеза с непрерывным скрытым состоянием. Вместо декодирования только из дискретных токенов RVQ модель объединяет конечные скрытые состояния глобальной и локальной LLM и на их основе генерирует звук с помощью архитектуры Flow-VAE, адаптированной из MiniMax Speech и переобученной под динамический диапазон и спектральные характеристики музыки. Такой подход сохраняет более богатую акустическую информацию, чем классическое авторегрессионное декодирование, что положительно сказывается на качестве и естественности звучания. Музыкальный токенизатор обучается на восьми слоях RVQ: первый семантический словарь на 16 384 элемента отражает основную музыкальную семантику, а остальные семь акустических словарей по 1 024 элемента кодируют остаточные детали. В процессе инференса дискретный декодер не требуется — используется только непрерывное представление.
Выводы
MiniMax Music 3 — это отличная модель не только для экспериментаторов и музыкантов, но и для бизнеса, которому требуется конвейерная генерация рекламных и фоновых треков без серьезных затрат на содержание LLM. Кроме того, модель сама по себе представляет значительный шаг для индустрии открытых ИИ для синтеза музыки. Разделение модели на глобальный и локальный компоненты решает фундаментальную проблему масштабируемости, позволяя генерировать длинные композиции с сохранением структурной целостности без чрезмерных затрат. Интеграция непрерывного скрытого синтеза с Flow-VAE отходит от чисто дискретного подхода, что приближает результат к студийному качеству. Модель уже доступна для скачивания на HuggingFace.
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Скидка 1 500 ₽ или бесплатная доставка - уже сейчас 🔥
Мы ценим обратную связь от клиентов. При оформлении заказа вы можете сообщить о своём намерении поделиться впечатлением о работе ServerFlow после получения товара.
* - скидка предоставляется при покупке от 30 000 рублей, в ином случае предусмотрена бесплатная доставка до ПВЗ СДЭК.
Продолжная использовать наш сайт, вы даете согласие на использование файлов Cookie, пользовательских данных (IP-адрес, вид операционной системы, тип браузера, сведения о местоположении, источник, откуда пришел на сайт пользователь, с какого сайта или по какой рекламе, какие страницы
открывает и на какие страницы нажимает пользователь) в целях функционирования сайта, проведения статистических исследований и обзоров. Если вы не хотите, чтобы ваши данные обрабатывались, покиньте сайт.
При оформлении заказа в ServerFlow вы можете сообщить о намерении оставить отзыв о нашей работе после получения товара.
Нам важно ваше честное мнение. Оно помогает развивать сервис и даёт другим клиентам представление о нашей работе.
Вы можете оставить отзыв на удобной для вас платформе:
Google Maps
2GIS
Яндекс Карты
Как работает акция
Применяя промокод, вы подтверждаете намерение поделиться впечатлением о работе ServerFlow после получения заказа. Мы применяем бонус уже к текущему заказу в знак благодарности за обратную связь.
Условия акции:
скидка 1 500 ₽ при заказе от 30 000 ₽
или бесплатная доставка* при заказе до 30 000 ₽
* Бесплатная доставка заказа осуществляется до ПВЗ СДЭК.