Top.Mail.Ru
MiniMax Music 3 — компактная модель для генерации музыки длительностью до 5 минут | Блог Serverflow Скачать
прайс-лист
Бесплатная
доставка по РФ
Бонус за
обратную связь
Интернет-магазин
Серверного оборудования
8 (800) 222-70-01 Консультация IT-специалиста Сравнение

MiniMax Music 3 — компактная модель для генерации музыки длительностью до 5 минут

~ 2 мин
56
Простой
Новости
MiniMax Music 3 — компактная модель для генерации музыки длительностью до 5 минут

Введение

Китайская ИИ-лаборатория MiniMax представила MiniMaxMusic 3 — новую открытую высокопроизводительную модель для синтеза музыки, способную генерировать целостные композиции длительностью до 5 минут. В основе лежит гибридная архитектура, объединяющая глобальную языковую модель на 8 миллиардов параметров и локальную модель на 0,6 миллиардов параметров, работающие в тандеме для раздельного моделирования музыкальной структуры и акустических деталей. Модель принимает текст песни с возможными тегами секций и детальное описание желаемого стиля, вокала и аранжировки, а на выходе выдает 32-килогерцевый 16-битный стереофонический WAV-файл. Music 3 уже доступна для тестирования через демо-версию.

Подробнее о MiniMax Music 3

Ключевая особенность Music 3 — способность удерживать долгосрочную музыкальную связность на протяжении всей композиции длительностью до 5 минут. Модель сохраняет тематические мотивы, ритм, вокальную идентичность и последовательность аранжировок, что позволяет создавать полноценные структуры песен: вступление, куплет, предприпев, припев, бридж, инструментальный проигрыш и концовку.

Для управления генерацией используются два входных параметра: текст песни и описание музыки. Текст может включать явные теги секций, например [Intro], [Verse], [Pre-Chorus], [Chorus], [Bridge], [Instrumental] и [Outro], что дает пользователю структурный контроль. Описание музыки определяет жанр, эмоциональный окрас, тембр вокала, инструменты, аранжировку и особенности продюсирования. Разработчики рекомендуют применять структурированные субтитры с тремя блоками: глобальные метаданные (жанр, BPM, тональность, звукоряд, эмоциональная прогрессия, сценарий прослушивания, производственный профиль), вокальные данные (пол вокалиста, тембр, стиль исполнения, гармония, бэк-вокал, эффекты) и аранжировка (основные и второстепенные инструменты, их эволюция по секциям, грув, бас, перкуссия, текстуры, пространственные эффекты). 

Гибридная архитектура MiniMax Music 3 использует иерархический авторегрессионный подход, который разделяет глобальное музыкальное моделирование и локальное акустическое. Глобальная модель на 8 миллиардов параметров (инициализированная на основе Qwen3-8B) предсказывает первый кодовый словарь Residual Vector Quantization покадрово, отвечая за долгосрочную семантическую и структурную прогрессию песни. Локальная модель на 0,6 млрд параметров восстанавливает оставшиеся семь акустических кодовых словарей в каждом кадре, наполняя музыку деталями — вокальной артикуляцией, инструментальной фактурой, временной непрерывностью.

Ключевой инновацией является модуль синтеза с непрерывным скрытым состоянием. Вместо декодирования только из дискретных токенов RVQ модель объединяет конечные скрытые состояния глобальной и локальной LLM и на их основе генерирует звук с помощью архитектуры Flow-VAE, адаптированной из MiniMax Speech и переобученной под динамический диапазон и спектральные характеристики музыки. Такой подход сохраняет более богатую акустическую информацию, чем классическое авторегрессионное декодирование, что положительно сказывается на качестве и естественности звучания. Музыкальный токенизатор обучается на восьми слоях RVQ: первый семантический словарь на 16 384 элемента отражает основную музыкальную семантику, а остальные семь акустических словарей по 1 024 элемента кодируют остаточные детали. В процессе инференса дискретный декодер не требуется — используется только непрерывное представление.

Выводы

MiniMax Music 3 — это отличная модель не только для экспериментаторов и музыкантов, но и для бизнеса, которому требуется конвейерная генерация рекламных и фоновых треков без серьезных затрат на содержание LLM. Кроме того, модель сама по себе представляет значительный шаг для индустрии открытых ИИ для синтеза музыки. Разделение модели на глобальный и локальный компоненты решает фундаментальную проблему масштабируемости, позволяя генерировать длинные композиции с сохранением структурной целостности без чрезмерных затрат. Интеграция непрерывного скрытого синтеза с Flow-VAE отходит от чисто дискретного подхода, что приближает результат к студийному качеству. Модель уже доступна для скачивания на HuggingFace.
Автор: Serverflow Serverflow
Поделиться

Комментарии 0

Написать комментарий
Сейчас тут ничего нет. Ваш комментарий может стать первым.
Написать отзыв
До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Написать комментарий

Комментарий появится на сайте после предварительной модерации

До 6 фото, размером до 12Мб каждое
Мы получили ваш отзыв!

Он появится на сайте после модерации.

Мы свяжемся с вами утром

График работы: Пн-Пт 10:00-18:30 (по МСК)

Обработаем вашу заявку
в ближайший рабочий день

График работы: Пн-Пт 10:00-18:30 (по МСК)