Что такое MiniMax Music 3
MiniMax Music 3 – модель для генерации целых песен длительностью до пяти минут на основе текста и описания музыкального стиля. Пользователь задаёт лирику и описание композиции, а модель собирает из этого готовый трек: с вокалом, инструментами, развивающейся аранжировкой. Причём это не генератор коротких лупов или фонового звука для видео. Здесь цель другая – структурно связная песня с интро, куплетами, припевом и прочими частями, как у настоящего трека.
Разработчик – компания MiniMax, модель опубликована на Hugging Face как открытая. И это важное уточнение: перед нами не веб-сервис с подпиской и кнопкой «сгенерировать», а модель, которую нужно разворачивать самому через поддерживаемые библиотеки – Diffusers, SGLang-Omni или ComfyUI.
Главная техническая особенность MiniMax Music 3 – способность удерживать музыкальную тему, ритм, тембр вокала и логику аранжировки на протяжении всей песни, а не только в пределах короткого отрезка. Задача неочевидная для генеративных музыкальных моделей: многие неплохо справляются с 20–30 секундами звука, но на более длинных дистанциях начинают «терять нить». Здесь же заявлена работа с треками вплоть до пяти минут при сохранении связности.
Аудитория модели – разработчики, ML-инженеры и технически подкованные музыкальные продюсеры, готовые работать с GPU, устанавливать зависимости и писать код для инференса. Для обычного пользователя без навыков Python и CUDA такой формат неудобен – простого веб-интерфейса нет, только программный доступ через библиотеки. Зато для тех, кто строит собственные продукты на базе генерации музыки – от прототипов музыкальных сервисов до исследовательских проектов – это готовый строительный блок с открытым кодом.
Выходной формат – WAV-файл с частотой дискретизации 32 кГц, 16 бит, стерео. По меркам многих ИИ-генераторов музыки это студийное качество звука. Хотя, конечно, оно не отменяет ограничений самой генеративной модели: точное соответствие всем деталям промпта никто не гарантирует.

Ключевые возможности MiniMax Music 3
Генерация полных песен до пяти минут
Модель создаёт не фрагмент, а завершённую композицию с чёткой структурой: интро, куплет, пре-припев, припев, пост-припев, бридж, инструментальная вставка, соло и аутро. Так решается проблема, знакомая многим генераторам музыки – распад композиции на разрозненные куски без общей логики развития.
На практике это выглядит так: пользователь передаёт полный текст песни с разметкой разделов и получает один аудиофайл, где вокальная партия, инструментал и динамика меняются в соответствии со структурой трека. Например, для лирики с тегами [Verse], [Chorus], [Bridge] модель выстроит соответствующие переходы между тихими и энергичными частями.
Управление через лирику и описание музыки
Модель принимает два входа: текст песни (lyrics) и текстовое описание музыки (music description). Лирика может содержать теги разделов – [Intro], [Verse], [Pre-Chorus], [Chorus], [Post-Chorus], [Bridge], [Instrumental], [Solo], [Outro], которые задают структуру песни напрямую в тексте.
Так решается задача точного контроля: вместо абстрактного «сделай красиво» пользователь может явно указать, где должен быть куплет, а где – инструментальная пауза. Можно написать текст с разметкой [Chorus] перед строчками, которые должны звучать как припев, и модель постарается выстроить под это соответствующую динамику.
Для более детального контроля разработчики рекомендуют использовать так называемый Structured Caption – описание, разбитое на три блока: глобальные метаданные (жанр, темп, тональность, эмоциональная динамика), детали вокала (пол голоса, тембр, манера исполнения, бэк-вокал) и аранжировку (инструменты, их развитие по секциям, ритм-секция, пространственные эффекты). Такая структура позволяет управлять не только общим стилем, но и тем, как композиция меняется во времени.
Иерархическая архитектура Global LLM и Local LLM
В основе модели – связка из двух языковых моделей разного масштаба. Global LLM на 8 миллиардов параметров (инициализирован на базе Qwen3-8B) отвечает за долгосрочную музыкальную структуру: предсказывает первый кодбук RVQ, работает с семантикой и композицией песни в целом. Local LLM на 0,6 миллиарда параметров восстанавливает детали на уровне отдельных кадров – тонкую акустическую фактуру звука.
Такое разделение решает классическую проблему генеративных аудиомоделей: сложно одновременно удерживать общую структуру произведения и прорабатывать мелкие акустические детали одной моделью. Здесь эти задачи разнесены между двумя компонентами, которые обучаются совместно.
На практике это выражается в том, что модель способна одновременно помнить, какая часть песни сейчас звучит – куплет или припев, и подробно прорисовывать вокальную артикуляцию или текстуру инструментов в конкретный момент времени.
Непрерывный синтез звука через Flow Matching и Flow-VAE
Вместо декодирования звука напрямую из дискретных токенов RVQ модель использует непрерывные скрытые состояния (hidden states) от Global и Local LLM. Они проходят через архитектуру Flow-VAE, адаптированную из модели MiniMax Speech и переобученную под музыку.
Так решается проблема потери качества при дискретизации звука: непрерывные представления сохраняют больше информации о вокальной артикуляции, текстуре инструментов и временной связности, чем чисто токенный подход. При инференсе синтез волновой формы опирается именно на объединённые скрытые состояния LLM, а не на декодер дискретного токенайзера.
Тренировочный токенайзер модели построен на восьми слоях Residual Vector Quantization: первый семантический кодбук (16 384 записи) отвечает за музыкальную структуру, остальные семь акустических кодбуков (по 1024 записи каждый) – за остаточные акустические детали. Но это внутренняя механика обучения – на этапе генерации пользователю она напрямую не видна.
Гибкий запуск: SGLang, Diffusers, ComfyUI
Модель поддерживается несколькими инференс-фреймворками, что расширяет варианты интеграции. SGLang-Omni подходит для серверного развёртывания, Diffusers – для интеграции в Python-пайплайны, ComfyUI – для визуальных ноды-based workflow, привычных тем, кто работает с генеративными изображениями и видео.
Отдельно предусмотрен режим для видеокарт с ограниченным объёмом видеопамяти. С автоматическим CPU offloading модель умещается примерно в 22 ГБ VRAM, а при послойной потоковой загрузке языковой модели – даже в 8 ГБ. Это расширяет круг пользователей, у которых нет доступа к топовым GPU с 24+ ГБ памяти.
Условия использования MiniMax Music 3
MiniMax Music 3 доступен пользователям полностью бесплатно.
Каких-либо пробных периодов не требуется – сервис можно использовать сразу без привязки банковской карты и без скрытых платежей.
Часто задаваемые вопросы
Что такое MiniMax Music 3
MiniMax Music 3 – это открытая модель для генерации целых песен длительностью до пяти минут на основе текста лирики и описания музыкального стиля. Она создаёт готовый трек с вокалом, инструментами и развивающейся аранжировкой, а не короткий музыкальный фрагмент. Разработчик – компания MiniMax, модель опубликована на Hugging Face.
Для чего нужен MiniMax Music 3
Модель нужна для автоматической генерации структурно связных песен с интро, куплетами, припевом и другими частями по заданному тексту и описанию стиля. Она решает задачу создания полноценного трека, а не фонового звука или короткого лупа. Подходит для построения собственных продуктов и прототипов на базе генерации музыки.
Кому подойдет MiniMax Music 3
MiniMax Music 3 ориентирована на разработчиков, ML-инженеров и технически подкованных музыкальных продюсеров, готовых работать с GPU и разворачивать модель через код. Для этого нужны навыки Python и понимание работы с CUDA. Обычному пользователю без веб-интерфейса и без опыта программирования такой формат будет неудобен.
Как пользоваться MiniMax Music 3
Модель нужно развернуть самостоятельно через поддерживаемые библиотеки – Diffusers, SGLang-Omni или ComfyUI. Пользователь передаёт текст песни (при желании с тегами разделов вроде `[Verse]` или `[Chorus]`) и текстовое описание музыки, после чего модель генерирует готовый аудиофайл. Готового веб-сервиса с кнопкой «сгенерировать» нет – доступ только программный.
Какие возможности есть у MiniMax Music 3
Ключевые возможности – генерация полных песен до пяти минут с сохранением музыкальной связности, управление структурой через теги разделов в лирике и детальные текстовые описания (Structured Caption), а также вывод в формате WAV 32 кГц/16 бит стерео. За качество отвечает архитектура из двух языковых моделей – Global LLM и Local LLM, которые совместно удерживают структуру и прорабатывают акустические детали.
Есть ли бесплатный тариф у MiniMax Music 3
MiniMax Music 3 распространяется как открытая модель на Hugging Face, а не как облачный сервис с подпиской. Понятия тарифов или лимитов в привычном для SaaS-продуктов виде здесь нет – модель можно скачать и развернуть самостоятельно.
Какие есть ограничения у MiniMax Music 3
Генерация ограничена 9000 акустическими фреймами, а текстовый промпт – 5000 токенами. Инференс требует видеокарты NVIDIA с поддержкой CUDA, без неё модель локально не запустить. Поддерживается только не-потоковая генерация – аудио выдаётся целиком после завершения обработки, а точное соответствие всем деталям промпта не гарантируется.
Сколько видеопамяти нужно для запуска MiniMax Music 3
С автоматическим CPU offloading модель умещается примерно в 22 ГБ VRAM. При послойной потоковой загрузке языковой модели требования снижаются до 8 ГБ, что делает запуск возможным на менее мощных видеокартах без 24+ ГБ памяти.
Чем MiniMax Music 3 отличается от других генераторов музыки
Можно выделить способность удерживать музыкальную тему и структуру на протяжении до пяти минут – тогда как многие генеративные модели теряют связность уже после 20–30 секунд звучания.