
El MiniMax-Music3 modelo de música ya puede desplegarse con pesos utilizables, código de inferencia y tres vías de ejecución documentadas. El sistema convierte letras con etiquetas de secciones y una descripción detallada del tema en una canción completa de hasta cinco minutos.
La salida se genera como un archivo WAV estéreo de 32 kHz y 16 bits. MiniMax publicó el modelo el 13 de agosto de 2026 con un enfoque de pesos abiertos, por lo que no se trata únicamente de una demostración o de un adelanto de investigación.
MiniMax-Music3 genera canciones de hasta cinco minutos a partir de letras y una Structured Caption. Permite uso comercial con atribución visible, aunque las organizaciones que superen ciertos ingresos deben solicitar autorización adicional.
Cómo funciona MiniMax-Music3
El modelo separa la información textual en dos entradas. Las letras incluyen etiquetas como [Intro], [Verse], [Chorus], [Bridge] o [Outro], mientras que la Structured Caption describe tres áreas: metadatos globales, características vocales y arreglos. También se distribuye una herramienta que amplía descripciones breves hasta ese formato estructurado y puede ejecutarse sin conexión.
Su arquitectura combina un Hybrid-LM con un modelo Global LLM de 8.000 millones de parámetros y un Local LLM de 600 millones. El primero predice la estructura musical a largo plazo y el segundo trabaja con los códigos acústicos restantes dentro de cada instante temporal. El material publicado no ofrece una identificación completamente consistente del modelo de base: la documentación menciona Qwen3-8B, mientras que una publicación de investigación cita Qwen3.5-8B.
La síntesis utiliza después un módulo de flow matching de 2.400 millones de parámetros y un Flow-VAE de 123 millones heredado de MiniMax Speech. El sistema fusiona los estados ocultos de los dos modelos de lenguaje y los transforma en un espacio latente de audio. En inferencia no necesita cargar el decodificador discreto del tokenizador.
Formas de ejecutar el modelo
MiniMax documenta tres caminos de despliegue. SGLang-Omni funciona como servidor de referencia y requiere dos GPU CUDA: una ejecuta Qwen y la generación autorregresiva, y la otra se encarga del flow matching y la decodificación de audio.
La canalización modular basada en diffusers puede funcionar con menos de 24 GB de VRAM a precisión completa. El uso de descarga automática a CPU reduce la exigencia aproximada a 22 GB, mientras que el group offloading a nivel de hojas permite bajar hasta 8 GB. ComfyUI ofrece además una plantilla nativa de texto a música con pesos FP16 e INT8 adaptados por Comfy-Org.
Licencia y usos previstos
La licencia comunitaria permite el uso comercial, pero exige mostrar «MiniMax-Music3» de forma visible en la interfaz del producto. Las organizaciones cuyos productos generen más de 20 millones de dólares estadounidenses de ingresos anuales agregados necesitan autorización previa por escrito de MiniMax. Quienes ofrezcan generación a terceros también deben mantener medidas contra la producción de contenidos que infrinjan derechos.
El modelo puede resultar útil para bandas sonoras de vídeos creados por usuarios, música adaptativa para juegos, anuncios localizados, identidad sonora de marcas, maquetas para compositores, listas condicionadas por estados de ánimo y generación por lotes sin costes por canción asociados a una API. Estas posibilidades dependen, en todo caso, de la calidad obtenida y de la evaluación práctica de cada flujo de trabajo.
Qué supone este lanzamiento
MiniMax-Music3 destaca por reunir generación de canciones largas, pesos disponibles y varias opciones de ejecución local en el mismo lanzamiento. Para creadores y equipos pequeños, el acceso offline puede facilitar pruebas y lotes de producción, aunque la capacidad de hardware sigue siendo relevante en la configuración de referencia.
La licencia impone condiciones concretas para los productos comerciales y la discrepancia sobre el checkpoint de base debe resolverse en la documentación. También quedan por valorar de forma independiente la consistencia entre letras y estructura, la calidad musical y la gestión de posibles salidas infractoras.
Encuentra más IA en nuestra sección de IA o suscríbete a Guslok – Guías 100% en YouTube para más contenido.