2026年8月13日,MiniMax正式开放新一代音乐生成模型 MiniMax Music 3.0 的模型权重,并同步公布其完整技术架构和本地推理方案。模型可以根据一个音乐创意以及可选歌词,在单次生成中完成作曲、编曲、演唱和最终音频制作,最长支持约5分钟完整歌曲。

与很多更偏“生成一段好听音乐”的模型不同,Music 3.0重点解决的是长歌曲中非常容易出现的几个问题:
主歌唱到后面,原来的音乐风格逐渐消失;
第二遍副歌与第一遍缺乏关联;
歌手音色在不同段落发生漂移;
乐器突然消失或无逻辑增加;
整体情绪没有起伏;
5分钟只是“把30秒音乐循环10遍”。
MiniMax把Music 3.0的目标定义得比较明确:不仅要把音频生成得更长,还要让整首歌曲在主题、节奏、人声身份以及编曲推进上维持完整音乐逻辑。
MiniMax Music 3.0是什么?
Music 3.0是一款文本与歌词驱动的完整歌曲生成模型。
它接收两个核心输入:
**Lyrics(歌词)**负责规定实际演唱内容以及歌曲宏观结构。
**Music Description(音乐描述)**则负责控制曲风、情绪、人声表现、乐器、编曲和最终制作质感。
例如可以输入:
温暖的华语流行抒情歌,74 BPM,成熟男声,主歌克制温柔,副歌逐渐加入鼓组和弦乐,最后回归钢琴独奏,整体具有真实录音棚质感。
再提供完整歌词,模型就会尝试把这些要求组织成一首具有:
前奏 → 主歌 → 预副歌 → 副歌 → Bridge → Final Chorus → Outro
等完整结构的歌曲。
最长5分钟不是简单延长音频
MiniMax Music 3.0原生支持最长约5分钟完整歌曲生成。官方强调,它会在长序列中持续维持音乐主题、节奏、人声音色和编曲发展,而不仅是把一段短音乐机械延长。
当前支持的主要结构标签包括:
| 标签 | 作用 |
|---|---|
[Intro] | 前奏 |
[Verse] | 主歌 |
[Pre-Chorus] | 预副歌 |
[Chorus] | 副歌 |
[Post-Chorus] | 后副歌 |
[Bridge] | 桥段 |
[Instrumental] | 器乐段 |
[Solo] | 独奏 |
[Outro] | 尾奏 |
这些标签可以直接写进歌词,让模型知道不同歌词分别属于什么歌曲段落。
例如:
[Intro][Verse]凌晨三点城市还醒着窗外的灯慢慢褪色[Pre-Chorus]如果明天真的会改变[Chorus]那就让风带我向前把没有说完的话唱一遍[Bridge][Final Chorus][Outro]这比单纯给模型一整段没有结构的歌词,更容易控制整首歌的发展。
核心架构:8B Global LLM+0.6B Local LLM
Music 3.0采用一套 Hierarchical Autoregressive / Hybrid-LM分层自回归架构。
简单理解,就是不让同一个模型同时负责“这首歌未来两分钟应该怎么发展”和“这一帧鼓点应该长什么样”这两个尺度完全不同的问题。
而是拆成两层。
Global LLM:负责整首歌“大方向”
Global LLM规模为 8B参数。
它按照时间逐帧预测第一层核心音乐Token,负责理解和保持:
整首歌主题;
长程音乐结构;
主歌与副歌关系;
情绪发展;
编曲推进;
人声身份;
音乐语义。
也就是说,它更像:
作曲家+编曲总监。
它首先考虑的是:
这首歌接下来应该往哪里发展?
Local LLM:负责每一帧“声音细节”
Local LLM规模为 0.6B参数。
它不会重新规划整首歌,而是围绕每个时间帧继续预测剩余声学Codebook,补充细粒度声音信息。
例如:
乐器质感;
鼓点细节;
高频信息;
人声纹理;
空间感;
声学残差。
可以把它理解成:
录音师+声音细节工程师。
最终形成:
8B Global LLM负责整首歌结构↓0.6B Local LLM负责局部声音细节↓音频合成这也是Music 3.0能够兼顾长程结构和局部音质的核心设计。
为什么不用一个巨大的模型全部解决?
一首5分钟歌曲存在两个完全不同的时间尺度。
在宏观层面,需要知道:
第二遍副歌应该比第一遍更强。
Bridge之后需要形成情绪释放。
Outro应该逐渐收束。
但在微观层面,又需要处理:
这一帧吉他的拨弦是什么质感。
鼓的Attack应该多强。
人声气息应该如何变化。
如果所有问题都使用同一套高成本序列预测,会让计算和建模都非常复杂。
Music 3.0通过Global / Local分工,把:
“歌曲结构”
和:
“声音细节”
拆成两个层级处理。
8层RVQ进一步拆分音乐语义和声学细节
Music 3.0的Music Tokenizer使用 8层Residual Vector Quantization(RVQ)。
第一层Codebook拥有:
16,384个Entries
主要用于表示:
核心音乐语义;
歌曲结构。
其余7层每层拥有:
1,024个Entries
用于逐渐补充声学残差信息。
也就是:
第1层歌曲到底在唱什么、怎么发展↓第2—8层把声音纹理一点点补完整MiniMax采用分阶段训练:先让第一层建立比较稳定的音乐信息骨架,再让全部8层一起学习更细的声音表现。
不直接用离散Token还原最终声音
Music 3.0还有一个比较重要的设计:
最终生成音频时,并不是简单把前面的离散RVQ Token全部扔给Decoder。
它会进一步取Global LLM和Local LLM最后几层的 连续Hidden States,进行融合。
完整路径为:
Global LLM Hidden States+Local LLM Hidden States↓Hidden-State Fusion↓2.4B Flow Matching↓Flow-VAE Latent↓123M Flow-VAE Decoder↓最终音频其中Flow Matching模块约为 2.4B参数,最终Flow-VAE Decoder约 123M参数。
MiniMax认为,连续Hidden State比单纯离散Token保留了更多高维声学信息,可以改善:
人声发音;
乐器质感;
时间连续性;
音色表现;
混音细节。
最终输出32kHz、16-bit立体声WAV
开放权重版本最终输出规格为:
32 kHz、16-bit、Stereo WAV。
这已经不是简单的音乐草稿MIDI,而是直接生成最终波形音频。
不过,它仍然不能自动等同于专业母带成品。
真正用于发行时,仍可能需要:
EQ;
Compressor;
Limiter;
Loudness处理;
人声修正;
Stem后期;
专业混音和母带。
AI负责把创作起点大幅向“完整歌曲”方向推进,但专业音乐制作仍有独立价值。
Music Description可以写得非常详细
Music 3.0支持非常细粒度的音乐描述。
MiniMax建议高级用户采用 Structured Caption,分成三个部分。
Global Metadata
可以定义:
Genre;
Subgenre;
BPM;
Key;
Scale;
Emotional Progression;
Listening Scenario;
Production Profile。
例如:
Genre: Alternative R&BBPM: 88Key: F# minorMood: restrained and lonely at first,gradually becoming hopefulProduction: spacious modern studio mixVocal Details
可以控制:
男声 / 女声;
音色;
演唱风格;
气声;
假声;
和声;
Backing Vocals;
Delay;
Auto-Tune等。
Arrangement
可以继续描述:
主乐器;
辅助乐器;
哪个段落加入什么乐器;
Groove;
Bass;
Percussion;
Texture;
Spatial Effects。
这使Prompt开始越来越像一份:
制作人给编曲师和录音师的Production Brief。
可以让副歌真正“变大”
AI音乐一个非常典型的问题是:
主歌是这个编曲,到了副歌只是“声音更响”。
Music 3.0希望通过歌词Section Tag+Structured Caption同时控制歌曲结构变化。
例如可以写:
Verse:only piano, muted bass and intimate female vocal.Pre-Chorus:strings slowly enter,drums begin building tension.Chorus:full drums, wide guitars,layered backing vocals,larger stereo image.Bridge:drop drums entirely,leave vocal and ambient piano.Final Chorus:return with full band,additional octave harmony,maximum emotional intensity.这样模型知道:
不同段落不只是换歌词,也应该改变编曲。
人声也是Music 3.0重点升级方向
MiniMax认为,AI音乐最容易暴露“机器感”的部分之一就是人声。
常见问题包括:
高频数字噪声;
发音不清楚;
呼吸不自然;
Phrase太机械;
情绪不能随音乐变化;
和声听起来像复制出来的。
Music 3.0通过Structured Caption控制人声音色、唱法、Breathy、Falsetto、Harmony和效果器,再结合连续Hidden State进行音频重建,以提高人声自然度。
官方还特别提到,希望让呼吸成为演唱本身的一部分,而不是附着在人声附近的合成噪声。
乐器细节也更加明确
Music 3.0并不只优化人声。
官方重点提到:
弦乐Attack与拉弓;
鼓和Bass冲击感;
高密度电子音乐中的乐器分离;
人声周围的空间感;
Glissando;
Legato。
这些声音细节主要受益于Hidden-State Fusion、Flow Matching和针对音乐重新训练的Flow-VAE。
它的目标是让不同乐器在编曲中的职责更加清楚,而不是所有声音挤成一团。
不会写专业音乐Prompt怎么办?
MiniMax还同步提供了一个很适合Agent用户的官方Skill:
music-caption-rewriter。
安装方式:
npx skills add MiniMax-AI/MiniMax-Music3 \ --skill music-caption-rewriter它可以把一句很普通的描述:
一首夏夜开车听的浪漫R&B,女声。
进一步扩写成结构化的:
Global Metadata;
Vocal Details;
Arrangement。
而且Skill已经给出了Claude Code、Cursor、Codex等Agent的安装方法。
这也意味着AI音乐开始与Agent Skills生态连接起来。
未来可能不是用户自己研究几十个音乐术语,而是:
用户描述创意↓Agent分析↓Music Caption Skill扩写↓Music 3生成↓Agent继续试听和调整现在已经可以下载权重
8月13日发布的Music 3.0是 Open-Weights版本,权重已经上线MiniMax官方Hugging Face,同时提供GitHub项目。
可以直接下载:
hf download MiniMaxAI/MiniMax-Music3 \ --local-dir /path/to/minimax_music3官方目前推荐的运行方案包括:
SGLang / SGLang-Omni;
Hugging Face Diffusers;
ComfyUI。
需要注意,我目前在MiniMax官网、GitHub README及Hugging Face模型卡中没有看到清晰展示的权重许可证文本,所以更严谨的表述是:
“开放权重”
而不是直接将其等同为任何特定OSI开源许可证。
24GB显卡就能运行?
官方Hugging Face模型卡给出的部署说明比较有意思。
标准全精度Diffusers Pipeline可以在 24GB以上显存GPU中运行。通过Automatic CPU Offload,实际显存需求可以压到约22GB。
如果显存继续降低,还可以使用Layer-by-Layer Group Offloading。
官方表示,即使 8GB显存也可以把模型跑起来,只是速度会明显降低。
所以部署可以简单理解成:
| 显存 | 方式 |
|---|---|
| 24GB+ | 正常本地推理 |
| 约22GB | CPU Offload |
| 8GB级 | Layer Streaming / Group Offload,速度更慢 |
不过目前推理仍要求CUDA,因此Mac上的Apple GPU并不是官方当前支持的标准推理路线。
目前不支持流式生成音频
开放权重版本当前还有一个重要限制:
只支持Non-Streaming Generation。
也就是说,并不是一边生成歌曲,一边立即实时播放。
需要先完成当前生成任务,再获得最终音频。
这一点与MiniMax商业API有所区别:开放平台Music Generation API本身提供stream参数。
所以需要区分:
- 开源/开放权重本地推理实现:当前非流式;
- MiniMax托管API:接口支持流式返回。
API也已经开放,甚至有免费版
Music 3.0并不是只有本地部署。
MiniMax开放平台目前提供:
music-3.0以及:
music-3.0-free两个接口版本。
其中:
music-3.0:付费及Token Plan用户,RPM 120;music-3.0-free:所有API Key用户均可调用,RPM 3。
国内开放平台当前价格为:
| 模型 | 价格 |
|---|---|
| Music-3.0-free | 0元 |
| Music-3.0 | 1元/首 |
| 歌词生成 | 0.05元/首 |
国际平台价格则为Music-3.0 0.15美元/首,最长5分钟。
没有歌词,也可以让AI先写
MiniMax API目前还支持Lyrics Optimizer。
如果:
lyrics_optimizer = true同时歌词为空,系统可以根据音乐Prompt自动生成歌词。
也就是说可以直接输入:
一首关于毕业以后朋友渐行渐远的华语流行摇滚,情绪从怀念逐渐走向释然。
平台先生成歌词,再由Music 3.0完成歌曲。
同样支持:
is_instrumental = true生成无人声纯音乐。
因此实际支持:
歌词+音乐描述 → 完整歌曲;
只有想法 → 自动歌词+歌曲;
音乐描述 → 纯音乐。
本地模型还有一些使用限制
官方模型卡目前列出了几个已知边界。
第一,文本Prompt Token化以后最多 5000 Tokens。
第二,音频生成最大限制为 9000 acoustic frames。
第三,Section Tags和音乐描述属于生成控制,而不是像MIDI指令一样的严格符号约束。
因此你要求:
必须126 BPM。
必须B-flat Major。
第48.5秒必须出现小提琴。
所有歌词逐字完全一致。
模型仍有可能发生偏差。
官方明确提醒,生成出的Tempo、Key、Instrumentation、Lyrics和Song Structure并不能保证100%逐项符合要求。
所以它更像:
非常听话的AI制作人
而不是:
可以精确到每一个Note Event的DAW。
Music 3.0与传统DAW是什么关系?
Music 3.0不会直接替代:
Ableton Live;
Logic Pro;
FL Studio;
Cubase;
Pro Tools。
它更适合将过去创作中的第一阶段:
写歌↓找旋律↓编曲Demo↓找歌手↓录制Demo压缩成:
描述想法+歌词↓完整歌曲Demo一名创作者可以迅速测试:
这个副歌好不好听;
男声还是女声;
R&B还是Rock;
要不要加弦乐;
Bridge应该怎么发展。
然后再决定是否进入正式制作。
特别适合哪些场景?
AI歌曲创作
独立音乐人可以快速把歌词变成完整Demo。
短视频和自媒体BGM
为不同内容定制音乐,不必长期依赖同一批公共音乐素材。
游戏音乐
生成:
主界面音乐;
剧情音乐;
Boss音乐;
场景BGM;
角色主题曲。
品牌音乐
快速测试品牌歌曲、广告音乐和活动主题曲方向。
AI短剧
可以根据剧情分别生成:
片头;
情绪BGM;
插曲;
片尾曲。
Agent自动内容生产
结合MiniMax官方Music Skill之后,可以让Agent自动完成:
理解内容主题↓写歌词↓规划歌曲结构↓扩写Music Caption↓调用Music 3↓生成最终WAV官方MiniMax Skills仓库已经提供Music Generation相关Skill,用于将音乐生成接入Agent工作流。
从Music 1.5到Music 3.0,完整歌曲越来越长
MiniMax此前的Music 1.5已经支持最长约4分钟音乐生成,而Music 3.0进一步将完整歌曲能力提升至约5分钟,并重新设计了长程结构和音频合成链路。
真正的升级不只是:
4分钟 → 5分钟。
而是长时间生成中,模型开始更重视:
主题保持;
结构推进;
动态变化;
乐器进出;
人声身份;
最终收束。
一个需要注意的官方资料差异
目前MiniMax官方博客与Hugging Face模型卡,对Global LLM初始化模型的描述存在差异。
MiniMax 8月13日官方技术博客写的是:
Qwen3.5-8B。
当前Hugging Face模型卡则写:
Qwen3-8B。
由于两边均属于MiniMax官方页面,目前不建议在文章标题或核心卖点中强调具体Qwen版本。
更稳妥的说法是:
Music 3.0采用8B Global LLM作为全局音乐建模核心。
等待MiniMax后续统一模型卡口径。
总结
MiniMax于2026年8月13日正式开放 Music 3.0模型权重。需要区分的是,Music-3.0 API其实早在7月16日已经进入MiniMax开放平台,因此此次最大的变化,是开发者终于可以下载模型并自行部署。
Music 3.0最核心的结构是:
8B Global LLM+0.6B Local LLM。
Global LLM负责整首歌的长程语义、主题和结构发展;Local LLM负责每一个Frame内部的声学细节。
在此基础上,模型继续使用:
8层RVQ;
Continuous Hidden-State Fusion;
2.4B Flow Matching;
123M Flow-VAE。
最终生成32kHz、16-bit立体声WAV。
用户既可以给完整歌词,也可以用 [Verse]、[Chorus]、[Bridge]、[Solo]、[Outro] 等标签控制歌曲结构,再通过Structured Caption描述BPM、Key、情绪、人声音色、乐器和编曲变化。
本地部署已经支持SGLang-Omni、Diffusers和ComfyUI;官方还提供music-caption-rewriter Skill,让Codex、Claude Code、Cursor等Agent帮助普通用户自动把一句音乐创意扩展成专业生成说明。
API方面,则同时提供music-3.0和免费限速版music-3.0-free,国内标准版当前为1元/首。
Music 3.0真正值得关注的地方,不是AI终于能“唱够5分钟”。
而是音乐模型开始尝试理解:
一首歌为什么要在这里进入副歌、为什么Bridge应该收住、为什么最后一次副歌应该比第一次更有力量。
当AI能够同时理解歌词、结构、编曲、人声和最终声学表现后,音乐生成正在从:
“生成一段听起来像音乐的音频”
进一步走向:
“完成一首真正具有开头、发展、高潮和结尾的歌曲”。









评论区 (0)
最新评论登录后发布评论并参与互动。
暂无评论,欢迎抢沙发。