2026年8月13日,MiniMax正式开放新一代音乐生成模型 MiniMax Music 3.0 的模型权重,并同步公布其完整技术架构和本地推理方案。模型可以根据一个音乐创意以及可选歌词,在单次生成中完成作曲、编曲、演唱和最终音频制作,最长支持约5分钟完整歌曲。

image.png

与很多更偏“生成一段好听音乐”的模型不同,Music 3.0重点解决的是长歌曲中非常容易出现的几个问题:


  • 主歌唱到后面,原来的音乐风格逐渐消失;

  • 第二遍副歌与第一遍缺乏关联;

  • 歌手音色在不同段落发生漂移;

  • 乐器突然消失或无逻辑增加;

  • 整体情绪没有起伏;

  • 5分钟只是“把30秒音乐循环10遍”。

MiniMax把Music 3.0的目标定义得比较明确:不仅要把音频生成得更长,还要让整首歌曲在主题、节奏、人声身份以及编曲推进上维持完整音乐逻辑。

MiniMax Music 3.0是什么?

Music 3.0是一款文本与歌词驱动的完整歌曲生成模型。

它接收两个核心输入:

**Lyrics(歌词)**负责规定实际演唱内容以及歌曲宏观结构。

**Music Description(音乐描述)**则负责控制曲风、情绪、人声表现、乐器、编曲和最终制作质感。

例如可以输入:

温暖的华语流行抒情歌,74 BPM,成熟男声,主歌克制温柔,副歌逐渐加入鼓组和弦乐,最后回归钢琴独奏,整体具有真实录音棚质感。

再提供完整歌词,模型就会尝试把这些要求组织成一首具有:

前奏 → 主歌 → 预副歌 → 副歌 → Bridge → Final Chorus → Outro

等完整结构的歌曲。

最长5分钟不是简单延长音频

MiniMax Music 3.0原生支持最长约5分钟完整歌曲生成。官方强调,它会在长序列中持续维持音乐主题、节奏、人声音色和编曲发展,而不仅是把一段短音乐机械延长。

当前支持的主要结构标签包括:

标签作用
[Intro]前奏
[Verse]主歌
[Pre-Chorus]预副歌
[Chorus]副歌
[Post-Chorus]后副歌
[Bridge]桥段
[Instrumental]器乐段
[Solo]独奏
[Outro]尾奏

这些标签可以直接写进歌词,让模型知道不同歌词分别属于什么歌曲段落。

例如:

[Intro][Verse]凌晨三点城市还醒着窗外的灯慢慢褪色[Pre-Chorus]如果明天真的会改变[Chorus]那就让风带我向前把没有说完的话唱一遍[Bridge][Final Chorus][Outro]

这比单纯给模型一整段没有结构的歌词,更容易控制整首歌的发展。

核心架构:8B Global LLM+0.6B Local LLM

Music 3.0采用一套 Hierarchical Autoregressive / Hybrid-LM分层自回归架构

简单理解,就是不让同一个模型同时负责“这首歌未来两分钟应该怎么发展”和“这一帧鼓点应该长什么样”这两个尺度完全不同的问题。

而是拆成两层。

Global LLM:负责整首歌“大方向”

Global LLM规模为 8B参数

它按照时间逐帧预测第一层核心音乐Token,负责理解和保持:


  • 整首歌主题;

  • 长程音乐结构;

  • 主歌与副歌关系;

  • 情绪发展;

  • 编曲推进;

  • 人声身份;

  • 音乐语义。

也就是说,它更像:

作曲家+编曲总监。

它首先考虑的是:

这首歌接下来应该往哪里发展?

Local LLM:负责每一帧“声音细节”

Local LLM规模为 0.6B参数

它不会重新规划整首歌,而是围绕每个时间帧继续预测剩余声学Codebook,补充细粒度声音信息。

例如:


  • 乐器质感;

  • 鼓点细节;

  • 高频信息;

  • 人声纹理;

  • 空间感;

  • 声学残差。

可以把它理解成:

录音师+声音细节工程师。

最终形成:

8B Global LLM负责整首歌结构↓0.6B Local LLM负责局部声音细节↓音频合成

这也是Music 3.0能够兼顾长程结构和局部音质的核心设计。

为什么不用一个巨大的模型全部解决?

一首5分钟歌曲存在两个完全不同的时间尺度。

在宏观层面,需要知道:

第二遍副歌应该比第一遍更强。
Bridge之后需要形成情绪释放。
Outro应该逐渐收束。

但在微观层面,又需要处理:

这一帧吉他的拨弦是什么质感。
鼓的Attack应该多强。
人声气息应该如何变化。

如果所有问题都使用同一套高成本序列预测,会让计算和建模都非常复杂。

Music 3.0通过Global / Local分工,把:

“歌曲结构”

和:

“声音细节”

拆成两个层级处理。

8层RVQ进一步拆分音乐语义和声学细节

Music 3.0的Music Tokenizer使用 8层Residual Vector Quantization(RVQ)

第一层Codebook拥有:

16,384个Entries

主要用于表示:


  • 核心音乐语义;

  • 歌曲结构。

其余7层每层拥有:

1,024个Entries

用于逐渐补充声学残差信息。

也就是:

第1层歌曲到底在唱什么、怎么发展↓第2—8层把声音纹理一点点补完整

MiniMax采用分阶段训练:先让第一层建立比较稳定的音乐信息骨架,再让全部8层一起学习更细的声音表现。

不直接用离散Token还原最终声音

Music 3.0还有一个比较重要的设计:

最终生成音频时,并不是简单把前面的离散RVQ Token全部扔给Decoder。

它会进一步取Global LLM和Local LLM最后几层的 连续Hidden States,进行融合。

完整路径为:

Global LLM Hidden States+Local LLM Hidden States↓Hidden-State Fusion↓2.4B Flow Matching↓Flow-VAE Latent↓123M Flow-VAE Decoder↓最终音频

其中Flow Matching模块约为 2.4B参数,最终Flow-VAE Decoder约 123M参数

MiniMax认为,连续Hidden State比单纯离散Token保留了更多高维声学信息,可以改善:


  • 人声发音;

  • 乐器质感;

  • 时间连续性;

  • 音色表现;

  • 混音细节。

最终输出32kHz、16-bit立体声WAV

开放权重版本最终输出规格为:

32 kHz、16-bit、Stereo WAV。

这已经不是简单的音乐草稿MIDI,而是直接生成最终波形音频。

不过,它仍然不能自动等同于专业母带成品。

真正用于发行时,仍可能需要:


  • EQ;

  • Compressor;

  • Limiter;

  • Loudness处理;

  • 人声修正;

  • Stem后期;

  • 专业混音和母带。

AI负责把创作起点大幅向“完整歌曲”方向推进,但专业音乐制作仍有独立价值。

Music Description可以写得非常详细

Music 3.0支持非常细粒度的音乐描述。

MiniMax建议高级用户采用 Structured Caption,分成三个部分。

Global Metadata

可以定义:


  • Genre;

  • Subgenre;

  • BPM;

  • Key;

  • Scale;

  • Emotional Progression;

  • Listening Scenario;

  • Production Profile。

例如:

Genre: Alternative R&BBPM: 88Key: F# minorMood: restrained and lonely at first,gradually becoming hopefulProduction: spacious modern studio mix

Vocal Details

可以控制:


  • 男声 / 女声;

  • 音色;

  • 演唱风格;

  • 气声;

  • 假声;

  • 和声;

  • Backing Vocals;

  • Delay;

  • Auto-Tune等。

Arrangement

可以继续描述:


  • 主乐器;

  • 辅助乐器;

  • 哪个段落加入什么乐器;

  • Groove;

  • Bass;

  • Percussion;

  • Texture;

  • Spatial Effects。

这使Prompt开始越来越像一份:

制作人给编曲师和录音师的Production Brief。

可以让副歌真正“变大”

AI音乐一个非常典型的问题是:

主歌是这个编曲,到了副歌只是“声音更响”。

Music 3.0希望通过歌词Section Tag+Structured Caption同时控制歌曲结构变化。

例如可以写:

Verse:only piano, muted bass and intimate female vocal.Pre-Chorus:strings slowly enter,drums begin building tension.Chorus:full drums, wide guitars,layered backing vocals,larger stereo image.Bridge:drop drums entirely,leave vocal and ambient piano.Final Chorus:return with full band,additional octave harmony,maximum emotional intensity.

这样模型知道:

不同段落不只是换歌词,也应该改变编曲。

人声也是Music 3.0重点升级方向

MiniMax认为,AI音乐最容易暴露“机器感”的部分之一就是人声。

常见问题包括:


  • 高频数字噪声;

  • 发音不清楚;

  • 呼吸不自然;

  • Phrase太机械;

  • 情绪不能随音乐变化;

  • 和声听起来像复制出来的。

Music 3.0通过Structured Caption控制人声音色、唱法、Breathy、Falsetto、Harmony和效果器,再结合连续Hidden State进行音频重建,以提高人声自然度。

官方还特别提到,希望让呼吸成为演唱本身的一部分,而不是附着在人声附近的合成噪声。

乐器细节也更加明确

Music 3.0并不只优化人声。

官方重点提到:


  • 弦乐Attack与拉弓;

  • 鼓和Bass冲击感;

  • 高密度电子音乐中的乐器分离;

  • 人声周围的空间感;

  • Glissando;

  • Legato。

这些声音细节主要受益于Hidden-State Fusion、Flow Matching和针对音乐重新训练的Flow-VAE。

它的目标是让不同乐器在编曲中的职责更加清楚,而不是所有声音挤成一团。

不会写专业音乐Prompt怎么办?

MiniMax还同步提供了一个很适合Agent用户的官方Skill:

music-caption-rewriter

安装方式:

npx skills add MiniMax-AI/MiniMax-Music3 \  --skill music-caption-rewriter

它可以把一句很普通的描述:

一首夏夜开车听的浪漫R&B,女声。

进一步扩写成结构化的:


  • Global Metadata;

  • Vocal Details;

  • Arrangement。

而且Skill已经给出了Claude Code、Cursor、Codex等Agent的安装方法。

这也意味着AI音乐开始与Agent Skills生态连接起来。

未来可能不是用户自己研究几十个音乐术语,而是:

用户描述创意↓Agent分析↓Music Caption Skill扩写↓Music 3生成↓Agent继续试听和调整

现在已经可以下载权重

8月13日发布的Music 3.0是 Open-Weights版本,权重已经上线MiniMax官方Hugging Face,同时提供GitHub项目。

可以直接下载:

hf download MiniMaxAI/MiniMax-Music3 \  --local-dir /path/to/minimax_music3

官方目前推荐的运行方案包括:


  • SGLang / SGLang-Omni;

  • Hugging Face Diffusers;

  • ComfyUI。

需要注意,我目前在MiniMax官网、GitHub README及Hugging Face模型卡中没有看到清晰展示的权重许可证文本,所以更严谨的表述是:

“开放权重”

而不是直接将其等同为任何特定OSI开源许可证。

24GB显卡就能运行?

官方Hugging Face模型卡给出的部署说明比较有意思。

标准全精度Diffusers Pipeline可以在 24GB以上显存GPU中运行。通过Automatic CPU Offload,实际显存需求可以压到约22GB。

如果显存继续降低,还可以使用Layer-by-Layer Group Offloading。

官方表示,即使 8GB显存也可以把模型跑起来,只是速度会明显降低。

所以部署可以简单理解成:

显存方式
24GB+正常本地推理
约22GBCPU Offload
8GB级Layer Streaming / Group Offload,速度更慢

不过目前推理仍要求CUDA,因此Mac上的Apple GPU并不是官方当前支持的标准推理路线。

目前不支持流式生成音频

开放权重版本当前还有一个重要限制:

只支持Non-Streaming Generation。

也就是说,并不是一边生成歌曲,一边立即实时播放。

需要先完成当前生成任务,再获得最终音频。

这一点与MiniMax商业API有所区别:开放平台Music Generation API本身提供stream参数。

所以需要区分:

  • 开源/开放权重本地推理实现:当前非流式;
  • MiniMax托管API:接口支持流式返回。

API也已经开放,甚至有免费版

Music 3.0并不是只有本地部署。

MiniMax开放平台目前提供:

music-3.0

以及:

music-3.0-free

两个接口版本。

其中:

  • music-3.0:付费及Token Plan用户,RPM 120;
  • music-3.0-free:所有API Key用户均可调用,RPM 3。

国内开放平台当前价格为:

模型价格
Music-3.0-free0元
Music-3.01元/首
歌词生成0.05元/首

国际平台价格则为Music-3.0 0.15美元/首,最长5分钟

没有歌词,也可以让AI先写

MiniMax API目前还支持Lyrics Optimizer。

如果:

lyrics_optimizer = true

同时歌词为空,系统可以根据音乐Prompt自动生成歌词。

也就是说可以直接输入:

一首关于毕业以后朋友渐行渐远的华语流行摇滚,情绪从怀念逐渐走向释然。

平台先生成歌词,再由Music 3.0完成歌曲。

同样支持:

is_instrumental = true

生成无人声纯音乐。

因此实际支持:


  • 歌词+音乐描述 → 完整歌曲;

  • 只有想法 → 自动歌词+歌曲;

  • 音乐描述 → 纯音乐。

本地模型还有一些使用限制

官方模型卡目前列出了几个已知边界。

第一,文本Prompt Token化以后最多 5000 Tokens

第二,音频生成最大限制为 9000 acoustic frames

第三,Section Tags和音乐描述属于生成控制,而不是像MIDI指令一样的严格符号约束。

因此你要求:

必须126 BPM。
必须B-flat Major。
第48.5秒必须出现小提琴。
所有歌词逐字完全一致。

模型仍有可能发生偏差。

官方明确提醒,生成出的Tempo、Key、Instrumentation、Lyrics和Song Structure并不能保证100%逐项符合要求。

所以它更像:

非常听话的AI制作人

而不是:

可以精确到每一个Note Event的DAW。

Music 3.0与传统DAW是什么关系?

Music 3.0不会直接替代:


  • Ableton Live;

  • Logic Pro;

  • FL Studio;

  • Cubase;

  • Pro Tools。

它更适合将过去创作中的第一阶段:

写歌↓找旋律↓编曲Demo↓找歌手↓录制Demo

压缩成:

描述想法+歌词↓完整歌曲Demo

一名创作者可以迅速测试:


  • 这个副歌好不好听;

  • 男声还是女声;

  • R&B还是Rock;

  • 要不要加弦乐;

  • Bridge应该怎么发展。

然后再决定是否进入正式制作。

特别适合哪些场景?

AI歌曲创作

独立音乐人可以快速把歌词变成完整Demo。

短视频和自媒体BGM

为不同内容定制音乐,不必长期依赖同一批公共音乐素材。

游戏音乐

生成:


  • 主界面音乐;

  • 剧情音乐;

  • Boss音乐;

  • 场景BGM;

  • 角色主题曲。

品牌音乐

快速测试品牌歌曲、广告音乐和活动主题曲方向。

AI短剧

可以根据剧情分别生成:


  • 片头;

  • 情绪BGM;

  • 插曲;

  • 片尾曲。

Agent自动内容生产

结合MiniMax官方Music Skill之后,可以让Agent自动完成:

理解内容主题↓写歌词↓规划歌曲结构↓扩写Music Caption↓调用Music 3↓生成最终WAV

官方MiniMax Skills仓库已经提供Music Generation相关Skill,用于将音乐生成接入Agent工作流。

从Music 1.5到Music 3.0,完整歌曲越来越长

MiniMax此前的Music 1.5已经支持最长约4分钟音乐生成,而Music 3.0进一步将完整歌曲能力提升至约5分钟,并重新设计了长程结构和音频合成链路。

真正的升级不只是:

4分钟 → 5分钟。

而是长时间生成中,模型开始更重视:


  • 主题保持;

  • 结构推进;

  • 动态变化;

  • 乐器进出;

  • 人声身份;

  • 最终收束。

一个需要注意的官方资料差异

目前MiniMax官方博客与Hugging Face模型卡,对Global LLM初始化模型的描述存在差异。

MiniMax 8月13日官方技术博客写的是:

Qwen3.5-8B。

当前Hugging Face模型卡则写:

Qwen3-8B。

由于两边均属于MiniMax官方页面,目前不建议在文章标题或核心卖点中强调具体Qwen版本。

更稳妥的说法是:

Music 3.0采用8B Global LLM作为全局音乐建模核心。

等待MiniMax后续统一模型卡口径。

总结

MiniMax于2026年8月13日正式开放 Music 3.0模型权重。需要区分的是,Music-3.0 API其实早在7月16日已经进入MiniMax开放平台,因此此次最大的变化,是开发者终于可以下载模型并自行部署。

Music 3.0最核心的结构是:

8B Global LLM+0.6B Local LLM。

Global LLM负责整首歌的长程语义、主题和结构发展;Local LLM负责每一个Frame内部的声学细节。

在此基础上,模型继续使用:


  • 8层RVQ;

  • Continuous Hidden-State Fusion;

  • 2.4B Flow Matching;

  • 123M Flow-VAE。

最终生成32kHz、16-bit立体声WAV。

用户既可以给完整歌词,也可以用 [Verse][Chorus][Bridge][Solo][Outro] 等标签控制歌曲结构,再通过Structured Caption描述BPM、Key、情绪、人声音色、乐器和编曲变化。

本地部署已经支持SGLang-Omni、Diffusers和ComfyUI;官方还提供music-caption-rewriter Skill,让Codex、Claude Code、Cursor等Agent帮助普通用户自动把一句音乐创意扩展成专业生成说明。

API方面,则同时提供music-3.0和免费限速版music-3.0-free,国内标准版当前为1元/首。

Music 3.0真正值得关注的地方,不是AI终于能“唱够5分钟”。

而是音乐模型开始尝试理解:

一首歌为什么要在这里进入副歌、为什么Bridge应该收住、为什么最后一次副歌应该比第一次更有力量。

当AI能够同时理解歌词、结构、编曲、人声和最终声学表现后,音乐生成正在从:

“生成一段听起来像音乐的音频”

进一步走向:

“完成一首真正具有开头、发展、高潮和结尾的歌曲”。

相关链接