Qwen-Music:大规模可控歌曲与翻唱生成系统技术报告 Qwen-Music Technical Report
三组件架构(分词器+LLM+渲染器)实现可控高保真歌曲与翻唱生成
前置知识
音乐语义令牌(Music Semantic Tokens)
将原始音乐波形压缩成 25 Hz、单码本的离散整数序列(每 40 毫秒对应一个 token,码本大小 $2^{15}=32768$,码率仅 375 bit/s)。它通过一个 0.6B 参数的 Conformer 编码器加向量量化瓶颈得到,保留歌词、旋律与和声等高层语义,但牺牲波形级声学细节。
这是整个系统的核心表示:LLM 在这个紧凑空间里做长程歌曲作曲,渲染器再把它还原成高保真立体声。理解它才能理解「语义压缩 + 声学渲染」的两段式分工。
Melody-CoT(基于旋律令牌的思维链)
受文本思维链启发,在生成完整 Music Semantic Tokens 之前,先显式生成(或从参考歌曲提取)一段人声旋律轮廓令牌作为中间计划。旋律令牌用 RMVPE 提取 50 Hz 音高,8 倍中值池化降到 6.25 Hz,再转成去均值的相对 MIDI 半音偏移(256 词表,含静音 token),故意丢弃绝对音高/调性/音色信息。
它是本文最核心的创新,既是提升原创歌曲创造力与结构连贯性的「作曲脚手架」,又是统一文本生歌与翻唱克隆两种任务的接口。
Diffusion Transformer 与 Classifier-Free Guidance (CFG)
渲染器第一阶段用一个 1.3B 参数、32 层、隐藏维 $d=1024$ 的 DiT,以条件流匹配(conditional flow matching)从 Music Semantic Tokens 预测连续声学隐变量。CFG 在推理时同时跑条件分支与无房分支(用可学习的 null 上下文 $C_\emptyset$ 替换文本)再做加权外推,提升文本遵循度。本文采用「Text-drop」策略:无房分支只丢弃文本、保留 LM 令牌作为主要骨架。
理解 DiT 的交叉注意力条件注入和 Text-drop CFG,才能看懂渲染消融实验为何强调「LM 令牌是主骨架、文本是补充语义」。
BestRQ 自监督预训练
一种掩码预测自监督方法,目标码由一个冻结的随机投影 + 随机码本生成,无需像 BYOL/MASK 的目标编码器分支。损失为 $\mathcal{L}_{\text{BestRQ}} = \frac{1}{|M|}\sum_{t \in M} \text{CE}(p(h_t), q(x_t))$,其中 $M$ 是掩码帧集合,$q(\cdot)$ 是冻结随机量化器。
这是分词器第一阶段、奠定音乐通用表示的预训练目标,理解它才知道为什么四阶段训练能从「连续表示」渐进到「离散量化」。
DPO 与 GSPO 偏好对齐
DPO(Direct Preference Optimization)是离线偏好优化,从打分候选构造偏好对直接优化策略;GSPO(Group Sequence Policy Optimization)是在线策略优化,直接从同策略(on-policy)采样与序列级奖励更新。本文在 SFT 冷启动后先用迭代 DPO 稳定对齐,再用 GSPO 探索更细粒度的音乐性与音质。
「监督初始化 → 离线 DPO → 在线 GSPO」是后训练三阶段,理解这条稳定→探索的优化路径才能看懂为什么要在 GSPO 阶段才精修音乐性。
Spec-VAE 与 Band-Mode Refiner
Spec-VAE 是频谱域 VAE:用 STFT 把 48 kHz 立体声转成复数谱 $X \in \mathbb{C}^{2\times480\times T}$,7 块编码器压成 128 维、25 Hz 的隐变量(总压缩比 192×),镜像解码器重建粗谱。Band-Mode Refiner 是零初始化的 ConvNeXt-1D 模块,对低频做相位修正、中频做幅相联合修正、高频做幅度修正。
这是渲染器把离散语义令牌还原成可听立体声的关键,192× 极限压缩下的稳定性设计是工程难点所在。
研究动机
歌曲生成与普通音频生成有本质区别,必须在分钟级时间跨度上同时建模歌词、旋律、节奏、人声演唱、乐器编排和音乐结构,而现有大规模音频生成模型仍难以同时做到「旋律发展稳定、歌词咬字清晰、演唱声自然、伴奏逼真」。其核心矛盾在于语义层与声学层的脱节:语义层需要规划歌词、人声旋律、段落结构、重复与风格推进;声学层却必须在波形分辨率上渲染音色、相位、立体声摆位与高频细节。离散令牌语言模型虽提供了可扩展的全局序列生成接口,但压缩后的令牌会丢失声学细节;而参考音频驱动的翻唱生成更额外要求「保留旋律、却允许改编/换声/换风格」,这在单一系统里极难统一。
本文的目标是本文目标是构建一个单一、连贯的大规模音乐生成系统 Qwen-Music,统一支持两类任务:一是文本到音乐的开放生成(给定文本描述、歌词与音乐属性,创造全新歌曲),二是参考音频翻唱生成(保留参考旋律,同时改变编曲、演唱声音与风格)。系统必须做到可控(流派/情绪/乐器/音色/性别)、结构连贯、歌词清晰、人声逼真,最终输出 48 kHz 高保真立体声,并在数百种语言的 500 万小时多语种语料上获得强泛化。
与已有工作不同的是,本文的独特切入角度是把歌曲生成显式拆成「语义作曲」与「声学渲染」两个解耦阶段,并在两者之间引入一个极致紧凑的 25 Hz 单码本 Music Semantic Token 作为唯一桥梁——既给自回归 LLM 一个可驾驭的序列空间做长程作曲,又作为渲染器的「音乐草图」。更进一步,它把旋律提升为一等中间表示(Melody-CoT):原创时先规划旋律再生成全曲,翻唱时直接把参考旋律令牌插进前缀,从而用同一个模型、同一套训练范式同时覆盖两种此前割裂的任务,而非像以往系统那样各做一套。
核心方法
整体直觉是「先在低码率语义空间里把歌谱写成稿子,再用生成式渲染器把稿子画成立体声油画」。推理流水线分三步:先把自然语言描述改写成结构化文本条件(流派/歌手特征/乐器编排等标签 + 生成歌词);接着 Qwen-Music-LLM 在文本条件下自回归预测 Music Semantic Tokens,翻唱时额外把参考旋律令牌作为 Melody-CoT 前缀;最后 Qwen-Music-Render 同时接收文本条件与语义令牌,做生成式渲染输出 48 kHz 立体声。技术路线由三大组件构成:Qwen-Music-Tokenizer 把波形压成 25 Hz 单码本语义令牌;Qwen-Music-LLM(3B,从 Qwen3.5-Omni 稠密变体初始化)做旋律感知的自回归建模;Qwen-Music-Render(1.3B DiT + Spec-VAE + Band-Mode Refiner)做生成式立体声渲染。
核心创新有三条,且彼此咬合。第一,Melody-CoT:把人声旋律做成显式的中间思维链——原创时先吐出段落级旋律令牌再生成全曲,让 LLM「先解决作曲结构再渲染细节」,而不是直接从文本硬猜全混音令牌;翻唱时把参考旋律令牌拼进前缀,使输出跟随旋律轮廓同时由文本控制音色/编曲/流派。第二,旋律令牌刻意的「信息阉割」:用相对 MIDI、去全局中位数、降采样到 6.25 Hz、仅取含歌词的段落,丢弃绝对音域/调性/音色,从而既防止旋律信号过强压制全局标签、又防止暴露整曲时长。第三,声学侧用 Spec-SnakeBeta(沿频率轴参数化 $\alpha_f,\beta_f$,按对数频率初始化)与零初始化的 Band-Mode Refiner,在 192× 压缩下稳定地修正频带相关的幅相残差,把离散语义令牌「升频」成可听高保真。
方法步骤详情
(1)Tokenizer 四阶段:Stage1 双向 BestRQ 自监督预训练(30 秒裁窗,span 掩码概率 0.3,冻结随机投影量化器);Stage2 因果自适应(仅把注意力改成左上下文,复用 Stage1 权重);Stage3 多任务 SFT(接 CTC 歌词头、ConvNeXt Mel 头与 chroma 头,损失 $\mathcal{L}_{\text{SFT}}=\lambda_{ctc}\mathcal{L}_{CTC}+\lambda_{mel}\mathcal{L}_{melspec}+\lambda_{chr}\mathcal{L}_{chromaspec}$,掩码概率降到 0.01,全曲 ≤300 s);Stage4 在 Conformer 第 13 层插单 VQ 瓶颈(32768 码本,余弦度量,直通估计 + commitment loss),用门控 $h_{out}=h+\alpha(h_q-h)$ 平滑注入并分阶段解冻。(2)LLM 训练:用 [text, (melody-CoT), music semantic tokens] 多种序列模式混合,对 Melody-CoT 区与最终令牌区都算 next-token loss;段落级模式只写含歌词段落、跳过前奏/尾奏/间奏,unique 段落级模式对重复段落只采一条代表旋律。(3)Render 三阶段:Stage1 仅重建 Spec-VAE;Stage2 引入波形域对抗(LSGAN+特征匹配);Stage3 冻结编解码器只训 Band-Mode Refiner(W:S 判别器交替 4:1)。(4)LLM 后训练三阶段:质量分级预训练(Q3–Q6→Q2→Q1,丢 Q7)→ SFT 冷启动 → 迭代离线 DPO → 在线 GSPO。(5)声学数据清洗:用噪声底感知的高频截止检测、比特率分析、假立体声检测等规则筛掉 MP3 转码/上采样伪无损,只保留真实高保真训练渲染器。
技术新颖性
技术新颖性体现在几处「反直觉但被实验证实」的设计。其一,单码本 25 Hz 极致压缩(375 bit/s)看似信息量不足以还原高保真,但作者用它做语义层建模、把高保真交给独立渲染器,反而让 LLM 序列空间可控。其二,Spec-SnakeBeta 把激活参数沿频率轴参数化并用对数频率先验初始化,使网络在不同频段有不同周期调制(图7 显示网络主要在 0–5 kHz 强化调制),这是面向 STFT 物理结构的激活设计。其三,Band-Mode Refiner 的「零初始化 + 频带分工修正」(低频只修相位、中频幅相联合、高频只修幅度)直接对应幅相误差的频带互补模式,初始等价恒等映射保证训练稳定。其四,质量分桶 Q1–Q7 + 动态质量采样(先重低质后换高质)的课程,配合 unique 段落级 Melody-CoT 减弱过条件,都是面向工程稳定性的精细设计。
实验结果
主观盲测(50 位专业音乐人评分员,每对由 3 位独立评判)显示 Qwen-Music 对 MiniMax Music 2.5+ 取胜率 59.1%、对 MiniMax 2.6 取 66.7%、对 Mureka V8 取 58.3%、对 Suno V5 取 55.4%,即便对标最强商业基线 Suno V5.5 仍以 50.3% 略占优(图2)。流派级 Bradley–Terry 分析(表4)中它在 8 个流派的 5 个里夺冠(Electronic/EDM、Jazz & Blues、Punk & Hardcore、R&B/Soul、Rock),Hip-Hop/Rap 与 Pop 排第二。外部 Artificial Analysis「Music with Vocals」榜上以 JazzCat 匿名参赛位列第三(图3)。客观指标(表5,300 中文 + 300 英文样本)上它在 SongBench/SongEval/AudioBox-Aesthetic 共 16 维中拿下 13 个最佳:SongBench 七维中六项第一(melody 7.03、arrangement 7.35、musicality 6.22、vocal 7.44、instrumental 7.24、mixing 7.13),SongEval 五维全第一,AudioBox-Aesthetic 在 content enjoyment 7.47 与 content usefulness 7.86 上居首;标签遵循均值 8.44 仅差最佳 0.04,vocal gender 项最佳;PER 6.10 为第二低(仅次于 Suno V5.5 的 4.19)。翻唱任务(表6/7)上,AI 参考集 Melody MAE 段落级 1.48 全场最低,胜过 Suno V5.5(2.00)、Suno V5(1.87)、MiniMax Cover(1.89);真实流行曲参考集上则在大部多数指标上压过 MiniMax Cover。渲染侧(表9,SDD 546 首),Spec-VAE+Refiner 在 STFT Dist 0.870、Mel Dist 0.461、CCPC 0.973、Spectral Pan Err 0.264 均最佳,Refiner 单独把 Mel Dist 从 0.572 拉到 0.461。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 文本到音乐(专业盲测胜率) | Win Rate (%) | 对 Suno V5.5 = 50.3% | Suno V5.5 49.7% | 在对标当前最强商业系统时仍略占优;对 MiniMax 2.6 高达 66.7% |
| 文本到音乐(音乐性) | SongBench Musicality | 6.22 | Suno V5.5 = 5.83 / Mureka V8 = 6.05 | 较第二名 Suno V5 (6.12) 提升 0.10,较 Suno V5.5 提升 0.39 |
| 文本到音乐(综合客观) | 16 项指标最佳数 | 13/16 最佳 | Suno V5.5 / Suno V5 / Mureka V8 / MiniMax 2.6 / 2.5+ 分摊剩余 | SongBench 六维第一、SongEval 五维全第一 |
| 歌词清晰度 | PER (×100, ↓) | 6.10 | Suno V5.5 = 4.19(最佳),Mureka V8 = 9.04(最差) | 第二低,仅比 Suno V5.5 高 1.91,明显优于多数对手 |
| 翻唱旋律保留 | Melody MAE (↓) | 段落级 1.48(AI 集)/ 1.44(真实集) | Suno V5.5 = 2.00(AI 集),MiniMax Cover = 1.76(真实集) | AI 参考集全场最低;真实集上亦优于 MiniMax Cover |
| 渲染重建质量 | Mel Distance (↓) / CCPC (↑) | 0.461 / 0.973 | Spec-VAE 无 Refiner = 0.572 / 0.966;SAME-L = 0.539 / 0.970 | Refiner 把 Mel Dist 降 0.111,全场最佳 |
局限与改进
作者承认的局限包括:PER 6.10 虽第二低但仍不及 Suno V5.5 的 4.19,歌词咬字清晰度并非最强;翻唱任务上商业系统(尤其 Suno V5/V5.5)在多项音乐性与标签遵循指标上仍占优,例如 AI 参考集 arrangement/musicality/mixing/structure 均落后于 Suno,说明在「保旋律 vs 高音乐性」之间存在权衡;通用标签遵循中 genre(8.08)与 instruments(8.65)也分别逊于 Mureka V8 与 Suno V5。我自己的观察:技术报告以「内部评测 + 自定义榜单」为主,PER 用自家 Qwen3-ASR、标签遵循用 Gemini 3.1 Pro,存在评测者即参赛者/或评测模型自身偏好风险;外部 Artificial Analysis 榜只验证英文人声,对中文等多语种客观优势缺乏第三方佐证;翻唱对比因 Suno 不接受真实歌曲输入,只能局限 AI 生成参考集,真实世界翻唱的对比对手只有 MiniMax Cover,说服力有限。
独立分析的弱点
其一,歌词清晰度(PER 6.10)落后 Suno V5.5 近 1.9 个点,可能根因是 25 Hz 单码本语义令牌对快速咬字的信息带宽不足——改进方向可考虑在渲染阶段注入音素级条件,或引入双流(语义+音素)令牌。其二,翻唱任务上存在「旋律保真 vs 音乐性」跷跷板:段落级 Melody-CoT 旋律最好(Melody MAE 1.48)但音乐性与标签遵循弱于 unique 段落级,说明条件强度难自适应——可设计强度可调的连续旋律嵌入或学习一个旋律门控。其三,参考旋律令牌刻意丢弃绝对音高/调性,导致「按原调翻唱」这类需求无法满足——可增加可选的绝对音高模式。其四,评测闭环高度依赖自家模型(Qwen3-ASR、内部 MOS 预测器)与单一第三方(Gemini 3.1 Pro),易引入偏好偏置——改进方向是引入更多独立评测器与公开多语种榜单。其五,渲染 DiT 与 Refiner 在 192× 压缩下虽稳,但训练仍依赖大规模高质量无损语料与精细声学清洗管线,工程门槛与算力门槛高。
未来方向
作者明确提出三个方向:更灵活的长上下文音乐结构建模、对演唱与表演更细粒度的表现力控制、更高效的渲染架构。基于本成果可延伸的研究包括:把 Melody-CoT 思想推广到「节奏 CoT / 和声 CoT / 段落结构 CoT」等多中间表示,形成可解释的多层级作曲链;将旋律令牌的相对 MIDI 表示升级为可学习、可混合强度的连续旋律嵌入,自适应权衡克隆度与创造性;探索音素/速度/力度等低层控制信号注入渲染器,弥合语义令牌带宽不足导致的歌词清晰度差距;用更轻量的蒸馏/一致性模型替换三阶段 DiT 渲染以降低推理成本;以及建立多语种、多流派的公开翻唱评测基准,减少自评依赖。
复现评估
复现难度整体偏高但工程信息透明。有利因素:四阶段分词器训练(表1)、Spec-VAE/Refiner 三阶段训练(表2)的超参与损失权重($\lambda_{\text{STFT}},\lambda_{\text{IF\_GD}},\lambda_{\text{KL}}$ 等)、DiT 架构(32 层、$d=1024$、24 头)、模型规模(0.6B 分词器、3B LLM、1.3B DiT)、码本($2^{15}$)与帧率(25 Hz)、数据规模(>500 万小时多语种)均已给出;声学清洗规则(表3)与截止检测算法(含式 7、式 8 的阈值 $f_c/f_{Nyq}<0.85$、$\Delta\text{dB}\ge40$)描述详细;评测协议(50 名专业评分员、3 人/对)也清楚。不利因素:核心训练数据未开源、内部 MOS 奖励模型与质量分桶 Q1–Q7 阈值细节未公开、后训练 DPO/GSPO 的奖励权重与超参缺省、Melody-CoT 的训练混合比例与旋律令牌具体映射代码未放出,且暂未提及模型权重或代码的开源计划。这意味着第三方几乎无法端到端复现,只能复现架构思路与组件级消融。
论文图表
系统总览图,展示两种核心任务(文本到音乐原创生成、参考音频翻唱生成)的输入输出形式,并点出可控维度(流派、情绪、乐器、音色、性别)。
它一句话讲清系统定位与任务边界,是理解全文「为什么要把两件事放进一个框架」的最佳入口。