← 返回 2026-07-20

Qwen-Music:大规模可控歌曲与翻唱生成系统技术报告 Qwen-Music Technical Report

Jin Xu, Kangdi Wang, Ruibin Yuan, Shun Lei, Xiong Wang, Xize Cheng, Xueyao Zhang, Yang Zhang, Yiheng Chen, Yongqi Wang, Yue Wang, Zhifang Guo, Zihan Liu, Zijian Lin, Dake Guo, Hangrui Hu, Lei Xie, Linhan Ma, Wei Xue, Wenxiang Guo, Xinfa Zhu, Xipin Wei, Yangze Li, Yuanjun Lv, Yuxuan Wang, Yunfei Chu, Zhiyong Wu 📅 2026-07-13 👍 27 2026-07-25 18:30
Qwen-Music 多阶段对齐 大语言模型 扩散Transformer 文本到音乐 翻唱生成 音乐生成 音频分词器 音频生成

三组件架构(分词器+LLM+渲染器)实现可控高保真歌曲与翻唱生成

前置知识

音乐语义令牌(Music Semantic Tokens)

将原始音乐波形压缩成 25 Hz、单码本的离散整数序列(每 40 毫秒对应一个 token,码本大小 $2^{15}=32768$,码率仅 375 bit/s)。它通过一个 0.6B 参数的 Conformer 编码器加向量量化瓶颈得到,保留歌词、旋律与和声等高层语义,但牺牲波形级声学细节。

这是整个系统的核心表示:LLM 在这个紧凑空间里做长程歌曲作曲,渲染器再把它还原成高保真立体声。理解它才能理解「语义压缩 + 声学渲染」的两段式分工。

Melody-CoT(基于旋律令牌的思维链)

受文本思维链启发,在生成完整 Music Semantic Tokens 之前,先显式生成(或从参考歌曲提取)一段人声旋律轮廓令牌作为中间计划。旋律令牌用 RMVPE 提取 50 Hz 音高,8 倍中值池化降到 6.25 Hz,再转成去均值的相对 MIDI 半音偏移(256 词表,含静音 token),故意丢弃绝对音高/调性/音色信息。

它是本文最核心的创新,既是提升原创歌曲创造力与结构连贯性的「作曲脚手架」,又是统一文本生歌与翻唱克隆两种任务的接口。

Diffusion Transformer 与 Classifier-Free Guidance (CFG)

渲染器第一阶段用一个 1.3B 参数、32 层、隐藏维 $d=1024$ 的 DiT,以条件流匹配(conditional flow matching)从 Music Semantic Tokens 预测连续声学隐变量。CFG 在推理时同时跑条件分支与无房分支(用可学习的 null 上下文 $C_\emptyset$ 替换文本)再做加权外推,提升文本遵循度。本文采用「Text-drop」策略:无房分支只丢弃文本、保留 LM 令牌作为主要骨架。

理解 DiT 的交叉注意力条件注入和 Text-drop CFG,才能看懂渲染消融实验为何强调「LM 令牌是主骨架、文本是补充语义」。

BestRQ 自监督预训练

一种掩码预测自监督方法,目标码由一个冻结的随机投影 + 随机码本生成,无需像 BYOL/MASK 的目标编码器分支。损失为 $\mathcal{L}_{\text{BestRQ}} = \frac{1}{|M|}\sum_{t \in M} \text{CE}(p(h_t), q(x_t))$,其中 $M$ 是掩码帧集合,$q(\cdot)$ 是冻结随机量化器。

这是分词器第一阶段、奠定音乐通用表示的预训练目标,理解它才知道为什么四阶段训练能从「连续表示」渐进到「离散量化」。

DPO 与 GSPO 偏好对齐

DPO(Direct Preference Optimization)是离线偏好优化,从打分候选构造偏好对直接优化策略;GSPO(Group Sequence Policy Optimization)是在线策略优化,直接从同策略(on-policy)采样与序列级奖励更新。本文在 SFT 冷启动后先用迭代 DPO 稳定对齐,再用 GSPO 探索更细粒度的音乐性与音质。

「监督初始化 → 离线 DPO → 在线 GSPO」是后训练三阶段,理解这条稳定→探索的优化路径才能看懂为什么要在 GSPO 阶段才精修音乐性。

Spec-VAE 与 Band-Mode Refiner

Spec-VAE 是频谱域 VAE:用 STFT 把 48 kHz 立体声转成复数谱 $X \in \mathbb{C}^{2\times480\times T}$,7 块编码器压成 128 维、25 Hz 的隐变量(总压缩比 192×),镜像解码器重建粗谱。Band-Mode Refiner 是零初始化的 ConvNeXt-1D 模块,对低频做相位修正、中频做幅相联合修正、高频做幅度修正。

这是渲染器把离散语义令牌还原成可听立体声的关键,192× 极限压缩下的稳定性设计是工程难点所在。

研究动机

歌曲生成与普通音频生成有本质区别,必须在分钟级时间跨度上同时建模歌词、旋律、节奏、人声演唱、乐器编排和音乐结构,而现有大规模音频生成模型仍难以同时做到「旋律发展稳定、歌词咬字清晰、演唱声自然、伴奏逼真」。其核心矛盾在于语义层与声学层的脱节:语义层需要规划歌词、人声旋律、段落结构、重复与风格推进;声学层却必须在波形分辨率上渲染音色、相位、立体声摆位与高频细节。离散令牌语言模型虽提供了可扩展的全局序列生成接口,但压缩后的令牌会丢失声学细节;而参考音频驱动的翻唱生成更额外要求「保留旋律、却允许改编/换声/换风格」,这在单一系统里极难统一。

本文的目标是本文目标是构建一个单一、连贯的大规模音乐生成系统 Qwen-Music,统一支持两类任务:一是文本到音乐的开放生成(给定文本描述、歌词与音乐属性,创造全新歌曲),二是参考音频翻唱生成(保留参考旋律,同时改变编曲、演唱声音与风格)。系统必须做到可控(流派/情绪/乐器/音色/性别)、结构连贯、歌词清晰、人声逼真,最终输出 48 kHz 高保真立体声,并在数百种语言的 500 万小时多语种语料上获得强泛化。

与已有工作不同的是,本文的独特切入角度是把歌曲生成显式拆成「语义作曲」与「声学渲染」两个解耦阶段,并在两者之间引入一个极致紧凑的 25 Hz 单码本 Music Semantic Token 作为唯一桥梁——既给自回归 LLM 一个可驾驭的序列空间做长程作曲,又作为渲染器的「音乐草图」。更进一步,它把旋律提升为一等中间表示(Melody-CoT):原创时先规划旋律再生成全曲,翻唱时直接把参考旋律令牌插进前缀,从而用同一个模型、同一套训练范式同时覆盖两种此前割裂的任务,而非像以往系统那样各做一套。

核心方法

整体直觉是「先在低码率语义空间里把歌谱写成稿子,再用生成式渲染器把稿子画成立体声油画」。推理流水线分三步:先把自然语言描述改写成结构化文本条件(流派/歌手特征/乐器编排等标签 + 生成歌词);接着 Qwen-Music-LLM 在文本条件下自回归预测 Music Semantic Tokens,翻唱时额外把参考旋律令牌作为 Melody-CoT 前缀;最后 Qwen-Music-Render 同时接收文本条件与语义令牌,做生成式渲染输出 48 kHz 立体声。技术路线由三大组件构成:Qwen-Music-Tokenizer 把波形压成 25 Hz 单码本语义令牌;Qwen-Music-LLM(3B,从 Qwen3.5-Omni 稠密变体初始化)做旋律感知的自回归建模;Qwen-Music-Render(1.3B DiT + Spec-VAE + Band-Mode Refiner)做生成式立体声渲染。

核心创新有三条,且彼此咬合。第一,Melody-CoT:把人声旋律做成显式的中间思维链——原创时先吐出段落级旋律令牌再生成全曲,让 LLM「先解决作曲结构再渲染细节」,而不是直接从文本硬猜全混音令牌;翻唱时把参考旋律令牌拼进前缀,使输出跟随旋律轮廓同时由文本控制音色/编曲/流派。第二,旋律令牌刻意的「信息阉割」:用相对 MIDI、去全局中位数、降采样到 6.25 Hz、仅取含歌词的段落,丢弃绝对音域/调性/音色,从而既防止旋律信号过强压制全局标签、又防止暴露整曲时长。第三,声学侧用 Spec-SnakeBeta(沿频率轴参数化 $\alpha_f,\beta_f$,按对数频率初始化)与零初始化的 Band-Mode Refiner,在 192× 压缩下稳定地修正频带相关的幅相残差,把离散语义令牌「升频」成可听高保真。

方法步骤详情

(1)Tokenizer 四阶段:Stage1 双向 BestRQ 自监督预训练(30 秒裁窗,span 掩码概率 0.3,冻结随机投影量化器);Stage2 因果自适应(仅把注意力改成左上下文,复用 Stage1 权重);Stage3 多任务 SFT(接 CTC 歌词头、ConvNeXt Mel 头与 chroma 头,损失 $\mathcal{L}_{\text{SFT}}=\lambda_{ctc}\mathcal{L}_{CTC}+\lambda_{mel}\mathcal{L}_{melspec}+\lambda_{chr}\mathcal{L}_{chromaspec}$,掩码概率降到 0.01,全曲 ≤300 s);Stage4 在 Conformer 第 13 层插单 VQ 瓶颈(32768 码本,余弦度量,直通估计 + commitment loss),用门控 $h_{out}=h+\alpha(h_q-h)$ 平滑注入并分阶段解冻。(2)LLM 训练:用 [text, (melody-CoT), music semantic tokens] 多种序列模式混合,对 Melody-CoT 区与最终令牌区都算 next-token loss;段落级模式只写含歌词段落、跳过前奏/尾奏/间奏,unique 段落级模式对重复段落只采一条代表旋律。(3)Render 三阶段:Stage1 仅重建 Spec-VAE;Stage2 引入波形域对抗(LSGAN+特征匹配);Stage3 冻结编解码器只训 Band-Mode Refiner(W:S 判别器交替 4:1)。(4)LLM 后训练三阶段:质量分级预训练(Q3–Q6→Q2→Q1,丢 Q7)→ SFT 冷启动 → 迭代离线 DPO → 在线 GSPO。(5)声学数据清洗:用噪声底感知的高频截止检测、比特率分析、假立体声检测等规则筛掉 MP3 转码/上采样伪无损,只保留真实高保真训练渲染器。

技术新颖性

技术新颖性体现在几处「反直觉但被实验证实」的设计。其一,单码本 25 Hz 极致压缩(375 bit/s)看似信息量不足以还原高保真,但作者用它做语义层建模、把高保真交给独立渲染器,反而让 LLM 序列空间可控。其二,Spec-SnakeBeta 把激活参数沿频率轴参数化并用对数频率先验初始化,使网络在不同频段有不同周期调制(图7 显示网络主要在 0–5 kHz 强化调制),这是面向 STFT 物理结构的激活设计。其三,Band-Mode Refiner 的「零初始化 + 频带分工修正」(低频只修相位、中频幅相联合、高频只修幅度)直接对应幅相误差的频带互补模式,初始等价恒等映射保证训练稳定。其四,质量分桶 Q1–Q7 + 动态质量采样(先重低质后换高质)的课程,配合 unique 段落级 Melody-CoT 减弱过条件,都是面向工程稳定性的精细设计。

Qwen-Music 推理流水线总览:先把自然语言描述改写成结构化文本条件(标签 + 歌词),Qwen-Music-LLM 生成 Music Semantic Tokens(翻唱时用参考旋律令牌做旋律克隆),Qwen-Music-Render 再做生成式渲染输出 48 kHz 立体声。
Figure 4: Qwen-Music 推理流水线总览:先把自然语言描述改写成结构化文本条件(标签 + 歌词),Qwen-Music-LLM 生成 Music Semantic Tokens(翻唱时用参考旋律令牌做旋律克隆),Qwen-Music-Render 再做生成式渲染输出 48 kHz 立体声。
Qwen-Music-Tokenizer 总览:通过 BestRQ 预训练、因果自适应、多任务 SFT、VQ 分词器训练四阶段把音乐波形映射为 25 Hz Music Semantic Tokens。
Figure 5: Qwen-Music-Tokenizer 总览:通过 BestRQ 预训练、因果自适应、多任务 SFT、VQ 分词器训练四阶段把音乐波形映射为 25 Hz Music Semantic Tokens。
Qwen-Music-Render 总览:Music Semantic Tokens 与文本条件引导一个语义条件 DiT 预测声学隐变量,Spec-VAE 解码成复数谱,Band-Mode Refiner 修正频带相关幅相细节,再做 iSTFT 合成 48 kHz 立体声。
Figure 6: Qwen-Music-Render 总览:Music Semantic Tokens 与文本条件引导一个语义条件 DiT 预测声学隐变量,Spec-VAE 解码成复数谱,Band-Mode Refiner 修正频带相关幅相细节,再做 iSTFT 合成 48 kHz 立体声。
Spec-SnakeBeta 分析。(a) 激活曲线:标准 SnakeBeta 对所有频段用同一 $\alpha$;Spec-SnakeBeta 按频率自适应周期调制,在 0.5/3/10/20 kHz 呈现不同非线性形状。(b) 各编码器层学习到的 $\alpha_f$ 相对对数频率初始化的偏差 $\Delta\alpha_f$,正值表示网络增强周期调制,最强偏差集中在 0–5 kHz。
Figure 7: Spec-SnakeBeta 分析。(a) 激活曲线:标准 SnakeBeta 对所有频段用同一 $\alpha$;Spec-SnakeBeta 按频率自适应周期调制,在 0.5/3/10/20 kHz 呈现不同非线性形状。(b) 各编码器层学习到的 $\alpha_f$ 相对对数频率初始化的偏差 $\Delta\alpha_f$,正值表示网络增强周期调制,最强偏差集中在 0–5 kHz。
高频截止检测器示例:蓝线为 10 秒验证片段的 Welch 谱,红虚线为检测到的截止 $f_c$,灰点线为独立估计的边缘噪声底。四个面板分别展示 15.3/16.0 kHz 硬截止与 20.3/20.8 kHz 可疑滚降。
Figure 8: 高频截止检测器示例:蓝线为 10 秒验证片段的 Welch 谱,红虚线为检测到的截止 $f_c$,灰点线为独立估计的边缘噪声底。四个面板分别展示 15.3/16.0 kHz 硬截止与 20.3/20.8 kHz 可疑滚降。

实验结果

主观盲测(50 位专业音乐人评分员,每对由 3 位独立评判)显示 Qwen-Music 对 MiniMax Music 2.5+ 取胜率 59.1%、对 MiniMax 2.6 取 66.7%、对 Mureka V8 取 58.3%、对 Suno V5 取 55.4%,即便对标最强商业基线 Suno V5.5 仍以 50.3% 略占优(图2)。流派级 Bradley–Terry 分析(表4)中它在 8 个流派的 5 个里夺冠(Electronic/EDM、Jazz & Blues、Punk & Hardcore、R&B/Soul、Rock),Hip-Hop/Rap 与 Pop 排第二。外部 Artificial Analysis「Music with Vocals」榜上以 JazzCat 匿名参赛位列第三(图3)。客观指标(表5,300 中文 + 300 英文样本)上它在 SongBench/SongEval/AudioBox-Aesthetic 共 16 维中拿下 13 个最佳:SongBench 七维中六项第一(melody 7.03、arrangement 7.35、musicality 6.22、vocal 7.44、instrumental 7.24、mixing 7.13),SongEval 五维全第一,AudioBox-Aesthetic 在 content enjoyment 7.47 与 content usefulness 7.86 上居首;标签遵循均值 8.44 仅差最佳 0.04,vocal gender 项最佳;PER 6.10 为第二低(仅次于 Suno V5.5 的 4.19)。翻唱任务(表6/7)上,AI 参考集 Melody MAE 段落级 1.48 全场最低,胜过 Suno V5.5(2.00)、Suno V5(1.87)、MiniMax Cover(1.89);真实流行曲参考集上则在大部多数指标上压过 MiniMax Cover。渲染侧(表9,SDD 546 首),Spec-VAE+Refiner 在 STFT Dist 0.870、Mel Dist 0.461、CCPC 0.973、Spectral Pan Err 0.264 均最佳,Refiner 单独把 Mel Dist 从 0.572 拉到 0.461。

Qwen-Music-Tokenizer 四阶段训练配方总览,所有阶段共享 0.6B 参数 Conformer 主干(24 层、宽度 1024、16 头、25 Hz 隐变量),均从前一阶段检查点初始化。
Table 1: Qwen-Music-Tokenizer 四阶段训练配方总览,所有阶段共享 0.6B 参数 Conformer 主干(24 层、宽度 1024、16 头、25 Hz 隐变量),均从前一阶段检查点初始化。
由专业评分员盲测 A/B 偏好得出的流派级 Bradley–Terry 评分,每流派独立计算,仅适合同流派内比较,分越高越受偏好,最佳加粗、次佳下划线。
Table 4: 由专业评分员盲测 A/B 偏好得出的流派级 Bradley–Terry 评分,每流派独立计算,仅适合同流派内比较,分越高越受偏好,最佳加粗、次佳下划线。
文本到音乐客观结果(300 中文 + 300 英文样本),用 SongBench/SongEval/AudioBox-Aesthetic 评音乐性与音质,Gemini 3.1 Pro 评标签遵循,PER 越低越好。
Table 5: 文本到音乐客观结果(300 中文 + 300 英文样本),用 SongBench/SongEval/AudioBox-Aesthetic 评音乐性与音质,Gemini 3.1 Pro 评标签遵循,PER 越低越好。
AI 生成参考旋律集上的翻唱客观结果(100 英文 + 100 中文),Qwen-Music(section) 用段落级旋律条件,Qwen-Music(unique section) 用去重段落级,PER 与 Melody MAE 越低越好。
Table 6: AI 生成参考旋律集上的翻唱客观结果(100 英文 + 100 中文),Qwen-Music(section) 用段落级旋律条件,Qwen-Music(unique section) 用去重段落级,PER 与 Melody MAE 越低越好。
真实流行曲参考旋律集上的翻唱客观结果(100 英文 + 100 中文),与 MiniMax Cover 对比。
Table 7: 真实流行曲参考旋律集上的翻唱客观结果(100 英文 + 100 中文),与 MiniMax Cover 对比。
DiT 渲染消融(中英各 100 样本),对比隐变量主干(Levo 2 VAE vs Spec-VAE)、改写文本条件(None/Tags only/Tags+Lyrics)、CFG 空分支设计(LM-token drop/Full-drop/Text-drop)。
Table 8: DiT 渲染消融(中英各 100 样本),对比隐变量主干(Levo 2 VAE vs Spec-VAE)、改写文本条件(None/Tags only/Tags+Lyrics)、CFG 空分支设计(LM-token drop/Full-drop/Text-drop)。
Song Describer Dataset 上的客观重建质量,所有模型在原生条件下评测,下标为 95% 置信区间。
Table 9: Song Describer Dataset 上的客观重建质量,所有模型在原生条件下评测,下标为 95% 置信区间。
Qwen-Music 与领先商业系统(MiniMax Music 2.5+、2.6、Mureka V8、Suno V5、V5.5)的盲测 A/B 偏好结果,由专业人类评分员评判。
Figure 2: Qwen-Music 与领先商业系统(MiniMax Music 2.5+、2.6、Mureka V8、Suno V5、V5.5)的盲测 A/B 偏好结果,由专业人类评分员评判。
在 Artificial Analysis Music with Vocals 排行榜的外部结果,Qwen-Music 以 JazzCat 匿名参赛,跻身领先英文人声生成系统前列。
Figure 3: 在 Artificial Analysis Music with Vocals 排行榜的外部结果,Qwen-Music 以 JazzCat 匿名参赛,跻身领先英文人声生成系统前列。
查看结构化数据
任务指标本文基线提升
文本到音乐(专业盲测胜率) Win Rate (%) 对 Suno V5.5 = 50.3% Suno V5.5 49.7% 在对标当前最强商业系统时仍略占优;对 MiniMax 2.6 高达 66.7%
文本到音乐(音乐性) SongBench Musicality 6.22 Suno V5.5 = 5.83 / Mureka V8 = 6.05 较第二名 Suno V5 (6.12) 提升 0.10,较 Suno V5.5 提升 0.39
文本到音乐(综合客观) 16 项指标最佳数 13/16 最佳 Suno V5.5 / Suno V5 / Mureka V8 / MiniMax 2.6 / 2.5+ 分摊剩余 SongBench 六维第一、SongEval 五维全第一
歌词清晰度 PER (×100, ↓) 6.10 Suno V5.5 = 4.19(最佳),Mureka V8 = 9.04(最差) 第二低,仅比 Suno V5.5 高 1.91,明显优于多数对手
翻唱旋律保留 Melody MAE (↓) 段落级 1.48(AI 集)/ 1.44(真实集) Suno V5.5 = 2.00(AI 集),MiniMax Cover = 1.76(真实集) AI 参考集全场最低;真实集上亦优于 MiniMax Cover
渲染重建质量 Mel Distance (↓) / CCPC (↑) 0.461 / 0.973 Spec-VAE 无 Refiner = 0.572 / 0.966;SAME-L = 0.539 / 0.970 Refiner 把 Mel Dist 降 0.111,全场最佳

局限与改进

作者承认的局限包括:PER 6.10 虽第二低但仍不及 Suno V5.5 的 4.19,歌词咬字清晰度并非最强;翻唱任务上商业系统(尤其 Suno V5/V5.5)在多项音乐性与标签遵循指标上仍占优,例如 AI 参考集 arrangement/musicality/mixing/structure 均落后于 Suno,说明在「保旋律 vs 高音乐性」之间存在权衡;通用标签遵循中 genre(8.08)与 instruments(8.65)也分别逊于 Mureka V8 与 Suno V5。我自己的观察:技术报告以「内部评测 + 自定义榜单」为主,PER 用自家 Qwen3-ASR、标签遵循用 Gemini 3.1 Pro,存在评测者即参赛者/或评测模型自身偏好风险;外部 Artificial Analysis 榜只验证英文人声,对中文等多语种客观优势缺乏第三方佐证;翻唱对比因 Suno 不接受真实歌曲输入,只能局限 AI 生成参考集,真实世界翻唱的对比对手只有 MiniMax Cover,说服力有限。

独立分析的弱点

其一,歌词清晰度(PER 6.10)落后 Suno V5.5 近 1.9 个点,可能根因是 25 Hz 单码本语义令牌对快速咬字的信息带宽不足——改进方向可考虑在渲染阶段注入音素级条件,或引入双流(语义+音素)令牌。其二,翻唱任务上存在「旋律保真 vs 音乐性」跷跷板:段落级 Melody-CoT 旋律最好(Melody MAE 1.48)但音乐性与标签遵循弱于 unique 段落级,说明条件强度难自适应——可设计强度可调的连续旋律嵌入或学习一个旋律门控。其三,参考旋律令牌刻意丢弃绝对音高/调性,导致「按原调翻唱」这类需求无法满足——可增加可选的绝对音高模式。其四,评测闭环高度依赖自家模型(Qwen3-ASR、内部 MOS 预测器)与单一第三方(Gemini 3.1 Pro),易引入偏好偏置——改进方向是引入更多独立评测器与公开多语种榜单。其五,渲染 DiT 与 Refiner 在 192× 压缩下虽稳,但训练仍依赖大规模高质量无损语料与精细声学清洗管线,工程门槛与算力门槛高。

未来方向

作者明确提出三个方向:更灵活的长上下文音乐结构建模、对演唱与表演更细粒度的表现力控制、更高效的渲染架构。基于本成果可延伸的研究包括:把 Melody-CoT 思想推广到「节奏 CoT / 和声 CoT / 段落结构 CoT」等多中间表示,形成可解释的多层级作曲链;将旋律令牌的相对 MIDI 表示升级为可学习、可混合强度的连续旋律嵌入,自适应权衡克隆度与创造性;探索音素/速度/力度等低层控制信号注入渲染器,弥合语义令牌带宽不足导致的歌词清晰度差距;用更轻量的蒸馏/一致性模型替换三阶段 DiT 渲染以降低推理成本;以及建立多语种、多流派的公开翻唱评测基准,减少自评依赖。

复现评估

复现难度整体偏高但工程信息透明。有利因素:四阶段分词器训练(表1)、Spec-VAE/Refiner 三阶段训练(表2)的超参与损失权重($\lambda_{\text{STFT}},\lambda_{\text{IF\_GD}},\lambda_{\text{KL}}$ 等)、DiT 架构(32 层、$d=1024$、24 头)、模型规模(0.6B 分词器、3B LLM、1.3B DiT)、码本($2^{15}$)与帧率(25 Hz)、数据规模(>500 万小时多语种)均已给出;声学清洗规则(表3)与截止检测算法(含式 7、式 8 的阈值 $f_c/f_{Nyq}<0.85$、$\Delta\text{dB}\ge40$)描述详细;评测协议(50 名专业评分员、3 人/对)也清楚。不利因素:核心训练数据未开源、内部 MOS 奖励模型与质量分桶 Q1–Q7 阈值细节未公开、后训练 DPO/GSPO 的奖励权重与超参缺省、Melody-CoT 的训练混合比例与旋律令牌具体映射代码未放出,且暂未提及模型权重或代码的开源计划。这意味着第三方几乎无法端到端复现,只能复现架构思路与组件级消融。