← 返回 2026-07-17

WanSong v1.0 技术报告:纯扩散双轨长时歌曲生成模型 WanSong v1.0 Technical Report

Binghui Chen, Pandeng Li, Yu Liu, Jingren Zhou 📅 2026-07-16 👍 17 2026-07-22 18:54
MMDit 双轨建模 强化学习对齐 扩散模型 流匹配 音乐生成 音频VAE

纯扩散端到端模型,单次生成5分钟多语种歌曲并直接分离人声与伴奏双轨

前置知识

纯扩散生成(Pure Diffusion)

扩散模型是一类生成模型,通过向数据逐步添加高斯噪声再学习逆向去噪过程来生成样本。本文采用的纯扩散方案指完全放弃自回归(AR)建模,将音频当作连续 token 序列,用 Flow Matching 框架在潜在空间中一次性预测整段音频的速度场,而非逐 token 生成。与 AR+扩散的级联流水线相比,纯扩散可以端到端单阶段输出完整波形,支持 step-distillation 加速推理,训练也相对简单稳定。

本文的核心方法论选择就是纯扩散而非当前主流 Suno/Mureka 所采用的 AR 或 AR+扩散级联方案,理解扩散生成机制是把握 WanSong 架构动机和效率优势的前提。

音频 VAE(Variational Autoencoder)

变分自编码器将原始立体声波形压缩成紧凑的连续潜在表示 z∈R^{Cz×T'},再由解码器重建波形,从而把高维音频桥接到扩散 Transformer 可处理的潜在空间。本文的 1-D VAE 以 44.1 kHz 立体声为输入,下采样因子为 1024,潜在帧率约 43.1 Hz,通道数 Cz=64。训练目标是生成器-判别器对抗损失加上多分辨率 STFT 幅度损失、特征匹配损失与 KL 散度正则:$L_G = \lambda_{mag}L_{mag} + \lambda_{fmap}L_{fmap} + \lambda_{adv}L_{Adv}(G;D) + \lambda_{KL}L_{KL}$。

VAE 的压缩比直接决定后续生成质量与效率的折中,论文 Table 1/2/5 证明将压缩比从 2048 降到 1024 带来决定性收益,这是理解整篇方法设计的关键。

Classifier-Free Guidance (CFG)

CFG 是扩散模型推理时常用的条件控制技术:在推理时同时计算条件预测和无条件预测,并通过引导强度 w 加权外推:$\hat{\epsilon} = (1+w)\epsilon_{cond} - w\epsilon_{uncond}$。w 越大则条件信号越强但多样性下降。本文的关键发现是:在歌曲生成中,w 较大时人声更准但伴奏被压制,w 较小时伴奏更丰富但人声退化——CFG 无法同时兼顾两个 stem,这正是双轨建模提出的直接动机。

CFG 失衡是 WanSong 必须从联合编码切换到双轨 token 方案的根本原因,掌握此概念才能理解 method 部分的核心创新。

MMDit 与 Hybrid Transformer

MMDit(Multimodal Diffusion Transformer,Esser et al. 2024)为不同模态(如文本与图像)分别设计可学习参数的对称双流 Transformer 块,在图像/视频扩散中表现优异。Hybrid Transformer 受 Flux 启发,并非每一层都为不同模态学习独立参数,而是部分层共享、部分层分离,从而在不损失质量的前提下减少参数量。本文在每块中采用来自 Wan2.1 的 fully-shared AdaLN 调制。

WanSong 25B 主干即 hybrid-MMDit,理解 MMDit 与 hybrid 设计才能看懂 Figure 2 的架构以及模型如何在文本/音频 token 间建模关系。

RLHF / DPO / ReFL

RLHF(人类反馈强化学习)通过人类偏好标注训练奖励模型,再用其信号优化生成模型。DPO(Direct Preference Optimization,Wallace et al. 2024)直接在正/负样本对上优化策略,损失 $L=-E_{a^+,a^-}[\log \tau(R(a^+)-R(a^-))]$,对全部时间步 t∈[0,1] 提供监督,利于优化音频全局结构。ReFL(Reward Feedback Learning,Xu et al. 2023)直接用奖励评估做反向传播,仅在低噪声阶段有效,更擅长精细细节但更易被奖励 hacking。本文先用 DPO 再用 ReFL 以互补。

RLHF 是 WanSong 提升音乐性、歌词准确率与提示对齐三大维度的关键后训练阶段,理解 DPO 与 ReFL 的互补性才能看懂论文的训练配方。

研究动机

现有商用级歌曲基础模型(如 Suno 2026、Mureka 2026)大多基于自回归(AR)建模或 AR+扩散级联流水线。AR 模型虽然提供了原则性的序列生成方式,但在两个关键维度上有根本性缺陷:其一是生成效率低,逐 token 推理导致长音频生成耗时显著;其二是难以在长时音频中保持一致的感知质量,长程依赖容易出现累积误差。一些工作在 AR 之上叠加扩散作为精细化模块以提升真实感,但这种多阶段、AR 主导的方案设计复杂,且各阶段之间信息损失难以避免。此外,早期实验显示将人声(vocal)与伴奏(BGM)联合编码到同一 token 流中时,扩散模型会过度聚焦于人声分量而抑制更复杂的 BGM 部分,CFG 也无法在两者间取得平衡:CFG 增大时人声变准但 BGM 变弱,CFG 减小时 BGM 改善但人声退化。

本文的目标是本文目标是构建一个商业级、端到端、单阶段的纯扩散歌曲生成基础模型 WanSong v1.0,能够一次性生成多达 5 分钟的高保真、多语种(中、英、日、韩等)歌曲,并在同一次推理中直接输出分离的人声和 BGM 双轨,便于下游后期编辑。模型还需支持通过 step-distillation 实现高效推理,并提供高效的微调与定制化路径以适配下游编辑任务。此外通过 RLHF 让模型在音乐性、歌词准确率和提示对齐三个维度上对齐人类偏好,整体达到甚至超过 Suno V5 与 Mureka V7.6 的商用水平。

与已有工作不同的是,本文的独特切入角度是把音频视为连续 token 序列,完全抛弃 AR 主导范式,将文本 token(LLM 编码)与双轨音频 token(VAE 编码)顺序拼接成统一序列喂给 hybrid-MMDit 主干做端到端流匹配训练。最关键的创新是提出双轨 token 方案:人声与 BGM 在网络输出端独立产生,但在每个 block 内部被当作同一 token 的不同通道联合学习,从而既消除两者之间的相互干扰,又能建模其内在依赖。这种设计同时让 CFG 失衡问题被根本性消除,并使模型天然输出 demix 后的双轨 stem,大幅简化后期制作流程。

核心方法

WanSong 的整体思路可以分两层理解。直觉上:放弃 AR 逐 token 生成,直接在 VAE 潜在空间用流匹配一次性预测整段立体声潜在表示,再解码回 44.1 kHz 波形;并显式把人声和 BGM 拆成两条独立输出轨道,但在网络内部联合学习。技术路线上,系统由三大模块组成:(1)连续 1-D VAE,以 1024 下采样因子把立体声压成 Cz=64、潜在帧率约 43.1 Hz 的潜在流;(2)hybrid-MMDit 扩散主干,约 25B 参数,N+KN=0.3,采用来自 Wan2.1 的 fully-shared AdaLN 调制,文本 token 与双轨音频 token 顺序拼接后通过跨样本 packing 喂入;(3)RLHF 后训练,针对音乐性、歌词准确率、提示对齐三维度训练奖励模型,并先用 DPO 再用 ReFL 做互补优化。训练数据来自一条五阶段(采集→预处理→过滤→标注→采样)的数据流水线,最终语料超过 600 万小时多语种歌曲。

核心创新点是双轨 token 建模(dual-stem token scheme)配合层内联合学习。与已有方法的本质区别在于:现有端到端扩散歌曲模型往往把人声和 BGM 编码到同一组 token 中,导致扩散模型过度聚焦人声、CFG 失衡。WanSong 让人声与 BGM token 在模型输出端独立产生,但每个 block 内部把它们当作同一 token 的不同通道来联合学习——这意味着模型在保持输出独立轨道的同时,仍能学习两者之间的内在依赖(如节奏、和声耦合)。这一设计从根本上消除了二者相互干扰,并让模型直接输出分离的人声/BGM stem,无需额外 demix。次要创新包括 halving VAE 压缩比到 1024、hybrid-MMDit 主干与 RLHF 三维度对齐。

方法步骤详情

完整方法分四步。第一步是 VAE 训练:将立体声波形 $x\in R^{2\times T}$(44.1 kHz)映射为潜在张量 $z\in R^{C_z\times T'}$,其中 $C_z=64$、$T'=T/1024$;生成器-多尺度判别器对抗训练,总损失 $L_G=\lambda_{mag}L_{mag}+\lambda_{fmap}L_{fmap}+\lambda_{adv}L_{Adv}(G;D)+\lambda_{KL}L_{KL}$($L_{mag}$ 为 Mid-Side 与 L/R 通道的多分辨率 STFT 幅度损失,$L_{fmap}$ 为 ℓ1 特征匹配,$L_{Adv}$ 为 Hinge 对抗,$L_{KL}$ 为 KL 散度正则)。训练语料约 $2.6\times 10^8$ 片段,域比例 Music:Speech:Sound=50%:40%:10%,AdamW(G 学习率 $2\times 10^{-4}$、D 学习率 $3\times 10^{-4}$),32 块 A100 训练 1.5M 步、crop 1.5 秒,后阶段对潜在加随机噪声增广。第二步是 hybrid-MMDit 主干:LLM 编码的文本 token 与 VAE 编码的双轨音频连续 token 顺序拼接为统一序列,跨样本 packing 提升吞吐,受 Flux 启发并非每层都为不同模态学习独立参数,每块采用 Wan2.1 的 fully-shared AdaLN。第三步是流匹配训练:给定音频潜在 $X_1$、噪声 $X_0\sim\mathcal{N}(0,I)$、时间步 $t\in[0,1]$(logit-normal 采样),按 Rectified Flow 形成插值 $X_t=tX_1+(1-t)X_0$,真值速度 $V_t=X_1-X_0$,损失为 $L=\alpha_{vocal}E_t[\|\theta(X_{vocal,t},C_{txt},t)-V_{vocal,t}\|^2]+\alpha_{bgm}E_t[\|\theta(X_{bgm,t},C_{txt},t)-V_{bgm,t}\|^2]$;预训练分 90s/300s/SFT 三阶段。第四步是 RLHF:针对音乐性、歌词准确率、提示对齐三维度收集提示并推理音频,人工标注偏好对训练奖励模型($L=-E_{a^+,a^-}[\log\tau(R(a^+)-R(a^-))]$),先用 DPO(覆盖全时间步、优化全局结构)再用 ReFL(仅低噪声阶段、优化精细细节)做互补优化,推理时用 step-distillation 加速。

技术新颖性

技术新颖性体现在四处。其一,双轨 token 方案与层内联合学习首次从根本上解决了人声/BGM 在单一 token 编码下相互干扰、CFG 无法同时兼顾的问题,并让模型天然输出 demix 后的双轨 stem——这是论文最独特的设计。其二,把 VAE 压缩比从 Stable Audio 2 的 2048 halving 到 1024,是性能跃升的最主要单一因素,论文用对照实验(Ours 2048 vs Ours 1024)严格分离了压缩比与架构优化的贡献。其三,hybrid-MMDit 主干结合 Wan2.1 的 fully-shared AdaLN,在减少参数的同时保持性能。其四,把 DPO 与 ReFL 组合用于歌曲生成对齐,分别覆盖全局结构(DPO,全时间步监督)和精细细节(ReFL,低噪声阶段),实现互补。整体技术路线强调"简单但有效、不依赖 gimmicky tricks"的设计哲学。

Data pipeline overview
Figure 1: Data pipeline overview
Our hybrid-transformer backbone
Figure 2: Our hybrid-transformer backbone

实验结果

核心发现分四部分。第一,VAE 重建:在 200 段内部音乐基准上,Ours(1024) 的 STFT/MEL/SI-SDR 为 1.029/0.629/7.246 dB,Stable Audio 2 为 1.430/0.856/4.386 dB;在 SeedTTS 2000 段语音上,Ours(1024) 为 0.698/0.458/12.922 dB,Stable Audio 2 为 0.999/0.754/8.653 dB。对照表明在相同压缩比 2048 下本文已优于 Stable Audio 2(音乐 −19% STFT、+0.28 dB SI-SDR;语音 −22% STFT、+1.72 dB),而把压缩比从 2048 halving 到 1024 带来音乐 +2.86 dB、语音 +4.27 dB 的 SI-SDR 跃升,证明 2048× 过于粗糙。第二,WanSong Bench(200 样本、中英日韩四语种、十多流派、约 4 分钟):WanSong 发音错误率 PER 仅 7.43%,远低于 LeVo 27.11%、Suno V5 22.80%、Mureka V7.6 12.7%;SongEval 的 Cla/Coh/Mem/Mus/Nat 为 4.47/4.55/4.57/4.46/4.4;Muq 文本对齐 0.44。第三,由于 SongEval 在近 2000 首歌上训练泛化不足(分数差异极小),论文改用 80k 首人工标注训练的自有音乐性模型(旋律/结构/整体体验权重 0.4/0.25/0.35,区间 [0,10]):WanSong 音乐性 5.49 显著领先 Suno V5 的 4.18、Mureka 3.83、LeVo 1.69。第四,token 压缩比消融(PT-90s):2048×+patch1 的 PER 19.2%、Quality 2.1;1024×+patch2(等价实际 2048)PER 20.6%、Quality 2.4;1024×+patch1 的 PER 15.0%、Quality 3.2,证明有效压缩比是效率-质量权衡的主导因素,且更大 patch size 引入不可恢复的退化。

VAE reconstruction quality on the wan-song music benchmark (200 clips)
Table 1: VAE reconstruction quality on the wan-song music benchmark (200 clips)
VAE reconstruction quality on the SeedTTS speech benchmark (2000 random samples)
Table 2: VAE reconstruction quality on the SeedTTS speech benchmark (2000 random samples)
Objective quantitative evaluations
Table 3: Objective quantitative evaluations
Objective quantitative evaluations
Table 4: Objective quantitative evaluations
Ablation study on token compression ratio
Table 5: Ablation study on token compression ratio
查看结构化数据
任务指标本文基线提升
VAE 音乐重建(200 段 WanSong 内部音乐) SI-SDR (dB) ↑ 7.246(Ours 1024) 4.386(Stable Audio 2) +2.86 dB,相对 +65%
VAE 语音重建(SeedTTS 2000 段) SI-SDR (dB) ↑ 12.922(Ours 1024) 8.653(Stable Audio 2) +4.27 dB,相对 +49%
歌曲生成发音准确率(WanSong Bench 200 样本) PER (%) ↓ 7.43%(WanSong) 12.7%(Mureka V7.6)/ 22.80%(Suno V5)/ 27.11%(LeVo) 相对 Mureka 降低 41%,相对 Suno 降低 67%
音乐性(自有 80k 标注评估模型) Musicality [0-10] ↑ 5.49(WanSong) 4.18(Suno V5)/ 3.83(Mureka)/ 1.69(LeVo) 相对 Suno +31%,相对 Mureka +43%
Token 压缩比消融(PT-90s) PER (%) ↓ / Quality (1-5) ↑ 15.0% / 3.2(1024×, patch 1) 19.2% / 2.1(2048×, patch 1) PER 降低 22%,Quality 提升 52%

局限与改进

作者承认的局限主要有三点。其一,SongEval(Yao et al. 2025)仅在近 2000 首歌上训练,泛化能力难以保证,导致 Table 3 中各系统分数差异极小,作者不得不退而使用自有评估模型;AudioBox 等公开指标也无法精确度量歌曲音频质量,最终音乐性只能依赖专家人工评估。其二,token 压缩比消融只在 PT-90s 阶段进行,受训练成本限制未在 300s 与 SFT 阶段进一步验证,长时长下的压缩比选择仍存在不确定性。其三,作者明确表示不会进一步降低压缩比,因为过低的压缩率会让 token 数量剧增,导致资源消耗与生成速度显著恶化——这意味着当前的 1024 是工程权衡而非理论最优。我额外观察到的局限包括:论文未给出 SongEval 与自有音乐性模型的预训练细节、未公开 VAE 与主干的详细层结构、未报告推理延迟与 step-distillation 的实际加速比,使得"高效推理"这一宣称难以独立验证。

独立分析的弱点

第一个弱点是评估体系对外部工具高度依赖且泛化能力存疑。SongEval 仅在约 2000 首歌上训练,导致 Table 3 各系统分数几乎贴在一起,最终只能依赖专家主观评估,削弱了结果的可复现性与可比性。改进方向是构建更大规模、多语种、流派平衡的开放评测基准并发布评估模型权重。第二个弱点是 RLHF 的奖励 hacking 风险:ReFL 直接基于奖励反向传播,作者也承认更易被 hacking,但论文未给出对抗性测试或越狱案例分析。改进方向是引入奖励多样性正则、多奖励集成或红队评估。第三个弱点是缺少可控性细节:论文宣称支持下游编辑任务,却未给出编辑能力(歌词改写、人声替换、风格迁移)的实验或量化指标。改进方向是补充可控编辑基准与消融。第四个弱点是基础设施成本极高(25B 参数、32 块 A100、600 万小时数据),普通研究者难以复现或对比,改进方向是发布蒸馏后的小模型或 API。第五个弱点是双轨建模对极端场景(纯器乐、纯清唱、密集合唱)的鲁棒性未在论文中量化。

未来方向

作者明确提出的未来方向包括:扩展 step-distillation 与高效微调/定制化路径以支持下游编辑任务,以及继续在更多维度上对齐人类偏好。基于本文成果可延伸的方向包括:第一,把双轨 token 思想推广到更多 stem(如鼓、贝斯、和声、主旋律各自独立轨道),形成多轨可编辑输出;第二,引入显式的结构与段落条件(如前奏-主歌-副歌-桥段-尾奏)以提升长时歌曲的结构连贯性;第三,把 RLHF 扩展到更多维度(节奏稳定性、音准、情感强度、跨语言歌词混合),并用更鲁棒的奖励集成抑制 hacking;第四,探索更低压缩比的 VAE 与更长上下文主干的权衡,配合稀疏注意力或 Mamba 类架构降低 token 数爆炸;第五,将双轨建模迁移到语音克隆、虚拟歌手、电影配乐 demix-on-generation 等下游任务;第六,研究纯扩散范式在实时交互式音乐伴奏(如跟随演奏者)中的潜力。

复现评估

论文复现性总体偏弱。作者未开源代码、模型权重或评测基准(截至发表),仅在正文中给出高层架构图与少量超参数:VAE 压缩比 1024、$C_z=64$、潜在帧率约 43.1 Hz、主干约 25B 参数、N+KN=0.3、AdamW 学习率 $G=2\times 10^{-4}/D=3\times 10^{-4}$、32 块 A100 训练 1.5M 步、域比例 50/40/10。许多关键细节缺失:hybrid-MMDit 的层数、注意力头数、LLM captioner 型号、step-distillation 的步数与加速比、奖励模型与 DPO/ReFL 的训练超参、自有评估模型的网络结构。数据方面给出 600 万小时多语种歌曲总量与五阶段流水线,但语料本身商业敏感、外部不可获取。算力方面,预训练需 32 块 A100 跑 1.5M 步、25B 主干、三阶段(90s/300s/SFT)训练,整体处于工业实验室级别,学术团队难以完整复现。WanSong Bench(200 样本、四语种、十多流派)也未公开。综合判断:核心结论(双轨建模与 1024 压缩比的优势)从消融实验可定性信服,但定量复现几乎不可行。