← 返回 2026-08-04

SwanTale:面向指令与零样本任务的统一多说话人语音与音频生成 SwanTale: Unified Multi-Speaker Speech and Audio Generation for Instruct and Zero-Shot Tasks

Yu Zhang, Ruiqi Li, Changhao Pan, Ke Lei, Xiang Yin, Cheng Yang 📅 2026-08-03 👍 154 2026-08-09 18:30
多模态 强化学习后训练 指令式TTS 流匹配 混合专家MoE 语音合成 零样本声音克隆 音频生成

单一模型同时支持自然语言设计声音与参考音频克隆声音的多模态语音音频生成系统

前置知识

零样本语音合成(Zero-Shot TTS)

给定一段简短的参考音频(通常几秒),模型据此克隆说话人音色,合成参考音频里没说过的新内容。说话人身份由参考音频提供,内容与韵律由文本控制。

本文的核心任务之一就是零样本克隆;理解「参考音频控制全局音色、文本控制内容」的分工,才能看懂两种任务如何共享同一个生成骨干。

流匹配(Flow Matching)

一种非自回归生成范式:构造一条从噪声 $x_0$ 到数据 $x_1$ 的连续轨迹 $x_t=(1-t)x_0+tx_1$,训练网络回归速度场 $v=x_1-x_0$,推理时用ODE积分去噪。相比自回归可避免重复和不稳定。

SwanTale 的骨干是流匹配DiT,损失 $\mathcal{L}_{flow}$ 只在生成区域计算、参考帧被遮罩,这是统一指令/零样本两任务的关键数学机制。

神经音频自编码器 / 潜空间VAE

用编码器把波形压成低帧率的连续潜变量(本文SwanVAE把48kHz波形压成25Hz、96维),再由解码器重建。下游生成模型在潜空间操作,显著缩短序列长度。常用重建损失(STFT/Mel/能量)+对抗判别器+KL正则。

SwanVAE是整个系统的声学底座,它的重建质量与潜空间可学性直接决定生成上限;理解其非对称设计(轻编码+重解码)和对后验均值的对齐目标才能看懂方法。

混合专家(Mixture of Experts, MoE)

用路由器为不同输入动态选择少量「专家」前馈子网络,而非让所有输入共用一组稠密权重,从而在可控算力下提升容量。常见有Top-K/Top-P路由、共享专家、负载均衡偏置。

Unified MoE 是本文最大创新:用任务路由(样本级)+音频路由(帧级Top-P)为语音、环境声、音效、音乐等异构模态分配专用专家,是读懂方法部分的前提。

组相对策略优化(GRPO)

一种强化学习算法:同一条件下采样多个候选,用组内奖励的均值/标准差归一化得到相对优势 $A_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,无需训练价值模型,配合clip目标更新策略。

SwanTale 用 Flow-GRPO 做后训练修正发音、稳定性与属性控制,并用监督锚点回放防止多说话人/音效能力被遗忘,是理解最终质量提升的关键。

无分类器引导(Classifier-Free Guidance, CFG)

推理时同时用「有条件」和「无条件(或弱条件)」两种预测,用加权差值放大条件影响 $ ilde{v}=v_\emptyset+\omega(v_{cond}-v_\emptyset)$,无需额外分类器即可提升条件遵循度。

SwanTale 用两段解耦CFG分别控制「内容/说话人轮次」和「其余声学条件」,并做时间步退火,这是推理质量的重要细节。

研究动机

现有零样本TTS(如CosyVoice、F5TTS、SwanVoice)在已有参考录音时已能高质量克隆音色,但在动画配音、广播剧、电影、广告、游戏、播客、短视频等媒体创作中,目标说话人往往根本没有参考录音——创作者需要从零设计声音、用自然语言指定角色该如何演绎台词、把台词放进随情节变化的声学场景,之后还可能用零样本复用设计好的声音。然而现有指令式TTS有三类硬伤:其一,大多数只生成干净人声,环境和音效若交给下游流水线拼接,其时间、响度、混响和声学纹理极易与人声漂移、互不咬合;其二,说话人控制往往退化为一组离散属性标签(年龄/性别/情绪/语速),而非「自然语言人设→声音」的直接映射;其三,现有指令式TTS通常无法在同一模型内同时保留零样本能力。此外还面临三大挑战:数据稀缺(高质量细粒度caption昂贵)、任务兼容性(指令路径用caption、零样本路径用参考音频,二者须共享内容建模且不互相削弱)、多音频模态复杂性(语音、环境声、瞬时音效、歌唱、音乐时间结构各异,需在同一波形中保证可懂度与音色一致)。

本文的目标是本文目标是构建一个统一模型SwanTale,在一个生成过程中同时支持两类任务:指令任务(用描述环境、说话人人设与细粒度内容的caption全权控制)与零样本任务(用参考音频控制全局音色、用内容caption控制细粒度内容),并能在单一波形中联合生成多说话人语音、环境声、局部音效、偶发歌唱与音乐。要求既保证语音可懂度与说话人一致性,又支持复杂指令式生成,还能把「从自然语言设计出的声音」再通过参考音频复用,形成完整的创作闭环,最终在零样本与指令两类任务的关键指标上同时取得领先。

与已有工作不同的是,独特切入在于「数据—模型双侧同时发力」。数据侧并非简单转录,而是构建SwanData-Caption流水线(约7000万条caption记录),用针对性合成子集(老年语音、中英文短句、发音挑战文本各10万条)补齐长尾,用风格人设库做软先验,用波形滤波+caption审计+人工组内最优-最差比较筛选高表达性数据。模型侧的独特之处有三:(1)奖励条件化质量控制——把STOI/PESQ/SI-SDR/MOS质量分作为条件而非优化目标,推理时直接固定到最高质量,无需任何强化学习rollout;(2)Unified MoE用任务路由+音频路由两级稀疏化,按扩散时间动态分配专家预算,为异构声学模式提供专用容量;(3)课程学习+GRPO后训练,把条件对齐、容量扩张、质量精修分成不同优化阶段。这套组合使单一模型首次同时覆盖两类任务和多种音频模态。

核心方法

整体思路是「先把音频压成一个对下游流模型友好的连续潜空间,再用非自回归流匹配DiT在该潜空间做条件生成,并用稀疏专家与强化学习把多任务多模态的容量与精度补齐」。技术上分五块:SwanVAE负责把48kHz单声道波形压成25Hz、96维的连续潜变量(每帧40ms),用非对称结构(轻量抗混叠卷积编码器+高斯VAE瓶颈,容量主要放在解码端Transformer Resampling Block);然后Qwen3.0-Instruct-8B编码caption、CosyVoice 2.0分词器处理文本,经交叉注意力注入非因果流匹配DiT;引入奖励条件化质量控制和Engram记忆层强化固定模式识别;用Unified MoE做两级动态稀疏路由;最后通过四阶段课程学习(零样本基座→干净语音稠密caption适配→全caption混合训练→高质量高表达SFT)与GRPO后训练逐步习得并强化能力。指令与零样本共享同一速度场骨干,仅caption输入与上下文遮罩不同。

核心创新是把「任务类型」和「音频模态」这两个正交维度的专用容量用统一稀疏机制显式建模,而非让异构声学模式争抢同一组稠密权重。Unified MoE含三类专家:任务共享专家(由任务路由在样本级选出,捕获指令/零样本各自的稳定先验)、路由音频专家(由音频路由对每帧做Top-P动态选择,处理说话人切换、重叠语音、表达变化、局部音效)、零(null)专家(作为跳连,降低稳定背景/静音帧的计算)。配合扩散时间感知的专家预算 $q(t)=\sigma(W_b e_t)$,让不同去噪阶段分配不同Top-P阈值、null偏置和容量 $c(t)=c_{min}+(c_{max}-c_{min})q(t)$,再用退火Gumbel-Softmax让专家角色逐步分化。这与把所有模态塞进稠密FFN或按模态分模型有本质区别。另一关键创新是奖励条件化:质量分当条件用而非当奖励优化,推理固定最高质量,零额外RL成本。

方法步骤详情

SwanVAE在32卡上用约10万小时内部音频、3.84秒片段训练,重建损失为多分辨率STFT+多频带Mel+帧能量,KL $\lambda_{KL}=0.02$,配MPD/MRD/MBCSD判别器;对后验均值 $\mu_\phi$ 施加流匹配对齐、因果预测、色度/能量读出等弱目标,训练后丢弃辅助头。数据经分离→分轨→转录→对齐得说话人锚定文本,Seed2.0 Lite按Environment/Speakers/Content标注,再用波形质量与人工最优-最差比较筛选(共约7000万条)。课程四阶段:2B零样本基座→70M干净样本稠密caption适配20k步→10M全caption混合训练引入Unified MoE 10k步→1M高质量SFT 4k步(64卡)。GRPO后训练8卡10轮,每条件采K=8条SDE轨迹算组相对优势 $A_i=(R_i-\mu_R)/(\sigma_R+\epsilon)$,clip目标+KL约束+监督锚点回放保住多说话人/音效。推理:零样本用参考帧作prompt、指令用全caption,两段解耦CFG $[1.5,3.0]$+时间退火+sway采样。

技术新颖性

新颖性体现在几处TTS少见的机制:(1)奖励条件化质量控制将质量作为条件而非奖励,绕开RLHF的rollout与奖励模型开销,且中低质量数据仍被利用、仅标记质量等级而非丢弃;(2)Engram记忆层用n-gram($N=\{2,3\}$)窗口哈希表识别caption中反复出现的固定模式(如「活泼少女」「火车汽笛」),用内容相关的门控残差更新 $\tilde{u}_i=u_i+\sigma(\cdot)W_V e_i$,初始偏置为负、训练中渐开,把固定模式识别与长程声学规划解耦;(3)Unified MoE在流匹配语音DiT里同时做任务级与帧级动态Top-P路由、并随扩散时间预算自适应,辅以router z-loss与null-collapse惩罚 $\mathcal{L}_{MoE}=\lambda_z\mathcal{L}_z+\lambda_{null}\mathcal{L}_{null}$ 稳定路由;(4)GRPO后训练用边缘保持SDE把确定性流ODE随机化,以逐元素对数似然均值保证不同长度utterance的clip比例可比,并用监督锚点回放防止多说话人/音效能力被遗忘。

Overview of the four-stage SwanData-Caption data processing pipeline
Figure 1: Overview of the four-stage SwanData-Caption data processing pipeline
Overview of SwanTale (a) 架构与 (b) Unified MoE
Figure 2: Overview of SwanTale (a) 架构与 (b) Unified MoE
Overview of SwanVAE 架构与训练目标
Figure 3: Overview of SwanVAE 架构与训练目标

实验结果

SwanVAE(Table 3-4)checkpoint横跨四域:语音域PESQ 4.1683、MCD 0.9638最优,歌唱域PESQ/STOI/MCD最优,通用音频ViSQOL 4.1269最优、音乐ViSQOL 4.2623第二。零样本(Table 5):独白Timbre 0.95、Richness 3.90、Hierarchy 3.70三项第一,Content Error降到0.086;对话SpeechJudge 3.92、Richness 3.66、Hierarchy 3.85四项第一;但独白Content Error与Sound Fidelity不及FishSpeech。指令(Table 6):中文APS 86.1、英文APS 84.2并列第一,中文DSD 80.1第二;英文DSD与角色扮演RP偏弱。SwanBench-Scene(Table 7):Mean MOS 4.22、四维均第一。消融(Table 8):去Unified MoE使指标由3.39/4.31/3.82降到3.02/4.09/3.56;caption编码器8B→32B提升到3.70/4.34/3.98。

Output-field definitions used in the caption annotation schema
Table 1: Output-field definitions used in the caption annotation schema
Reconstruction quality on the speech and singing voice test sets
Table 3: Reconstruction quality on the speech and singing voice test sets
Reconstruction quality on the general audio and music test sets
Table 4: Reconstruction quality on the general audio and music test sets
Zero-shot monologue and dialogue TTS results on SwanBench-Speech
Table 5: Zero-shot monologue and dialogue TTS results on SwanBench-Speech
Instruct TTS results on InstructTTSEval
Table 6: Instruct TTS results on InstructTTSEval
Results on SwanBench-Scene
Table 7: Results on SwanBench-Scene
Results on SwanBench-Caption (消融)
Table 8: Results on SwanBench-Caption (消融)
Utterance-level accuracy of SwanVerifier
Table 12: Utterance-level accuracy of SwanVerifier
查看结构化数据
任务指标本文基线提升
语音域重建 PESQ↑ 4.1683(最优) DAC 4.1178 列所有对比系统第一,谱质量最佳
语音域重建 MCD↓ 0.9638(最优) VoxCPM2 AudioVAE V2 1.2222 显著最低,反映25Hz潜空间保谱结构
零样本独白TTS Timbre Consistency↑ 0.95(第一) GLM-TTS 0.94 音色一致性最优
零样本独白TTS Expressive Richness↑ 3.90(第一) SwanVoice 3.81 高表达性数据+GRPO带来表达性领先
零样本独白TTS Content Error↓ 0.086 FishSpeech 0.066 不及最强专用基线(短板)
指令TTS(中文) APS↑ 86.1(第一) Qwen3-TTS/VoxCPM2 85.2 +0.9,显式声学控制最优
指令TTS场景音质 Mean MOS(SwanBench-Scene)↑ 4.22(第一) Qwen3-TTS 4.09 +0.13,四维度全面领先
SwanBench-Caption消融 Instruction Accuracy↑ 3.39(完整)/3.70(32B编码器) 去MoE 3.02 Unified MoE+大编码器共带来+0.68

局限与改进

作者坦承三类挑战:复杂背景音乐生成仍困难(音乐需随情绪切换类型或过渡)、长篇幅指令生成(超过2分钟且含音效的复杂多说话人场景)仍是难题、精细局部风格控制(指定说话人的连续情绪变化、重音与节奏的精确控制、停顿与音效的精准时序)在数据标注和模型设计上都难。我额外观察到:指令任务的角色扮演(RP)与英文DSD明显偏弱(ZH/EN RP仅64.1/63.6),说明style-persona库对长尾职业/角色覆盖不足;零样本在内容准确率与音质上并未全面领先专用系统(如FishSpeech),显示「统一」仍有权衡成本;所有指令评测依赖Gemini系列LLM裁判,存在裁判偏好与评分校准噪声;GRPO仅对单人困难样本做后训练、多说话人/音效靠锚点回放间接保护,这类样本的真实强化收益未被直接验证。

独立分析的弱点

弱点一:角色/人设泛化不足。RP中英文都偏弱(64.1/63.6),改进方向是把style矩阵扩展到更多职业、角色原型与情境,并引入「职业→声音」的检索增强。弱点二:统一模型的内容准确率/音质有权衡——零样本独白Content Error 0.086、Sound Fidelity 3.95落后于专用系统FishSpeech(0.066/4.09),可针对内容路径单独强化发音奖励或用更大文本编码器。弱点三:长篇幅多说话人+音效(>2分钟)受限,可引入分段一致性约束与说话人嵌入缓存。弱点四:依赖LLM裁判(Gemini)评测,有偏好噪声,建议补充基于音素/说话人嵌入的客观指标交叉验证。弱点五:背景音乐与情绪联动弱,可借鉴音乐生成模型的分层条件化。

未来方向

作者明确提出把音频生成与编辑统一到同一框架(对既有音频的内容/说话人/情绪做编辑)。基于本成果可延伸:(1)统一生成-编辑模型,复用SwanVAE潜空间与流匹配骨干做inpainting/voice conversion;(2)扩展style-persona库与检索式人设生成,改善角色扮演RP;(3)长篇章一致性建模(跨段落说话人/情绪记忆);(4)更强的局部风格控制(细粒度韵律/重音/停顿标注与时序对齐);(5)把奖励条件化推广到更多可控维度(情绪强度、语速的连续控制);(6)探索更高效推理(当前用两段CFG+sway采样,去噪步数仍可观)。

复现评估

复现难度较高。论文给出大量关键超参:SwanVAE训练32卡、100k小时、48kHz/25Hz/96维、$\lambda_{KL}=0.02$、固定3.84秒片段;SwanTale训练64卡,四阶段步数(20k/10k/4k)、学习率峰值 $7.5\times10^{-5}$、caption编码器Qwen3.0-Instruct-8B、CosyVoice 2.0分词器、推理CFG $[1.5,3.0]$、引导退火 $(0.6,0.6,1.0)$、GRPO K=8/10轮/8卡。但训练数据为字节跳动内部数据(23M+1.7M小时零样本、70M caption)非公开,项目页给出但未见代码/权重开源声明,且依赖多个内部模型(SwanVoice、SwanAligner、Seed-ASR 2.0、Seed2.0 Lite、SwanVerifier)。因此算法思路清晰可借鉴,但端到端复现几乎不可行,只能在自有数据上部分复现组件。评测benchmark(SwanBench系列)部分为自建、裁判用Gemini,可部分复现。