KVAE:面向多模态生成模型的分词器家族 KVAE: Family of Tokenizers for Multimodal Generative Models
KVAE 系列分词器覆盖音频、图像、视频三模态,重建与生成质量均匹配或超越主流开源方案
前置知识
潜在扩散模型(Latent Diffusion Model, LDM)
一种两阶段生成范式:先用视觉/音频分词器(编码器-解码器对)把高维信号压到低维潜在空间,再在该空间训练扩散模型(去噪过程),最后经解码器还原。这种解耦使扩散不必在像素/波形维度操作,大幅降低算力,但生成质量高度依赖分词器塑造的潜在空间性质。
本文所有工作都建立在 LDM 框架上:分词器既是入口也是出口,其压缩率、重建质量与可扩散性直接决定下游生成模型的收敛速度和最终效果。
分词器(Tokenizer / VAE)
本文语境里指编码器 $\mathcal{E}$ 与解码器 $\mathcal{D}$ 组成的压缩-重建对,把输入信号映射到低维潜在表示。视频模型用三元组 $f_t \times f_s \times f_s$(时间/空间压缩因子)加通道数 $c$ 刻画,如 KVAE-4×16×16(64 通道);音频用 $(采样率, 潜在帧率, 通道数)$ 刻画。
理解压缩因子与通道数是读懂本文实验对比的前提:不同的 $f_t \times f_s$ 组合代表不同的信息瓶颈,直接决定下游扩散模型要处理的 token 数量。
可扩散性(Diffusability)
由 Skorokhodov 等人 [82] 提出的概念,描述潜在表示对扩散建模的友好程度,区别于解码器重建输入的准确度。它是潜在空间的结构性质,重建好的分词器未必可扩散性好,二者可互相权衡,这正是重建-生成困境的根源。
本文核心方法论就是把可扩散性作为筛选分词器的关键指标,并用便宜的 CDS 统计量近似它,从而避免为每个候选都训练昂贵的生成模型。
相关衰减斜率(Correlation Decay Slope, CDS)
用余弦相似度计算潜在特征随空间距离 $\delta$(曼哈顿距离)衰减的斜率:先定义空间相关图 $g(\delta)$,再用 $g(\delta) \simeq \alpha + \beta\delta$ 在 $\delta=1,\ldots,8$ 上拟合,CDS 定义为 $-\beta$。CDS 越大说明潜在特征空间去相关越快。
本文发现 CDS 与 Bradley-Terry 主观视觉质量评分的 Pearson 相关高达 $r=0.906$,被用作冻结分词器的廉价诊断指标,是整套模型选择流程的基石。
变分自编码器(VAE)
编码器输出潜在分布参数(高斯均值与方差),通过重参数化采样 $\mathcal{E}(x)_s$ 训练,并用 KL 散度 $D_{KL}$ 约束后验接近标准正态 $\mathcal{N}(0,I)$。本文把神经编解码器的离散量化替换为连续高斯瓶颈,使其从传输编解码器转变为可服务扩散的 VAE。
KVAE 全家桶本质上都是 VAE;连续瓶颈是让潜在空间可被扩散建模的前提,理解 KL 正则与重参数化才能看懂各阶段损失函数。
神经编解码器(DAC / EnCodec / SoundStream)
卷积编码器-解码器加残差向量量化(RVQ)的架构,源于 SoundStream,经 EnCodec、DAC 发展,本为信号传输优化。离散码本和低比特率适合传输却不利于扩散,故生成管线常把量化换成连续瓶颈。KVAE-Audio 即在 DAC 骨干上做此改造。
KVAE-Audio 直接继承 DAC 的卷积主干与 Snake 激活,理解神经编解码器的步长梯子与判别器组合是读懂音频分词器设计选择的基础。
研究动机
潜在扩散建模(LDM)是当前文本条件生成的主流范式,但它把分词器置于生成流程的核心位置:分词器塑造的潜在空间直接影响学习速度、合成样本质量以及后续应用。然而业界长期面临重建-生成困境——在固定下游算力下,提升单 token 特征维度可改善重建 FID 却恶化生成 FID,重建指标无法可靠预测下游生成质量。具体到音频领域,多数开源音频分词器要么只在 16–24 kHz 工作,要么压缩 mel 频谱图再交给独立声码器(如 MMAudio 在 43.07 Hz、LTX-2 在 25 Hz),既丢弃相位又把可用带宽限制在声码器水平,无法满足媒体制作中与视频混合的全带需求;联合文本到视频+音频的生成目前还没有能与闭源方案竞争的开源方案,全带分词器是先决条件而非锦上添花。视频侧同样面临注意力二次复杂度带来的算力压力,亟需高压缩、高可扩散性的分词器。
本文的目标是本文目标是构建一组覆盖音频、图像、视频三模态、专为文本条件生成设计的 KVAE 分词器:KVAE-Audio(48 kHz、50 Hz、64 通道的全带连续波形分词器)、KVAE-3D(4×16×16 与 4×8×8 两个因果视频分词器)、KVAE-2D(8 倍压缩、32 通道图像分词器)。在重建指标(PSNR、LPIPS、PESQ 等)和生成指标(Fréchet 距离、CLIP/CLAP 分数等)以及主观并排评估上,要匹配或超越 Wan-2.2、HunyuanVideo-1.5、FLUX.2、MovieGen、StableAudio、MMAudio 等前沿开源分词器,并公开训练细节、模型选择方法与设计消融,把开发难点与设计权衡坦诚分享给社区。
与已有工作不同的是,本文的独特切入角度是把可扩散性与重建保真度视为联合约束而非简单权衡,并发展出便宜的冻结分词器诊断手段来在昂贵生成训练前筛选候选。具体地,它把图像域的相关衰减斜率(CDS)迁移到一维音频潜在空间作为筛选信号,并在每个模态都用受控分词器置换实验——固定生成模型架构、数据和步数,只换冻结分词器——来归因生成质量差异。此外,它把三个模态放在同一份报告里,使通道数与压缩因子、序列长度的联合权衡这一通用规律(如视频升到 64 通道有利、而音频 64 通道恰好是重建-生成交叉点)得以显性呈现,单看任一模态都看不出这种联合性。
核心方法
整体思路是:先在潜在空间塑造一个对扩散友好又高压缩的表示,再用重建+感知+对抗+KL 的多目标训练塑造它,最后用廉价统计量(CDS)做模型筛选、用受控置换实验做最终裁决。视频分词器受 CogVideoX 启发,采用无注意力、以 Conv3D 为主计算块的因果架构,配以空间 RMSNorm(可在推理时调整片段大小),下/上采样块按时间-空间顺序操作;图像分词器 KVAE-2D-2.0 是四级卷积残差自编码器,基宽 128、通道倍率 (1,2,4,8),32 通道高斯潜在、8×8 空间压缩。音频分词器继承 DAC 卷积主干与 Snake 激活 $x + \sin^2(\alpha x)/\alpha$,但把残差向量量化换成连续高斯瓶颈,把步长梯子从 [2,4,8,8] 重排为 [2,3,4,5,8](乘积 960,恰好 50 Hz),并在瓶颈处加一个自注意力块;编码器输出还向冻结音频基础模型做表示对齐。所有模型都用 4 阶段训练,末阶段为解码器微调。
核心创新有三:其一,把可扩散性作为一等设计目标,并用 CDS(潜在特征空间相关衰减斜率,由 $g(\delta) \simeq \alpha + \beta\delta$ 拟合后取 $-\beta$)这种廉价统计量在生成训练前筛选候选——本文报告 CDS 与 Bradley-Terry 主观视觉质量的 Pearson 相关达 $r=0.906$;其二,不对称的编码器-解码器设计,视频 KVAE-4×16×16 的解码器比编码器宽 5.3 倍,把生成能力集中在解码器;其三,全带端到端波形音频分词,仅用 64 通道(远窄于 SAME-L 的 256 与 MovieGen 的 128)就达到更优的重建与生成。与已有方法的本质区别在于:不再单纯追逐重建指标,而是把生成质量作为评估协议的一部分(受控置换实验),让分词器选择服务于扩散而非传输。
方法步骤详情
视频分词器训练分四阶段:(1) 损失 $\hat{\mathcal{L}}^I = \mathcal{L}_1 + w\cdot\text{LPIPS} + D_{KL}$(L1 + 感知 + KL);(2) 加带 warm-up 的基于帧 GAN 得 $\hat{\mathcal{L}}^{II}$;(3) 叠加 EQ-loss 配合潜在下采样与旋转;(4) 解码器微调。序列从 65 帧起步(CogVideoX 为 17),上限 129,以 0.3 概率交错图像批次;训练集含 1000 万图像、200 万视频。音频训练目标 $\mathcal{L} = \mathcal{L}_1 + w_{\text{spec}}\mathcal{L}_{\text{spec}} + D_{KL} + \text{GAN} + \mathcal{L}_{\text{perc}} + \mathcal{L}_{\text{align}}$,判别器为周期判别器加多分辨率 STFT 频谱判别器;crop 从 0.38 秒增至 5 秒;末阶段冻结编码器微调解码器。所有模型重建评估统一取后验均值而非采样。
技术新颖性
技术新颖性体现在:跨模态统一的可扩散性筛选框架(同一 CDS 思想用到图像和一维音频潜在);用空间 RMSNorm 替换 GroupNorm 既恢复因果性又免去上下文并行训练的全员同步、且不损质量(图 9);重排的步长梯子 [2,3,4,5,8] 让音频在 50 Hz 帧率下用更短接收野的残差单元实现 960× 压缩;瓶颈自注意力在 50 Hz(每秒仅 50 token)下成本极低却带来主要频谱改进;解码器微调被定位为近乎免费的午餐——潜在空间已冻结,重建改善不会作废已训练好的生成模型。作者还把视频与音频通道数选择的相反结论(视频 64 通道更优、音频 64 通道恰是交叉点)并置,揭示了通道数必须与压缩因子、序列长度联合调参这一通用规律,单模态报告无法呈现这种联合性。
实验结果
视频重建(表 1,MCL-JCV):KVAE-2.0 在 4×8×8 组 PSNR 36.0,比 HunyuanVideo-1.0/Wan-2.1(34.3)高约 1.7 dB;4×16×16 组 35.2 对 HunyuanVideo-1.5 34.4、Wan-2.2 34.2,平均领先 1 dB。图像(表 2):KVAE-2D-2.0 PSNR 28.05、NED 0.976 超过 FLUX.2-dev(27.72)。生成侧 KVAE-4×16×16 在 2B CrossDiT 上收敛更快、FID 超 32 通道 HunyuanVideo-1.5。音频(表 3/4,0.6B 置换):KVAE-Audio 仅 166.9M、64 通道,AudioSet/MUSDB18 频谱距离领先 852.1M 的 SAME-L,语音 PESQ 4.266 略胜 MovieGen;AudioCaps 上 CLAP 0.344、FAD(PANNs) 15.381 全优,并排对三基线胜率 0.54–0.74。消融(表 5):瓶颈注意力单独带来 MEL −8.5%、STFT −8.7%,感知损失反使重建变差,解码器微调恢复并超越。CDS 与 Bradley-Terry 质量 r=0.906。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 视频重建 4×8×8(MCL-JCV 720p) | PSNR↑ | KVAE-2.0 36.0 dB | HunyuanVideo-1.0 34.3 / Wan-2.1 34.3 dB | +1.7 dB |
| 视频重建 4×16×16 | PSNR↑ | KVAE-2.0 35.2 dB | HunyuanVideo-1.5 34.4 / Wan-2.2 34.2 dB | +0.8~1.0 dB |
| 图像重建(OmniDoc-TokenBench) | PSNR↑ | KVAE-2D-2.0 28.05 | FLUX.2-dev 27.72 / FLUX.1-dev 26.24 | +0.33~1.81 dB |
| 音频重建(AudioSet eval, 44.1kHz) | STFT↓ | KVAE-Audio 1.770 | MMAudio 1.938 / SAME-L 2.726 | 相对 MMAudio −8.7% |
| 音频生成(AudioCaps) | FAD(PANNs)↓ | KVAE-Audio 15.381 | MMAudio 17.873 / SAME-L 18.446 | 相对 MMAudio −13.9% |
| 音频生成(AudioCaps) | CLAP↑ | KVAE-Audio 0.344 | MMAudio 0.336 / DACVAE MovieGen 0.313 | +0.008 |
| 音频并排主观评估 | 胜率 | KVAE-Audio | MMAudio / DACVAE MovieGen / SAME-L | 0.54–0.74 全线领先 |
局限与改进
作者明确承认:CDS 的 $r=0.906$ 是 14 个配置的样本内关联,并不能建立样本外预测,而联合训练轨迹只有单条、不应解读为普遍训练规律。音频通道数 64 的交叉点是分词器-生成器对的性质而非分词器固有:更大的生成器有更多容量吸收更宽潜在,最优通道数应随其增大——而本文音频生成器仅 0.6B,故 64 应理解为该规模下的最优点。判别器组合、感知损失骨干与对齐目标 $F$、$\mathcal{L}_{\text{align}}$ 的具体形式均推迟到专门发表而未在本文公开。FAD 三个骨干内部都在 16–32 kHz 工作,对 16 kHz 以上频段结构性不敏感,故表 4 测的是潜在是否为好的生成基底而非结果是否全带。训练数据部分为私有,含 1000 万图像、200 万视频、约 1 万小时音频。我另观察到:并排评估未给标注者数量、提示集规模与统计显著性,胜率区间未报告置信区间;可扩散性的机制(频谱偏置如何链接到信息容量)作者承认尚未确立。
独立分析的弱点
其一,CDS 筛选缺乏样本外验证,14 个配置样本量偏小且高度同源(多为 KVAE 变体),存在过拟合该家族特性的风险;改进方向是在异构外部分词器集上做前瞻式盲测,并报告 CDS 的预测区间与失败案例。其二,关键训练细节(对齐目标 $F$、判别器分辨率组合、感知损失权重搜索过程)被保留到专门发表,影响完全复现与公平横向比较;改进方向是尽快开源超参与配置文件。其三,音频结论绑定在 0.6B 生成器,向更大模型外推时 64 通道未必最优;改进方向是给出通道数随生成器规模 scaling 的扫描曲线。其四,主观评估仅给点估计胜率而无置信区间,难以判断 0.54 这类窄优势是否显著;改进方向是报告 Bootstrap 置信区间与标注者一致性。其五,全带优势(>16 kHz)在表 4 的 FAD 上无法体现,缺少专门的全带生成评估协议;改进方向是引入高频段专用指标或频谱包络对比。
未来方向
作者提出:音频通道数最优值应随下游生成器规模增大而增大,需进一步 scaling 扫描;联合文本到视频+音频的生成尚无开源竞争方案,全带分词器是其前置条件,是自然的延伸方向。基于成果可延伸:把 CDS 推广到样本外预测并发展多模态联合的可扩散性诊断;探索解码器微调与生成器训练的交替/联合优化以持续提升质量;在更长序列(视频已测到 400 帧)和更高分辨率下验证因果无注意力架构的扩展性;把表示对齐机制在更多模态间统一;以及建立音频分词器的公共基准(类似视觉的 TokenBench)以替代本文自组的测试集。CDS 之外的语义探针、谱诊断、PCA 诊断也可继续探索其与生成质量的关联。
复现评估
复现性中等偏上。代码以 MIT 许可在 https://github.com/kandinskylab/kvae 与 https://github.com/kandinskylab/kvae-audio 开源,KVAE-Audio 权重在 HuggingFace kandinskylab/KVAE-Audio 发布。评估协议描述较细:视频统一取后验均值、统一重采样到 44.1 kHz、明确 MCL-JCV 与三个音频公开测试集(AudioSet eval、MUSDB18-HQ、EARS)。但训练数据部分私有(1000 万图像、200 万视频、约 1 万小时音频,含带宽过滤等预处理),且对齐目标 $F$、$\mathcal{L}_{\text{align}}$ 形式、判别器分辨率组合、感知损失骨干与权重搜索过程均推迟到专门发表,这些是音频最终配置的关键,短期内难以完全复现。算力上,多阶段、多模态、千万级数据训练属大算力工程,普通团队复现门槛高;2B/0.6B 生成器的置换实验也需可观资源。总体上:推理与评估可复现,训练的端到端复现受限于未公开细节与私有数据。
论文图表