TSDS-Toolbox:度量时间序列数据集相似度的统一工具箱 TSDS-Toolbox: A Toolbox for Measuring Time-Series Dataset Similarity
统一时间序列数据集相似度基准的工具箱,揭示相似度与下游任务损失高度任务相关
前置知识
时间序列数据集相似度
指定义一个相异度函数 $s(X,Y)$ 来量化两个时间序列数据集之间的差异,数值越小表示越相似。与比较单条序列不同,数据集级相似度把整个数据集视为经验样本集合或分布,用于回答“哪个源数据集最适合微调我的模型”这类检索与选择问题。它分为直接比较数据集的数据集级指标,以及先把数据集压缩为代表序列再比较的降维器路线两类。
这是全文的研究对象,理解两种类别(数据集级 vs 降维器+序列级)的划分是读懂方法设计和实验表格的前提。
动态时间规整(DTW)
DTW 是经典的序列距离:通过动态规划寻找两条序列之间的最小代价对齐路径,允许时间轴上的伸缩变形,从而对齐速度不同的模式。本文中 DTW 既是降维路线下的序列距离,也是 DBA 平均和 MAD 方法中对齐步骤的基础。LCSS(最长公共子序列)是其近亲,用欧氏阈值判定匹配点并按 $1-\mathrm{LCSS}/\min(|r_X|,|r_Y|)$ 归一化。
DTW/DBA 组合是实验中表现最稳的序列级路线,也是理解 Table 2/3 中降维器对比结果的技术基础。
最优传输与 Wasserstein 距离
最优传输(OT)把两个经验分布看作土堆和坑,寻找把一个分布搬运到另一个分布的最小总代价方案 $s_{\mathrm{OT}}=\min_{\Pi\in U(a,b)}\sum_{i,j}\Pi_{ij}C_{ij}$,可用精确 EMD 或 Sinkhorn 近似求解。Wasserstein 距离是其在分布层面的形式;本文的 WSD 采用 Fréchet 式实现,用样本均值 $\mu$ 和协方差 $\Sigma$ 的高斯近似计算。
WSD 和 OT 是四大数据集级指标中的两个,理解它们“把数据集当分布”的视角才能解释为何它们在 OOD 预测任务上相关性更高。
最大均值差异(MMD)
MMD 是基于核函数的两样本检验统计量:把样本映射到再生核希尔伯特空间后比较均值嵌入,$s_{\mathrm{MMD}}$ 即两组内平均核相似度之和减去两倍组间平均核相似度,取非负平方根。它无需估计密度,能捕捉任意阶的分布差异,常用于域适应和两分布检验。本文将其直接用于比较展平后的时间序列窗口样本集。
MMD 是四大数据集级指标之一,实验中它在 Lag-Llama OOD 上表现尚可(0.406)但在其他任务上接近零甚至为负,是“任务依赖”结论的重要例证。
降维器:DBA 与 PCA
降维器把一个数据集压缩成单条代表性序列,从而让序列级距离可以用于数据集比较。DBA(DTW 重心平均)在 DTW 对齐意义下迭代平均一组序列,保留时间形态;PCA 则从展平的窗口样本的主成分构造代表序列,捕捉主要变化方向。两者代表“保形”与“保方差”两种压缩哲学,选择会影响下游相关性。
Table 3 专门对比这两种降维器:分类任务上 DBA 全面占优,理解其机制是解释该结果差异的关键。
时间序列基础模型
指在大规模跨域时间序列上预训练、可微调后用于多种下游任务的通用模型。本文集成 Lag-Llama(概率预测)和 Time-MoE(混合专家架构的预测基础模型)作为评估适配器:在 OOD 设置中源数据微调后直接在目标上测 MSE,在迁移学习设置中还用小规模目标参考集继续适配,以模拟真实的迁移场景。
评估层的全部下游结论都建立在这两个模型给出的任务损失上,没有它们就无法量化相似度的实用价值。
研究动机
时间序列普遍存在于金融、医疗、语音和气候等领域,而在基础模型时代,为微调选择与目标域相近的源数据集已成为影响下游性能的关键环节。然而时间序列数据集相似度的研究生态高度碎片化:sktime、GluonTS、TFB 等基准主要服务于分类、预测等模型开发与评估,TSB-UAD 等资源面向异常检测,tslearn、Soft-DTW 等相似度工具则聚焦单条序列而非数据集层面的比较。Wasserstein 距离、最优传输、MMD、Match-and-Deform 等数据集级方法散落在各论文中,各自在不同实验设置下被评估;研究者每开展一项新研究都要重复整合指标、统一异构数据格式、从零搭建下游评估流水线,导致方法之间无法公平比较,结论也难以复现。
本文的目标是本文旨在构建一个统一、可扩展的时间序列数据集相似度基准框架 TSDS-Toolbox,落实三个目标。其一,提供统一的基准测试接口,使数据集级指标与“降维器+序列距离”两类方法能在完全一致的实验设置下被系统、可复现地比较,并明确各自的数据约束(等长、等维、多变量支持等)。其二,建立标准化的下游评估流水线,覆盖分类与预测两类任务、分布外(OOD)与迁移学习(TL)两种设置,量化相似度分数对下游任务损失的实际解释力。其三,采用模块化、配置驱动(YAML)的设计,让用户能以插件方式添加自定义数据集、相似度方法、降维器、评估任务和基础模型适配器,而不必改动框架本身。
与已有工作不同的是,本文的独特切入角度有二。第一是视角转换:从主流的序列级比较转向数据集级比较,把整个数据集视为经验分布(WSD、MMD、OT 路线)或经降维器压缩为代表序列(DBA/PCA + DTW/ED/LCSS 路线),并让 $s_m(X,Y)=m(X,Y)$ 与 $s_{R,d}(X,Y)=d(R(X),R(Y))$ 共享同一接口,从而使两大类方法首次可以同台公平评测。第二是不止于定义相似度,更系统验证其有用性:通过基础模型适配器(Lag-Llama、Time-MoE)在 OOD 与迁移学习设置下产出任务损失,再用 Pearson 相关把“距离分数”与“真实迁移效果”挂钩,回答“哪个指标更能预测下游表现”这一此前缺乏统一答案的问题,而非仅比较距离矩阵的结构差异。
核心方法
TSDS-Toolbox 是一个配置驱动的流水线:用户在 YAML 中指定数据格式、预处理、相似度方法、降维器、评估任务、基础模型适配器与输出选项,支持两种执行模式——仅相似度模式(计算并可视化成对距离矩阵)和相似度+评估模式(额外运行下游任务并产出任务性能矩阵)。整体分四层:数据层把 GluonTS、CSV、NPY、DataFrame 等异构格式转为统一的“数值+元数据”表示,并做采样、定长窗口切分、训练验证切分、归一化等一致预处理;相似度层计算数据集级指标(WSD、MMD、OT、MAD)与序列级指标(DBA/PCA 降维后接 DTW、欧氏距离、LCSS)的成对距离矩阵;评估层通过分类 OOD(kNN 单类成员)与预测 OOD/TL(Lag-Llama、Time-MoE 的 MSE)检验相似度的下游价值;分析层输出热力图、网络图与 Pearson 相关分析。实验在 25 个 GluonTS 数据集上端到端验证,每个数据集有放回采样 100 个长度 100 的窗口并做 z-score 归一化。
核心创新是把异构的相似度方法统一到同一基准接口之下并绑定下游效用评估。数据集级指标直接计算 $s_m(X,Y)=m(X,Y)$:WSD 用 Fréchet 式公式 $s_{\mathrm{WSD}}=\|\mu_X-\mu_Y\|_2^2+\mathrm{Tr}(\Sigma_X+\Sigma_Y-2(\Sigma_X\Sigma_Y)^{1/2})$ 比较高斯近似;MMD 用核均值嵌入;OT 求最小运输代价 $s_{\mathrm{OT}}=\min_{\Pi\in U(a,b)}\sum_{i,j}\Pi_{ij}C_{ij}$;MAD 交替估计运输计划 $\hat\Pi$ 与 DTW 对齐路径 $\hat W$。序列级路线先以 DBA 或 PCA 把数据集压缩为代表序列,再计算 DTW、ED 或 LCSS。与已有工作各设各的实验不同,所有方法在同一数据表示、同一预处理、同一评估协议下运行,并统一用 Pearson 相关衡量其对下游损失的预测能力,使跨方法的公平比较第一次成为可能。
方法步骤详情
第一步,数据层:输入 GluonTS/CSV/NPY/DataFrame 数据集,输出统一的数值+元数据表示;预处理包括有放回采样(每数据集 100 个长度 100 窗口)、定长窗口切分、训练-验证切分、z-score 归一化与剔除平坦序列。第二步,相似度层:输出成对距离矩阵;数据集级指标约束各异(WSD 需等长等维、MMD/OT 需展平、MAD 支持不同 $N$/$T$),序列级路线先经 DBA 或 PCA 降维,再计算 DTW、ED 或 LCSS(按 $1-\mathrm{LCSS}/\min(|r_X|,|r_Y|)$ 归一化)。第三步,评估层:分类用单类 kNN 成员距离,阈值 $\tau_X$ 由源数据校准,得分 $E_{\mathrm{cls}}=1-\mathrm{MembershipRate}(Y|X)$;预测 OOD 微调 Lag-Llama/Time-MoE 后在目标上记录 $E_{X,Y}=\mathrm{MSE}(f^X_{Y,\text{inference}})$;TL 再以小目标参考集适配后评估。第四步,分析层:输出热力图、网络图与 Pearson 相关。
技术新颖性
技术新颖性主要有三点。首先,据作者所述这是首个系统化基准“数据集级”时间序列相似度的工具箱:此前 tslearn、sktime 等工具的相似度函数都作用在单条序列上,WSD、MAD 等数据集级方法只有论文附带的独立实现,本文首次把七类方法纳入同一框架,并在 Table 1 中逐项明确其约束(是否需要降维器、等长、等维、多变量、不同 $N$/$T$ 支持),为选型提供了清晰地图。其次,评估层把“相似度是否真的有用”变成可量化问题:不满足于比较距离矩阵的结构,而是用 kNN 成员率与基础模型 MSE 两种任务损失,通过 Pearson 相关直接度量指标的实用价值,这在此前的工具箱工作中是缺失的。最后,配置驱动与分层插件式设计使新增数据集、指标、降维器、任务和模型适配器都无需修改框架代码,保证了可复现性与可扩展性的工程落地。
实验结果
实验用 25 个跨交通/天气/电力/汇率/旅游/公共卫生的 GluonTS 数据集,每数据集有放回采 100 个长度 100 窗口,归一化并剔除平坦序列,报告与任务损失的 Pearson 相关。Table 2 表明:无指标在所有任务上持续领先——相似度是任务依赖的。Time-MoE 预测 OOD 中 MAD 最强(0.619)、WSD 次之(0.604);分类 OOD 中 OT 最佳(0.417),而 MAD(-0.041)与 WSD(0.010)几乎无效;Lag-Llama OOD 中 DBA+DTW 领先(0.420),MMD 次之(0.406);Time-MoE 迁移学习中 DBA+ED(0.358)与 WSD(0.353)最佳,MMD 为 -0.030。Table 3 显示分类上 DBA 全面优于 PCA(0.237/0.304/0.127 对 -0.033/0.004/0.006),Lag-Llama OOD 上 PCA 有竞争力(0.405 对 0.420),LCSS 整体最弱(Time-MoE OOD 仅 0.087/0.068)。Figure 2 定性佐证了这一点。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Time-MoE 预测分布外(OOD)评估 | Pearson 相关系数(相似度距离 vs MSE 任务损失) | MAD:0.619(全部方法中最优) | 次优 WSD 0.604;最弱 DBA+LCSS 0.087 | 比次优高 0.015,约为最弱方法的 7 倍 |
| 分类分布外评估(kNN 单类成员) | Pearson 相关系数(距离 vs 成员损失) | OT:0.417(最优) | MAD -0.041、WSD 0.010、MMD 0.059 | 唯一显著有效的数据集级指标,与其在预测任务上的排名几乎颠倒 |
| Lag-Llama 预测 OOD 评估 | Pearson 相关系数 | DBA+DTW:0.420(最优) | MMD 0.406;OT 仅 0.033 | 领先 MMD 0.014,约为 OT 的 12.7 倍 |
| Time-MoE 迁移学习预测评估 | Pearson 相关系数 | DBA+ED:0.358(WSD 0.353 并列最佳) | MMD -0.030、PCA+LCSS 0.051 | 相对负相关的 MMD 提升 0.388 |
| 降维器对比(分类任务,DTW/ED/LCSS 三种距离) | Pearson 相关系数 | DBA:0.237 / 0.304 / 0.127 | PCA:-0.033 / 0.004 / 0.006 | DBA 在三条距离上全面占优,ED 下差距达 0.300 |
局限与改进
作者坦承并经我验证的主要局限:其一,结论是“任务依赖”而非可操作的选择准则——论文给出了各指标在四类任务上的相关系数,但未提供面对新任务时如何挑选指标的规则;其二,许多相关系数绝对值偏低(如分类上多数指标低于 0.1),说明现有相似度度量对部分下游行为的解释力仍有限;其三,实验规模可控但不大:25 个 GluonTS 数据集、单一采样协议(100 个长度 100 的窗口)、仅 Lag-Llama 与 Time-MoE 两个基础模型,多变量数据需展平后比较,可能损失通道间的结构信息;其四,分类评估采用单类 kNN 成员率而非真实分类精度,与实际迁移场景存在差距;其五,论文篇幅很短(ACM 模板约 5 页,会议信息还是占位符),训练超参、显著性检验等实现细节不足,部分结论只能依赖开源代码核实。
独立分析的弱点
独立分析可见以下弱点。第一,可扩展性存疑:精确 Earth Mover's Distance 与 MAD(需交替估计运输计划和 DTW 路径)在数据集对数与窗口数增大时代价很高,论文未报告运行时间与内存,改进方向是全面采用 Sinkhorn 近似、低秩/GPU 批处理或近似最近邻检索。第二,Table 1 显示 WSD 要求等长等维、ED 默认等长,现实中长度不一的数据需截断或重采样,可能系统性扭曲相似度,可引入长度自适应的嵌入表示。第三,窗口有放回采样会产生重复序列,可能高估数据集内部一致性并影响距离与相关估计,应补充无放回采样与去重的敏感性分析。第四,Pearson 相关只捕捉线性关系且未报告置信区间或显著性检验,单个数据集的离群值即可拉动相关系数,宜补充 Spearman 相关、bootstrap 区间与逐任务散点图。第五,kNN 成员阈值 $\tau_X$ 依赖源数据分位数校准,对含异常段的源数据可能敏感,可探索自适应或多分位数阈值。
未来方向
作者把工具箱定位为可扩展的基础,自然的延伸方向包括:纳入更多下游任务与评估设置,如异常检测、缺失值插补、以及基于相似度检索源数据的时序 RAG(与 TS-RAG 等工作衔接),直接验证相似度对检索增强预测的价值;接入更多基础模型(Chronos、TimesFM、Moirai 等)并发展多变量原生的数据集级指标,避免展平带来的维度与通道结构损失;从机理上回答“为何数据集级指标在 OOD 预测上更强、而 OT 在分类上更强”,把经验相关性上升为理论刻画;探索元学习式的指标自动选择,根据任务类型、数据规模与采样率等特征推荐合适的相似度方法,把“任务依赖”转化为可执行的决策规则;此外还可将分析层扩展为交互式仪表盘,支持子群分析、显著性检验与跨任务相关矩阵的可视化对比。
复现评估
复现条件总体较好。代码已在 GitHub 开源(https://github.com/yenkuliu/TSDS-Toolbox),实验使用的 25 个 GluonTS 公开数据集均可直接获取;流水线由 YAML 配置驱动,数据加载、预处理、相似度计算、评估与分析各自模块化,论文对 WSD、MMD、OT、MAD 及分类/预测评估的公式定义完整,对账难度低。主要成本集中在评估层:微调 Lag-Llama 与 Time-MoE 并在 25 个数据集上跑 OOD/TL 预测需要 GPU 资源,论文未给出具体算力、训练超参与运行时长,需要查阅仓库中的模型适配器配置;相似度计算本身(DTW 系、MMD、OT)在 100×100 窗口规模下单机即可完成。总体评估:相似度模块易复现,端到端评估复现需要一定算力与工程调试,难度中等。
论文图表