面向隐私感知联邦生物信号学习的混合量子启发Kolmogorov-Arnold网络 Hybrid Quantum-inspired Kolmogorov-Arnold Networks for Privacy-Aware Federated Biosignal Learning
混合量子启发KAN以更少参数与通信量在联邦ECG分类上稳定超越MLP
前置知识
联邦学习与 FedAvg
一种分布式训练范式:原始数据保留在各客户端本地,只交换模型参数或梯度。FedAvg(联邦平均)是最基础的算法——客户端 $k$ 用本地数据训练若干 epoch 得到 $\theta^{r+1}_k$,服务器按样本量加权平均 $\theta^{r+1} = \sum_k \frac{n_k}{n}\theta^{r+1}_k$ 作为新全局模型,重复若干轮。
本文全部实验基于 FedAvg,且其每轮同步完整模型状态的特性使通信开销正比于参数总数,这正是作者论证 HQKAN 参数效率价值的逻辑起点,不理解 FedAvg 就无法理解论文的核心动机。
Kolmogorov–Arnold 网络 (KAN)
基于 Kolmogorov–Arnold 表示定理(任意多元连续函数可分解为一元函数的复合与求和)的网络架构。与 MLP 把固定激活函数放在节点上不同,KAN 把可学习函数放在边上,节点只做求和;经典 KAN 用 B 样条参数化边函数,理论上能以更少参数逼近复杂函数。
本文的 HQKAN 以 QKAN 作为隐特征处理器,只有理解 KAN 把激活放到边上的结构思想,才能明白其参数效率的来源以及它与 MLP 基线的本质差异。
数据重上传与量子启发模型 (DARUAN)
数据重上传(Data Re-uploading)把经典输入 $x$ 编码为参数化量子线路中的旋转角,并在多个线路层中反复上传,形成 $U(\theta_1, x)U(\theta_2, x)\cdots$ 的级联结构,使极少量量子比特也能表达丰富的函数类。量子启发模型指无需真实 NISQ 量子硬件、纯经典模拟即可运行这类结构的模型。
QKAN 的可学习边函数正是 DARUAN 式的可训练单量子比特线路,这是标题中 quantum-inspired 一词的技术实质,也是理解 HQKAN 结构设计的前提。
非IID数据与 Dirichlet 划分
联邦学习中各客户端数据分布不一致即 non-IID,会导致本地最优方向发散、全局模型漂移。标准模拟方法是给每个客户端从 Dirichlet($\alpha$) 分布抽取各类别样本比例:$\alpha$ 越小标签越偏斜,$\alpha \to \infty$ 趋近 IID。偏斜程度可用 Hellinger 距离 $H(p,q) = \frac{1}{\sqrt{2}}\left(\sum_c (\sqrt{p_c}-\sqrt{q_c})^2\right)^{1/2}$ 定量刻画。
论文主实验用 $\alpha=0.3$ 构造 non-IID,并扫描 $\alpha \in \{0.1, 0.3, 0.5, 1, 1000\}$ 检验鲁棒性、用 Hellinger 距离画性能-偏斜曲线,不熟悉这套设定就读不懂实验设计的含义。
不平衡数据的评估指标
macro-F1 对每个类别分别计算 F1 再取平均,不被多数类主导,适合 113:1 这类极端不平衡;Cohen's $\kappa$ 衡量预测与真实标签超出随机一致的程度;Brier 分数为 $\frac{1}{N}\sum_i (\hat{p}_i - y_i)^2$,同时惩罚准确性差与校准差;PPV(精确率)、敏感度(召回率)、特异度用于逐类分析漏检与误报的权衡。
论文的核心结论全部建立在这几个指标上,且模型选择依据是验证集 macro-AUPRC——因为它对少数类敏感,而准确率会被多数类淹没。
研究动机
心电图(ECG)是典型的隐私敏感生物医学信号,分散存储在医院、可穿戴设备与患者终端中,出于合规与伦理约束无法把原始波形汇聚到中心服务器训练。联邦学习允许各方只交换模型更新而不共享原始数据,是自然的出路,但联邦 ECG 分类在实际落地中面临三重叠加困难:客户端本地样本有限、心律失常标签严重不平衡、各机构数据呈非独立同分布。以本文使用的 MIT-BIH 基准为例,训练集五个 ANSI/AAMI 类的样本数为 N 类 72,471、S 类 2,223、V 类 5,788、F 类仅 641、Q 类 6,431,多数类与最稀有类之比约 113:1;INCART 数据集中 S 类也只有 1,331 个。与此同时,FedAvg 每轮都要同步完整模型状态,通信开销正比于参数总数,模型必须同时做到准确、小巧、通信省,这给分类器架构提出了苛刻要求。
本文的目标是本文的具体目标是在严格对齐的训练预算下,系统评估混合量子启发 Kolmogorov–Arnold 网络(HQKAN)能否成为联邦 ECG 分类中比多层感知机(MLP)更有效、更省参数的分类器。实验覆盖两个公开基准:MIT-BIH 五类心跳分类(非室性异位 N、室上性异位 S、室性异位 V、融合波 F、未知 Q)与 INCART 三类分类;客户端数 $K \in \{8, 16, 32\}$,数据划分为 IID 与 Dirichlet $\alpha=0.3$ 的 non-IID 两种,另扫描 $\alpha \in \{0.1, 0.3, 0.5, 1, 1000\}$ 检验鲁棒性;每种配置跑 5 个随机种子,统一采用 FedAvg、$R=30$ 轮、每轮本地 $E=5$ 个 epoch。评估聚焦 macro-F1、Cohen's $\kappa$、Brier 分数以及少数类的 PPV/敏感度/特异度,最终量化 HQKAN 在预测质量与通信效率上的双重优势。
与已有工作不同的是,已有的联邦 ECG 研究几乎全部采用 CNN、LSTM、ResNet 等常规骨干,再通过迁移学习、半监督、个性化或差分隐私等外围机制应对 non-IID 与隐私问题,很少质疑骨干网络本身的参数效率。本文的独特切入角度来自量子机器学习社区:QKAN 用 DARUAN 数据重上传的可训练单量子比特线路作为可学习边函数,参数量远小于同容量的 MLP,且无需真实量子硬件即可经典模拟。作者敏锐地注意到在 FedAvg 中通信开销正比于参数总数,于是把量子启发模型的参数效率从附带优点升级为联邦场景的第一性设计约束,并在两个公开 ECG 基准上、跨客户端规模(8/16/32)与异质度(IID 及 5 档 Dirichlet 浓度)系统检验这一假说,填补了量子启发架构在联邦生物信号学习中的评估空白。
核心方法
直觉上,联邦学习的通信瓶颈约等于模型大小,所以理想的分类器是每个参数都更值钱的架构。HQKAN 是自编码器式的混合结构:前后各一层全连接编码器/解码器负责原始波形与隐空间之间的映射,中间的隐特征处理器由 QKAN 承担。对 MIT-BIH 输入是展平后的 187 维,对 INCART 是 300 维。QKAN 借鉴 Kolmogorov–Arnold 表示定理,把可学习函数放到边上,并将边函数参数化为 DARUAN 数据重上传的单量子比特线路——经典输入逐层编码为旋转角,少量参数即可拟合复杂非线性,这正是它比同容量 MLP 更紧凑的原因。技术上 HQKAN 用 GPU 高效的 FlashQKAN 框架在 PyTorch 实现,借助 cuTe DSL 编写的融合算子与分块并行(block tiling)加速经典模拟;MLP 基线是纯 ReLU 全连接网络。两模型在每个数据集内输入完全相同、训练预算完全一致,唯一变量是分类器结构,保证对比公平。
核心创新是把量子启发的参数效率直接转化为联邦学习的通信效率与异质鲁棒性。传统观点认为 QKAN 的卖点是逼近能力与紧凑性,本文指出在 FedAvg 每轮同步全模型状态的设定下,可训练参数更少直接等价于每轮上传/下发的字节数更少:HQKAN 在 MIT-BIH 上仅 11,581 个可训练参数(MLP 为 18,485,减少 37.35%),INCART 上 15,147 个(MLP 为 27,443,减少 44.81%)。与既有 KAN 用固定 B 样条作边函数不同,QKAN 的边函数是可训练的 DARUAN 单量子比特重上传线路,兼具表达力与紧凑性。更关键的实验发现是:这种压缩并没有以牺牲鲁棒性为代价——用 Hellinger 距离度量标签偏斜时,偏斜越强 HQKAN 的 AUPRC 优势反而越大,MLP 衰减更陡,说明在 non-IID 联邦中小模型可以同时做到更准、更稳、更省通信。
方法步骤详情
完整流程分五步。第一步数据准备:MIT-BIH 采用 Kachuee 等发布的预处理版本,每个心跳是 187 维单导联波形,归一化到 $[0,1]$,不足处补零,按种子做标签分层的 80/20 划分得 70,043 训练/17,511 验证,官方 21,892 个测试心跳仅用于最终评估;INCART 按 CAT-Net 协议提取 300 维片段,含 104,273 N、1,331 S、13,586 V。第二步联邦划分:基于 FLamby 构建客户端,IID 时对每类样本轮转分配,non-IID 时各客户端标签比例从 Dirichlet($\alpha$) 抽取。第三步本地训练:第 $r$ 轮客户端以全局参数 $\theta^r$ 初始化,用逆类频率加权的交叉熵对抗失衡,AdamW(学习率 $10^{-3}$、权重衰减 $10^{-4}$、batch 128)训练 5 个 epoch,返回 $\theta^{r+1}_k$。第四步聚合:服务器按样本量加权平均 $\theta^{r+1} = \sum_k \frac{n_k}{n}\theta^{r+1}_k$,全客户端参与,共 30 轮。第五步选择与评估:保留验证集 macro-AUPRC 最高的 checkpoint(AUPRC 对少数类敏感而准确率被多数类主导),报告测试集指标并对 5 个种子取均值±标准差。
技术新颖性
技术新颖性体现在四个层面。其一,基准设定新:这是 HQKAN 首次被引入联邦生物信号学习,构成分类器 × 客户端规模 × IID/non-IID × 2 数据集 × 5 种子的完整对照矩阵,而以往联邦 ECG 工作没有用量子启发骨干。其二,结构组合新:全连接编解码器加 QKAN 隐处理器的自编码器式设计,让量子启发模块只处理低维隐特征,规避直接编码高维波形的开销,也解释了参数为何能压到 11,581。其三,工程实现新:FlashQKAN 通过 cuTe DSL 融合算子与 block tiling 实现 GPU 高效经典模拟,证明 QKAN 不必依赖缓慢的量子线路模拟器。其四,评价视角新:用 Hellinger 距离 $H(p,q) = \frac{1}{\sqrt{2}}\left(\sum_{c=1}^{C}(\sqrt{p_c}-\sqrt{q_c})^2\right)^{1/2}$ 把异质度定量化并扫描 $\alpha \in \{0.1, 0.3, 0.5, 1, 1000\}$,画出性能-偏斜曲线而非只报单一 non-IID 点,使鲁棒性结论可被直观检验。
实验结果
聚合性能上 HQKAN 在全部 12 个配置中占优。MIT-BIH IID 下 macro-F1:8 客户端 0.739 对 MLP 0.726(+0.013),16 客户端 0.716 对 0.672,32 客户端 0.687 对 0.633,领先幅度随客户端增多从 0.013 扩大到 0.054;non-IID($\alpha=0.3$)下 32 客户端达 0.761 对 0.698,Brier 从 0.121 降到 0.094。INCART 趋势一致:IID 下 32 客户端 0.773 对 0.743,non-IID 下 0.850 对 0.838,Brier 0.032 对 0.040。少数类方面,MIT-BIH IID 时 F 类 PPV 差距最大(0.239 对 0.147),non-IID 时 HQKAN 对 S/V/F 的平均敏感度分别高 0.147、0.077、0.073,但 S 类 PPV 略低(0.755 对 0.768);INCART 的 S 类 PPV 高 0.079–0.083 而敏感度低 0.005–0.023,呈精度-召回权衡。鲁棒性实验中,在所有 Dirichlet 浓度($\alpha \in \{0.1,0.3,0.5,1,1000\}$)下 HQKAN 的 AUROC 与 AUPRC 均更高,且 Hellinger 距离越大优势越大,MLP 的 AUPRC 衰减更陡。效率上,可训练参数减少 37.35%(MIT-BIH)与 44.81%(INCART),每轮通信开销分别减少 24.89% 与 36.41%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| MIT-BIH 五类心律失常联邦分类(32 客户端,non-IID $\alpha=0.3$) | macro-F1(5 种子均值±标准差) | 0.761±0.026(HQKAN) | 0.698±0.030(MLP) | +0.063,相对提升约 9% |
| INCART 三类心律失常联邦分类(32 客户端,non-IID $\alpha=0.3$) | macro-F1(5 种子均值±标准差) | 0.850±0.026(HQKAN) | 0.838±0.009(MLP) | +0.012,且 Brier 从 0.040 降至 0.032 |
| MIT-BIH 五类联邦分类(32 客户端,non-IID) | Brier 分数(越低越好) | 0.094±0.012(HQKAN) | 0.121±0.010(MLP) | 降低 22.3%,校准性更好 |
| 模型紧凑度(MIT-BIH / INCART) | 可训练参数量 | 11,581 / 15,147(HQKAN) | 18,485 / 27,443(MLP) | 分别减少 37.35% 与 44.81% |
| 联邦每轮通信开销(MIT-BIH / INCART) | 通信量(正比于参数总数) | 较 MLP 减少 24.89% / 36.41%(HQKAN) | MLP 全模型同步 | 两数据集通信成本约四分之一到三分之一节省 |
局限与改进
作者承认少数类上存在 PPV-敏感度权衡:INCART 的 S 类在两种划分下敏感度均略低于 MLP(-0.005 与 -0.023),MIT-BIH IID 的 F 类敏感度也更低(0.837 对 0.868),对漏检代价高的临床筛查场景需谨慎。我自己的观察还有几点:一是基线只有 MLP,没有 CNN/ResNet/LSTM 等文献中常用的联邦 ECG 骨干,对更强基线是否仍占优未知;二是通信成本按参数总数估算,未考虑量化或压缩后的真实字节数,也未报告墙钟训练时间;三是 MIT-BIH 上 32 客户端的绝对 macro-F1(IID 0.687)明显低于 8 客户端的 0.739,联邦碎片化本身仍是未解难题,HQKAN 只是减缓而未解决;四是部分 non-IID 配置方差很大(如 MIT-BIH 8 客户端 non-IID 下 MLP macro-F1 标准差 0.096),结论稳健性可再加强;五是实验没有差分隐私或安全聚合,privacy-aware 仅停留在数据不出本地的层面。
独立分析的弱点
独立分析后,最突出的弱点是基线单薄与消融缺失。全文只有 MLP 一个对照组,缺少 1D-CNN、ResNet、LSTM 及个性化 FL 方法,无法排除优势主要来自小模型在 FedAvg 下漂移更小这一通用现象,而非 QKAN 结构本身;加入一个参数量对齐的紧凑 MLP 或 B 样条 KAN 对照能大幅增强因果解释。其次是结构细节不透明:论文未披露 QKAN 的量子比特数、重上传层数与隐维度,读者无法分析性能随结构的标度规律,也无法判断是否存在过参数化更优的区间。第三,实验场景偏理想:全客户端参与、无掉线、无系统异质,而真实跨机构联邦中客户端可用性和算力差异巨大,这正是 HQKAN 紧凑性本应发挥价值的场景却未被测试。第四,通信度量是参数计数而非压缩后字节数,若 MLP 也用量化或剪枝,优势可能缩小。针对每一点,改进方向分别是:补充多基线与结构消融、公开完整结构超参、引入部分参与与掉线模拟、报告真实通信字节与训练时间。
未来方向
作者在结论中指出的方向是:对客户端异质性的鲁棒性不必以牺牲模型与通信效率为代价,HQKAN 为隐私感知联邦生物信号学习提供了紧凑替代。在此基础上可延伸多条路径:其一,把 HQKAN 与差分隐私、安全聚合结合,量化噪声在极小参数模型上的精度损失,把 privacy-aware 做实;其二,结合 Quantum-Train 思路用量子线路生成经典权重,把每轮同步参数进一步压缩;其三,测试更严苛的系统设定——客户端部分参与、掉线、异构算力边缘设备部署,验证 FlashQKAN 的实时推理能力;其四,系统消融量子比特数、重上传层数与隐维度,回答多少量子结构才够用,并与其他 KAN 变体(B 样条、傅里叶 KAN)横向对比;其五,扩展到多导联大规模数据集(如 PTB-XL)与跨数据集迁移(MIT-BIH 训练、INCART 测试),检验量子启发特征处理器的泛化;其六,与 FedProx、SCAFFOLD、个性化联邦等异质优化方法组合,覆盖临床最关心的长尾心律失常类型。
复现评估
复现条件总体友好。数据侧两个数据集均公开:MIT-BIH 用 Kachuee 等 2018 年的预处理版本(187 维心跳、现成划分),INCART 来自 PhysioNet 并按 CAT-Net 协议提取,均为标准资源。代码侧论文明确依赖三个开源组件:FLamby(联邦医疗基准框架)、QKAN 官方实现(github.com/Jim137/qkan)与 FlashQKAN(PyTorch + cuTe DSL),拼装难度不大,但本文自身的实验脚本、QKAN 具体结构(量子比特数、层数、隐维度)与划分种子未在正文完整给出,需查阅代码仓库或联系作者。算力门槛低:模型仅 1–3 万参数、数据十几万条、30 轮训练,单张消费级 GPU 即可,5 种子乘以几十个配置的完整矩阵估计数小时到一两天能跑完。主要风险是 non-IID 划分的随机性导致的高方差(部分配置标准差超过 0.1),复现时需固定划分种子并做多次重复;对熟悉 FedAvg 与 FLamby 的团队,整体复现难度属中等偏易。
论文图表
MIT-BIH 在 32 客户端下的鲁棒性曲线:横轴是客户端标签分布与全局分布的 Hellinger 距离(越大越偏斜),每个点对应一个 Dirichlet 浓度 $\alpha \in \{0.1,0.3,0.5,1,1000\}$,纵轴为 AUROC 与 AUPRC,分别画出 MLP 与 HQKAN 两条趋势线。
这是论文最核心的鲁棒性证据:随标签偏斜加大,MLP 的 AUPRC 下降更快而 HQKAN 保持平稳、差距拉大,直接支撑结论中异质鲁棒性的主张。
与 Fig. 3 同构的 INCART 版本:32 客户端、5 个本地 epoch,横轴 Hellinger 距离、纵轴 AUROC/AUPRC,每个点对应一个 $\alpha$ 值,对比 MLP 与 HQKAN 随偏斜加剧的性能轨迹。
在第二个数据集上复现了鲁棒性结论,排除单数据集偶然性,是全文从两个基准归纳出普适结论的必要一环。
MIT-BIH 主结果表:按 IID/non-IID 与客户端数 8/16/32 分行,列出 MLP 与 HQKAN 的 macro-F1、Cohen's κ、Brier 分数的均值±标准差。例如 IID 32 客户端 HQKAN macro-F1 0.687±0.012 对 MLP 0.633±0.008;non-IID 32 客户端 0.761±0.026 对 0.698±0.030。
论文最重要的定量结果表,聚合指标的全部 24 组对比数字都来自这里,是验证 HQKAN 全面占优这一核心论断的第一手证据。
INCART 主结果表,结构与 Table I 相同:三类分类下 IID 与 non-IID、8/16/32 客户端的 macro-F1、κ、Brier 对比,如 non-IID 32 客户端 HQKAN 0.850±0.026 对 MLP 0.838±0.009,Brier 0.032±0.003 对 0.040±0.006。
提供第二个数据集上的完整数字,证明结论的跨数据集一致性;同时暴露出部分 non-IID 配置标准差偏大(如 8 客户端 κ 达 0.157),便于读者评估统计稳健性。
MIT-BIH 32 客户端下少数类 S、V、F 的逐类 PPV、敏感度、特异度对比,按 IID 与 non-IID 分组。关键数字包括:IID 下 F 类 PPV HQKAN 0.239 对 MLP 0.147;non-IID 下 S 类敏感度 0.515 对 0.368,但 PPV 0.755 略低于 0.768。
聚合指标无法揭示的精度-召回权衡在这里显形,是理解 HQKAN 在极端不平衡的 F 类上究竟赢得多少、以及 S 类是否值得临床信任的关键表格。
INCART 32 客户端下 N、S、V 三类的逐类 PPV、敏感度、特异度。HQKAN 的 S 类 PPV 在两种划分下均更高(IID 0.278 对 0.199,non-IID 0.808 对 0.725),但敏感度略低;V 类敏感度分别高 0.008 与 0.020。
与 Table III 呼应,逐类量化第二个数据集上的优势与权衡,特别是 S 类 PPV 提升近 8 个百分点这一对筛查场景很有价值的细节。