CardioState-JEPA:延迟感知的心脏信号跨模态共享表征学习 CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation
让ECG、PPG、PCG在潜在心脏时间轴上互相监督,一个编码器统一心脏表征
前置知识
ECG / PPG / PCG 三种心脏传感模态
心电图(ECG)记录心肌电除极的体表电位;光电容积描记(PPG)用光测量外周血管血液容积变化,反映血流动力学;心音图(PCG)用电子听诊器记录瓣膜开闭产生的声学振动。三者观测同一个心动周期:电激活引发收缩,瓣膜运动产生心音,血液射出后才表现为外周脉搏,因此同一拍在三个传感器中出现的时间依次错开。
论文的全部动机与延迟对齐机制都建立在这三种信号的生理时序关系上,不理解 R 波、S1 心音、PPG 上升支的先后关系,就无法理解为什么必须建模生理延迟而不是按时间戳对齐。
JEPA(联合嵌入预测架构)
一类自监督表征学习方法:不重建原始输入,而是在潜空间中根据可见上下文预测被掩码部分的表征(预测目标来自动量教师编码器),损失直接作用在潜向量上。由于不追求逐点还原波形,学到的表示偏向抽象的结构与语义而非低层细节,且不需要对比学习中的负样本。
CardioState-JEPA 的名字和核心损失函数都源自 JEPA;理解『预测潜在状态而非重建波形』这一原则,是理解本文为何能避免传感器形态捷径、为何无需负样本的关键。
掩码潜在预测与 MAE
类似视觉 MAE 的做法:随机遮挡大块输入,用可见部分推断被遮挡部分,但推断发生在潜空间而非像素/波形空间。本文在 token 级做连续块掩码,掩码块常覆盖整个心拍,迫使模型利用相邻心动周期的节律与相位结构推断缺失状态,而不是做局部插值。
Stage I 的模态内目标 $\mathcal{L}_{\text{intra}}$ 就是掩码潜在预测,消融实验显示它是三个模态性能的主要来源,是理解两阶段课程的第一步。
动量编码器(EMA teacher)
额外维护一份编码器参数,是在线编码器的指数滑动平均(本文动量从 0.998 线性升至 0.9999),只对完整无掩码信号做前向,输出 stop-gradient 的目标编码。它变化缓慢、更稳定,为潜在预测提供可靠目标并防止表征塌缩,思路来自 BYOL/I-JEPA。
本文跨模态与模态内预测的目标编码 $\bar{z}$ 都由动量编码器给出,不读懂它就看不懂公式 (2)、(4) 和附录算法 1 的训练流程。
VICReg 防塌缩正则
一种无需负样本的表示对齐方法,用三项约束:配对样本嵌入互相接近(不变性项)、每个特征维方差不低于阈值(方差项)、特征维之间去相关(协方差项),从而在拉近正样本对的同时避免所有样本塌缩到同一点的退化解。
把三个模态拉进同一空间天然存在塌缩风险,本文用 $\mathcal{L}_{\text{state}}$(VICReg 项)实现『配对模态靠近但不塌缩』,消融中去掉它 ECG 平均掉约 6.5 分。
线性探测(linear probing)评估协议
冻结预训练编码器,只在其池化输出上训练一个任务专属的线性分类或回归头。因为主干完全不动,分数纯粹衡量预训练表征本身的可迁移质量,是基础模型论文之间公平比较的标准协议。
论文全部 25 个下游任务都采用冻结编码器 + 线性探测,所有『本文 vs 基线』的结论都建立在该协议之上,且数据划分做到患者不相交。
心动周期生理时序(R 波、S1/S2、PAT)
一个心动周期内:ECG 的 R 波标志心室电除极开始;经电-机械耦合约 75 ms 后二尖瓣关闭产生第一心音 S1;血液射入主动脉后经脉搏传导约 125–160 ms(脉搏到达时间 PAT)到达外周,形成 PPG 上升支。这些间期随个体生理状态和疾病而变化。
这组数字是延迟对齐器的物理锚点:R 波→S1 间期监督 ECG→PCG 延迟,PAT 监督 ECG→PPG 延迟,学到的延迟与真实生理事件的中位偏差仅 3–4 ms。
研究动机
现有心脏基础模型都是单模态的:ECG 方向有 ECGFounder(基于超 1000 万条标注记录)、ECG-FM、HeartLang、D-BETA 等,PPG 方向有 PaPaGei、AnyPPG(超 10 万小时)、PulsePPG,PCG 方向则直接借用通用音频模型 AudioMAE 和 CLAP。它们各自表现很好,但一个模态学到的节律、相位与形态结构完全无法被另一个模态复用。更麻烦的是,三种信号虽源自同一次心动周期,却在时间上错位:电活动(ECG)几乎即时,心音(PCG)经电-机械耦合约 75 ms 后出现 S1,外周脉搏(PPG)要等脉搏传导时间 PAT 约 125–160 ms;同一事件在三个传感器里分别呈现为尖锐电位、短促声爆与平滑脉冲波。若按时间戳朴素对齐,会把同一拍的不同相位拿来比对;若做原始波形重建,模型会去拟合传感器形态与噪声这些应被丢弃的干扰;对比学习的负样本在生理数据里语义又含糊——不同个体可能共享节律、心率甚至病理。同时,同步多传感器配对记录稀缺(如 EPHNOGRAM、VitalDB 规模远小于 80 万条 MIMIC-IV ECG 与 460 万条 PPG 的单模态语料),海量单模态数据难以直接用于跨模态对齐。
本文的目标是本文要训练一个统一的心脏基础模型:用单个共享 Transformer 编码器同时处理 ECG、PPG、PCG,把三种异构波形映射进同一个『心脏编码』(cardiac code)空间。具体有三条设计要求:(1) 表示必须能从单一模态的部分观测中恢复完整的心动周期状态,因为下游场景往往只有一个传感器,且配对数据稀缺;(2) 不同传感器在同一心脏时刻的编码必须一致,即扣除生理延迟后跨模态对齐;(3) 编码要丢弃传感器形态、噪声、摆放位置等干扰因素,只保留节律、相位、病理等共享生理结构。评估采用冻结编码器加线性探测,覆盖 ECG、PPG、PCG 共 25 个下游任务,目标是全面超过各模态最强的自监督信号基线(平均分别提升 15.5、8.2、18.8 AUROC),并逼近依赖临床文本或大规模标注的『特权』模型,最终一个模型就能部署到三类传感场景。
与已有工作不同的是,本文的独特切入是把『跨模态生理对应』本身当作监督信号,而不是要绕开的麻烦。其一,与一般多模态学习假设模态时间对齐(图文对、音视频)不同,心脏三模态天然错位,本文显式建模并监督这个延迟:用可学习的延迟对齐器把一个模态的预测目标采集到『潜在心脏时间』上的对应时刻,而非原始时间戳,并以 R 波→S1 间期(ECG–PCG)和脉搏到达时间(ECG–PPG)作为生理锚点约束学到的延迟。其二,针对心脏数据的体制(单模态海量、配对稀缺),设计了先在海量单模态数据上做模态内掩码潜在预测、再用稀缺配对数据做跨模态对齐的两阶段课程,同时混合采样单模态数据防止各模态编码漂移。其三,把 JEPA『预测潜在状态而非重建波形』的原则系统引入三种物理机制迥异的心脏传感器联合建模,在潜空间对齐的同时避免奖励低层形态拟合。
核心方法
直觉上,ECG、PPG、PCG 是同一个隐藏心脏过程 $c(t)$ 的三种『渲染』:ECG 记录电活动,PCG 记录瓣膜闭合的声学结果,PPG 记录血液到达外周的血流动力学结果。形式化地,$x_m(t) = O_m(c(t-\tau_m(t)),\, u_m(t))$,其中 $O_m$ 是模态特有的观测函数,$u_m$ 汇集噪声与摆放等干扰,$\tau_m$ 是相对电激活的生理延迟。既然 $c$ 是共享的,理想表征应能从任一模态恢复 $c$,且不同模态在扣除 $\tau_{m\to n}$ 后彼此一致。技术路线上:每个模态先经轻量的模态专属 tokenizer(步幅卷积统一到约 16–25 token/s 的低码率、多尺度深度可分离块捕捉 QRS 波/PPG 上升支/S1 等短事件、线性投影加位置与模态嵌入),再全部送入一个共享的 ViT-B Transformer 编码器(12 层、12 头、$d=768$,没有任何模态专属层),投影器输出用于训练和迁移的心脏编码;一份 EMA 动量编码器在无掩码信号上生成稳定目标。训练分两阶段:Stage I 用海量单模态数据做模态内掩码潜在预测;Stage II 在配对数据上做延迟感知的跨模态预测,辅以 VICReg 状态对齐与心拍相位预测两个轻量正则。
核心创新是『在潜在心脏时间轴上做跨模态预测』。与重建式多模态学习预测原始波形不同,本文让一个模态的上下文编码去匹配另一个模态在被掩码位置的动量编码器目标(潜在状态),这既避免奖励拟合传感器形态与噪声,也不需要生理数据中语义含糊的负样本。关键机制是可学习延迟对齐器:延迟头 $h_\delta$ 接收源编码 $z_i^m$ 与目标模态嵌入 $e_n$,输出有界偏移 $\tau_i^{m\to n} = \tau_{\max}\tanh(h_\delta([z_i^m; e_n]))$,再以 $t_i+\tau_i$ 为中心用高斯核 $\tilde{z}^n=\sum_j a_{ij}\bar{z}^n_j$($a_{ij}=\mathrm{softmax}(-(t_j-t_i-\tau_i)^2/2\sigma^2)$)从目标模态 token 中软采集对齐目标。与已有多模态时序方法的本质区别有三:延迟是逐 token、逐样本估计的,而非全局固定常数;软核采集对 $\tau$ 可微,给延迟头提供可用梯度;延迟还受生理锚点监督($\mathcal{L}_{\text{delay-sup}}$ 回归到 R 波→S1 间期或脉搏到达时间),且检测不到干净心拍时自动屏蔽该项而不影响主损失,使延迟学的是真实的心电-机械-血流时序而非任意降低损失的数值。
方法步骤详情
第一步,分词:输入经模态专属 tokenizer 得到 $h_m=f_m(x_m)$——步幅按模态设定使三种模态(ECG 12 导 500 Hz、PPG 125 Hz、PCG 4 kHz)输出同为约 16–25 token/s,多尺度深度可分离卷积为 QRS 波、PPG 上升支、S1 等短事件加宽上下文,线性投影后加位置与模态嵌入。第二步,Stage I(30 万步,批 196):对单模态样本做连续块掩码,可见上下文经 $g_\theta$ 编码,预测器 $q_\theta$ 在掩码位置匹配动量编码器 $\bar{g}_{\bar\theta}$(stop-gradient)的 LayerNorm 后编码,Smooth-L1 损失 $\mathcal{L}_{\text{intra}}=\frac{1}{|T|}\sum_i H(\hat{z}_i,\mathrm{LN}(\bar{z}_i))$;掩码常跨整拍,迫使模型从相邻周期推断缺失状态;相位项 $\mathcal{L}_{\text{phase}}$ 同时预测心拍内相位。第三步,Stage II(20 万步,批 64,热启动):以概率 $p$ 采样配对批(VitalDB/PPG-EXT 的 ECG–PPG、EPHNOGRAM 的 ECG–PCG、SensSmartTech 三模态),延迟头估计逐 token 偏移,高斯核软采集对齐目标,按熵定权 $w_i=1-H(a_i)/\log N_i$ 计算加权跨模态损失;VICReg 项 $\mathcal{L}_{\text{state}}$ 拉近配对模态并防塌缩;总目标是五个损失的加权和 $\mathcal{L}=\sum_k \lambda_k\mathcal{L}_k$(intra/cross/delay/state/phase),未配对样本仍用 Stage I 损失防止漂移。第四步,部署:编码器冻结,信号过 tokenizer、共享编码器、投影器后池化交给线性头;全程单卡 H100。
技术新颖性
技术新颖性体现在四点。其一,问题形式化新颖:首次把 ECG、PPG、PCG 统一进『共享潜在心脏状态 + 模态渲染 + 生理延迟』的视角(式 (1)),把跨模态生理对应提升为一等公民的监督信号——通用时序基础模型(Chronos、MOMENT 等)把通道当独立流,心脏基础模型则完全单模态。其二,延迟对齐机制新颖:不同于图文、音视频等天然时间对齐的多模态学习,这里的延迟头输出逐 token 的有界偏移,经可微高斯核在目标 token 序列上软采集,配合熵定权(对齐越确定权重越高)与生理锚点回归,使『延迟』既是可学习参数又是可解释的生理量(验证集上中位误差仅 3–4 ms)。其三,两阶段课程与数据体制精确匹配:单模态数据(数十万到数百万条)先行建立模态内结构,稀缺配对数据专注对齐且混合采样防漂移,这一『先单后配』配方对其他配对稀缺的传感领域有直接借鉴价值。其四,JEPA 原则首次系统用于三种物理机制迥异的心脏传感器联合建模,控制变量的消融显示,同数据同架构下掩码潜在预测显著优于 SimCLR、BYOL、BarlowTwins 与 MAE。
实验结果
PPG(Table 1,17 任务):6 个分类任务平均 macro-AUROC 从最强基线 AnyPPG 的 72.2 提到 80.4(+8.2),其中房颤 97.7 对 93.3、活动识别 90.3 对 79.0、BIDMC 呼吸率 78.4 对 53.2;11 个回归任务平均 MAE 从 10.9 降到 9.1,血压提升显著(UCI SBP 10.3 对 15.2,BCG SBP 4.4 对 13.5)。ECG(Table 2,6 数据集 × 1%/10%/100% 共 18 设置):平均 AUROC 84.1,比最强自监督基线 MoCo-v3(68.5)高 15.5 分,几乎所有设置领先自监督组;对比特权模型,84.1 逼近 ECG-FM(84.0)、超 ECGFounder(83.5)、接近 D-BETA(85.9),如 PTB-XL Rhythm 100% 达 96.4 超 ECGFounder 的 94.6。PCG(Table 3):CirCor 杂音 97.9±0.1 对 AudioMAE 79.1(+18.8),CinC2016 异常心音 66.8±0.4 对 62.4。共享空间(Figure 3):Stage II 后模态轮廓系数从 0.121 降到 −0.006,三模态样本在 t-SNE 上充分交错而类别结构更清晰(AF 轮廓 0.03→0.12,六类心律失常 0.01→0.09)。机制验证(Figure 8):学到的延迟与真实生理事件吻合,ECG→PPG 中位误差 4 ms、ECG→PCG 3 ms。消融(Table 4):三模态联合最均衡(PPG 回归 9.1 与 PCG 82.3 最优);JEPA 显著优于对比/重建目标(对 MAE:ECG 90.9 对 84.4、PPG 分类 80.4 对 62.0);去掉跨模态预测、状态对齐、延迟建模分别使 ECG 掉到 83.8、84.4、85.3,各成分互补。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| PPG 分类(WESAD、DaLiA、MIMIC AF、心律失常、BIDMC RR、UQVital RR 六任务平均) | macro-AUROC ×100 | 80.4 | AnyPPG 72.2(最强自监督基线) | +8.2 |
| PPG 回归(心率、血压、SpO2、HRV 等 11 任务平均) | MAE(越低越好) | 9.1 | AnyPPG 10.9 | −1.8(误差降低约 17%) |
| PCG 杂音检测(CirCor DigiScope) | macro-AUROC ×100(3 seeds) | 97.9 ± 0.1 | AudioMAE 79.1 | +18.8 |
| PCG 异常心音检测(CinC2016) | macro-AUROC ×100(3 seeds) | 66.8 ± 0.4 | AudioMAE 62.4 | +4.4 |
| ECG 分类(PTB-XL 四子集 + CPSC 2018 + CSN,1%/10%/100% 标注共 18 设置平均) | macro-AUROC ×100 | 84.1 | MoCo-v3 68.5(最强自监督);ECG-FM 84.0 / D-BETA 85.9(文本监督参考) | +15.5(对自监督基线),并匹配或超过多数特权模型 |
| PPG 房颤检测(MIMIC AF) | macro-AUROC ×100 | 97.7 | AnyPPG 93.3 | +4.4 |
| PPG 血压回归(UCI SBP) | MAE (mmHg) | 10.3 | AnyPPG 15.2 | −4.9 |
局限与改进
作者承认的局限:配对与三模态语料远小于单模态语料,延迟对齐器只在较少的干净心拍上训练;PCG 预训练数据最小(BMD-HS 仅 3,436 条训练记录),限制了声学表征的独立上限;在 ECG 上三模态相对最强双模态(ECG+PPG 91.4 对 90.9)的增益在噪声范围内,第三模态的收益主要体现在 PPG 与 PCG;延迟对齐器假设源信号上能检测到可靠参考事件(R 波),极噪声记录会退化为无监督对齐;所有结果基于冻结编码器的线性探测,未做完整微调或更大编码器。我的补充观察:CinC2016 上 66.8 的绝对值仍偏低,声学异常检测离临床可用尚有距离;延迟锚点只覆盖以 ECG 为源的配对,PPG↔PCG 之间没有直接锚点;预训练 ECG(MIMIC-IV)与下游 PTB-XL 之间存在设备与人群的域差,论文未单独分析跨域鲁棒性;高斯核带宽 $\sigma$ 的选取、以及病理(如束支传导阻滞会改变 QRS–S1 时序)对延迟估计的影响未讨论——而延迟本身是有诊断价值的量,被对齐机制当作干扰『吸收』掉也可能丢失信息。
独立分析的弱点
弱点一,对心拍检测的依赖:延迟头需要源信号上可检测的 R 波锚点,在房颤、严重运动伪影或可穿戴干电极接触不良场景会退化,改进方向是引入置信度加权的多事件融合锚点,或用互相关等无锚点对齐先验做兜底。弱点二,软采集使用固定带宽 $\sigma$,当不同模态的 token 间距(由采样率与步幅决定)差异较大时行为不一致,可让 $\sigma$ 可学习或随目标 token 密度自适应。弱点三,延迟被当作要消除的干扰,但脉搏到达时间 PAT 本身是血压与动脉硬化的生物标志物,更好的设计是把 $\hat{\tau}$ 作为显式输出头,让同一机制同时服务于『对齐』与『生理测量』。弱点四,PCG 数据瓶颈:BMD-HS 仅 3,436 条,可通过 ECG→PCG 跨模态蒸馏、音频-心音联合语料或数据增广扩充。弱点五,评估只在冻结线性探测下进行,微调、少样本、领域外场景(新生儿 ECG、剧烈运动 PPG)均未测,实际部署价值待验证。弱点六,参数共享假设:所有模态共用一个编码器,低资源模态(PCG)的梯度可能被高资源模态主导,可探索模态平衡采样、梯度手术或模态混合专家。
未来方向
作者提出的方向:完整微调与更大的编码器规模;扩充配对与三模态语料以强化延迟对齐器的训练;在更大数据上提升 PCG 独立表征能力。基于本文成果可延伸的:把学到的生理延迟本身产品化,输出 PAT、R–S1 间期作为无袖带血压与动脉硬化筛查的生物标志物,实现『表征 + 测量』一体;将延迟感知对齐推广到其他存在物理传播延迟的多传感系统(如地震-水听、脑电-血流、雷达-视觉);与临床文本结合(借鉴 MERL、D-BETA 路线),在共享心脏编码之上叠加报告对齐,有望追平甚至超越纯文本监督模型;增加生成式解码头,从共享编码重建任意模态波形,用于缺失模态补全与可解释性验证;本文已显示输入长度鲁棒性优势(Table 6 中标准差最小),可进一步发展任意长度、流式推理以适配可穿戴设备;最后,在更大的三模态配对语料上检验延迟头能否发现病理特异的对齐模式(如心衰患者的延迟异常),打开『对齐残差即诊断信号』的新方向。
复现评估
复现条件较好。代码已开源(GitHub: hamzashafiq28/CardioState-Jepa),权重发布在 HuggingFace(hamzashafiq/CardioState-Jepa)。预训练数据全部公开:MIMIC-IV-ECG(PhysioNet,需签署使用协议)、PPG-EXT、BMD-HS、VitalDB、EPHNOGRAM、SensSmartTech;下游基准(PTB-XL、CPSC 2018、CSN、WESAD、CirCor、CinC2016 等)同样公开,附录 Table 5 给出每个任务的划分与类别数。算力适中:ViT-B(12 层、12 头、$d=768$)在单张 H100 上完成 Stage I 30 万步(批 196)加 Stage II 20 万步(批 64),约数天量级,单卡实验室可承受。附录给出完整超参:AdamW、权重衰减 0.05、EMA 动量 0.998→0.9999、损失权重($\lambda_{\text{cross}}=1$、$\lambda_{\text{delay}}=1$、$\lambda_{\text{state}}=0.05$)及敏感性分析;下游统一 AdamW、100 epoch、批 16、学习率 1e-3,协议透明。主要门槛是 PhysioNet 凭证审批与多数据集预处理工程量,总体属于医学时序基础模型中复现难度偏低的一档。
论文图表
对比单模态感知与统一生理建模:ECG 在 R 波处记录电事件,PPG 在收缩峰处记录血流事件,PCG 在 S1/S2 处记录声学事件,三者标注同一心拍内不同生理时刻的对应关系,右侧汇聚为统一的心脏基础模型。
一图点明全文动机:三种信号是同一心动周期的错位观测,这既是『共享表征』的生理依据,也是必须建模延迟的原因。