← 返回 2026-07-20

托卡马克等离子体诊断模型的传感器鲁棒性基准:TokaMark 系统性评估 Benchmarking Sensor Robustness in Plasma Diagnostic Models: A Systematic Evaluation on TokaMark

Neerav Gupta 📅 2026-07-05 👍 2 2026-07-25 18:30
传感器失效 基准测试 托卡马克 扰动预测 时间序列预测 模型鲁棒性 等离子体诊断 缺失数据填补

首个针对等离子体诊断 ML 模型的传感器失效鲁棒性基准,揭示序列模型在临近扰动失效时崩塌。

前置知识

托卡马克(Tokamak)

一种利用强磁场将高温等离子体约束在环形真空室中的聚变装置,是目前最成熟的磁约束聚变概念。等离子体温度需达到上亿摄氏度(高于太阳核心),远超任何材料熔点,因此必须靠磁场将其悬浮隔离在器壁之外。MAST(Mega Amp Spherical Tokamak,英国卡拉姆实验室,1999–2013 运行)是一种紧凑型球形托卡马克,共产生约 3 万次等离子体放电(shot),每次持续 2–3 秒。

本文的所有实验都建立在 MAST 放电数据之上,理解 shot(放电)、磁场约束、诊断信号这些基本概念,才能看懂任务为什么是预测等离子体电流。

等离子体破裂(Disruption)

等离子体约束在毫秒级时间内突然失控丧失,热能与磁能瞬间倾泻到反应器壁上。de Vries 等人在 JET 上统计破裂约占常规放电的 3–4%,ITER 量级装置每次破裂都可能造成第一壁、磁体和结构件的永久损伤。早期预警(ITER 要求 50–100 毫秒提前量)让控制系统能优雅终止等离子体,是反应堆级装置的安全刚需。

本文的核心安全动机就是破裂预测,Task 4-4 预测的等离子体电流骤降正是破裂最清晰的前兆之一,所有鲁棒性结论都围绕『传感器在破裂临近时失效会怎样』展开。

NRMSE(归一化均方根误差)

定义为 $\mathrm{NRMSE} = \sqrt{\frac{1}{N}\sum_{i=1}^{N}(\hat{y}_i - y_i)^2} / \sigma_y$,其中 $\sigma_y$ 是测试集真值的标准差。NRMSE = 1.0 表示模型并不比『永远预测均值』更好,低于 1.0 才有真实预测价值。本文在窗口层面计算 NRMSE 并对所有测试窗口取平均。

这是本文最主要的回归评估指标,论文中所有 +X% 退化都是相对干净基线 NRMSE 的百分比上升,看懂这个指标才能理解 +212% 这种『性能崩塌』的严重程度。

缺失值填补(Imputation)

当传感器读数丢失或被人为置零时,用某种策略补回缺失位置。本文评估三种:零填充(zero-fill,不填补,保持为零,也是 TokaMark 默认行为)、均值填充(mean-fill,用训练集该通道均值替换)、前向填充(forward-fill,把缺口前最后一个有效观测一直沿用直到恢复有效数据,最贴近工业传感器实际行为)。

填补策略是本文的实用核心结论来源——前向填充几乎消除随机丢包退化、均值填充在告警任务上把 LSTM 从 TPR=0 救回 1.00,理解这三种策略才能看懂论文的实操建议。

归纳偏置(Inductive Bias)

模型架构内建的对数据结构的先验假设。XGBoost 把每个窗口压成 142 个统计量再建树;LSTM 顺序处理序列,自然更看重最近时间步;Transformer 用全局自注意力把所有时间步等权看待;CNN 用每通道独立卷积编码器。这些不同偏置直接决定了模型对传感器失效的脆弱程度。

本文最有解释力的洞察就是『架构归纳偏置决定鲁棒性轮廓』——LSTM 重末端所以临近失效最致命、Transformer 全局所以前后都受影响、XGBoost 聚合统计所以最稳。

TPR 与 MWT(告警指标)

TPR(True Positive Rate,真阳率)= 在真破裂前成功告警的放电比例;MWT(Mean Warning Time,平均预警时间)= 首次告警到破裂时刻 $t_{\text{cut}}$ 之间的平均毫秒数。当模型预测电流低于该放电平均预测电流的阈值分数 $\theta \in [0.05, 0.60]$ 时触发告警,$\theta$ 按最大化 TPR 优化。

本文最反直觉的发现——『对 NRMSE 有害的均值填充,却对告警 TPR 有救命之效』——只有在理解 NRMSE 和告警指标是两套独立评估体系后才能体会。

研究动机

现有等离子体诊断机器学习模型几乎全部在『干净、完整』的传感器数据上评估,但这与现实严重脱节。作者流式读取了 300 个 MAST 放电来刻画真实缺失结构,发现动力学诊断(干涉仪和 D-alpha 光谱)平均每放电有 14–15% 的 NaN,且这两类信号的 NaN 比例在每一位小数上都完全相同(相关系数 $r = 1.000$),因为它们共用同一个采集触发器,触发晚到时两类信号同时缺失,形成放电开头的前置缺口(覆盖 10–16% 信号历史)。个别传感器还会因热损伤和电磁干扰在放电中段死掉。更糟的是,这些失效在时间上并非均匀分布,而恰恰集中在等离子体最不稳定、预测最关键的时刻——破裂会产生强烈热载和电磁瞬变,主动恶化传感器在事件临近时的性能。所有已发表的破裂预测工作(Kates-Harbeck 在 JET/DIII-D、Vega 在 JET 实时部署、Churchill 在 DIII-D 的高分辨卷积、Aymerich/Guo 在 JET/EAST 的时空轮廓)都默认推理时数据完整干净,这个假设在工程中根本站不住。

本文的目标是构建首个针对等离子体诊断机器学习模型的系统性鲁棒性基准。具体目标包括:(1)用 300 个真实 MAST 放电刻画自然缺失结构,让失效场景扎根于真实硬件失效模式而非任意假设;(2)设计六种物理上有依据的失效场景(随机丢包、通道消融、时序缺口含前置/中段/事件前、相关诊断组失效、扰动临近失效),其中扰动临近失效据作者所知此前从未被评估过;(3)在统一的 TokaMark Task 4-4(给 150 毫秒诊断历史预测 100 毫秒后的等离子体电流)上评估 XGBoost、LSTM、Transformer 和 TokaMark CNN 四种架构,并提出可跨架构比较的 Robustness Score;(4)补充弹级(shot-level)告警评估(TPR/MWT),用 FAIR-MAST 的真值破裂时间戳 $t_{\text{cut}}$;(5)评估零填充/均值填充/前向填充三种缓解策略在 NRMSE 与告警两套指标下的表现。

与已有工作不同的是,本文的独特切入角度在于填补 TokaMark 基准自己留下的一块空白:TokaMark 把『对不完整状态信息的鲁棒性』列为四大核心评估维度之一,并明确指出信号可能『因硬件问题在某次放电中缺席』或『因采集窗口受限或诊断失效而含缺失时段』,但整篇 TokaMark 论文里没有任何一处真正评估了这一维度。已有最接近的工作 Chandrasekaran(187 个 GOLEM 放电、CatBoost、单一模型)和 Yang(HL-3、跨设备缺通道)范围都窄得多。本文的独特性在于:四架构 × 六失效模式 × 三种严重度 × 三种填补 × 两套评估指标(NRMSE + 告警)的全面组合,加上首次提出的标准化 Robustness Score,以及扰动临近失效这一与破裂预测安全最直接相关的全新场景。

核心方法

整体思路是『先测真实失效长什么样,再据此设计可控实验,最后用两套指标交叉验证结论』。第一步,作者流式读取 300 个 FAIR-MAST 放电,逐诊断类别统计 NaN 百分比、最大值、缺失放电数和结构(前置块/变量/恒存在),把现实里『动力学诊断前置缺失、且 D-alpha 与干涉仪完全相关』这一硬件事实转化为可复现的失效场景设计依据。第二步,在干净数据上训练四种代表截然不同归纳偏置的架构(XGBoost 的统计聚合、LSTM 的顺序递归、Transformer 的全局注意力、TokaMark CNN 的每通道卷积),训练只用 200 个放电的 9950 个窗口,测试用 50 个放电的 2420 个窗口。第三步,只在测试集上施加六种物理失效场景(训练集始终干净),施加三种严重度梯度。第四步,同时用窗口级 NRMSE 和弹级告警 TPR/MWT 两套指标评估,并比较三种填补策略。最后用 Robustness Score 把所有零填充场景下的退化压缩成单一数字便于跨架构排序。

核心创新点是『物理驱动的扰动临近失效 + 双指标评估的逆转现象』。和以往仅用随机噪声或随机丢包的鲁棒性研究不同,作者提出在预测窗口的最后几个时间步注入缺口——这模拟了『破裂临近时传感器正好失效』这一最致命的真实场景,因为模型最依赖的恰恰是这些末端时间步。与此配套的双指标评估揭示了一个反直觉且极实用的现象:对 NRMSE 有害的均值填充,对告警 TPR 反而救命(LSTM 从 0.00 恢复到 1.00)。这种『同一系统同一失效、同一填补在不同评估体系下结论完全相反』的发现,是已有方法从未触及的——它直接说明任何聚变 ML 部署都必须同时评估回归精度和告警可靠性,否则会做出致命的错误部署决策。此外,Robustness Score $\mathrm{RS} = \frac{1}{|S|}\sum_{s \in S} \frac{\mathrm{NRMSE}_{\text{clean}}}{\mathrm{NRMSE}_s}$ 提供了首个标准化的跨架构鲁棒性度量。

方法步骤详情

完整方法步骤如下:(1)数据准备——基于 TokaMark 的 80/10/10 弹级划分,从 200 个训练放电抽 9950 个窗口、50 个测试放电抽 2420 个窗口,每个窗口是 (600, 18) 的张量(600 个时间步、18 通道,含 14 路诊断和 4 路执行器信号,见表 1)。(2)模型训练——XGBoost 先把每个窗口压成 142 个统计量(每路诊断 9 个:均值、标准差、最小最大、中位数、首末值、线性斜率、零分数;每路执行器 4 个),用 500 棵树、学习率 0.05、最大深度 6、子采样 0.8、列采样 0.8、GPU 直方图、20 轮无提升早停;LSTM 是隐藏 128 的 2 层结构加 dropout 0.2,Adam 学习率 $10^{-3}$、ReduceLROnPlateau(patience 5、factor 0.5)、梯度裁剪 1.0、早停 patience 15;Transformer 是 3 层编码器、$d=128$、4 头、前馈维 256、dropout 0.1、余弦退火($T_{\max}=100$、$\eta_{\min}=10^{-5}$);CNN 复现 Rousseau 等人的多分支卷积($N=3$、核 $K=3$、步长 $s=3$、填充 $p=1$、潜维 $D=16$)后接共享 MLP(64→32→16→1)。(3)失效注入——仅在测试集施加,六场景各自带 2–3 个严重度(如丢包 $p \in \{0.10, 0.25, 0.50\}$、消融 $n \in \{1,3,6\}$、缺口 $f \in \{0.20,0.40,0.60\}$)。(4)指标计算——窗口级 NRMSE、弹级 TPR/MWT(阈值 $\theta$ 在 [0.05,0.60] 上扫优)、Robustness Score。(5)缓解评估——对每种失效施加零/均值/前向填充后重算两套指标,注意填充只用 corruption mask 限制在被人为置零的位置,不动自然零。

技术新颖性

技术新颖性体现在四个层面。第一,扰动临近失效场景是全新的——据作者所知此前从未有任何工作评估『预测窗口末端注入缺口』这一最具安全意义的失效模式,而它恰恰戳中了 LSTM 顺序归纳偏置的命门。第二,把自然缺失刻画(300 放电的 NaN 结构统计)作为场景设计的物理依据,特别是发现 D-alpha 与干涉仪 NaN 相关 $r=1.000$ 直接催生了相关诊断组失效场景,这种『从真实数据反推实验设计』的做法比任意噪声注入更可信。第三,首次提出 Robustness Score 作为跨架构、跨场景的单一标量度量,$\mathrm{RS}=1$ 表示完全鲁棒,鼓励社区采用。第四,双指标(NRMSE + 告警)联合评估揭示的均值填充逆转现象,是已有单指标评估体系下根本看不见的——这是方法论层面最深刻的新颖性,说明鲁棒性结论取决于你看哪个指标。

三种序列建模管线
Figure 1: 三种序列建模管线

实验结果

论文的核心发现可以归为五组。**(1)干净基线与精度-鲁棒权衡**:Transformer 干净 NRMSE 最低(0.470)但 RS 也最低(0.765);XGBoost 反过来(NRMSE 0.494、RS 0.841 最高);LSTM 居中(0.496、0.808);CNN 干净 0.528、RS 0.764 几乎和 Transformer 一模一样,说明多分支卷积和全局注意力虽然归纳偏置截然不同,整体鲁棒性却殊途同归。所有模型的干净 NRMSE 都高于 TokaMark 报告的 0.429,这是因为本文只用 200 放电训练(TokaMark 用满 9270),但相对退化模式由架构决定、与起点无关。**(2)扰动临近失效是序列模型的灭顶之灾**:在 20% 末端缺口(最轻严重度)下,LSTM NRMSE 直接飙升 +212% 并随缺口变大不进一步恶化(硬天花板),Transformer +143%→+205% 渐进,CNN +67.7%→+167.7%,XGBoost 只 +8%→+37%。LSTM 之所以崩得最惨,正是它的顺序偏置让它最依赖末端时间步——而这些时间步恰恰是破裂临近时最先失效的。**(3)前向填充几乎消灭随机丢包退化**:50% 丢包下 LSTM 从 +57% 降到约 0%、Transformer 从 +85% 降到 -0.4%(测量噪声内),但 XGBoost 只能靠均值填充部分恢复(+39%),因为往已损坏的统计特征里塞均值不是干净的修复。**(4)等离子体电流是全架构唯一最关键信号**:移除 summary-ip 导致 LSTM +139.8%、Transformer +89.1%、XGBoost +72.7%、CNN +27.7%,没有任何架构找到替代代理;执行器线圈次之(CNN 对其最敏感 +46.9%,因为每通道编码器无法跨通道补偿)。反直觉的是,自然缺失率最高的动力学诊断和软 X 射线移除后退化反而不到 +20%——模型在 14–15% NaN 训练中已经学会把它们当可选通道。**(5)告警指标逆转——本文最具实操价值的发现**:干净数据下 CNN 告警 TPR 最高(0.60,30/50 放电预警成功),但所有模型 MWT 仅 12–15 毫秒,远低于 ITER 要求的 50–100 毫秒;25% 扰动临近失效下 LSTM TPR 从 0.52 崩到 0.00、Transformer 到 0.08、CNN 到 0.46;最惊人的是,对 NRMSE 有害的均值填充在此反而把 LSTM TPR 救回 1.00(全部 50 个破裂放电都告警),前向填充也强恢复(LSTM 0.96、Transformer 0.76、CNN 0.78)。原因是填充阻止了人为零值掩盖末端电流下降信号,让阈值告警能正确触发。

Task 4-4 输入信号表
Table 1: Task 4-4 输入信号表
300 个 MAST 放电的自然 NaN 刻画
Table 2: 300 个 MAST 放电的自然 NaN 刻画
四模型训练超参数
Table 3: 四模型训练超参数
干净数据性能与 Robustness Score
Table 4: 干净数据性能与 Robustness Score
50 个破裂测试放电的弹级告警指标
Table 5: 50 个破裂测试放电的弹级告警指标
三种失效场景下 NRMSE 随严重度变化
Figure 2: 三种失效场景下 NRMSE 随严重度变化
按诊断类别的通道重要性热图
Figure 3: 按诊断类别的通道重要性热图
相关诊断组失效
Figure 4: 相关诊断组失效
扰动临近失效 vs 前置缺口对比
Figure 5: 扰动临近失效 vs 前置缺口对比
NRMSE 视角下各模型的缓解策略效果
Figure 6: NRMSE 视角下各模型的缓解策略效果
各模型整体 Robustness Score
Figure 7: 各模型整体 Robustness Score
50 个破裂放电的弹级告警指标(干净数据)
Figure 8: 50 个破裂放电的弹级告警指标(干净数据)
传感器失效下的弹级告警指标
Figure 9: 传感器失效下的弹级告警指标
扰动临近失效下告警检测的缓解策略效果
Figure 10: 扰动临近失效下告警检测的缓解策略效果
查看结构化数据
任务指标本文基线提升
Task 4-4 干净等离子体电流预测 窗口级 NRMSE(越低越好) Transformer 0.470(最佳)、XGBoost 0.494、LSTM 0.496、CNN 0.528 TokaMark CNN 在 9270 放电全集上 NRMSE 0.429 本文仅用 200 放电训练,绝对值不可直接对比;相对退化模式由架构决定,结论不受起点影响。Transformer 在四架构中最准。
Task 4-4 50% 随机丢包鲁棒性 零填充下 NRMSE 相对干净基线的退化% CNN +201%(最差)、XGBoost +145%、Transformer +85%、LSTM +57%;前向填充后 LSTM≈0%、Transformer≈-0.4% 零填充(TokaMark 默认,不填补) 前向填充在序列模型上几乎完全消除随机丢包退化,零架构成本,是实用默认策略。
等离子体电流通道消融 移除 summary-ip 后 NRMSE 退化% LSTM +139.8%、Transformer +89.1%、XGBoost +72.7%、CNN +27.7% 移除前干净基线 等离子体电流是全架构唯一最关键信号,无架构找到替代代理;CNN 最不敏感因其卷积池化分散了依赖。
扰动临近失效(20% 末端缺口) NRMSE 相对干净基线退化% LSTM +212%(硬天花板)、Transformer +143%、CNN +67.7%、XGBoost +8% 干净数据 LSTM 崩塌源于其顺序归纳偏置对末端时间步的硬依赖;XGBoost 因统计聚合(斜率/末值)最稳,仅 +8%。
Task 4-4 干净告警(50 个破裂放电) TPR / MWT(ms) CNN TPR 0.60/MWT 12.6ms、LSTM 0.52/15.2ms、Transformer 0.48/13.2ms、XGBoost 0.40/13.1ms ITER 要求 50–100ms 提前量 所有模型 MWT 12–15ms 远低于 ITER 最低 50ms,反映 Task 4-4 的 100ms 预测窗口本身不足以支撑反应堆级破裂预防。
扰动临近失效下告警 TPR 的均值填充恢复 25% 末端缺口下的 TPR LSTM 0.00→1.00、Transformer 0.08→0.58、CNN 0.46→0.30;前向填充 LSTM 0.96/Trans 0.76/CNN 0.78 零填充下 LSTM TPR=0.00 对 NRMSE 有害的均值填充对告警 TPR 反而救命,揭示了 NRMSE 与告警指标不可互换、必须双评估的核心方法论结论。

局限与改进

作者坦诚承认了多项局限。**回归框架限制**:Task 4-4 把等离子体电流预测建成回归问题,而破裂预测文献主流是二分类(破裂 vs 非破裂)或剩余时间估计,鲁棒性方法论本身架构/任务无关,但扩展到分类是必要的未来工作。**目标变量受限**:等离子体电流 summary-ip 由机器主动控制、放电大部分时间相对平坦,本身就是个有限的预测目标;它之所以是最关键输入信号,部分因为输出信号和最重要的输入信号是同一个东西。**MAST 特定缺失模式**:本文自然缺失刻画发现的前置采集缺口(动力学诊断 14–15% NaN、集中在放电开头)可能专属于 MAST 采集系统,专家反馈在其他装置上诊断失效更常发生在破裂之后而非放电开头,故场景应放在 MAST 运行条件下解读。**告警指标局限**:告警阈值是在测试集上优化的简单电流下降启发式,严格做法应留出独立阈值调优集并报告 FAR;FAR 因 50 个测试放电全部破裂而无法计算;12–15ms 的 MWT 可能反映 Task 4-4 的 100ms 短预测窗口而非模型固有局限。**Task 4-5 扩展失败**:四架构在 Mirnov 预测任务上干净 NRMSE 都 >1.0(与 TokaMark 基线 1.0053 一致),无预测价值故无法做鲁棒性评估。**XGBoost 时序缺口近似**:XGBoost 在特征向量上运作,时序缺口靠靶向受影响最大的轨迹统计量(首值/末值/斜率)实现而非真正的时序掩码,结果是保守估计。**训练集规模与单次训练**:仅 200 放电、每个模型只训一次,未刻画运行间方差,直接性能对比需谨慎。**我自己的观察**:告警阈值在测试集上扫优存在轻微乐观偏差;50 个测试放电样本偏小,TPR 的 0.00→1.00 这种极端反转在更大样本上可能没那么干净。

独立分析的弱点

**(1)告警评估缺非破裂样本**:50 个测试放电全部破裂导致 FAR 无法计算,TPR=1.00 的『完美恢复』在没有非破裂对照时无法证伪——可能只是均值填充让所有放电都触发告警(包括本不该触发的)。改进方向:补一批非破裂放电专门算 FAR 和误报率,让告警结论真正可信。**(2)单一装置、单一任务**:所有结论只在 MAST 的 Task 4-4 上成立,迁移到 DIII-D/JET/SPARC/ITER 是否成立未知,尤其 MAST 前置缺失模式可能不普适。改进方向:把六场景与 RS 直接搬到 DisruptionBench 的多装置框架上做跨设备验证。**(3)等离子体电流是受控平坦信号**:把它当回归目标本身偏弱,模型最依赖 summary-ip 部分因为输入输出同源。改进方向:转向非受控量(如锁定模式幅度、密度、辐射功率)的预测,鲁棒性画像会更接近真实破裂前兆。**(4)告警阈值在测试集调优**:阈值 $\theta \in [0.05,0.60]$ 在测试集上扫优最大化 TPR,存在过拟合测试集的风险,尤其样本只有 50 个。改进方向:用留出阈值集或交叉验证,并报告 ROC 曲线而非单点。**(5)单次训练无方差**:每个架构只训一次,+212% 这种关键数字没有置信区间。改进方向:多种子重复训练报告均值±标准差,至少对核心结论(扰动临近失效崩塌、告警逆转)做显著性检验。**(6)XGBoost 时序缺口是代理近似**:和另三架构的真正时序掩码不可严格对比。改进方向:给 XGBoost 也实现逐时间步掩码后再算统计量,或明确标注此差异在 RS 排序中的影响。

未来方向

作者明确点名的未来方向包括:把鲁棒性方法论扩展到破裂起始二分类(带标注放电结果)和剩余时间估计,因为当前回归框架与破裂预测文献主流不符;开发能在有限训练数据下对 Mirnov 诊断做有意义预测的模型(Task 4-5 目前 NRMSE>1.0 无法评估)。基于成果可延伸的方向:**(a)跨装置鲁棒性基准**——把六场景与 RS 直接接入 DisruptionBench 多装置框架,验证结论是否随装置变化;**(b)学习物理冗余**——论文发现移除 summary-ip 退化巨大可能反映模型未学会用 Bp 磁探针阵列按安培定律线性合成 Rogowski 等价电流(Alcator C-Mod 在 Rogowski 失效那年正是这么做的且 TPR 未降),训练时显式注入这种物理冗余约束应能显著降低 summary-ip 依赖;**(c)伪占位符训练**——把 Yang 等人的 learned pseudo-data placeholder 从跨设备迁移技术升级为标准训练实践,让模型显式区分『缺失通道』与『零值信号』;**(d)硬件冗余设计**——对最关键信号(等离子体电流、有源线圈)部署独立冗余采集链,使单点硬件失效无法同时污染模型最依赖的信号;**(e)自适应填补策略**——根据当前是回归监控还是阈值告警自动切换填补(前向填充默认、告警用均值填充),把论文的『双指标最优策略不同』结论工程化;**(f)按破裂类型分诊**——锁定模破裂(约占 JET 90%)宜用鞍磁通环、杂质注入破裂宜用软 X 射线,鲁棒系统应保留对所有诊断类别的敏感度而非依赖单一信号。

复现评估

复现性是本文的强项,作者明确把『每个实验都能从零复现』作为承诺,并给出三重资源。**代码**:完整代码库在 https://github.com/Neerav-Gupta/tokamark-robustness 。**数据与检查点**:预采集数据阵列(约 25GB)连同训练好的模型检查点托管在 https://huggingface.co/datasets/Neerav-Gupta/tokamark-robustness-data ,省去重新跑特征工程的麻烦。**底层数据**:FAIR-MAST 原始数据公开可访问于 https://s3.echo.stfc.ac.uk/mast/tokamark/v1 。**超参数全公开**:表 3 列出四架构的优化器、学习率、学习率调度、批大小、最大轮数、早停 patience、dropout、梯度裁剪、参数量(XGBoost ~500K 节点、LSTM ~430K、Transformer ~310K、CNN ~458K),数据划分(200 训练放电/9950 窗口、50 测试放电/2420 窗口)也明确。**算力门槛低**:四架构参数量都在几十万量级,单 GPU 即可训练,对独立研究者友好。**复现难度**:中等偏低——主要不确定性在于(1)每个模型只训一次未给随机种子和运行间方差,复现者得到的绝对数字可能略有漂移但相对模式应稳定;(2)XGBoost 时序缺口是特征级代理,复现者需仔细对照实现细节;(3)告警阈值在测试集扫优的细节需对照代码。总体而言,这是一篇复现性显著高于领域平均水平的基准类工作。