时间序列基础模型中的预测坍缩 Forecast Collapse in Time-Series Foundation Models
低可预测性令校准预测幅度坍缩,逐序列损失漏掉截面排序,CalibRank 兼顾两者
前置知识
信息系数(IC,截面相关)
在多资产/多序列面板中,把同一时间戳 $t$ 上的 $N$ 个预测值与 $N$ 个真实值各自组成向量,计算二者的 Pearson 相关系数 $IC_t$,再对时间戳取平均得到 IC。它衡量『在某一时刻,模型能否正确排出哪些序列涨得多、哪些涨得少』,是量化投资组合构建最关心的量。与逐序列误差不同,IC 只依赖同一截面内的相对大小关系,对整体预测幅度完全不敏感。
本文诊断的核心失效就是 IC 崩掉:MSE 训练的模型在美股小时收益率上 IC 仅 0.046 且幅度近乎为零。理解 IC 必须逐时间戳计算再平均(池化所有 (i,t) 对会混淆时序与截面变异)也是读懂全部实验设计的前提。
时间序列基础模型(TSFM)
在海量时间序列上预训练、可跨领域做零样本或少量微调预测的大模型:TimesFM 用平方误差,Chronos 对量化后的值做交叉熵,Moirai/Lag-Llama/Toto 用似然,Sundial 用流匹配,TTM/Timer/Time-MoE 等用平方误差类损失。论文 Table 2 审计了 19 个模型、18 个可溯源训练目标:15 个披露了预测损失,其中 4 个属平方误差类,但没有任何一个在训练时联合评分整个截面。
论文揭示的是这一整类模型的评测盲点:它们逐序列校准良好,却在需要截面结构的下游任务(如选股排序)上集体失效,即『预测坍缩』。
可预测方差上限 $R^2_{\max}$ 与相关上限 $IC_{\max}$
把目标分解为 $y=\mu+\varepsilon$,其中 $\mu=E[y\mid F_{t-1}]$ 是给定信息集的条件均值,$\varepsilon$ 是不可约噪声。定义信噪比 $\mathrm{SNR}=\mathrm{Var}(\mu)/E[\mathrm{Var}(y\mid F_{t-1})]$,则可预测方差占比为 $R^2_{\max}=\mathrm{SNR}/(1+\mathrm{SNR})$,相关上限为 $IC_{\max}=\sqrt{R^2_{\max}}$。平方根很关键:$\mathrm{SNR}=0.01$ 时 $IC_{\max}\approx 0.10$,上限远高于 SNR 本身。
这是『幅度坍缩』机制的数学核心:小时级收益率 SNR 极低(Finance1K 收益的达成 $R^2$ 仅 0.0044),任何校准点预测的幅度必然被压到接近零;成交量 SNR 高约 20 倍,所以同样管线不坍缩。
衰减恒等式与最佳缩放幅度 $A^\star$
经典测量误差理论(源自 Spearman 1904,Fuller 1987 系统化)指出,预测与目标的相关可分解为 $\mathrm{corr}(\hat y, y)=\rho\cdot IC_{\max}$,其中 $\rho=\mathrm{corr}(\hat y,\mu)$ 是模型对可预测成分的对齐度。把预测乘上最优标量 $s^\star=\mathrm{Cov}(\hat y,y)/\mathrm{Var}(\hat y)$ 后的标准差比称为最佳缩放幅度,满足精确恒等式 $A^\star=|\mathrm{corr}(\hat y,y)|\le IC_{\max}$。
它说明弱相关与正确尺度不可兼得:相关性差的预测在最优重标定后幅度必然小。这把『预测太平』从模型缺陷重新解释为低可预测性下的统计必然,是论文第一条主定理。
逐序列(pointwise)损失与耦合不变性
若损失形如 $R(\hat y)=\sum_{i,t}E[\ell(\hat y_{it},y_{it})]$,每一项只依赖单对 $(\hat y_{it},y_{it})$ 的联合分布,那么在保持每个坐标对分布不变、只改变跨坐标依赖(重耦合)的变换下 $R$ 完全不变,而 $IC_t$ 可以大幅改变。论文的二序列高斯构造:固定平方误差风险 1.40 不动,$E[IC_t]$ 可在 0.371 到 0.032 之间摆动一个数量级。
这解释了『排序坍缩』:即便模型容量足够,逐序列训练也不保证选到的解在截面排序上正确。要修复就必须显式奖励下游决策实际使用的截面泛函——这正是 CalibRank 的动机。
校准-排序权衡与 CalibRank 目标
MSE 等校准目标在低可预测性下输出低幅度预测;直接优化 IC 等排序目标则完全不约束尺度(实验中幅度膨胀到目标 25 倍以上)。CalibRank 用标量化组合两者:$\mathcal{L}=\frac{1}{M}\sum_{i,t}(\hat y_{it}-y_{it})^2-\frac{\lambda}{|B|}\sum_{t\in B}IC_t$,其中 $IC_t$ 是可微的逐时间戳 Pearson 相关,$\lambda$ 控制权衡位置。
它是论文给出的实用解:在 Finance1K 上把 IC 从 0.046 提到 0.126(约 2.7 倍),同时幅度控制在目标的约 1.8 倍内。理解该目标才能读懂 λ 扫描、帕累托前沿和工作点选择建议。
研究动机
时间序列基础模型(如 TimesFM、Chronos)在通用预测基准上表现强劲,但金融市场是极端压力测试:美股小时级收益率的信噪比极低,而许多金融决策依赖的不是单序列精度,而是截面上众多资产之间的相对排序。作者把现成 TSFM 直接用于 1,000 只美股的小时收益率预测时发现意外现象:预测值几乎平坦在零附近,截面 IC 极差——MSE 训练下原始幅度只有目标的 0.027、IC 仅 0.046,作者称之为『预测坍缩』。这与 Rahimikia et al. (2025) 的大规模评测(TSFM 在股票超额收益上零样本和微调后都弱)相互印证。更奇怪的是,在完全相同的协议下把目标换成同一批股票的成交量,坍缩基本消失(MSE 幅度 0.391、IC 0.530)。同时,若直接以 IC 为训练目标,排序虽好(IC 0.124)但幅度膨胀到目标的 25 倍以上。而传统时序评测(如 GIFT-Eval 的 11 个指标)逐序列打分,43 个多变量配置也被展平后评分,没有任何指标度量原始幅度或截面结构,因此这类失效在现行基准上完全不可见。
本文的目标是论文要回答一个看似简单的问题:为什么同一条预测管线对收益率目标坍缩、对成交量目标却不坍缩?具体目标有四层。第一,给出『预测坍缩』(低幅度与差截面排序的组合)的可检验定义,并严格区分『弱尺度』『弱排序』『两者皆弱』三种不同的失败模式——论文强调这三者不是一回事。第二,从理论上刻画两个相互独立的机制:低可预测性通过 $IC_{\max}=\sqrt{\mathrm{SNR}/(1+\mathrm{SNR})}$ 限制校准点预测的最佳缩放幅度;逐序列风险对跨序列耦合不敏感,等风险的预测器可以有截然不同的截面排序。第三,刻画由此产生的校准-排序权衡,并提出能同时控制两者的实用训练目标 CalibRank。第四,发布 Finance1K(1,000 只美股、28,510 个小时步、对齐的收益率与成交量双目标),使目标可预测性的受控对照可以在固定预测协议下进行。
与已有工作不同的是,已有工作各自看到过碎片:Green et al. (2026) 研究均值最优预测对边际分布的欠离散;Andreoletti (2026) 独立记录了 transformer 在收益率上的低幅度预测;量化与推荐领域早有回归+排序复合损失(Feng et al. 2019 的 pairwise hinge、Lin et al. 2026 的秩相关优化、Yang et al. 2020 的相关损失工具箱)。本文的独特切入在于把问题拆成两条可分别检验、可分别证伪的数学命题:一条把测量误差衰减恒等式改写成预测幅度的语言,得到精确恒等式 $A^\star=|\mathrm{corr}(\hat y,y)|\le IC_{\max}$;另一条证明任何逐序列点态风险在『重耦合』变换下不变——风险固定 1.40 时 $E[IC_t]$ 可从 0.371 摆到 0.032。实验设计同样独树一帜:用同一股票面板上收益率与成交量的双目标做匹配对照,把坍缩归因于目标可预测性而非管线缺陷;审计 19 个 TSFM 的训练目标,证明『没有一项联合评分截面』是整个领域的结构性盲点;再用 GIFT-Eval 的 97 个公开配置把幅度衰减与达成 $R^2$ 联系起来(相关 0.88/0.87)。
核心方法
直觉上,一次预测可能在三个不同维度上失败:尺度太平、排序错乱、或两者兼有。论文第一步就是把这些容易混淆的对象严格分开——目标侧的可预测性上限($R^2_{\max}$、$IC_{\max}$)、模型对可预测成分的对齐度 $\rho=\mathrm{corr}(\hat y,\mu)$、以及预测自身的性质($IC_t$、原始幅度 $A_t$、最佳缩放幅度 $A^\star$)。技术路线分三步。机制一:在分解 $y=\mu+\varepsilon$($\mu=E[y\mid F_{t-1}]$,$E[\varepsilon\mid F_{t-1}]=0$)下推导衰减恒等式 $\mathrm{corr}(\hat y,y)=\rho\cdot IC_{\max}$ 和幅度恒等式 $A^\star=|\mathrm{corr}(\hat y,y)|\le IC_{\max}$,说明低 SNR 必然压扁校准点预测,且均值与中位数点预测在此意义下重合、换绝对误差损失也逃不掉。机制二:证明逐序列风险 $R(\hat y)=\sum_{i,t}E[\ell(\hat y_{it},y_{it})]$ 只读取每个坐标对的边缘联合律,重耦合跨坐标依赖不改变 $R$ 却能改变 $IC_t$。疗法:引入 CalibRank $\mathcal{L}=\frac{1}{M}\sum_{i,t}(\hat y_{it}-y_{it})^2-\frac{\lambda}{|B|}\sum_{t\in B}IC_t$,扫 7 个 λ 值描出权衡前沿,并在合成面板、12 个骨干架构、97 个 GIFT-Eval 配置上分别验证。
核心创新是把『预测太平』从一个视觉症状拆成两个可检验的统计命题,并给出对症的复合目标。与已有方法的本质区别有三。其一,不同于把低幅度归咎于模型容量或实现缺陷,论文证明这是低可预测性下校准点预测的统计必然:即便预测恰好等于条件均值 $\mu$ 本身(Prop 4.2 证明对称噪声下均值与中位数点预测重合),其最佳缩放幅度也只能等于 $IC_{\max}$——SNR=0.01 时约 0.10。其二,不同于『换个鲁棒损失』的思路,论文证明问题比 MSE 广得多:19 个被审计的 TSFM 目标(平方误差、分位数、似然、交叉熵、流匹配、先验拟合)逐序列可识别的量各不相同,但没有一个联合评分截面;二序列高斯构造显示平方误差风险固定 1.40 时 $E[IC_t]$ 可变化一个数量级(0.371→0.032)。其三,CalibRank 不估计整个联合分布(copula),只直接奖励下游决策实际使用的那一个可观测泛函——逐时间戳截面 Pearson 相关——并用 MSE 锚定尺度,从而在权衡前沿上给出一个可控、可选点的工作区间。
方法步骤详情
第一步,数据:Finance1K 含 1,000 只美股 2015 年至 2026 年初的 28,510 个小时步,双目标为收盘价对数收益 $\log(p_t/p_{t-1})$ 与对数成交量变化 $\log(v_t/v_{t-1})$;按时间切分,前 19,957 步(至 2022 年末)训练、后 8,553 步测试;任务是用过去 96 个小时预测下一步;每 4 个测试步评估一次,其中 684 个周末节假日步因截面零离散被剔除,IC 只在剩余 1,455 个交易小时上计算。第二步,受控骨干:长度 96 的单变量上下文切成 6 个长度 16 的 patch,线性嵌入到 $d=128$ 并加可学习位置项,经 3 层 Transformer(4 头、GEGLU 激活、dropout 0.1)后均值池化,LayerNorm+线性头输出标量,共约 0.38M 参数;该编码器只用于隔离目标函数效应。第三步,训练协议:AdamW,学习率 $3\times10^{-4}$,权重衰减 $10^{-4}$,批次为 24 个完整截面,1,500 步,种子 11/23/42;受控比较中唯一变量是损失函数;TSFM 微调用学习率 $10^{-6}$。第四步,合成验证:按式 (25)–(27) 生成已知 $\mu,\varepsilon,\delta$ 的面板,SNR 扫两个数量级、3 个技能水平,拟合与评估用不相交的随机流。第五步,外部证据:TimesFM 与 Chronos 在 Finance1K 和 97 个 GIFT-Eval 配置上零样本评估,比较原始幅度与一组拟合基线的达成 $R^2$,并用三种分层(0.05/0.30)描述关联。
技术新颖性
理论新颖性在于两条精确结果的组合而非单一技巧。幅度侧把 Fuller (1987) 的衰减恒等式改写成预测幅度的语言:$A^\star=|\mathrm{corr}(\hat y,y)|$ 是无条件的恒等式(OLS 斜率的标准差单位形式),而 $A^\star\le IC_{\max}$ 才是需要可预测性假设的上界——论文明确区分二者的假设负担,并指出原始幅度 $A_t$ 与 $IC_t$ 之间没有恒等式,避免常见误读。排序侧的 Prop 4.3 是不变性结果:用 Sklar 定理的语言,点态风险只探测边缘-配对律,重耦合(等价于移动 copula)对它不可见;显式构造(定理 5.4)给出 $g=\mathrm{Cov}(\hat y_1,y_2)$ 扫动时风险恒为 $2(1-r)=1.40$,而 $E[IC_t]=\frac{2}{\pi}\arcsin(r-g)$ 依次取 0.371/0.194/0.032。实证新颖性在于匹配设计:同一面板的双目标对照把坍缩归因于目标可预测性;12 骨干×3 目标函数×3 种子的网格排除了架构解释;Table 2 的 19 模型目标审计把单点观察上升为领域级结构缺失;附加的方向律 $\Pr(\mathrm{sign}\,\hat y=\mathrm{sign}\,y)=\frac12+\frac{1}{\pi}\arcsin(IC)$ 还把 IC=0.05 翻译成 51.6% 的命中率,说明『看起来可忽略』的相关在经济上可以有意义。
实验结果
受控比较(Table 4,收盘收益):MSE 训练的预测幅度仅 0.027±0.005(目标为 1)、IC 0.046±0.003,典型坍缩;纯 IC 训练把 IC 提到 0.124 但幅度达 25.26±1.11 倍、MSE 恶化到 4.22e-1;CalibRank(预设 $\lambda=1$)达到 IC 0.126±0.002、幅度 1.836±0.118、MSE 1.43e-3——排序与纯 IC 相当而幅度受控,MSE 比纯 IC 低约 300 倍。成交量负对照:MSE 已达 (幅度 0.391, IC 0.530),CalibRank 仅微升到 (0.391, 0.538),符合『高可预测目标不坍缩』的预测。跨架构(Table 5,12 个骨干:DLinear、PatchTST、iTransformer、TimeMixer、Autoformer、Transformer、Informer、FEDformer、Non-stationary Transformer、Reformer、LightTS、TSMixer):CalibRank 对全部 12 个模型提升 IC,平均 IC 从 0.062 升到 0.123,平均 MSE 从 4.3e-4 到 5.8e-4(纯 IC 目标均值 4.9e-1,比 CalibRank 高 800 多倍);Non-stationary Transformer 最好(IC 0.147)且几乎无 MSE 代价,构成帕累托前沿全部四个点。λ 扫描:第一个非零排序权重贡献几乎全部 IC 增益,IC 在 $\lambda=0.1$ 即达 0.1246、到 $\lambda=1$ 变化小于 0.002,$\lambda=0.1$ 时幅度已达目标 87.5% 且 MSE 约为 $\lambda=1$ 一半,单位幅度交叉约在 $\lambda\approx0.17$;λ 从 0 到 1 的中位 IC 增益 0.0489、中位 MSE 乘子 1.280×。合成验证:恒等式对留出集最佳缩放幅度的预测误差小于 0.0015、对相关的误差小于 0.0021。GIFT-Eval:97 个配置上原始幅度与 $\sqrt{R^2}$ 相关 0.88(Chronos)/0.87(TimesFM);达成 $R^2\ge0.30$ 的 65 个配置中两模型保留约四分之三幅度,$R^2<0.05$ 的 6 个配置保留不足 6%;GIFT-Eval 中位达成 $R^2=0.56$,Finance1K 收益仅 0.0044。留出决策回报(类 Sharpe,不在损失内):0.052±0.010(MSE)→ 0.143±0.029(纯 IC)→ 0.170±0.030(加权 CalibRank)。消融:理论驱动的逐时间戳加权对 IC 的贡献可忽略(close −0.0006 / volume +0.0014),说明增益来自截面评分本身。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| Finance1K 收盘收益预测(受控 0.38M 骨干) | 截面 IC(1,455 个交易小时平均) | 0.126 ± 0.002(CalibRank, λ=1) | 0.046 ± 0.003(MSE 目标) | 约 2.7 倍(论文称 nearly triples) |
| Finance1K 收盘收益预测(受控骨干) | 原始幅度(目标归一为 1) | 1.836 ± 0.118 | 0.027(MSE);25.26(纯 IC) | 从坍缩(2.7% 目标幅度)或膨胀(25 倍)拉回目标尺度附近 |
| 12 个预测骨干平均(DLinear/PatchTST/iTransformer/Autoformer 等) | 平均 IC | 0.123(CalibRank) | 0.062(MSE) | +0.061,且 12/12 每个骨干 individually 提升 |
| Finance1K 收盘收益(受控骨干) | MSE(完整评估网格) | 1.43×10⁻³ | 4.22×10⁻¹(纯 IC 目标;均值 4.9×10⁻¹) | 低约 300 倍(跨骨干均值口径比纯 IC 低 800 余倍) |
| Finance1K 留出决策回报(构建零和组合权重,未进入训练损失) | 类 Sharpe 比率(均值/标准差) | 0.170 ± 0.030(加权 CalibRank) | 0.052 ± 0.010(MSE);0.143 ± 0.029(纯 IC) | 约 3.3 倍(相对 MSE) |
| GIFT-Eval 97 配置(TimesFM/Chronos 零样本) | 原始幅度与 √R² 的经验相关 | 0.88(Chronos)/ 0.87(TimesFM) | —(跨数据集关联性证据,非对比基线) | 确立幅度随可预测性衰减的规律:R²≥0.30 的 65 个配置保留约 3/4 幅度,R²<0.05 的 6 个配置保留 <6% |
局限与改进
作者承认的限制:幅度恒等式在『最佳缩放』意义下精确且只在仿真中直接检验;GIFT-Eval 的达成 $R^2$ 来自一组固定拟合基线,只是可用可预测性的下界,因此该实验展示的是坍缩在实践中的出现位置,而非对定理 4.1 上界的检验;截面诊断与疗法只在一个真实面板(美股小时线)上验证,12 骨干降低了架构特异的可能但不证明其他领域同样成立;Finance1K 按波动率分层且需要长覆盖历史,不支持全市场业绩声明;CalibRank 只针对逐时间戳 Pearson 相关这一个泛函,不估计联合分布,关心秩、尾部或校准场景的应用需要不同的截面项;标量化前沿不是基本极限,回归兼容的 listwise 目标可能支配它;方法要求每个时间戳存在有意义的截面,单序列不适用;IC 是比值,跨时间池化会出现 Simpson 效应,平均化的 $IC_{\max}$ 也因平方根凹性而 Jensen 松弛。我的补充观察:其一,IC 绝对水平仍低(0.126),论文未考虑交易成本、换手率与容量,实用价值存疑;其二,纯 IC 目标 25 倍的幅度问题原则上可用简单的事后线性重标定部分修复,论文没有给出『纯 IC+事后缩放』这一更便宜基线的严格对照;其三,0.38M 参数的受控编码器与真正的大规模 TSFM 之间有差距,zero-shot TSFM 证据只是关联性的;其四,λ=1 虽是预设,但 λ 扫描是事后分析,工作点选择准则目前只有描述性交叉点(λ≈0.17)。
独立分析的弱点
独立分析的弱点与改进方向。第一,排序增益的绝对量小:IC 从 0.046 到 0.126 虽近 3 倍,但在仅 1,455 个交易小时的评估窗口上,这种水平的信号极易被交易成本、买卖价差和执行滑点吞掉;改进方向是引入成本感知回测、按 $IC_t$ 置信度筛选交易时段、或延长样本外窗口检验稳定性。第二,缺少『事后校准』基线:纯 IC 输出乘一个在验证集上拟合的标量即可修复幅度,CalibRank 的真正卖点应是端到端稳定性与训练-部署一致性,论文应补充该基线并量化可微截面项相对两阶段方案的优化收益。第三,排序泛函选择过窄:Pearson IC 对异常值敏感,金融实践常用 Spearman 秩相关或加权 IC;Table 3 设计空间中的 Spearman/pairwise/listwise 分支均未进入实验,可系统比较不同排序泛函的下游表现与鲁棒性。第四,外部效度单一:全部真实数据证据来自美股、小时频、单步预测;作者自己指出能源、交通、传感器等场景同样存在截面决策,应在其上重复『收益率 vs 成交量』式的目标对照。第五,理论-现实之间的缝隙:二序列高斯构造与 1,000 序列面板差距较大,『有限容量下优化在等风险解中任意选择』的论证主要靠文字桥接,可用过参数化模型直接展示等风险解的选取确实发生、以及共享预训练表征如何加剧这种任意性。
未来方向
作者提出的方向:把多元结构保留进评测协议——基准应保留通道分组与时间戳,在截面内计算排序分数后再平均,并报告原始幅度(GIFT-Eval 的 97 个配置中 43 个多变量配置都被展平打分,11 个指标无一度量幅度或截面结构);在按日期切分的验证集上按幅度容差选择 λ,再报告未触碰的测试结果;探索可能支配简单标量化的回归兼容 listwise 目标(如 Bai et al. 2023 的 listwise 方法);在环境传感网络、临床监护、能源系统、交通预测等下游依赖『哪些通道一起动/哪个先劣化』的领域检验同一诊断;处理时变可预测性——定位衰减在何时最强,同时保持逐时间戳恒等式不变。基于本文成果可延伸的:把截面项引入 TSFM 的预训练或微调目标,检验能否在保持通用性的同时修复金融零样本坍缩;与概率/生成式预测结合,研究预测分布的条件散布保留与点预测坍缩的关系(论文提到天气领域的生成式集合动机);理论上扩展到非中位数分位点预测与序列异质尺度(论文只在附注给出);学习型截面泛函(可微 Spearman、尾部依赖、学习图)与 CalibRank 的组合;以及设计比『拟合基线达成 $R^2$ 下界』更紧的可预测性天花板估计方法,让幅度诊断可以定量归一。
复现评估
复现条件相当好。数据:Finance1K 在 HuggingFace 公开(abel-lab/finance1k),发布包含对齐面板、精确时间切分、ticker 顺序、有效性掩码和校验和,数据契约完整;双目标(对数收益/对数量变)定义清晰。算力:每次运行只需单张 NVIDIA RTX Pro 6000,训练仅 1,500 步、骨干约 0.38M 参数,普通单卡即可负担;OpenMP/MKL/OpenBLAS/NumExpr 线程数在数值库导入前钉为 1 以保证种子级可复现;所有受控实验用三种子(11/23/42)报告均值±标准差;合成实验按实验名键控独立 RNG 流,调用顺序无关。理论:假设 A1–A7 显式列出,证明完整给出,衰减恒等式与 1.40 风险构造都可直接数值验证。难度评估:受控编码器与 12 骨干实验为低到中等难度;TimesFM/Chronos 的 GIFT-Eval 97 配置扫描需获取模型权重与基准数据,难度中等。保留意见:论文未给出独立代码仓库链接(仅承诺 Finance1K 发布包),实验 harness 由生成式 AI 辅助编写并经作者审查;部分归档运行使用加权变体协议而正文预设均匀 λ=1,复现时须仔细区分两条协议线,避免混淆 Table 4 与图 3(a,b) 中略有差异的数值(如幅度 1.73 与 1.836)。
论文图表
三联图。(a) 三只股票(QLYS、RAIL、MCRB)的真实收益与 MSE/IC/CalibRank 三种目标下预测的对比曲线:MSE 预测几乎平坦(幅度仅目标的 0.01–0.03),IC 预测幅度失控(21–26 倍,98–100% 超出坐标范围),CalibRank 预测幅度贴近目标(1.38–1.54 倍)。(b) 所有模型与目标函数的 MSE-IC 散点及经验帕累托前沿(红)和固定架构的 Autoformer 七点 λ 扫描(青)。(c) TimesFM 与 Chronos 在 97 个 GIFT-Eval 配置上的原始幅度对达成 R²,Finance1K 位于远低于所有公开配置的可预测性位置。
这是全文的路线图:一图同时呈现坍缩现象、两种单目标失败的极端形态、权衡前沿的存在性,以及公开基准与金融目标的可预测性鸿沟,是向他人讲解论文时的第一张图。