← 返回 2026-08-21

TinyCast:基于计算周期性的概率零样本时间序列预测 TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity

Armin Steinhauser 📅 2026-08-16 👍 9 2026-08-26 18:30
基础模型 时间序列预测 概率预测 边缘部署 零样本学习

14.6万参数零样本概率预测器:免参数频谱检测周期,纯卷积可跑在MCU上

前置知识

零样本时间序列预测

基础模型在大型多样化语料上预训练后,不对未见序列做任何参数更新即可直接预测其未来。与"一模型一数据集"范式相反,一个模型服务所有信号;评测通常在 GIFT-Eval、Chronos-ZS 等基准上以零样本模式进行,并与季节性 naive、AutoARIMA 等基线比较。

TinyCast 的全部卖点建立在零样本设定上:146,505 参数的模型要在从未见过的序列上直接输出预测,这是理解其实验设计与"通用性"主张的前提。

分位数回归与 pinball 损失

概率预测不输出单点而输出分布的摘要。pinball 损失 $\mathcal{L}_\tau(q,y)=\max(\tau(y-q),(\tau-1)(q-y))$ 对分位水平 $\tau$ 惩罚偏高或偏低的预测,训练后模型在每个时刻给出多个分位数(本文为 0.1 到 0.9 的九分位),构成预测区间。

本文的核心主张之一是"低于 1.4 M 参数还能输出预测分布",主指标 nWQL 即九分位加权分位损失,读懂结果表必须先理解这个概念。

周期图与 Fisher 显著性检验

对去均值的序列做 FFT 后取各频率分量的功率,得到周期图,峰位对应可能的周期。Fisher (1929) 检验判断峰值是否显著超出白噪声假设(本文 $\alpha=0.05$,跨频桶 Bonferroni 校正),不显著的槽被置零,避免把噪声当周期。

零参数周期检测器是 TinyCast 的灵魂:周期的测量、取整与显著性过滤直接决定位置编码的相位通道与解码器相位分桶的行为。

膨胀因果卷积

因果卷积只看过去;膨胀(dilation)让卷积核按 $2^{i-1}$ 跳步采样,层数 $N$、核 $K_c$ 时感受野为 $1+(K_c-1)\sum_i 2^{i-1}$,用局部核即可覆盖长历史。它是 WaveNet/TCN 的基本原语,只需嵌入式运行时自带的卷积算子。

TinyCast 的编码器完全由它构成(10 块、膨胀 1 到 512、感受野 2047),这正是模型免注意力又能做静态 INT8 量化的结构性原因。

静态 INT8 量化(W8A8)

把权重与激活都量化为 8 位整数,缩放因子一次性校准后冻结,推理全程整数运算。softmax、FFT 等非仿射算子难以整数化,须保留为 FP32 "孤岛";逐输出通道缩放可缓解异常激活通道问题。

论文的部署故事——138.1 KiB 权重在 STM32H753 上端到端预测——依赖"混合路径只含卷积与矩阵乘法"这一结构性质使静态 W8A8 可行。

研究动机

时间序列预测长期处于"一模型一数据集"的范式:每个站点、每台机器、每类信号都要收集历史、训练、验证并持续维护专门模型,人力成本不随算力降价而下降。per-dataset 模型虽可小到一千参数以下(如 SparseTSF),缺的正是这种规模上的通用性;唯一无需逐信号准备的传统统计方法(AutoARIMA、AutoETS 等)又要在推理时逐序列拟合。另一条路是时间序列基础模型:Chronos、TiRex、TimesFM 等预训练后可零样本预测未见序列,但参数量动辄数百万到数千万,且序列混合依赖注意力或 FFT,对嵌入式设备极不友好。作者的关键观察是:GIFT-Eval 榜单上所有声明无测试集泄漏、参数量低于 1 MB 的模型每步只输出一个点估计,无法告诉控制回路或报警阈值该有多信任这个预测——而不确定性恰恰是工业部署的核心需求。

本文的目标是本文要回答的不是"大模型能做多准",而是"一个概率式零样本预测器最小能做多大"。具体目标:构建参数量仅 146,505 的时间序列基础模型,对任意未见序列零样本输出 9 个分位数($\tau \in \{0.1, 0.2, \dots, 0.9\}$)构成的概率预测分布,预测长度可达 720 步;同时所有学习到的运算只含卷积、矩阵乘法、归一化和逐元素门控,能以静态 INT8 量化,在无神经加速器、无片外存储的单核 Cortex-M 级 MCU 上端到端运行,一个固件服务任意信号,无需逐信号拟合或重训练。

与已有工作不同的是,切入点是一个容量论证:在十万级参数预算下,任何用于"重新发现季节性"的容量都是从模型本可以学习到的其他结构中扣走的,而周期结构恰恰可以用固定的、零参数的计算直接测出来。于是 TinyCast 把周期性"计算"而非"学习":对上下文做一次实数 FFT 得到归一化周期图,用 Fisher 显著性检验选出主导周期,再把上下文按其相位折叠。与最近的先例 FlowState 从数据集元数据读取周期不同,TinyCast 直接从序列本身测量周期,这使模型可用于没有任何元数据的信号。与 TimesNet、Autoformer 等显式周期方法也不同:后者仍依赖注意力或自相关这类嵌入式运行时不支持的算子;TinyCast 全部学习运算只剩卷积与矩阵乘法,这一被迫的限制同时成就了部署,使"参数预算逼出的架构"与"嵌入式硬件跑得动的架构"成为同一个架构。

核心方法

TinyCast 是免注意力的块自回归概率预测器:周期这种可以"白算"的结构交给零参数频谱检测,网络只建模剩余部分。长度 $L=2048$ 的上下文先按自身 min–max 归一化到 $[0,1]$;去直流后做一次 rFFT,经 Fisher 检验($\alpha=0.05$,Bonferroni 校正)选出最多 $K=4$ 个整数周期;周期参数化一个对任意 $t\in[0,L+H]$ 可求值的位置编码:每槽一对 $\sin(2\pi t/p_k), \cos(2\pi t/p_k)$ 相位通道,加 5 个 recency 通道共 13 维。值与位置编码拼接过线性层映到 $D=64$,经 10 个编码器块(kernel 3、膨胀率 $2^{i-1}$ 的深度可分离因果卷积 + RMSNorm + ALBERT 绑定的单一 SwiGLU),感受野 2047。解码器为每个未来位置组装三路读出:池化摘要 $c=[\bar h\parallel h_{L-1}]$、按 16 个相位桶折叠的周期模板、对零参数季节草稿做 6 块因果卷积修正的 future-conv;查询经残差 SwiGLU 与 $W_{\text{out}}\in\mathbb{R}^{9\times D}$ 一次输出 48 位置 × 9 分位数。块中位数拼回上下文,重复 $\lceil H/48 \rceil$ 次至 720 步。训练用 pinball 损失加 $\lambda=0.3$ 门控 committing 项,scheduled sampling 展开 4 块,语料为去泄漏的 GIFT-Eval-Pretrain、KernelSynth 与 4 个合成分片。

核心创新是"计算周期性而非学习周期性",以及由此释放容量的设计逻辑。零参数检测器每次前向只做一次 $O(L\log L)$ 的 FFT,用 Fisher 显著性检验筛掉噪声峰,失败槽置零并使相位通道塌缩为全窗口均值——空槽优雅回退,而强加一个序列没有的周期反而是主动伤害(推理干预实验证实)。周期真正被"花掉"的地方是解码器的相位分桶:把编码器状态按周期内相位折叠成每槽 16 项的周期模板,未来位置按自身相位读模板,以近乎零成本恢复季节形状,消融显示它是架构家族最大的单一贡献(nGMASE $-0.098$)。与已有工作的本质区别:TimesNet/Autoformer 用注意力或自相关学习折叠后的混合;SparseTSF、CycleNet、FITS 需要按数据集手工给周期且在目标序列上训练;FlowState 从元数据读周期缩放状态空间编码器;TinyCast 在推理时对每个未见序列自行测周期并写入位置编码频率,且整条混合路径只有卷积与矩阵乘法——这正是静态 INT8 能覆盖全部学习权重的结构性原因。

方法步骤详情

(1) 输入:任意尺度单变量上下文 $y\in\mathbb{R}^{2048}$,按窗口 min–max 归一化到 $[0,1]$。(2) 周期检测:去直流后 rFFT 得归一化周期图,保留通过 Fisher 检验的局部极大值,四舍五入为整数周期 $p_1,\dots,p_K$($K\le 4$),失败槽置零。(3) 位置编码:每位置 4 对相位通道加 5 个 recency 通道共 13 维。(4) 编码:拼接过线性层 14→64,过 10 个膨胀因果卷积块(膨胀 $1,\dots,512$),输出 $h\in\mathbb{R}^{L\times 64}$。(5) 解码读出:池化摘要 $c=[\bar h\parallel h_{L-1}]$;相位分桶把 $h$ 按每槽 16 桶平均成周期模板,未来位置按自身相位读出,经 $W_{\text{phase}}\in\mathbb{R}^{64\times 256}$ 混合得 $s_h$;以主周期同相位历史均值作季节草稿,草稿与位置编码、最后 128 个编码器状态拼接过 6 块因果卷积得修正 $u$。(6) 输出:查询经残差 SwiGLU 与 $W_{\text{out}}$ 一次给出 48 位置 × 9 分位数,反归一化。(7) 块自回归:块中位数拼回上下文,重复 $\lceil H/48 \rceil$ 次到 720 步。部署时权重做逐通道静态 INT8(W8A8,尺度冻结),RMSNorm/SiLU/输入归一化保留 FP32;主机端可选符号对称化与周期对齐,设备端两者都不用。

技术新颖性

技术新颖性体现在四个层面。其一,把"测周期"做成模型定义的一部分而非预处理:检测器零参数、可每次前向重算或缓存,测得的周期直接写入位置编码频率与解码器相位模板,形成端到端的相位对齐,且推理干预实验证明检测器贡献的是"周期与该序列的对应关系"而非"占用的尺度"。其二,消融证明相位分桶是该架构家族最大的单一贡献($-0.098$ nGMASE),收益随配置周期结构含量增长,支持容量论证。其三,参数工程:深度可分离卷积加 ALBERT 绑定的单一 SwiGLU 省下 191,680 个参数,使模型从 338,185 减半到 146,505 而无可测精度损失。其四,部署:作者声称这是首个在无加速器、无片外存储的单核 Cortex-M 级芯片上端到端运行的通用零样本概率预测器,138.1 KiB INT8 权重、固定工作集、单固件服务任意信号。相对 Reverso(线性递归层)、FlowState(元数据周期)、TTM(紧凑 mixer),TinyCast 用"固定计算替代学习"的杠杆到达了更小的规模-精度前沿。

TinyCast 架构。(a) 单个编码器块;(b) 一个 48 步 block 的整体流水线:归一化上下文与周期条件化位置编码经编码器和解码器并行产出所有块位置的九个分位数,虚线箭头是串联各块的中位数反馈;(c) 解码器:三路读出组合出每个视界位置的查询
Figure 1: TinyCast 架构。(a) 单个编码器块;(b) 一个 48 步 block 的整体流水线:归一化上下文与周期条件化位置编码经编码器和解码器并行产出所有块位置的九个分位数,虚线箭头是串联各块的中位数反馈;(c) 解码器:三路读出组合出每个视界位置的查询

实验结果

GIFT-Eval(97 配置,指标为相对季节性 naive 的几何平均,1.0 持平):TinyCast 以 146,505 参数取得 nGMASE 0.774、nWQL 0.545、nMSIS 0.554,是榜单参数量可确认的最小零样本模型;无泄漏零样本模型中唯一低于 1.4 M 还输出预测分布者,概率指标上更优者至少 1.4 M(TTM-R3 花 9.6 倍参数得 0.520,FlowState-9.1M 花 62 倍得 0.502);榜单外 33 个更优模型均超 10 M,最小的 TabPFN-TS 11.1 M(约 75 倍)。Chronos-ZS:相对 MASE 0.880、相对 WQL 0.722,概率精度领先所有免训练方法,点精度被 AutoARIMA/AutoTheta 领先 1–2%。fev-bench:相对 MASE 0.819、相对 WQL 0.658,技巧分 0.304 [0.247, 0.364],更优发布模型为 28–62 倍参数。消融:去检测器重训损失 0.0071 nGMASE(约三种子跨度 0.0009 的 8 倍)与 0.0042 nWQL;相位分桶 $-0.098$,加 recency 门控 $-0.113$;future-conv $-0.015$;符号对称化值 0.0079,周期对齐值 0.0120 但仅影响 2/97 配置。部署:静态 W8A8 全榜 0.790/0.553(退化 2.14%/1.26%);固件配置 0.833/0.581,在 72/97 配置上仍胜季节性 naive;INT8 核心 138.1 KiB,STM32H753(Cortex-M7)端到端运行,三个独立后端输出逐位一致。

零样本 GIFT-Eval 结果;越低越好,学习类模型按列加粗。三个指标均为相对季节性 naive(1.000)的比值,括号内为不输出预测分布模型的点误差
Table 1: 零样本 GIFT-Eval 结果;越低越好,学习类模型按列加粗。三个指标均为相对季节性 naive(1.000)的比值,括号内为不输出预测分布模型的点误差
消融实验各配置臂的参数量对照(Appendix C)
Table 7: 消融实验各配置臂的参数量对照(Appendix C)
GIFT-Eval 点精度(左)与 nWQL(右)随参数量(对数轴)的变化;越低越好。TinyCast* 为固件配置;虚线阶梯为主机配置下的帕累托前沿
Figure 2: GIFT-Eval 点精度(左)与 nWQL(右)随参数量(对数轴)的变化;越低越好。TinyCast* 为固件配置;虚线阶梯为主机配置下的帕累托前沿
查看结构化数据
任务指标本文基线提升
GIFT-Eval 零样本点预测(97 配置) nGMASE(相对季节性 naive 的几何平均,越低越好) 0.774(146,505 参数) 季节性 naive = 1.000;次小模型 Reverso-Nano(200K)0.760;榜单最佳 Reverso(2.6M)0.711 比季节性 naive 好 22.6%;以最小参数预算扩展规模-精度帕累托前沿
GIFT-Eval 零样本概率预测 nWQL(九分位加权分位损失相对值) 0.545 季节性 naive 1.000;同量级点估计模型 Reverso-Small(550K)0.626;FLAIR 0.587;TTM-R3(1.4M)0.520 唯一低于 1.4 M 参数且输出预测分布的无泄漏零样本模型
GIFT-Eval 区间质量 nMSIS 0.554 季节性 naive 1.000;TTM-R3(1.4M)0.501 概率分布质量接近 9.6 倍参数的模型
Chronos-ZS(27 数据集零样本) 相对 MASE / 相对 WQL 0.880 / 0.722 季节性 naive 参考;AutoARIMA 与 AutoTheta 点精度领先 1–2% 概率精度领先所有免训练方法;这是设计过程未被污染的独立检验
fev-bench(100 任务,含协变量与多变量) 相对 MASE / 相对 WQL / 技巧分 0.819 / 0.658 / 0.304 [0.247, 0.364](单变量,不用协变量) 所有更优的发布模型参数量为本文的 28–62 倍 点与概率精度均领先全部统计基线
嵌入式部署(STM32H753,Cortex-M7) nGMASE / nWQL(固件配置:静态 W8A8,无主机策略) 0.833 / 0.581,INT8 核心 138.1 KiB 季节性 naive 环形缓冲:1.000 / 1.000(零权重、无分布) 在 72/97 配置上仍优于季节性 naive;INT8 量化仅退化 2.14%/1.26%

局限与改进

作者承认的局限:每次调用都要重新编码完整 2048 步上下文,流式变体(因果归一化 + 窗口平移不变位置编码)在短上下文配置上精度有损;模型是单变量的,不读协变量也不读跨序列结构(fev-bench 46 个任务提供协变量、35 个为多变量,均未被利用);输入超出预训练覆盖范围时退化是静默的;周期是取整后的频谱桶,分辨率随窗口/周期比值下降;逐窗口 min–max 归一化对单个极端值敏感。证据层面:消融家族都在约 340 K–445 K 预算而非部署的 146,505 上运行,只能给出组件贡献的上界;GIFT-Eval 探针参与了架构与推理选择的设计,作者因此把 Chronos-ZS 当作未污染的检验。我自己的观察:fev-bench 有 12 个任务与训练语料重叠,其相对优势可能略被高估;Chronos-ZS 点精度输给经典统计方法说明超小模型在点估计上仍有天花板;块自回归只在块间回传中位数,长视界下分布信息(尤其尾部)可能逐步失真;Fisher 检验偏保守,多重季节性与非整数周期可能测不准;周期对齐的增益在数据集重采样下无法与零区分。

独立分析的弱点

独立弱点分析:(1) min–max 归一化的离群点敏感是真实风险——工业传感器毛刺会把整个窗口的动态范围压扁,可改用中位数/IQR 等稳健统计或可学习的缩放;(2) 周期检测的硬判决(取整、Fisher 阈值、$K=4$ 上限)使非整数周期、缓变周期与三重以上共存的季节性受损,可改为对若干候选周期做软混合或后验加权;(3) 块间只回传中位数,丢弃了已算出的分位数信息,可回传分位数向量或压缩的分布状态以减少长视界尾部失真;(4) 主机端符号对称化使核心调用翻倍,周期对齐只惠及 97 配置中的 2 个且增益不可分辨,两者性价比存疑,可把对称化收益蒸馏进单次前向;(5) 消融未在部署预算上重跑,各组件在 146,505 参数下的真实边际贡献未知,应在部署预算上补一组对照;(6) 模型对分布外输入静默退化,缺少不确定性飙升或拒绝预测的机制,对安全攸关的告警场景是隐患。

未来方向

作者提出的方向:流式逐步推理变体(需解决窗口平移不变的归一化与增量卷积状态,论文承认其精度代价集中在短上下文配置);把模型用作有标签历史出现时的初始化做微调(声明未测试);把"固定计算替代学习"的机制推广到季节性之外——趋势、水平漂移等任何可用固定计算测得的结构都可以换回学习容量,预算越小这笔交换越值。基于成果可延伸:给解码器加协变量/多变量头以覆盖 fev-bench 约一半任务;用共形预测或后验校准替代固定的 9 分位输出,适配风险敏感控制;把周期检测改成可微软选择并与训练联合优化;用多尺度窗口提高月度/年度长周期的频谱分辨率;把对称化蒸馏与量化感知训练结合,缩小固件配置与主机配置之间 0.023 的交互差距;在 Cortex-M4/M33、RISC-V 等更多 MCU 级平台验证 INT8 图的可移植性。

复现评估

复现条件较好:权重、训练与运行代码、评测产物均开源(github.com/raws-labs/tinycast 与 HuggingFace raws-labs/tinycast),训练语料全部可得——GIFT-Eval-Pretrain 与 Chronos KernelSynth 来自原发布方,另有 4 个合成数据分片由发布的配方可再生,种子与配置存于 checkpoint。GIFT-Eval 公布逐配置结果,任何对比者的聚合分数都能在同一基础上重算;论文还给出 8 个评分配置与配对 bootstrap 区间、以及失败干预的测量。146,505 参数的模型训练成本应远小于主流基础模型,但论文未报告 GPU 时数与训练时长。嵌入式侧在 Appendix E 记录了 STM32H753 上的延迟与内存,三个独立 INT8 后端输出一致,硬件复现需要一块 Cortex-M7 开发板与相应工具链。总体难度中等偏低,主要门槛在合成数据分片的再生和嵌入式部署工具链。