论文

ScaleIn:时序基础模型的尺度不变训练

Scale-Invariant Training for Time Series Foundation Models

模型训练预训练

摘要

时序基础模型(TSFM)在跨形态与领域的大量序列上训练,各序列典型数值尺度可相差很大。ReVIN等仿射缩放先缩放输入,再于计算损失前逆变换。我们证明,相比在缩放目标上计算损失,逆变换使每序列梯度乘以 $b^p$,其中 $b$ 为标准差等缩放分母,$p$ 为损失的齐次次数。我们称其为尺度污染训练ScaleCon,因为尺度成为隐式重要性权重,使大尺度序列主导训练。对于任意尺度等变缩放器和 $p$ 次齐次残差损失,包括MSE、MAE、分位数损失,在缩放目标上计算损失可使每个小批梯度及完整优化轨迹对训练序列的独立任意缩放不变,得到ScaleIn。现有TSFM同时使用两种目标,却缺少一致报告与共同惯例。合成和真实数据对照分离ScaleCon导致的收敛差异及ScaleIn修正。四架构预训练的24项架构—基准比较中,ScaleIn全部降低MASE,在GIFT-Eval与M竞赛上平均降低18.8%和21.9%;监督神经预测20组匹配设置中16组降低MASE。多数现有预测管线只需一行代码修改即可采用。