论文
时间序列基础模型的合成数据蒸馏
Distillation of Synthetic Data for Time Series Foundation Models
摘要
时间序列基础模型 (TSFM) 越来越多地在合成生成的时间序列轨迹上进行预训练,其中数据生成过程是已知的。当前的 预训练 配方基于损失目标,该损失目标将 TSFM 输出与每个轨迹的已实现未来值进行比较。相反,我们提出了将 TSFM 输出与每个轨迹的条件预测分布进行比较的损失目标,我们将这个过程称为合成数据 蒸馏 (SDD)。 SDD 对应于训练目标的 Rao-Blackwellization,因为它保持随机梯度的期望不变,同时可证明降低 Loewner 偏序下随机梯度的协方差。我们在参数大小从 $4$M 到 $2.5$B 的 TSFM 模型系列上凭经验验证 SDD,并观察到每个模型大小的验证损失收敛速度更快:在高斯过程数据上,SDD 达到或改进了现状损失,同时需要减少 $10\%-40\%$ 的训练迭代。