论文
Timer-S1:采用Serial Scaling的十亿规模时间序列基础模型
Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling
摘要
我们介绍Timer-S1,一个强大的Mixture-of-Experts(MoE)时间序列基础模型,总参数量8.3B,每token激活参数0.75B,上下文长度11.5K。为克服现有预训练时间序列基础模型的可扩展性瓶颈,我们在模型架构、数据集和训练流水线三个维度执行Serial Scaling。Timer-S1集成了稀疏TimeMoE模块和面向Serial-Token Prediction(STP)的通用TimeSTP模块,STP是一个遵循预测任务串行本质的通用训练目标。所提范式引入串行计算以改进长期预测,同时避免了标准下一token预测中代价高昂的滚动式推理和显著的误差累积。为追求高质量且无偏的训练数据集,我们整理了包含一万亿时间点的TimeBench语料库,并应用细致的数据增广以减轻预测偏差。我们进一步开创了一个后训练阶段,包括继续预训练和长上下文扩展,以增强短期和长上下文性能。在大规模GIFT-Eval排行榜上评估,Timer-S1取得了最先进的预测性能,作为预训练模型获得最佳MASE和CRPS分数。Timer-S1已发布以促进进一步研究。
