论文

Timer-S1:采用Serial Scaling的十亿规模时间序列基础模型

Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling

模型训练预训练

摘要

我们介绍Timer-S1,一个强大的Mixture-of-Experts(MoE)时间序列基础模型,总参数量8.3B,每token激活参数0.75B,上下文长度11.5K。为克服现有预训练时间序列基础模型的可扩展性瓶颈,我们在模型架构、数据集和训练流水线三个维度执行Serial Scaling。Timer-S1集成了稀疏TimeMoE模块和面向Serial-Token Prediction(STP)的通用TimeSTP模块,STP是一个遵循预测任务串行本质的通用训练目标。所提范式引入串行计算以改进长期预测,同时避免了标准下一token预测中代价高昂的滚动式推理和显著的误差累积。为追求高质量且无偏的训练数据集,我们整理了包含一万亿时间点的TimeBench语料库,并应用细致的数据增广以减轻预测偏差。我们进一步开创了一个后训练阶段,包括继续预训练和长上下文扩展,以增强短期和长上下文性能。在大规模GIFT-Eval排行榜上评估,Timer-S1取得了最先进的预测性能,作为预训练模型获得最佳MASE和CRPS分数。Timer-S1已发布以促进进一步研究。

Timer-S1:采用Serial Scaling的十亿规模时间序列基础模型
图5:TimeBench数据集与Timer-S1训练流水线的示意图。TimeBench整合了来自多个领域的超过一万亿个时间点,经过以质量为核心的预处理、可预测性评估与增强多样性的增广。TimeBench以单序列(single-series)序列格式加载,用于学习单变量模式。Timer-S1的训练遵循多阶段设计:首先通过带统一预测期(horizon)加权的串行token预测进行预训练;随后使用预测期衰减目标进行持续预训练以提升短期精度;并通过长上下文适配将上下文长度从2880扩展到11520。