论文

TempusBench:时间序列预测的评估框架

TempusBench: An Evaluation Framework for Time-Series Forecasting

模型评测基准与评测资源

摘要

基础模型已经改变了自然语言处理和计算机视觉,并且有关时间序列基础模型 (TSFM) 的文献迅速增长,试图在预测中复制这一成功。虽然最近的开源模型展示了 TSFM 的前景,但该领域缺乏全面且得到社区认可的模型评估框架。我们看到至少有四个主要问题阻碍了这一框架的发展。首先,现有的评估框架包括源自过时数据集(例如 M3)的基准预测任务,其中许多缺乏明确的元数据,并且与用于预训练 TSFM 的语料库重叠。其次,这些框架沿着一组狭义定义的基准预测任务(例如预测范围长度或域)评估模型,但忽略了核心统计属性,例如非平稳性和季节性。第三,特定领域模型(例如 XGBoost)经常被不公平地比较,因为现有框架并未对所有模型强制执行系统且一致的超参数调整约定。第四,缺乏解释比较绩效的可视化工具。为了解决这些问题,我们引入了 TempusBench,这是一个针对 TSFM 的开源评估框架。 TempusBench 包含 1) 现有 TSFM 预训练语料库中未包含的新数据集,2) 一组超越现有任务的新颖基准任务,3) 具有标准化超参数调整协议的模型评估管道,以及 4) 基于张量板的可视化界面。我们在 GitHub 上提供代码访问:https://github.com/Smlcrm/TempusBench,并在 https://benchmark.smlcrm.com/ 维护实时排行榜。