论文
QuitoBench:高质量开放时间序列预测基准
QuitoBench: A High-Quality Open Time Series Forecasting Benchmark
摘要
时间序列预测在金融、医疗保健和云计算领域至关重要,但进展受到一个根本瓶颈的限制:缺乏大规模、高质量的基准。为了解决这一差距,我们引入了 \textsc{QuitoBench},这是一种用于时间序列预测的制度平衡基准,覆盖八个趋势$\times$seasonality$\times$可预测性 (TSF) 制度,旨在捕获与预测相关的属性而不是应用程序定义的域标签。该基准测试基于 \textsc{Quito},这是支付宝跨越九个业务领域的十亿规模应用程序流量的时间序列语料库。我们对 232,200 个评估实例中来自深度学习、基础模型和统计基线的 10 个模型进行了基准测试,报告了四个关键发现:(i) 上下文长度交叉,其中深度学习模型在短上下文中领先 ($L=96$),但基础模型在长上下文中占主导地位 ($L \ge 576$); (ii) 可预测性是主要的困难驱动因素,导致不同制度之间的 MAE 差距为 3.64 ×$; (iii) 深度学习模型在参数少 59 倍的情况下匹配或超越基础模型; (iv) 对于两个模型系列来说,缩放训练数据量比缩放模型大小带来的好处要大得多。这些发现得到了强大的跨基准和跨指标一致性的验证。我们的开源版本为时间序列预测研究提供了可重复的、机制感知的评估。