论文
时间序列基础模型中的预测崩溃
Forecast Collapse in Time-Series Foundation Models
摘要
当预测 1,000 只美国股票的每小时回报时,我们观察到一个意想不到的现象:预测几乎持平,并且根据横截面相关性衡量,显示股票排名很差。我们称之为预测崩溃。令人惊讶的是,在相同设置下预测交易量时,这种现象基本上消失了。我们研究了时间序列基础模型 (TSFM)、12 个深度学习预测模型和 97 个公共基准配置的预测崩溃,发现它与目标可预测性密切相关。我们确定了其背后的两个不同原因:低可预测性限制了校准点预测的幅度,而每个系列的目标使跨系列的结构未确定。这些发现揭示了校准排名权衡:优化平方误差会导致预测平坦,而直接优化横截面相关性可以提高排名,但可能会使预测幅度增加一个数量级以上。为了解决这种权衡问题,我们引入了 CalibRank,这是一个平衡校准和排名的简单目标。在 Finance1K 上,CalibRank 将横截面相关性提高了近三倍,同时保持幅度接近目标,并提高了所有测试模型的相关性。我们的结果揭示了传统时间序列评估中的一个盲点:每个系列的指标可以隐藏下游决策所需的跨系列结构中的失败。