论文
后来的测试集并不是一个新领域:预训练的熟悉程度在无污染的情况下仍然存在
A Later Test Set Is Not a New Domain: Pretraining Familiarity Survives a Contamination-Free Hold-Out
摘要
时间序列基础模型几乎完全在其之前的公共档案中进行评估,因此高分与在预训练期间查看测试集密不可分。显而易见的补救措施是推迟模型的发布。我们构建了一个:十三个预测器——四个经典的,每个数据集三个训练的,六个预训练的——基于来自五个领域的七个组,每个观察结果在最后一个模型发布后发布,并且每个数据集都可以在没有 API 密钥的情况下重建。根据该协议,预训练模型赢得 7 组中的 5 组,在 Theta 基线上输掉一组,并且每日汇率与季节性朴素预测以及测试的所有其他方法都没有区别。然后,我们询问是什么区分了胜利和损失,并报告了一个负面结果:人们将达到的两个内在属性——在输入窗口上测量的季节性强度和谱熵——并不能解释这种模式,而季节性强度是与优势负相关的。跟踪它的是语料库熟悉度。我们最大的收益(在每周维基百科页面浏览量上,MASE 比最佳经典方法低 28%)落在维基百科页面浏览量上,TimesFM 的作者将这个领域描述为预训练语料库的主体,粒度相同,仅时间窗口不同。在预训练系列中,每个模型预测相同的系列,因此系列难度取消,TimesFM 系列在维基百科上的排名比 Chronos 系列高出 -0.53,而其他地方的排名为 -0.09(1,500 对 754 系列,Mann-Whitney p < 1e-5)。我们的结论是,时间保留会消除对窗口的记忆,但不会消除对领域的熟悉,因此基准测试需要相对于公开的语料库陈述域保留,并且从业者的问题不是哪种模型更好,而是他们的领域是否是模型提出的领域。