论文

评估选择决定预测排行榜:来自生产市场小组的证据

Evaluation Choices Decide the Forecasting Leaderboard: Evidence from a Production Marketplace Panel

模型评测评测方法与指标

摘要

预测基准报告哪种方法获胜。我们表明,答案是由评估者在拟合任何模型之前的选择决定的。我们在 67 个月内对 1,887 名企业客户组成的生产市场面板上的 24 种预测方法和一本教科书参考进行了基准测试,其中包括 6 个 2025 年时间序列基础模型。我们保持数据、范围和周期固定,仅改变评估设计。三个选择各自推翻或消除一个标题结论。将分析单位从市场总量改为单个客户,使我们的生产基线从十九人中的第二位(毫无胜算)上升到二十五人中的二十三人。它的二十四个挑战者中有十九个在那里击败了它。更改合并的错误量决定了 Diebold-Mariano 测试是否能找到任何结果。对预测区间进行评分而不是点预测几乎完全重新排序了该领域,间歇性需求的排名相关性为 0.02。然后我们测量已部署的系统从中获得的结果。它的选择规则抓住了无所作为和事后选择之间 55% 的距离。这种逆转并不是我们的数据的怪癖。我们在公共 M5 零售面板上运行了已发布的协议,未更改。相同的基线形状在市场总数中排名第一,在每个系列中排名最后,被一切击败,并且重播的选择规则关闭了相同地板到天花板距离的 64.7%。在该名单中添加五个零样本基础模型会改变谁在总数上获胜,而不是形状。带子的盲点也会移动:保形带子在最尖锐的物品上掩盖了大部分。将我们自己的面板分成更小的组会将对比变成一条曲线:基线的排名在每个分解级别上都会恶化。我们发布了评估协议并报告了我们自己的错误,该错误在我们发现之前就颠倒了结果。