论文

准确性不是服务:间歇性需求预测的决策感知基准

Accuracy Is Not Service: A Decision-Aware Benchmark for Intermittent-Demand Forecasting

模型评测评测方法与指标

摘要

合同物流备件运营商根据订单级服务获得报酬:仅当每个请求的行都得到满足时,订单才算数,但预测员是根据行级预测准确性来选择的。当需求间歇性且不稳定、历史较短且交付周期长达数月时,这种脱节就很重要。我们对 38 种预测方法进行了基准测试,涵盖经典模型、间歇性需求模型、机器学习模型、深度学习模型和预训练基础模型。通用的决策感知协议在从实时合同和两个公共数据集提取的工业面板上对它们进行评估。在对 20,330 个真实多项目订单进行评估的方法中,预测准确度排名和订单服务排名在工业面板上呈负相关(-0.555)。与点精度相比,服务与累积预测偏差的方向(包括零需求期间的过度预测)的关系更为密切。检查 Chronos-2 实例标准化中的偏差会产生无需训练的修正,将每种材料的填充代理从 77.5% 提升到 92.0%(14.5 个百分点),达到 90% 的政策目标,并将完整订单填充率从 54% 提高到 63%。为了再现性,我们发布了 RUF(Regenerate-Until-Fidelity),这是一种生成经过保真度认证的合成面板的方法,可在该面板上再现结果。对于间歇性需求,最低错误的预测不需要提供最高的服务。偏差方向有助于解释这种差距,无需重新训练即可缩小这种差距。